当前位置：首页 > news >正文

广州做网站如何网络营销推广方式包括哪些

news 2026/4/7 3:24:47

广州做网站如何,网络营销推广方式包括哪些,网页空间结构,天元建设集团有限公司总工程师python爬虫-bs4 目录 python爬虫-bs4说明安装导入基础用法解析对象获取文本Tag对象获取HTML中的标签内容find参数获取标签属性获取所有标签获取标签名嵌套获取子节点和父节点说明 BeautifulSoup 是一个HTML/XML的解析器，主要的功能也是如何解析和提取 HTML/XML 数…

python爬虫-bs4

说明

BeautifulSoup 是一个HTML/XML的解析器，主要的功能也是如何解析和提取 HTML/XML 数据

在爬虫项目中经常会遇到不规范、及其复杂的HTML代码

BeautifulSoup4提供了强大的方法来遍历文档的节点以及根据各种条件搜索和过滤文档中的元素。你可以使用CSS选择器、正则表达式等灵活的方式来定位和提取所需的数据

安装

pip install BeautiifulSoup4

导入

from bs4 import BeautifulSoup

基础用法

解析对象

soup = BeautifulSoup('目标数据','解析器')

目前有三种主流解析器

html.parser
lxml(推荐)
html5lib

获取文本

获取文本的方法两种方式text和contents

contents：

from bs4 import BeautifulSoupdata = """
<h1>Welcome to BeautifulSoup Practice</h1><div class="article"><h2>Article Title</h2><p>This is a paragraph of text for practicing BeautifulSoup.</p><a href="https://www.example.com">Link to Example Website</a>
"""
soup = BeautifulSoup(data, 'lxml')
print(soup.contents)
# 输出：
"""
[<html><body><h1>Welcome to BeautifulSoup Practice</h1>
<div class="article">
<h2>Article Title</h2>
<p>This is a paragraph of text for practicing BeautifulSoup.</p>
<a href="https://www.example.com">Link to Example Website</a>
</div></body></html>]
"""

text：

print(soup.text)
"""
Welcome to BeautifulSoup PracticeArticle Title
This is a paragraph of text for practicing BeautifulSoup.
Link to Example Website
"""

Tag对象

获取HTML中的标签内容

比如<p> <div>

示例：

print(soup.h2)
# <h2>Article Title</h2>print(soup.h2.text)
# Article Title

find参数

获取class要加下划线，因为在python中它属于关键字，除了class还可以换成任意属性名

data = """
<h1>Welcome to BeautifulSoup Practice</h1><div class="article"><p>This is a paragraph of text for practicing BeautifulSoup.</p></div><div class="ex2"><p>This is a abcd.</p></div>
"""
soup = BeautifulSoup(data, 'lxml')
print(soup.find('div', class_='article'))

获取标签属性

data = ' <p id = "apple">This is a paragraph of text for practicing BeautifulSoup.</p>'
soup = BeautifulSoup(data, 'lxml')
tag = soup.find('p')
print(tag.get('id'))
# apple

获取所有标签

soup = BeautifulSoup(data, 'lxml')
print(soup.find_all('p'))
# [<p>This is a paragraph of text for practicing BeautifulSoup.</p>, <p>This is a abcd.</p>]print(len(soup.find_all('p')))
# 2

括号为空则获取全部标签

获取标签名

print(soup.div.name)
# div

嵌套获取

示例HTML如下

html = '''
<div class="article"><h2>Article Title</h2><p>This is a paragraph of text for practicing BeautifulSoup.</p><p>This is a abcd.</p><a href="https://www.example.com">Link to Example Website</a>
</div>
'''

目标：获取div下的所有p标签内容

print(soup.find('div', class_='article').find_all('p'))

子节点和父节点

soup = BeautifulSoup(data, 'lxml')
# 遍历获取所有父节点
for item in soup.p.parents:print(item)# 遍历获取所有子节点
for i in soup.p.children:print(soup.p.children)

查看全文

http://www.hkea.cn/news/935820/

网站建设的图片叠加步骤过程2021年搜索引擎排名

网站建设摄影服务上海seo网站排名优化公司

网页设计中html代码seo博客网站

怎样建设小游戏网站google关键词搜索技巧

淘宝客要推广网站怎么做全媒体广告代理

那个b2b网站可以做外贸武汉全网推广

深圳css3网站开发多少钱如何策划一个营销方案

织梦统计网站访问量代码网络营销公司如何建立

北京市住房城乡建设委网站公司怎么在网上推广

网站建设首页怎样插入视频百度指数在线查询小程序

青州网站制作哪家好aso优化哪家好

wordpress做网站优点郑州网站seo优化

宝安做棋牌网站建设找哪家公司好湖南长沙疫情最新消息