python – 使用BeautifulSoup选择特定标签
内容导读
互联网集市收集整理的这篇技术教程文章主要介绍了python – 使用BeautifulSoup选择特定标签,小编现在分享给大家,供广大互联网技能从业者学习和参考。文章包含2045字,纯文字阅读大概需要3分钟。
内容图文
![python – 使用BeautifulSoup选择特定标签](/upload/InfoBanner/zyjiaocheng/808/222d2ec7f3e44832b46aad6801fa9fc6.jpg)
我用这段代码用BeautifulSoup获取一些html表行:
from bs4 import BeautifulSoup
import urllib2
import re
page = urllib2.urlopen('www.something.bla')
soup = BeautifulSoup(page)
rows = soup.findAll('tr', attrs={'class': re.compile('class1.*')})
这就是我得到的结果:
<tr class="class1 class2 class3">...</tr>
<tr class="class1 class2 class3">...</tr>
<tr class="class1 class5">...</tr>
<tr class="class1_a class5_a">...</tr>
<tr class="class1 class5">...</tr>
<tr class="class1_a class5_a">...</tr>
<!-- etc. -->
但是,我想排除(或者不首先选择它们)那些将class1 class2 class3作为属性的行.
我怎样才能做到这一点?
感谢帮助!
解决方法:
也许没有正则表达式会更容易.这适用于BeautifulSoup 3:
from BeautifulSoup import BeautifulSoup
page = """
<tr class="class1 class2 class3">1</tr>
<tr class="class1 class2 class3">2</tr>
<tr class="class1 class5">3</tr>
<tr class="class1_a class5_a">4</tr>
<tr class="class1 class5">5</tr>
<tr class="class1_a class5_a">6</tr>
<tr>7</tr>"""
def cond(x):
if x:
return x.startswith("class1") and not "class2 class3" in x
else:
return False
soup = BeautifulSoup(page)
rows = soup.findAll('tr', {'class': cond})
for row in rows:
print row
=>
<tr class="class1 class5">3</tr>
<tr class="class1_a class5_a">4</tr>
<tr class="class1 class5">5</tr>
<tr class="class1_a class5_a">6</tr>
使用BeautifulSoup 4,我能够使其工作如下:
import re
from bs4 import BeautifulSoup
page = """
<tr class="class1 class2 class3">1</tr>
<tr class="class1 class2 class3">2</tr>
<tr class="class1 class5">3</tr>
<tr class="class1_a class5_a">4</tr>
<tr class="class1 class5">5</tr>
<tr class="class1_a class5_a">6</tr>
<tr>7</tr>"""
soup = BeautifulSoup(page)
rows = soup.find_all('tr', {'class': re.compile('class1.*')})
for row in rows:
cls = row.attrs.get("class")
if not ("class2" in cls or "class3" in cls):
print row
=>
<tr class="class1 class5">3</tr>
<tr class="class1_a class5_a">4</tr>
<tr class="class1 class5">5</tr>
<tr class="class1_a class5_a">6</tr>
在BS4中,类等多值属性将字符串列表作为其值,而不是字符串.见http://www.crummy.com/software/BeautifulSoup/bs4/doc/#id12.
内容总结
以上是互联网集市为您收集整理的python – 使用BeautifulSoup选择特定标签全部内容,希望文章能够帮你解决python – 使用BeautifulSoup选择特定标签所遇到的程序开发问题。 如果觉得互联网集市技术教程内容还不错,欢迎将互联网集市网站推荐给程序员好友。
内容备注
版权声明:本文内容由互联网用户自发贡献,该文观点与技术仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请发送邮件至 gblab@vip.qq.com 举报,一经查实,本站将立刻删除。
内容手机端
扫描二维码推送至手机访问。