草庐IT

BeautifulSoup文档2-详细方法 | 对象的种类有哪些?

虫无涯N 2023-03-28 原文
(2-详细方法 | 对象的种类有哪些?)

1 使用细节

  • 将一段文档传入BeautifulSoup 的构造方法,就能得到一个文档的对象,;
  • 可以传入一段字符串或一个文件句柄,比如:
from bs4 import BeautifulSoup soup = BeautifulSoup(open("index.html")) soup = BeautifulSoup("<html>data</html>")

2 对象的种类

2.1 种类说明

  • Beautiful SoupHTML文档转换成一个树形结构,每个节点都是Python对象;
  • 所有对象为4种: Tag , NavigableString , BeautifulSoup , Comment .

2.2 Tag对象

  • XMLHTML原生文档中的tag相同;
# -*- coding:utf-8 -*- # 作者:NoamaNelson # 日期:2023/2/14 # 文件名称:bs02.py # 作用:BeautifulSoup的使用 # 博客:https://blog.csdn.net/NoamaNelson from bs4 import BeautifulSoup soup = BeautifulSoup('<b class="boldest">Extremely bold</b>', 'html.parser') tag = soup.b print(type(tag))
  • 输出为:
<class 'bs4.element.Tag'>
  • tag很很多属性,两个最重要的属性: name和attributes

2.2.1 name属性

  • 通过.name 来获取tag的名字;
print(tag.name)
  • 输出为:
b
  • 可以修改tag的name:
tag.name = "blockquote" print(tag)
  • 输出为:
<blockquote class="boldest">Extremely bold</blockquote>

2.2.2 attributes属性

  • 一个tag可能有很多个属性. tag <b class="boldest"> 有一个 “class” 的属性,值为 “boldest” . tag的属性的操作方法与字典相同:
print(tag["class"])
  • 输出为:
['boldest']
  • 也可以直接”点”取属性, 比如: .attrs
print(tag.attrs)
  • 输出为:
{'class': ['boldest']}
  • tag的属性可以被添加,删除或修改. 操作方法与字典一样:
tag['class'] = 'verybold' tag['id'] = 1 print(tag) del tag['class'] del tag['id'] print(tag) print(tag.get('class'))
  • 输出为:
<blockquote class="verybold" id="1">Extremely bold</blockquote> <blockquote>Extremely bold</blockquote> None

2.2.3 多值属性

  • 最常见的多值的属性是 class (一个tag可以有多个CSS的class).;
  • 还有一些属性 rel , rev , accept-charset , headers , accesskey .;
  • Beautiful Soup中多值属性的返回类型是list:
# 多值属性 css_soup = BeautifulSoup('<p class="body strikeout"></p>', 'html.parser') print(css_soup.p['class']) css_soup = BeautifulSoup('<p class="body"></p>', 'html.parser') print(css_soup.p['class'])
  • 输出为:
['body', 'strikeout'] ['body']

2.3 NavigableString对象

  • NavigableString 类来包装tag中的字符串;
# NavigableString类 soup = BeautifulSoup('<b class="boldest">Extremely bold</b>', 'html.parser') print(tag.string) print(type(tag.string))
  • 输出为:
Extremely bold <class 'bs4.element.NavigableString'>
  • 使用 replace_with() 方法替换tag中的字符串:
# replace_with() 方法 tag.string.replace_with("No longer bold") print(tag)
  • 输出为:
<blockquote>No longer bold</blockquote>

2.4 BeautifulSoup对象

  • BeautifulSoup 对象表示的是一个文档的全部内容;
  • 它支持 遍历文档树搜索文档树 中描述的大部分的方法;
  • 包含了一个值为 “[document]” 的特殊属性:
# BeautifulSoup类 # [document]属性 print(soup.name)
  • 输出为:
[document]

2.5 Comment对象

  • Comment 对象是一个特殊类型的 NavigableString 对象;
  • Comment可以对注释进行解析;
# Comment对象 markup = "<b><!--Hey, buddy. Want to buy a used parser?--></b>" soup = BeautifulSoup(markup, 'html.parser') comment = soup.b.string print(comment) print(type(comment))
  • 输出为:
Hey, buddy. Want to buy a used parser? <class 'bs4.element.Comment'>

3 本文涉及的源码

# -*- coding:utf-8 -*- # 作者:NoamaNelson # 日期:2023/2/14 # 文件名称:bs02.py # 作用:BeautifulSoup的使用 # 博客:https://blog.csdn.net/NoamaNelson from bs4 import BeautifulSoup # name属性 soup = BeautifulSoup('<b class="boldest">Extremely bold</b>', 'html.parser') tag = soup.b print(type(tag)) print(tag.name) # 修改name tag.name = "blockquote" print(tag) print(tag["class"]) # Attributes属性 print(tag.attrs) # tag属性修改删除等操作 tag['class'] = 'verybold' tag['id'] = 1 print(tag) del tag['class'] del tag['id'] print(tag) print(tag.get('class')) # 多值属性 css_soup = BeautifulSoup('<p class="body strikeout"></p>', 'html.parser') print(css_soup.p['class']) css_soup = BeautifulSoup('<p class="body"></p>', 'html.parser') print(css_soup.p['class']) # NavigableString类 print(tag.string) print(type(tag.string)) # replace_with() 方法 tag.string.replace_with("No longer bold") print(tag) # BeautifulSoup类 # [document]属性 print(soup.name) # Comment对象 markup = "<b><!--Hey, buddy. Want to buy a used parser?--></b>" soup = BeautifulSoup(markup, 'html.parser') comment = soup.b.string print(comment) print(type(comment))

有关BeautifulSoup文档2-详细方法 | 对象的种类有哪些?的更多相关文章

  1. ruby - 如何使用 Nokogiri 的 xpath 和 at_xpath 方法 - 2

    我正在学习如何使用Nokogiri,根据这段代码我遇到了一些问题:require'rubygems'require'mechanize'post_agent=WWW::Mechanize.newpost_page=post_agent.get('http://www.vbulletin.org/forum/showthread.php?t=230708')puts"\nabsolutepathwithtbodygivesnil"putspost_page.parser.xpath('/html/body/div/div/div/div/div/table/tbody/tr/td/div

  2. ruby - 如何从 ruby​​ 中的字符串运行任意对象方法? - 2

    总的来说,我对ruby​​还比较陌生,我正在为我正在创建的对象编写一些rspec测试用例。许多测试用例都非常基础,我只是想确保正确填充和返回值。我想知道是否有办法使用循环结构来执行此操作。不必为我要测试的每个方法都设置一个assertEquals。例如:describeitem,"TestingtheItem"doit"willhaveanullvaluetostart"doitem=Item.new#HereIcoulddotheitem.name.shouldbe_nil#thenIcoulddoitem.category.shouldbe_nilendend但我想要一些方法来使用

  3. ruby - 为什么我可以在 Ruby 中使用 Object#send 访问私有(private)/ protected 方法? - 2

    类classAprivatedeffooputs:fooendpublicdefbarputs:barendprivatedefzimputs:zimendprotecteddefdibputs:dibendendA的实例a=A.new测试a.foorescueputs:faila.barrescueputs:faila.zimrescueputs:faila.dibrescueputs:faila.gazrescueputs:fail测试输出failbarfailfailfail.发送测试[:foo,:bar,:zim,:dib,:gaz].each{|m|a.send(m)resc

  4. ruby - Facter::Util::Uptime:Module 的未定义方法 get_uptime (NoMethodError) - 2

    我正在尝试设置一个puppet节点,但ruby​​gems似乎不正常。如果我通过它自己的二进制文件(/usr/lib/ruby/gems/1.8/gems/facter-1.5.8/bin/facter)在cli上运行facter,它工作正常,但如果我通过由ruby​​gems(/usr/bin/facter)安装的二进制文件,它抛出:/usr/lib/ruby/1.8/facter/uptime.rb:11:undefinedmethod`get_uptime'forFacter::Util::Uptime:Module(NoMethodError)from/usr/lib/ruby

  5. ruby-on-rails - 按天对 Mongoid 对象进行分组 - 2

    在控制台中反复尝试之后,我想到了这种方法,可以按发生日期对类似activerecord的(Mongoid)对象进行分组。我不确定这是完成此任务的最佳方法,但它确实有效。有没有人有更好的建议,或者这是一个很好的方法?#eventsisanarrayofactiverecord-likeobjectsthatincludeatimeattributeevents.map{|event|#converteventsarrayintoanarrayofhasheswiththedayofthemonthandtheevent{:number=>event.time.day,:event=>ev

  6. Ruby 方法() 方法 - 2

    我想了解Ruby方法methods()是如何工作的。我尝试使用“ruby方法”在Google上搜索,但这不是我需要的。我也看过ruby​​-doc.org,但我没有找到这种方法。你能详细解释一下它是如何工作的或者给我一个链接吗?更新我用methods()方法做了实验,得到了这样的结果:'labrat'代码classFirstdeffirst_instance_mymethodenddefself.first_class_mymethodendendclassSecond使用类#returnsavailablemethodslistforclassandancestorsputsSeco

  7. ruby-on-rails - Rails 3.2.1 中 ActionMailer 中的未定义方法 'default_content_type=' - 2

    我在我的项目中添加了一个系统来重置用户密码并通过电子邮件将密码发送给他,以防他忘记密码。昨天它运行良好(当我实现它时)。当我今天尝试启动服务器时,出现以下错误。=>BootingWEBrick=>Rails3.2.1applicationstartingindevelopmentonhttp://0.0.0.0:3000=>Callwith-dtodetach=>Ctrl-CtoshutdownserverExiting/Users/vinayshenoy/.rvm/gems/ruby-1.9.3-p0/gems/actionmailer-3.2.1/lib/action_mailer

  8. ruby - Highline 询问方法不会使用同一行 - 2

    设置:狂欢ruby1.9.2高线(1.6.13)描述:我已经相当习惯在其他一些项目中使用highline,但已经有几个月没有使用它了。现在,在Ruby1.9.2上全新安装时,它似乎不允许在同一行回答提示。所以以前我会看到类似的东西:require"highline/import"ask"Whatisyourfavoritecolor?"并得到:Whatisyourfavoritecolor?|现在我看到类似的东西:Whatisyourfavoritecolor?|竖线(|)符号是我的终端光标。知道为什么会发生这种变化吗? 最佳答案

  9. ruby-on-rails - 如何验证非模型(甚至非对象)字段 - 2

    我有一个表单,其中有很多字段取自数组(而不是模型或对象)。我如何验证这些字段的存在?solve_problem_pathdo|f|%>... 最佳答案 创建一个简单的类来包装请求参数并使用ActiveModel::Validations。#definedsomewhere,atthesimplest:require'ostruct'classSolvetrue#youcouldevencheckthesolutionwithavalidatorvalidatedoerrors.add(:base,"WRONG!!!")unlesss

  10. ruby - 主要 :Object when running build from sublime 的未定义方法 `require_relative' - 2

    我已经从我的命令行中获得了一切,所以我可以运行rubymyfile并且它可以正常工作。但是当我尝试从sublime中运行它时,我得到了undefinedmethod`require_relative'formain:Object有人知道我的sublime设置中缺少什么吗?我正在使用OSX并安装了rvm。 最佳答案 或者,您可以只使用“require”,它应该可以正常工作。我认为“require_relative”仅适用于ruby​​1.9+ 关于ruby-主要:Objectwhenrun

随机推荐