Python爬虫：抓取多级页面数据

Python秒杀 2023-04-10 原文

前面讲解的爬虫案例都是单级页面数据抓取，但有些时候，只抓取一个单级页面是无法完成数据提取的。本节讲解如何使用爬虫抓取多级页面的数据。

在爬虫的过程中，多级页面抓取是经常遇见的。下面以抓取二级页面为例，对每级页面的作用进行说明：

一级页面提供了获取二级页面的访问链接。
二级页面作为详情页用来提取所需数据。

一级页面以<a>标签的形式链接到二级页面，只有在二级页面才可以提取到所需数据。

多级页面分析

下面以电影天堂2020 新片精品为案例进行讲解，将每部影片的名称，以及下载链接抓取下来。首先点击“更多”进入一级页面，如下图所示：

图1：Python爬虫多级页面抓取

1) 寻找url规律

通过简单分析可以得知一级与二级页面均为静态页面，接下来分析 url 规律，通过点击第 1 页，第 2 页 …，其规律如下：

第1页 ：https://www.dytt8.net/html/gndy/dyzz/list_23_1.html
第2页 ：https://www.dytt8.net/html/gndy/dyzz/list_23_2.html
第n页 ：https://www.dytt8.net/html/gndy/dyzz/list_23_n.html

2) 确定正则表达式

通过元素审查可知一级页面的元素结构如下：

图2：页面元素分析

其正则表达式如下：

 <table width="100%".*?<td width="5%".*?<a href="(.*?)".*?ulink">.*?</table>

点击二级页面进入详情页，通过开发者工具分析想要数据的网页元素，即电影名称，和下载链接，其正则表达式如下：

<div class="title_all"><h1><font color=#07519a>(.*?)</font></h1></div>.*?<div><a href="(.*?)">.*?</a>

爬虫增量抓取

爬虫是一种效率很低的程序，非常消耗计算机资源。对于聚焦爬虫程序而言，需要每天对特定的网站进行数据抓取，如果每次都去抓取之前已经抓取过的数据，就会白白消耗了时间和资源。而增量爬虫是指通过监测网站更新的情况，只抓取最新数据的一种方式，这样就大大降低了资源的消耗。

对于本节案例来说，电影天堂网站每天都会更新内容，因此编写一个增量抓取的爬虫程序是非常合适的。

那么要如何判断爬虫程序是否已抓取过二级页面的 url 呢？其实，当您第一次运行爬虫程序时，爬虫会将所有的 url 抓取下来，然后将这些 url 放入数据库中。为了提高数据库的查询效率，您可以为每一个 url 生成专属的“指纹”。当网站更新后，第二次运行爬虫程序时，程序只会对数据库中不存在的指纹进行抓取。

程序代码实现

1) 建库建表

将抓取的数据的存放至 MySQL 数据库，需要先进行建库建表操作。注意，这里需要将 url 指纹单独存放在一张表中，如下所示：

create database movieskydb charset utf8;
use movieskydb;
create table request_finger(
finger char(60)
)charset=utf8;
create table movieinfo(
moviename varchar(300),
downloadaddr varchar(600)
)charset=utf8;

2) url指纹生成

您可以使用 Python 内置模块 md5 来生成加密“指纹”，如下所示。

#导入模块
from hashlib import md5
#待加密的url
url=“https://www.dytt8.net/html/gndy/dyzz/20210226/61131.html”
生成MD5对象
secret = md5()
加密url
secret.update(url.encode())
提取十六进制的加密串
finger = secret.hexdigest()
print(finger)

输出结果：

2d5e46ee52756e8ae59c9ba42230b883

3) 程序完整代码

-- coding: utf-8 --
from urllib import request
import re
import time
import random
import pymysql
from hashlib import md5
from ua_info import ua_list
import sys
class MovieSkySpider(object):
def init(self):
self.url = ‘https://www.dytt8.net/html/gndy/dyzz/list_23_{}.html’
self.db = pymysql.connect(
‘localhost’,‘root’,‘123456’,‘movieskydb’,
charset=‘utf8’
)
self.cursor = self.db.cursor()
1.请求函数
def get_html(self, url):
headers = {‘User-Agent’: random.choice(ua_list)}
req = request.Request(url=url, headers=headers)
res = request.urlopen(req)
本网站使用gb2312的编码格式
html = res.read().decode(‘gb2312’, ‘ignore’)
return html
2.正则解析函数
def re_func(self,re_bds,html):
pattern = re.compile(re_bds,re.S)
r_list = pattern.findall(html)
return r_list
3.提取数据函数
def parse_html(self,one_url):
调用请求函数，获取一级页面
one_html = self.get_html(one_url)
re_bds = ‘<table width=“100%”.?<td width=“5%”.?<a href=“(.?)".?ulink”>.*?’
获取二级页面链接
link_list: [‘/html//html/gndy/dyzz/20210226/61131.html’,‘/html/xxx’,‘’,‘’]
link_list = self.re_func(re_bds,one_html)
for link in link_list:
判断是否需要爬取此链接
1.获取指纹
拼接二级页面url
two_url = ‘https://www.dytt8.net’ + link
s = md5()
#加密url，需要是字节串
s.update(two_url.encode())
生成指纹，获取十六进制加密字符串，
finger = s.hexdigest()
2.通过函数判断指纹在数据库中是否存在
if self.is_hold_on(finger):
抓取二级页面数据
self.save_html(two_url)
time.sleep(random.randint(1,2))
抓取后，把想用的url专属指纹存入数据库
ins = ‘insert into request_finger values (%s)’
self.cursor.execute(ins,[finger])
self.db.commit()
else:
sys.exit(‘更新完成’)
4.判断链接是否已经抓取过
def is_hold_on(self,finger):
查询数据库
sql=‘select finger from request_finger where finger=%s’
execute()函数返回值为受影响的行数（即0或者非0）
r = self.cursor.execute(sql,[finger])
如果为0表示没有抓取过
if not r:
return True
5.解析二级页面，获取数据（名称与下载链接）
def save_html(self,two_url):
two_html = self.get_html(two_url)
re_bds = '

(.*?)
\
.*?

若要查询数据库存储数据，执行以下命令即可：

mysql> select * from movieinfo\G

输出如下，如下图所示：

图3：MySQL数据库存储数据

在二级页面提取数据时要注意该页面的类型。该网站在二级页面使用了两种类型的网页结构，另外一种页面结构的正则表达式如下所示：

<div class="title_all"><h1><font color=#07519a>(.*?)</font></h1></div>.*?<td style="WORD-WRAP.*?>.*?>(.*?)</a>

若要抓取此类页面的数据，需要更换二级页面正则表达式。

零基础Python学习资源介绍

👉Python学习路线汇总👈

温馨提示：篇幅有限，已打包文件夹获取方式在：点击这里【 Python全套资料】即可获取。

👉Python必备开发工具👈

温馨提示：篇幅有限，已打包文件夹获取方式在：点击这里【 Python全套资料】即可获取。

👉Python学习视频600合集👈

观看零基础学习视频，看视频学习是最快捷也是最有效果的方式，跟着视频中老师的思路，从基础到深入，还是很容易入门的。

👉实战案例👈

光学理论是没用的，要学会跟着一起敲，要动手实操，才能将自己的所学运用到实际当中去，这时候可以搞点实战案例来学习。

👉100道Python练习题👈检查学习结果。

👉面试刷题👈

温馨提示：篇幅有限，已打包文件夹获取方式在：点击这里【 Python全套资料】即可获取。

爬虫 Python lt gt amp

有关Python爬虫：抓取多级页面数据的更多相关文章

python - 如何使用 Ruby 或 Python 创建一系列高音调和低音调的蜂鸣声？ - 2
关闭。这个问题是opinion-based.它目前不接受答案。想要改进这个问题？更新问题，以便editingthispost可以用事实和引用来回答它.关闭4年前。Improvethisquestion我想在固定时间创建一系列低音和高音调的哔哔声。例如:在150毫秒时发出高音调的蜂鸣声在151毫秒时发出低音调的蜂鸣声200毫秒时发出低音调的蜂鸣声250毫秒的高音调蜂鸣声有没有办法在Ruby或Python中做到这一点？我真的不在乎输出编码是什么(.wav、.mp3、.ogg等等)，但我确实想创建一个输出文件。
ruby - 解析 RDFa、微数据等的最佳方式是什么，使用统一的模式/词汇(例如 schema.org)存储和显示信息 - 2
我主要使用Ruby来执行此操作，但到目前为止我的攻击计划如下:使用gemsrdf、rdf-rdfa和rdf-microdata或mida来解析给定任何URI的数据。我认为最好映射到像schema.org这样的统一模式，例如使用这个yaml文件，它试图描述数据词汇表和opengraph到schema.org之间的转换:#SchemaXtoschema.orgconversion#data-vocabularyDV:name:namestreet-address:streetAddressregion:addressRegionlocality:addressLocalityphoto:i
ruby - Ruby 有 `Pair` 数据类型吗？ - 2
有时我需要处理键/值数据。我不喜欢使用数组，因为它们在大小上没有限制(很容易不小心添加超过2个项目，而且您最终需要稍后验证大小)。此外，0和1的索引变成了魔数(MagicNumber)，并且在传达含义方面做得很差(“当我说0时，我的意思是head...”)。散列也不合适，因为可能会不小心添加额外的条目。我写了下面的类来解决这个问题:classPairattr_accessor:head,:taildefinitialize(h,t)@head,@tail=h,tendend它工作得很好并且解决了问题，但我很想知道:Ruby标准库是否已经带有这样一个类？最佳
Python 相当于 Perl/Ruby ||= - 2
这个问题在这里已经有了答案:关闭10年前。PossibleDuplicate:Pythonconditionalassignmentoperator对于这样一个简单的问题表示歉意，但是谷歌搜索||=并不是很有帮助；)Python中是否有与Ruby和Perl中的||=语句等效的语句？例如:foo="hey"foo||="what"#assignfooifit'sundefined#fooisstill"hey"bar||="yeah"#baris"yeah"另外，类似这样的东西的通用术语是什么？条件分配是我的第一个猜测，但Wikipediapage跟我想的不太一样。
java - 什么相当于 ruby 的 rack 或 python 的 Java wsgi？ - 2
什么是ruby的rack或python的Java的wsgi？还有一个路由库。最佳答案来自Python标准PEP333:Bycontrast,althoughJavahasjustasmanywebapplicationframeworksavailable,Java's"servlet"APImakesitpossibleforapplicationswrittenwithanyJavawebapplicationframeworktoruninanywebserverthatsupportstheservletAPI.ht
ruby - 我如何添加二进制数据来遏制 POST - 2
我正在尝试使用Curbgem执行以下POST以解析云curl-XPOST\-H"X-Parse-Application-Id:PARSE_APP_ID"\-H"X-Parse-REST-API-Key:PARSE_API_KEY"\-H"Content-Type:image/jpeg"\--data-binary'@myPicture.jpg'\https://api.parse.com/1/files/pic.jpg用这个:curl=Curl::Easy.new("https://api.parse.com/1/files/lion.jpg")curl.multipart_form_
世界前沿3D开发引擎HOOPS全面讲解——集3D数据读取、3D图形渲染、3D数据发布于一体的全新3D应用开发工具 - 2
无论您是想搭建桌面端、WEB端或者移动端APP应用，HOOPSPlatform组件都可以为您提供弹性的3D集成架构，同时，由工业领域3D技术专家组成的HOOPS技术团队也能为您提供技术支持服务。如果您的客户期望有一种在多个平台（桌面/WEB/APP，而且某些客户端是“瘦”客户端）快速、方便地将数据接入到3D应用系统的解决方案，并且当访问数据时，在各个平台上的性能和用户体验保持一致，HOOPSPlatform将帮助您完成。利用HOOPSPlatform，您可以开发在任何环境下的3D基础应用架构。HOOPSPlatform可以帮您打造3D创新型产品，HOOPSSDK包含的技术有：快速且准确的CAD
华为OD机试用Python实现 -【明明的随机数】 2023Q1A - 2
华为OD机试题本篇题目：明明的随机数题目输入描述输出描述：示例1输入输出说明代码编写思路最近更新的博客华为od2023|什么是华为od，od薪资待遇，od机试题清单华为OD机试真题大全，用Python解华为机试题|机试宝典【华为OD机试】全流程解析+经验分享,题型分享,防作弊指南华为o
FOHEART H1数据手套驱动Optitrack光学动捕双手运动(Unity3D) - 2
本教程将在Unity3D中混合Optitrack与数据手套的数据流，在人体运动的基础上，添加双手手指部分的运动。双手手背的角度仍由Optitrack提供，数据手套提供双手手指的角度。 01 客户端软件分别安装MotiveBody与MotionVenus并校准人体与数据手套。MotiveBodyMotionVenus数据手套使用、校准流程参照：https://gitee.com/foheart_1/foheart-h1-data-summary.git02 数据转发打开MotiveBody软件的Streaming，开始向Unity3D广播数据；MotionVenus中设置->选项选择Unit
使用canal同步MySQL数据到ES - 2
文章目录一、概述简介原理模块二、配置Mysql使用版本环境要求1.操作系统2.mysql要求三、配置canal-server离线下载在线下载上传解压修改配置单机配置集群配置分库分表配置1.修改全局配置2.实例配置垂直分库水平分库3.修改group-instance.xml4.启动监听四、配置canal-adapter1修改启动配置2配置映射文件3启动ES数据同步查询所有订阅同步数据同步开关启动4.验证五、配置canal-admin一、概述简介canal是Alibaba旗下的一款开源项目，Java开发。基于数据库增量日志解析，提供增量数据订阅&消费。Git地址：https://github.co

Python爬虫：抓取多级页面数据

多级页面分析

1) 寻找url规律

2) 确定正则表达式

爬虫增量抓取

程序代码实现

1) 建库建表

2) url指纹生成

生成MD5对象

加密url

提取十六进制的加密串

3) 程序完整代码

-- coding: utf-8 --

1.请求函数

本网站使用gb2312的编码格式

2.正则解析函数

3.提取数据函数

调用请求函数，获取一级页面

获取二级页面链接

link_list: [‘/html//html/gndy/dyzz/20210226/61131.html’,‘/html/xxx’,‘’,‘’]

判断是否需要爬取此链接

1.获取指纹

拼接二级页面url

生成指纹，获取十六进制加密字符串，

2.通过函数判断指纹在数据库中是否存在

抓取二级页面数据

抓取后，把想用的url专属指纹存入数据库

4.判断链接是否已经抓取过

查询数据库

execute()函数返回值为受影响的行数（即0或者非0）

如果为0表示没有抓取过

5.解析二级页面，获取数据（名称与下载链接）

(.*?)

零基础Python学习资源介绍

有关Python爬虫：抓取多级页面数据的更多相关文章

随机推荐