【python爬虫】 python 爬取知乎的公开收藏夹

师怀 2023-04-17 原文

前言

看看如何用 python 爬取知乎的公开收藏夹

内容

尝试

第一个方法
开始的时候用 python ，request 库进行的网页请求，在请求你的收藏夹总界面的时候还可以返回信息，这个 url, https://www.zhihu.com/people/xxx/collections,,xxx 部分可以查看自己知乎账号那儿是长怎么样的。再进入了具体的收藏夹页面的时候 https://www.zhihu.com/collection/3341994xx request 就返回不了内容。这应该是因为知乎这个页面是 js 动态加载的 (需要 js 逆向)，request 这个链接返回不了，你要的内容。。
第二个方法
用 selenium 模拟浏览器进行爬虫，selenium 是 python 一个用来控制浏览器的库 (pip 下载)，可以用来做关于浏览器的自动化，也可以用来爬虫。它需要搭配浏览器的驱动进行使用。火狐，chrome，edge 都有自己的驱动。火狐驱动地址，谷歌驱动地址，edge驱动地址。

selenium

登录知乎

下好库和驱动后，开始写一下，发现在用 selenium 操作浏览器打开知乎，输入密码登录时会出现 10001 错误，一个博客上写是因为 js 判断识别出来这是机器在操作，网上有一些解决方法，这里选取了用浏览器 debug 模式，新建了一个用户文件夹，每次打开浏览器直接控制这个新的浏览器。

如何新建浏览器用户文件
1. 找到浏览器 exe 文件目录，在这里进入 cmd 命令行模式。
2. 输入以下代码 chrome.exe --remote-debugging-port=9222 --user-data-dir="E:\data_info\selenium_data 。chrome. exe 就是对于浏览器的 exe 文件 (edge 就是 msedge. exe) , 9222 自己选一个端口号等下在代码中要写一下，最后那个是生成的新的用户目录自己写一个。
3. 对浏览器创建一个新的快捷方式放到桌面，然后右键属性，在目标这一栏填上 2 中的代码，点击就会打开一个新的浏览器，然后在这里先登录好知乎。

具体代码

from requests import options
from selenium import webdriver  # 用来驱动浏览器的
import time
import selenium
from selenium.webdriver.edge.options import Options
from selenium.webdriver.edge.service import Service
from selenium.webdriver.common.by import By
import os
os.startfile("C:\\Users\\Administrator\\Desktop\\Microsoft Edge (1).lnk") # 打开设置好的浏览器快捷方式
options = Options() # 得到edge的设置
options.add_experimental_option("debuggerAddress", "127.0.0.1:6001") # 配置浏览器的端口地址
#options.add_experimental_option('excudeSwitches',['enable-automation'])
driver=webdriver.Edge(service =Service("D:\\BaiduNetdiskWorkspace\\Lite Code\\python脚本\\firefox_selenium\\msedgedriver.exe"),options=options) # 浏览器驱动的放置地址
time.sleep(3)
write = ""

def get_all_folder(url):
    driver.get(url)
    time.sleep(2)
    href=[]
    title = driver.find_elements(By.XPATH,'(//a[@class="SelfCollectionItem-title"])')
    for ind,i in enumerate(title):
        href.append(title[ind].get_attribute('href'))
    return href

def pythonpazhihu(url,write):
    driver.get(url)
    time.sleep(3)
    #h2 = driver.find_elements(By.CLASS_NAME,"ContentItem-title")
    title = driver.find_elements(By.XPATH,'(//h2[@class="ContentItem-title"]//a)')
    h3 = driver.find_elements(By.XPATH,'(//h2[@class="ContentItem-title"]//a[@href])')
    for ind,i in enumerate(h3):
        content = str(title[ind].text)+" , "+str(h3[ind].get_attribute('href'))
        write=write+content+"\n"
        print(title[ind].text,h3[ind].get_attribute('href'))
    #print(h3.text)
    time.sleep(2)
    return write
try:    
    url_all1 = "https://www.zhihu.com/collections/mine?page=1" # 总收藏也有两页，得到这两页每个收藏夹的具体链接
    url_all2 = "https://www.zhihu.com/collections/mine?page=2"
    href1 = get_all_folder(url_all1)
    href2 = get_all_folder(url_all2)
    href2 = href1+href2
    #print(href2)
    for url_son in href2:
        for i in range(5):
            #url = 'https://www.zhihu.com/collection/7179314xx?page=%s'%(i+1)
            url = url_son+'?page=%s'%(i+1) # 对每个收藏夹链接进行5页的循环
            write = pythonpazhihu(url,write) # 把读到的标题和链接写到write变量中
finally:
    driver.close()
    with open("./zhihu.txt","w",encoding="utf-8") as fp:
        fp.write(write)

小结

代码思路就是，先打开浏览器快捷方式，访问总的收藏夹页面，得到每个的收藏夹链接，再访问每个具体链接获取收藏的标题和地址。
注意的，1. 浏览器驱动地址填写用的 service 的方式，这是 selenium 更新后新的写法。2. selenium 新的定位变成了 find_elements 有两个参数，By. xxx ，用来表示用什么方式定位，例如 By. xpath, 注意 xpath 内容要用 () 括起来。

有关【python爬虫】 python 爬取知乎的公开收藏夹的更多相关文章

python - 如何使用 Ruby 或 Python 创建一系列高音调和低音调的蜂鸣声？ - 2
关闭。这个问题是opinion-based.它目前不接受答案。想要改进这个问题？更新问题，以便editingthispost可以用事实和引用来回答它.关闭4年前。Improvethisquestion我想在固定时间创建一系列低音和高音调的哔哔声。例如:在150毫秒时发出高音调的蜂鸣声在151毫秒时发出低音调的蜂鸣声200毫秒时发出低音调的蜂鸣声250毫秒的高音调蜂鸣声有没有办法在Ruby或Python中做到这一点？我真的不在乎输出编码是什么(.wav、.mp3、.ogg等等)，但我确实想创建一个输出文件。
ruby-on-rails - 建模收藏夹 - 2
我希望将Favorite模型添加到我的User和Link模型。业务逻辑用户可以有多个链接(即可以添加多个链接)用户可以收藏多个链接(他们自己的或其他用户的)一个链接可以被多个用户收藏，但只有一个所有者我对如何为这种关联建模以及在模型就位后如何创建用户收藏夹感到困惑？classUser 最佳答案下面的数据模型怎么样:classUser:destroyhas_many:favorite_links,:through=>:favorites,:source=>:linkendclassLink:destroyhas_many:favor
Python 相当于 Perl/Ruby ||= - 2
这个问题在这里已经有了答案:关闭10年前。PossibleDuplicate:Pythonconditionalassignmentoperator对于这样一个简单的问题表示歉意，但是谷歌搜索||=并不是很有帮助；)Python中是否有与Ruby和Perl中的||=语句等效的语句？例如:foo="hey"foo||="what"#assignfooifit'sundefined#fooisstill"hey"bar||="yeah"#baris"yeah"另外，类似这样的东西的通用术语是什么？条件分配是我的第一个猜测，但Wikipediapage跟我想的不太一样。
java - 什么相当于 ruby 的 rack 或 python 的 Java wsgi？ - 2
什么是ruby的rack或python的Java的wsgi？还有一个路由库。最佳答案来自Python标准PEP333:Bycontrast,althoughJavahasjustasmanywebapplicationframeworksavailable,Java's"servlet"APImakesitpossibleforapplicationswrittenwithanyJavawebapplicationframeworktoruninanywebserverthatsupportstheservletAPI.ht
华为OD机试用Python实现 -【明明的随机数】 2023Q1A - 2
华为OD机试题本篇题目：明明的随机数题目输入描述输出描述：示例1输入输出说明代码编写思路最近更新的博客华为od2023|什么是华为od，od薪资待遇，od机试题清单华为OD机试真题大全，用Python解华为机试题|机试宝典【华为OD机试】全流程解析+经验分享,题型分享,防作弊指南华为o
python - 如何读取 MIDI 文件、更改其乐器并将其写回？ - 2
我想解析一个已经存在的.mid文件，改变它的乐器，例如从“acousticgrandpiano”到“violin”，然后将它保存回去或作为另一个.mid文件。根据我在文档中看到的内容，该乐器通过program_change或patch_change指令进行了更改，但我找不到任何在已经存在的MIDI文件中执行此操作的库.他们似乎都只支持从头开始创建的MIDI文件。最佳答案 MIDIpackage会为您完成此操作，但具体方法取决于midi文件的原始内容。一个MIDI文件由一个或多个音轨组成，每个音轨是十六个channel中任何一个上的
「Python｜Selenium｜场景案例」如何定位iframe中的元素？ - 2
本文主要介绍在使用Selenium进行自动化测试或者任务时，对于使用了iframe的页面，如何定位iframe中的元素文章目录场景描述解决方案具体代码场景描述当我们在使用Selenium进行自动化测试的时候，可能会遇到一些界面或者窗体是使用HTML的iframe标签进行承载的。对于iframe中的标签，如果直接查找是无法找到的，会抛出没有找到元素的异常。比如近在咫尺的例子就是，CSDN的登录窗体就是使用的iframe，大家可以尝试通过F12开发者模式查看到的tag_name,class_name,id或者xpath来定位中的页面元素，会抛出NoSuchElementException异常。解决
python ffmpeg 使用 pyav 转换一组图像到视频 - 2
2022/8/4更新支持加入水印水印必须包含透明图像，并且水印图像大小要等于原图像的大小pythonconvert_image_to_video.py-f30-mwatermark.pngim_dirout.mkv2022/6/21更新让命令行参数更加易用新的命令行使用方法pythonconvert_image_to_video.py-f30im_dirout.mkvFFMPEG命令行转换一组JPG图像到视频时，是将这组图像视为MJPG流。我需要转换一组PNG图像到视频，FFMPEG就不认了。pyav内置了ffmpeg库，不需要系统带有ffmpeg工具因此我使用ffmpeg的python包装p
Python 刷Leetcode题库，顺带学英语单词（31） - 2
ValidPalindromeGivenastring,determineifitisapalindrome,consideringonlyalphanumericcharactersandignoringcases. [#125]Example:"Aman,aplan,acanal:Panama"isapalindrome."raceacar"isnotapalindrome.Haveyouconsiderthatthestringmightbeempty?Thisisagoodquestiontoaskduringaninterview.Forthepurposeofthisproblem
python - 是否可以使用 Ruby 或 Python 禁用 anchor /引用来发出有效的 YAML？ - 2
是否可以在PyYAML或Ruby的Psych引擎中禁用创建anchor和引用(并有效地显式列出冗余数据)？也许我在网上搜索时遗漏了一些东西，但在Psych中似乎没有太多可用的选项，而且我也无法确定PyYAML是否允许这样做.基本原理是我必须序列化一些数据并将其以可读的形式传递给一个不是真正的技术同事进行手动验证。有些数据是多余的，但我需要以最明确的方式列出它们以提高可读性(anchor和引用是提高效率的好概念，但不是人类可读性)。Ruby和Python是我选择的工具，但如果有其他一些相当简单的方法来“展开”YAML文档，它可能就可以了。最佳答案

【python爬虫】 python 爬取知乎的公开收藏夹

前言

内容

尝试

selenium

登录知乎

具体代码

小结

有关【python爬虫】 python 爬取知乎的公开收藏夹的更多相关文章

随机推荐