【Python爬虫从入门到实战】Requests库与XPath解析详解(附豆瓣Top250抓取案例)

发布时间:2026/8/3 4:36:49

【Python爬虫从入门到实战】Requests库与XPath解析详解(附豆瓣Top250抓取案例)
前言在Python爬虫的世界里requests和lxml (XPath)是一对黄金搭档。前者负责高效地获取网页数据后者负责精准地提取目标信息。本文将结合豆瓣电影Top250实战案例带你彻底掌握这两个核心工具。第一部分基础知识体系1. Requests 库HTTP 请求的利器requests是一个基于urllib3封装的 HTTP 客户端库被称为“给人类使用的 HTTP 库”。核心特点API 简洁直观自动处理连接管理、Cookie 持久化。支持多种协议支持 Keep-Alive 和连接池。安全性支持 SSL 证书验证、Session 会话保持。自动解码内置 JSON 解码器自动处理压缩响应。关键概念URL互联网上某个资源的地址如https://www.baidu.com/s?wdpython。Headers (请求头)伪装浏览器的关键。User-Agent告诉服务器你是谁浏览器版本、操作系统。如果不加这个很容易被服务器识别为爬虫并拦截403 Forbidden。常用方法与属性方法/属性说明示例requests.get()发送 GET 请求response requests.get(url, headersheaders)requests.post()发送 POST 请求requests.post(url, datadata)response.text获取字符串形式的响应内容用于解析 HTMLresponse.content获取二进制响应内容用于下载图片、视频response.status_code获取状态码200 (成功), 404 (未找到), 500 (服务器错误)response.encoding设置/获取编码格式response.encoding utf-8IP 代理 (Proxies)当访问频率过高导致 IP 被封时需要使用代理 IP 来隐藏真实身份或突破访问限制。proxies { http: http://106.14.170.158:18, https: http://106.14.170.158:18 } requests.get(url, proxiesproxies)2. XPath 解析器精准的数据提取XPath (XML Path Language) 是一种在 XML/HTML 文档中查找信息的语言。相比于正则表达式它更适合处理结构化的 DOM 树。XPath解析器获取XPath解析器是浏览器的插件或者拓展在浏览器的插件或者拓展商城就能找到推荐下载XPath Helper以下以Microsoft拓展商城为例在我们想要获取其内容路径的页面打开XPath解析器按住shift键移动鼠标到想要的内容如果将鼠标移动到内容上面没有路径显示就单击一下左键这时就会出现相关内容。节点关系根节点整个文档的源头。父/子/兄弟节点描述元素之间的层级关系。文本节点包含在标签内的文字内容。路径表达式绝对路径从根节点开始写如/html/body/div[1]/div...不推荐太脆弱。相对路径使用//开头从全文档搜索匹配节点如//div[classitem]推荐。常用语法速查语法说明示例/选取直接子节点/div/a//选取所有后代节点不考虑位置//div//span.选取当前节点常用于循环内部继续查找..选取父节点选取属性//a/hreftext()选取文本内容//div/text()[]谓语条件筛选//div[idmain]进阶函数与轴下面通过一个本地 HTML 文件hello.html来演示 XPath 的进阶用法。该文件包含一个ul列表里面有多个带有不同id属性的li标签内容如下!DOCTYPE html html langen head meta charsetUTF-8 / title学习Xpath/title /head body ul li idlhfPython爬虫/li lirequests库/li li idzlgxqXpath解析器/li liget请求/li lipost请求/li li idzwq classc1Hello World/li /ul /body /htmlfrom lxml import etree 解析本地文件 html_etree etree.parse(D:\PYTHON基础\python\Python_spider\hello.html) 1. 查找 ul 下面的 li 标签 —— 多种路径写法 li_list1 html_etree.xpath(/html/body/ul/li/text()) # 绝对路径 li_list2 html_etree.xpath(//ul/li/text()) # 相对路径 li_list3 html_etree.xpath(//li/../text()) # 父节点 li_list4 html_etree.xpath(//li/./text()) # 当前节点 2. 查询所有带 id 属性的 li 标签 li_list5 html_etree.xpath(//ul/li[id]/text()) 3. 查找 id 为 zwq 的标签的 class 属性值 li_list6 html_etree.xpath(//ul/li[idzwq]/class) 4. 查找 id 为 zwq 的 li 标签的文本 li_list7 html_etree.xpath(//ul/li[idzwq]/text())运行输出演示# li_list1绝对路径和 li_list2相对路径输出相同 [Python爬虫, requests库, Xpath解析器, get请求, post请求, Hello World] li_list5所有带 id 属性的 li 标签文本 [Python爬虫, Xpath解析器, Hello World] li_list6id 为 zwq 的标签的 class 属性值 [c1] li_list7id 为 zwq 的 li 标签文本 [Hello World]contains()模糊匹配属性检查字符串是否包含子字符串。例如//div[contains(class, btn)]可以匹配 class 为btn-primary的标签。示例查找 id 中包含字母l的 li 标签。li_list8 html_etree.xpath(//ul/li[contains(id,l)]/text())输出[Python爬虫, Hello World]starts-with()匹配以某字符串开头的属性。示例查找 id 中以l开头的 li 标签。li_list9 html_etree.xpath(//ul/li[starts-with(id,l)]/text())输出[Python爬虫]string-length()根据字符串长度筛选。示例查找 id 长度等于 3 的 li 标签。li_list10 html_etree.xpath(//ul/li[string-length(id)3]/text())输出[Python爬虫, Hello World]逻辑运算符 or组合多个条件。示例查找 id 为lhf或zwq的 li 标签注意正确写法需要把or条件放在同一个谓语[]内而不是写成两个独立的li[...]。li_list11 html_etree.xpath(//ul/li[idlhf or idzwq]/text())输出[Python爬虫, Hello World]position() 与 last()根据位置筛选。示例查找前 3 个 li、最后一个 li、以及第 1 个 li。li_list12 html_etree.xpath(//ul/li[position()4]/text()) li_list13 html_etree.xpath(//ul/li[last()]/text()) li_list14 html_etree.xpath(//ul/li[1]/text())输出# li_list12前 3 个 li [Python爬虫, requests库, Xpath解析器] li_list13最后一个 li [Hello World] li_list14第 1 个 li [Python爬虫]索引注意 XPath 的索引是从1开始的而不是 0。例如//li[1]是第一个 li。第二部分实战演练——爬取豆瓣电影 Top2501. 需求分析目标抓取电影名称、导演、主演、年份、国家、类型、评分、评价人数及引言。存储保存为 CSV 文件。难点分页处理URL 规律。数据清洗文本中包含大量\xa0空格和换行符。异常处理防止程序中断。2. 完整代码实现from lxml import etree import requests import csv import time 配置区 1. 构造请求头伪装成浏览器 headers { User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36 } 2. 准备CSV文件 with open(douban_250.csv, w, encodingutf-8-sig, newline) as file: writer csv.writer(file) # 写入表头 writer.writerow([电影名称, 导演, 主演, 年份, 国家, 类型, 评分, 评价人数, 引言]) # 循环抓取区 # 豆瓣Top250共10页每页25部start参数每次增加25 for start in range(0, 250, 25): url fhttps://movie.douban.com/top250?start{start} print(f正在抓取第 {start // 25 1} 页: {url}) try: # 3. 发送请求 response requests.get(urlurl, headersheaders, timeout10) # 检查响应状态非200会抛出异常 response.raise_for_status() # 设置编码防止乱码 response.encoding utf-8 except Exception as e: print(f页面请求失败{e}) continue 4. 解析 HTML html etree.HTML(response.text) 获取所有电影项的列表定位到每一个电影的容器 items html.xpath(//div[classitem]) 数据提取与清洗区 for item in items: try: # --- 提取电影名称 --- # .// 表示在当前 item 节点下查找 title_list item.xpath(.//span[classtitle][1]/text()) title title_list[0].strip() if title_list else 暂无名称 # --- 提取详细信息导演/主演/年份等 --- # 这里获取的是 p 标签下的所有文本列表通常包含两行 info_lines item.xpath(.//div[classbd]/p[1]/text()) # 初始化变量 director actors year country movie_type 暂无数据 if info_lines: # 清洗数据去除首尾空白和 \xa0 (不间断空格) # replace(\xa0, ) 是关键步骤 clean_line_1 info_lines[0].strip().replace(\xa0, ).replace(\n, ) # 解析第一行导演和主演 if 主演: in clean_line_1: parts clean_line_1.split(主演:) director parts[0].replace(导演:, ).strip() actors parts[1].strip() elif 导演: in clean_line_1: director clean_line_1.replace(导演:, ).strip() # 解析第二行年份 / 国家 / 类型 if len(info_lines) amp;amp;gt; 1: line_2 info_lines[1].strip().replace(\xa0, ).replace(\n, ) # 使用 split(/) 分割注意有些数据可能缺失 details [x.strip() for x in line_2.split(/)] if len(details) amp;amp;gt; 3: year details[0] country details[1] movie_type details[2] elif len(details) 2: year details[0] country details[1] # --- 提取评分 --- rating_list item.xpath(.//span[classrating_num]/text()) rating rating_list[0].strip() if rating_list else 暂无评分 # --- 提取评价人数 --- # 这里的 xpath 路径可能需要根据实际网页微调通常是 span[4] 或者通过 text 内容判断 rating_num_raw item.xpath(.//div[classstar]/span[4]/text()) rating_num rating_num_raw[0].replace(人评价, ).strip() if rating_num_raw else 0 # --- 提取引言 --- quote_list item.xpath(.//p[classquote]/span/text()) quote quote_list[0].strip() if quote_list else 暂无引言 # 5. 写入 CSV writer.writerow([title, director, actors, year, country, movie_type, rating, rating_num, quote]) except Exception as e: print(f解析单条数据出错: {e}) continue 礼貌爬取休眠 2 秒 time.sleep(2) print(抓取完成数据已保存至 douban_250.csv)3. 代码关键点解析避坑指南关于\xa0的处理在实战中你会发现打印出来的字符串里有很多\xa0。这是 HTML 中的“不间断空格”Non-breaking space。问题直接使用.split()有时无法完美分割或者导致字符串看起来很乱。解决使用replace(\xa0, )将其替换为普通空格然后再进行strip()和split()操作。XPath 的相对路径在for item in items:循环内部提取具体字段时XPath 必须以.开头例如.//span...。错误写法//span[classtitle]—— 这会去整个网页找所有的 title导致每次循环都拿到第一部电影的名字。正确写法.//span[classtitle]—— 只在当前的item范围内查找。异常捕获的重要性网络请求和数据处理都非常容易出错比如某个电影没有引言或者网络突然断开。使用try-except包裹请求代码防止因一次 404 导致整个程序崩溃。使用try-except包裹解析代码防止因某部电影数据结构特殊缺字段导致报错中断。总结通过本案例我们不仅复习了requests发送请求和XPath解析数据的语法更重要的是学习了如何处理脏数据。爬虫不仅仅是把网页下载下来更核心的价值在于将非结构化的网页数据转化为结构化的、干净的数据。希望这篇教程对你的学习有所帮助如有问题欢迎在评论区交流。

相关新闻

UReport2报表图片加载优化:动态URL参数重写与防裂图实践

UReport2报表图片加载优化:动态URL参数重写与防裂图实践

2026/8/3 4:36:49

1. 项目概述:当报表图片加载遇到“拦路虎”最近在折腾一个老项目,里面用到了UReport2这个报表引擎。需求很简单,就是要在报表里动态插入一些图片,比如用户头像、产品示意图或者公司Logo。按理说,UReport2本身是支持图片…

如何快速配置XUnity.AutoTranslator实现游戏文本自动翻译

如何快速配置XUnity.AutoTranslator实现游戏文本自动翻译

2026/8/3 4:36:49

如何快速配置XUnity.AutoTranslator实现游戏文本自动翻译 【免费下载链接】XUnity.AutoTranslator 项目地址: https://gitcode.com/gh_mirrors/xu/XUnity.AutoTranslator XUnity.AutoTranslator是一款强大的Unity游戏本地化工具,能够自动翻译游戏内文本&…

Unity贝塞尔曲线插件实战:从原理到高效路径动画实现

Unity贝塞尔曲线插件实战:从原理到高效路径动画实现

2026/8/3 4:26:49

1. 项目概述:为什么Unity开发者绕不开贝塞尔曲线?如果你在Unity里做过UI动效、角色移动路径、或者任何需要平滑过渡的动画,大概率已经和贝塞尔曲线打过照面了。这东西听起来有点数学,但用起来是真香。简单说,它就是一种…

零基础6小时掌握AI编程:从环境搭建到项目实战的完整指南

零基础6小时掌握AI编程:从环境搭建到项目实战的完整指南

2026/8/3 5:26:51

最近在尝试用AI辅助编程时,发现很多非技术背景的朋友对Claude Code这类工具既好奇又无从下手。网上的资料要么太零散,要么默认读者有编程基础,导致学习门槛很高。本文将从零开始,手把手带你掌握Claude Code,即使你从未…

Slurm-web:企业级HPC集群管理的5大架构优势与部署指南

Slurm-web:企业级HPC集群管理的5大架构优势与部署指南

2026/8/3 5:26:51

Slurm-web:企业级HPC集群管理的5大架构优势与部署指南 【免费下载链接】Slurm-web Open source web interface for Slurm HPC & AI clusters 项目地址: https://gitcode.com/gh_mirrors/sl/Slurm-web 在现代高性能计算环境中,Slurm作为主流的…

5步搞定Windows安卓应用安装:APK Installer新手完全指南

5步搞定Windows安卓应用安装:APK Installer新手完全指南

2026/8/3 5:26:51

5步搞定Windows安卓应用安装:APK Installer新手完全指南 【免费下载链接】APK-Installer An Android Application Installer for Windows 项目地址: https://gitcode.com/GitHub_Trending/ap/APK-Installer 你是否曾经希望在Windows电脑上直接安装安卓应用&a…

小说下载器:跨平台小说下载的终极解决方案

小说下载器:跨平台小说下载的终极解决方案

2026/8/3 5:26:51

小说下载器:跨平台小说下载的终极解决方案 【免费下载链接】novel-downloader 一个可扩展的通用型小说下载器。 项目地址: https://gitcode.com/gh_mirrors/no/novel-downloader 在数字阅读时代,你是否遇到过这样的困境:追更数月的小说…

如何三步解锁Wand游戏修改器的完整专业版功能

如何三步解锁Wand游戏修改器的完整专业版功能

2026/8/3 5:26:51

如何三步解锁Wand游戏修改器的完整专业版功能 【免费下载链接】Wand-Enhancer Advanced UX and interoperability extension for Wand (WeMod) app 项目地址: https://gitcode.com/GitHub_Trending/we/Wand-Enhancer 还在为Wand(原WeMod)游戏修改…

OpenSubtitlesDownload终极指南:如何为视频自动匹配精准字幕

OpenSubtitlesDownload终极指南:如何为视频自动匹配精准字幕

2026/8/3 5:16:51

OpenSubtitlesDownload终极指南:如何为视频自动匹配精准字幕 【免费下载链接】OpenSubtitlesDownload Automatically find and download the right subtitles for your favorite videos! 项目地址: https://gitcode.com/gh_mirrors/op/OpenSubtitlesDownload …

ncmdumpGUI:一键解锁网易云音乐ncm文件的终极解决方案

ncmdumpGUI:一键解锁网易云音乐ncm文件的终极解决方案

2026/8/3 4:49:52

ncmdumpGUI:一键解锁网易云音乐ncm文件的终极解决方案 【免费下载链接】ncmdumpGUI C#版本网易云音乐ncm文件格式转换,Windows图形界面版本 项目地址: https://gitcode.com/gh_mirrors/nc/ncmdumpGUI 你是否曾经从网易云音乐下载了心爱的歌曲&am…

分布式配置中心选型实战:Nacos与Consul在创业场景下的对比

分布式配置中心选型实战:Nacos与Consul在创业场景下的对比

2026/8/2 0:04:43

分布式配置中心选型实战:Nacos与Consul在创业场景下的对比工程导读:本文深入讨论 分布式配置中心选型实战:Nacos与Consul在创业场景下的对比 在生产工程实践中的核心落地方案。基于 分布式架构与微服务设计 视角,剖析实际痛点、架…

MoneyPrinterPlus实战指南:AI视频批量生成与自动化发布完整解决方案

MoneyPrinterPlus实战指南:AI视频批量生成与自动化发布完整解决方案

2026/8/2 0:04:43

MoneyPrinterPlus实战指南:AI视频批量生成与自动化发布完整解决方案 【免费下载链接】MoneyPrinterPlus AI一键批量生成各类短视频,自动批量混剪短视频,自动把视频发布到抖音,快手,小红书,视频号上,赚钱从来没有这么容易过! 支持本地语音模型chatTTS,fasterwhisper,…

从提示词小白到AI内容架构师(20年技术老兵的6阶能力跃迁图谱,仅剩最后87个免费解读名额)

从提示词小白到AI内容架构师(20年技术老兵的6阶能力跃迁图谱,仅剩最后87个免费解读名额)

2026/8/3 0:06:20

更多请点击: https://codechina.net 第一章:AI写作能力跃迁的认知革命 过去五年,AI写作已从“模板填充”迈入“语义共建”阶段——模型不再仅复述训练数据中的句式,而是基于跨文档推理、意图锚定与风格自适应,动态构建…

AU-48八米拾音的信噪比衰减与降噪门限耦合分析

AU-48八米拾音的信噪比衰减与降噪门限耦合分析

2026/8/3 0:06:20

一、"拾音 8 米"这个指标该怎么读AU-48 的规格里,麦克风拾取范围写的是 10cm-800cm,配合 T1/T2 参数切换可选四档:中距离 0.5-2m、近距离 0.1-0.2m、远距离 0.5-5m、超远距离 0.5-8m。"能拾音 8 米"这句话本身没错&#…

LangChain 从 Demo 到团队落地,真正卡壳的是哪一步?

LangChain 从 Demo 到团队落地,真正卡壳的是哪一步?

2026/8/3 0:06:20

聊《LangChain并不难,难的是知道什么时候不该用》之前,先说一句实在的:别急着背概念,先看它在真实项目里到底解决什么问题。 摘要 摘要:很多人学 LangChain 都是从调个 API 开始,跑通一个 Demo 觉得挺简单…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/2 17:06:42

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/2 5:08:03

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/3 2:41:27

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…