)
用 Python 采集小红书公开数据xhs 从零上手一篇讲透附避坑清单【免费下载链接】xhs基于小红书 Web 端进行的请求封装。https://reajason.github.io/xhs/项目地址: https://gitcode.com/gh_mirrors/xh/xhs打开小红书网页版一条条复制笔记标题、点赞数、评论区内容再手动粘进 Excel……如果您正在做竞品分析、选题调研或内容监控多半经历过这种人肉爬虫的煎熬。数据量一旦过百这种手工方式基本就不可用了。好消息是开源项目xhs已经帮您把小红书 Web 端的请求封装好了。它是一个轻量级的 Python 工具库只需传入登录后的 Cookie就能稳定地获取笔记详情、用户主页、完整评论等公开数据甚至还能直接发笔记、点赞、关注。本文就用最省事的方式带您一步步跑起来。一、最快跑通三行代码看到第一份数据先别管复杂的原理让工具先出声。xhs 对 Python 版本要求不高3.7 及以上即可安装非常简单pip install xhs不过有一点必须提前说明小红书接口有签名x-s校验单靠这个库本身还不能直接调用需要配合浏览器模拟工具生成签名。推荐您按顺序完成下面几步环境准备pip install playwright playwright install再下载一份 stealth.min.js反爬绕过脚本放到本地供签名时使用。之后在代码里构造XhsClient并传入从浏览器复制出来的 Cookie就能开始调用了from xhs import XhsClient client XhsClient(cookie您的cookie, signsign) note client.get_note_by_id(笔记ID, 笔记的xsec_token) print(note[title], note[interact_info])看到控制台打印出笔记标题和互动数据的那一刻您就正式上手了。二、能力全景这个库到底能干什么xhs 的能力可以按功能维度分成六大块下面逐层拆解方便您按需取用。1. 笔记数据从单条到批量单条笔记的核心信息标题、正文、话题、用户、点赞/收藏/评论/转发数可以通过get_note_by_id一行拿到。如果您想整理某个账号的全部笔记get_user_all_notes会分页拉取并自动组装成结构化的 Note 对象连图片 URL、视频地址都替您解析好了。更贴心的是save_files_from_note_id可以直接把一篇笔记的图片或视频批量下载到本地文件夹按笔记标题自动建目录做素材收集时非常省事。2. 用户画像主页与行为数据想知道一个博主的粉丝量、简介、主页内容get_user_info获取用户公开资料get_user_notes拉取对方发布过的笔记列表get_user_collect_notes和get_user_like_notes还能看到对方公开的收藏与点赞内容——这对于分析竞品账号的内容偏好极有价值。3. 评论体系还原真实互动评论是判断内容质量的黄金数据。get_note_all_comments会递归抓取一篇笔记下的所有评论及其子评论自动处理翻页游标最终返回一个扁平化的评论列表方便后续做情感分析或舆情统计。4. 搜索与信息流发现热门内容get_note_by_keyword支持关键词搜索还能按综合/最热/最新排序、按图文/视频过滤get_home_feed则能抓取推荐、穿搭、美食、旅行等十余个分类的信息流。想做选题调研时这两个接口是主力。5. 互动操作点赞、收藏、评论、关注除了读xhs 也封装了写的能力点赞/取消点赞、收藏/取消收藏、评论/删除评论、关注/取关一一对应一个方法。做自动化运营脚本时这些接口可以组合出完整的行为闭环。6. 发布能力图文与视频笔记进阶用户还能直接调用发布接口create_image_note上传本地图片发布图文笔记create_video_note支持视频分片上传并自动截取首帧做封面甚至支持定时发布和私密发布。相关演示在 example/login_qrcode_from_creator.py 等示例中都有体现。三、登录方案三种方式按需选择绝大多数接口都需要登录态xhs 提供了三种登录路径Cookie 直传从浏览器复制 Cookie 直接传给客户端最快捷适合快速测试扫码登录通过get_qrcode生成二维码手机扫码后轮询状态适合不想手动复制 Cookie 的场景可参考 example/login_qrcode.py手机号登录短信验证码方式登录示例见 example/login_phone.py。建议日常脚本优先用扫码或手机号登录避免 Cookie 过期后频繁手动更换。四、高手心得五个实战避坑要点用过一段时间后我总结了下面几条高频踩坑经验强烈建议您提前规避Cookie 三字段必须齐全a1、web_session、webId 缺一不可缺了会直接签名失败或返回异常数据。签名不稳定很正常重试是标配官方示例里就内置了 10 次重试逻辑遇到window._webmsxyw is not a function之类的报错别慌加上重试和适当 sleep 就好。控制请求频率批量抓取时建议在循环里加间隔如每次 1 秒避免触发 IP 限制。若收到IPBlockError说明请求过于密集需要放缓节奏或更换网络环境。多账号共用签名服务注意 a1进阶用法是把 playwright 封装成独立的 Flask 签名服务见 example/basic_sign_server.py此时务必保证各账号 Cookie 中的 a1 与签名服务保持一致否则会持续报签名错误。发布功能先在测试号上验证创建笔记、上传文件这类写操作不可逆正式使用前务必用测试账号完整跑通流程。五、常见问题 FAQQ获取笔记时要求传 xsec_token这个参数去哪找A在小红书网页版打开目标笔记浏览器地址栏里 URL 上的xsec_token参数就是直接复制传入即可。Qxhs 和那些付费采集软件相比有什么优势A免费、开源、可二次开发接口能力透明可控缺点是需要自己处理签名与反爬有一定上手门槛。Q爬取的数据能商用吗A请务必遵守平台规则与法律法规。建议只采集公开数据、控制请求频率且不用于侵犯他人权益的用途。本项目的初心也是技术学习与个人研究。Q想深入了解接口细节怎么办A推荐阅读项目自带的文档docs/crawl.rst 覆盖主页爬取的各类接口docs/basic.rst 讲签名与基础用法docs/creator.rst 说明发布功能核心源码集中在 xhs/core.py方法命名清晰、注释完整直接读代码也是一种高效学习方式。Q想体验最新功能或二次开发如何安装A可以克隆源码仓库安装git clone https://gitcode.com/gh_mirrors/xh/xhs cd xhs python setup.py install六、下一步让数据驱动您的决策从复制粘贴到自动化采集xhs 帮您省下的不只是时间更是一种数据随手可得的能力。无论您是要做电商口碑监控、竞品账号跟踪还是内容选题分析这套工具都能成为您稳定可靠的数据底座。建议的进阶路线是先用示例脚本跑通单条数据再逐步组合成批量采集任务最后加上定时调度形成自己的数据看板。现在就动手安装试试吧让第一行数据输出成为您效率提升的起点。【免费下载链接】xhs基于小红书 Web 端进行的请求封装。https://reajason.github.io/xhs/项目地址: https://gitcode.com/gh_mirrors/xh/xhs创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考