Highlights
- 1Multi-platform crawler: XHS, Douyin, Kuaishou, Bilibili, Weibo, Tieba, Zhihu
- 2Reuses Chrome login state via CDP/Playwright to avoid JS reverse engineering
- 3WebUI + exports (CSV/JSON/SQLite) and MediaCrawlerPro upgrade announced
NanmiCoder/MediaCrawler
小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 | 评论爬虫、微博帖子 | 评论爬虫、百度贴吧帖子 | 百度贴吧评论回复爬虫 | 知乎问答文章|评论爬虫
snapshot: 2026-07-28
scraped_at: Jul 28, 2026, 1:51 AM
period stars: +362
stars: 58,240
forks: 11,594
Language: Python
Summary
The generated summary body for the selected provider.
Highlights
Translation
Translated body generated separately from the summary.
No translation available yet.
README
Captured original README content.
<details> <summary>🖥️ <strong>WebUI 可视化操作界面</strong></summary> <img src="docs/static/images/img_8.png" alt="WebUI 界面预览"> </details> <details> <summary>🔗 <strong>使用 Python 原生 venv 管理环境(不推荐)</strong></summary> </details> <table> <thead> <tr> <th width="220">赞助商</th> <th align="left">介绍</th> </tr> </thead> <tbody> <tr> <td align="center" valign="middle"> <a href="https://tikhub.io/?utm_source=github.com/NanmiCoder/MediaCrawler&utm_medium=marketing_social&utm_campaign=retargeting&utm_content=carousel_ad"><img src="docs/static/images/tikhub_banner_zh.png" width="180" alt="TikHub"></a> </td> <td valign="middle"> <a href="https://tikhub.io/?utm_source=github.com/NanmiCoder/MediaCrawler&utm_medium=marketing_social&utm_campaign=retargeting&utm_content=carousel_ad">TikHub.io</a> 提供 900+ 高稳定性数据接口,覆盖 TK、DY、XHS、Y2B、Ins、X 等 14+ 海内外主流平台,支持用户、内容、商品、评论等多维度公开数据 API,并配套 4000 万+ 已清洗结构化数据集,使用邀请码 <code>cfzyejV9</code> <a href="https://tikhub.io/?utm_source=github.com/NanmiCoder/MediaCrawler&utm_medium=marketing_social&utm_campaign=retargeting&utm_content=carousel_ad">注册并充值</a>,即可额外获得 $2 赠送额度。 </td> </tr> <tr> <td align="center" valign="middle"> <a href="https://www.atlascloud.ai/?utm_source=github&utm_medium=link&utm_campaign=mei%27da%27c%27rmeidacrawler"><img width="160" alt="Atlas Cloud" src="docs/static/images/atlas_cloud_logo_black.png#gh-light-mode-only"><img width="160" alt="Atlas Cloud" src="docs/static/images/atlas_cloud_logo_white.png#gh-dark-mode-only"></a> </td> <td valign="middle"> <a href="https://www.atlascloud.ai/?utm_source=github&utm_medium=link&utm_campaign=mei%27da%27c%27rmeidacrawler">Atlas Cloud</a> 是一个全模态 AI 推理平台,让开发者通过统一的 AI API 访问视频生成、图像生成和 LLM API,无需分别维护多个厂商集成,即可调用 300+ 精选模型。Atlas Cloud 最新推出 <a href="https://www.atlascloud.ai/console/coding-plan">coding plan 优惠</a>,为开发者提供更具性价比的 API 访问预算。 </td> </tr> <tr> <td align="center" valign="middle"> <a href="https://bloome.im/app?ref=NanmiCoder&utm_medium=github&utm_source=NanmiCoder-MediaCrawler-ivor-202607"><img src="docs/static/images/bloome_logo.png" width="180" alt="Bloome"></a> </td> <td valign="middle"> <a href="https://bloome.im/app?ref=NanmiCoder&utm_medium=github&utm_source=NanmiCoder-MediaCrawler-ivor-202607">Bloome</a> 是一个 AI Agent IM 平台——让多个 AI agent(Claude、ChatGPT、DeepSeek 等)和你在同一个对话里像团队成员一样协作,自动分工、互相校对,直接生成表格、文档与可视化看板。零配置、云端运行,网页和手机都能用,还能把配好的 agent 一键分享给团队。👉 <a href="https://bloome.im/app?ref=NanmiCoder&utm_medium=github&utm_source=NanmiCoder-MediaCrawler-ivor-202607">试试 Bloome</a> </td> </tr> <tr> <td align="center" valign="middle"> <a href="https://go.nodemaven.com/MediaCrawler"><img src="docs/static/images/nodemaven_logo.svg" width="180" alt="NodeMaven"></a> </td> <td valign="middle"> <a href="https://go.nodemaven.com/MediaCrawler">NodeMaven</a> 提供稳定可靠的高质量代理服务,适用于自动化、网页抓取、SEO 研究和社交媒体管理。服务支持 99.9% 可用性、最长 7 天的粘性会话、IP 质量筛选(所有代理的欺诈评分均低于 97%)、无需 KYC,以及最高 10% 的流量返现。MediaCrawler 用户使用优惠码 <code>CRAWLER35</code> 可享移动和住宅代理 35% 折扣,使用 <code>CRAWLER40</code> 可享 ISP(静态)代理 40% 折扣。👉 <a href="https://go.nodemaven.com/MediaCrawler">访问 NodeMaven</a> </td> </tr> </tbody> </table> <table> <tr> <td align="center" width="33%"> <img src="docs/static/images/wechat_pay.jpeg" width="250" alt="微信赞赏"><br> <b>微信赞赏</b> </td> <td align="center" width="33%"> <img src="docs/static/images/zfb_pay.png" width="250" alt="支付宝"><br> <b>支付宝</b> </td> <td align="center" width="33%"> <a href="https://buymeacoffee.com/relakkes" target="_blank"> <img src="docs/static/images/bmc_button.png" width="250" alt="Buy Me a Coffee"> </a><br> <b>Buy Me a Coffee</b> </td> </tr> </table> <div id="disclaimer"> </div>免责声明:
MediaCrawler is an open-source Python toolkit for scraping public content and comments from major Chinese social platforms (小红书/XHS、抖音/Douyin、快手、B站/Bilibili、微博、百度贴吧、知乎). The project uses Playwright browser automation and a CDP mode to reuse real Chrome login state (cookies, extensions) so it can obtain JS signature parameters without doing heavy JS reverse engineering. The README lists concrete features: keyword search, fetch by specific post ID, two-level comments, creator homepage crawl, login-state caching, proxy pool support, and comment word-cloud generation. Data can be exported to CSV/JSON/JSONL/Excel/SQLite/MySQL, and a WebUI (Vite + backend API) is provided for visual configuration, runtime logs and data preview.
大家请以学习为目的使用本仓库⚠️⚠️⚠️⚠️,爬虫违法违规的案件 <br>
本仓库的所有内容仅供学习和参考之用,禁止用于商业用途。任何人或组织不得将本仓库的内容用于非法用途或侵犯他人合法权益。本仓库所涉及的爬虫技术仅用于学习和研究,不得用于对其他平台进行大规模爬虫或其他非法行为。对于因使用本仓库内容而引起的任何法律责任,本仓库不承担任何责任。使用本仓库的内容即表示您同意本免责声明的所有条款和条件。
点击查看更为详细的免责声明。点击跳转
一个功能强大的多平台自媒体数据采集工具,支持小红书、抖音、快手、B站、微博、贴吧、知乎等主流平台的公开信息抓取。
| 平台 | 关键词搜索 | 指定帖子ID爬取 | 二级评论 | 指定创作者主页 | 登录态缓存 | IP代理池 | 生成评论词云图 |
|---|---|---|---|---|---|---|---|
| 小红书 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| 抖音 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| 快手 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| B 站 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| 微博 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| 贴吧 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| 知乎 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
<strong>MediaCrawlerPro 重磅发布!开源不易,欢迎订阅支持</strong>
专注于学习成熟项目的架构设计,不仅仅是爬虫技术,Pro 版本的代码设计思路同样值得深入学习!
MediaCrawlerPro 相较于开源版本的核心优势:
点击查看:MediaCrawlerPro 项目主页 更多介绍
💡 如果这个项目对您有帮助,请给个 ⭐ Star 支持一下!
在进行下一步操作之前,请确保电脑上已经安装了 uv:
uv --version,如果正常显示版本号,证明已经安装成功项目依赖 Node.js,请前往官网下载安装:
# 进入项目目录
cd MediaCrawler
# 使用 uv sync 命令来保证 python 版本和相关依赖包的一致性
uv sync
如果使用默认的 CDP 模式(连接已有 Chrome 浏览器),无需安装浏览器驱动。仅在使用标准 Playwright 模式时需要安装。
# 仅在标准 Playwright 模式下需要安装浏览器驱动
uv run playwright install
项目默认使用 CDP 模式连接用户已有的 Chrome 浏览器,可以复用浏览器已有的登录状态、Cookie、扩展等,大幅降低平台风控检测风险。
使用前需要:
chrome://inspect/#remote-debugging,勾选 "Allow remote debugging for this browser instance"Server running at: 127.0.0.1:9222 表示已就绪💡 提示:运行爬虫后,Chrome 浏览器会弹出确认对话框,点击"接受"即可。程序会等待用户确认,60秒内操作完成即可。
如果不想使用 CDP 模式,可以在
config/base_config.py中设置ENABLE_CDP_MODE = False切换为标准 Playwright 模式。
# 在 config/base_config.py 查看配置项目功能,写的有中文注释
# 从配置文件中读取关键词搜索相关的帖子并爬取帖子信息与评论
uv run main.py --platform xhs --lt qrcode --type search
# 从配置文件中读取指定的帖子ID列表获取指定帖子的信息与评论信息
uv run main.py --platform xhs --lt qrcode --type detail
# 打开对应APP扫二维码登录
# 其他平台爬虫使用示例,执行下面的命令查看
uv run main.py --help
MediaCrawler 提供了基于 Web 的可视化操作界面,无需命令行也能轻松使用爬虫功能。
开发时需要同时启动后端 API 服务和前端 Vite 开发服务器:
# 终端 1:启动 API 服务器(默认端口 8080)
uv run uvicorn api.main:app --port 8080 --reload
# 终端 2:启动前端开发服务器
cd webui
npm install
npm run dev # 默认在 5173 端口启动,并代理 /api 到 8080
启动成功后,访问 http://localhost:5173/ 即可打开 WebUI 界面。
首次打开会进行环境检测(调用
/api/env/check),请确保后端服务已启动。如果检测失败,可点击「跳过检测」临时跳过。
如果希望通过 API 服务器直接提供 WebUI 静态资源,需要先构建前端:
cd webui
npm install
npm run build # 产物输出到 api/webui/
构建完成后,只需启动 API 服务器:
uv run uvicorn api.main:app --port 8080 --reload
然后访问 http://localhost:8080 即可。
如果是爬取抖音和知乎,需要提前安装 nodejs 环境,版本大于等于:
16即可
# 进入项目根目录
cd MediaCrawler
# 创建虚拟环境
# 我的 python 版本是:3.11 requirements.txt 中的库是基于这个版本的
# 如果是其他 python 版本,可能 requirements.txt 中的库不兼容,需自行解决
python -m venv venv
# macOS & Linux 激活虚拟环境
source venv/bin/activate
# Windows 激活虚拟环境
venv\Scripts\activate
pip install -r requirements.txt
playwright install
# 项目默认是没有开启评论爬取模式,如需评论请在 config/base_config.py 中的 ENABLE_GET_COMMENTS 变量修改
# 一些其他支持项,也可以在 config/base_config.py 查看功能,写的有中文注释
# 从配置文件中读取关键词搜索相关的帖子并爬取帖子信息与评论
python main.py --platform xhs --lt qrcode --type search
# 从配置文件中读取指定的帖子ID列表获取指定帖子的信息与评论信息
python main.py --platform xhs --lt qrcode --type detail
# 打开对应APP扫二维码登录
# 其他平台爬虫使用示例,执行下面的命令查看
python main.py --help
MediaCrawler 支持多种数据存储方式,包括 CSV、JSON、JSONL、Excel、SQLite 和 MySQL 数据库。
📖 详细使用说明请查看:数据存储指南
成为赞助者,可以将您的产品展示在这里,每天获得大量曝光!
联系方式:
relakkesrelakkes@gmail.com如果这个项目对您有帮助,欢迎打赏支持,您的每一份支持都是我持续更新的动力 ❤️
如果这个项目对您有帮助,请给个 ⭐ Star 支持一下,让更多的人看到 MediaCrawler!
本项目(以下简称“本项目”)是作为一个技术研究与学习工具而创建的,旨在探索和学习网络数据采集技术。本项目专注于自媒体平台的数据爬取技术研究,旨在提供给学习者和研究者作为技术交流之用。
本项目开发者(以下简称“开发者”)郑重提醒用户在下载、安装和使用本项目时,严格遵守中华人民共和国相关法律法规,包括但不限于《中华人民共和国网络安全法》、《中华人民共和国反间谍法》等所有适用的国家法律和政策。用户应自行承担一切因使用本项目而可能引起的法律责任。
本项目严禁用于任何非法目的或非学习、非研究的商业行为。本项目不得用于任何形式的非法侵入他人计算机系统,不得用于任何侵犯他人知识产权或其他合法权益的行为。用户应保证其使用本项目的目的纯属个人学习和技术研究,不得用于任何形式的非法活动。
开发者已尽最大努力确保本项目的正当性及安全性,但不对用户使用本项目可能引起的任何形式的直接或间接损失承担责任。包括但不限于由于使用本项目而导致的任何数据丢失、设备损坏、法律诉讼等。
本项目的知识产权归开发者所有。本项目受到著作权法和国际著作权条约以及其他知识产权法律和条约的保护。用户在遵守本声明及相关法律法规的前提下,可以下载和使用本项目。
关于本项目的最终解释权归开发者所有。开发者保留随时更改或更新本免责声明的权利,恕不另行通知。