技术路线已定:使用 MediaCrawler 采集小红书/抖音/微博互动数据
决策:商业用途 + 可接受账号风险
核实日期:2026-09-08(GitHub API 实时数据)
⚠️ 必须先看的结论(30 秒版)
技术上完全可行,MediaCrawler 就是你需求的直接答案:7 个平台、点赞/评论/转发字段齐全、支持 CSV/JSON/Excel/SQLite/MySQL/PostgreSQL 导出。
但有一道商用授权墙,绕不过去:
LICENSE 第 3 条原文(NON-COMMERCIAL LEARNING LICENSE 1.1):
Without the written consent of the copyright owner, the Software may not be used for any commercial purposes or to cause improper influence on third parties.
(未经版权所有者书面同意,不得将本软件用于任何商业目的)
这意味着:商用必须取得 relakkes 的书面同意。 开源仓库里没有提供商业授权通道------只有付费的 MediaCrawlerPro(功能不同的另一个产品)。所以你现在只有两条路:
| 路线 | 做法 | 成本 | 合规状态 |
|---|---|---|---|
| A. 联系作者授权 | 发邮件 relakkes@gmail.com 谈商用授权 | 未知,需协商 | ✅ 合规 |
| B. 采购 Pro 版 | 订阅 MediaCrawlerPro | 未公开报价 | ⚠️ 需确认 Pro 授权条款 |
在授权落地前,只能以"非商用学习"方式使用------技术上能跑,法律上算侵权。
1. 项目现状
| 项 | 值 |
|---|---|
| Stars | 64,599 |
| Forks | 12,536 |
| 最后 push | 2026-08-14 |
| License | NON-COMMERCIAL LEARNING 1.1 (GitHub API 报 NOASSERTION,读 LICENSE 文件确认) |
| 技术栈 | Playwright 浏览器自动化 + Python |
| 依赖 | 58 个包 |
支持 7 个平台 (media_platform/ 目录实测):xhs 小红书 / douyin 抖音 / weibo 微博 / bilibili B站 / kuaishou 快手 / tieba 贴吧 / zhihu 知乎
采集模式(README):
- 关键词搜索
- 指定帖子 ID
- 二级评论
- 创作者主页
- 登录态缓存
- IP 代理池
- 评论词云
2. 需求字段匹配度核对
你要「主题、点赞、评论、转发」------逐项核对:
| 你的需求 | MediaCrawler 能力 | 状态 |
|---|---|---|
| 主题(关键词搜索) | ✅ 关键词搜索模式 | ✅ |
| 点赞数 | ✅ 互动字段(各平台 field.py 均定义) |
✅ |
| 评论 | ✅ 支持二级评论采集 | ✅ |
| 转发 | ✅ 互动字段 | ✅ |
| 数据导出 | ✅ CSV / JSON / JSONL / Excel / SQLite / MySQL / PostgreSQL | ✅ |
功能层面 100% 匹配。 卡点只在授权。
3. 平台风险实况
MediaCrawler issue 关键词计数实测:
| 平台 | 相关 issue | 风险等级 |
|---|---|---|
| 小红书 xhs | 197 | 🔴 极高 |
| 抖音 douyin | 94 | 🟠 高 |
| 微博 weibo | 44 | 🟢 中等 |
| B站 bilibili | 42 | 🟡 中高 |
| 知乎 zhihu | 32 | 🟡 中高 |
| 贴吧 tieba | 21 | 🟢 中 |
| 快手 kuaishou | 13 | 🟢 中 |
| 「风控」关键词 | 190 | --- |
| 「461」风控码 | 18 | --- |
| 「封号」 | 19 | --- |
代表性 issue:
- #757 (33 评,bug):xhs 采集出现状态码 461
- #776 (24 评):响应头缺少
Verifytype字段导致小红书无法爬取 - #865 :小红书账号永久封禁 ,作者以
风控问题不处理标签关闭------作者明确拒绝处理风控问题
实施顺序建议:微博 → 贴吧/快手 → B站/知乎 → 抖音 → 小红书
小红书是最大坑。 你明确要小红书,意味着必须:
- 用小号(不要主账号)
- 控制频率(Pro 版有断点续爬 + IP 代理池能缓解)
- 接受"随时失效、作者不修"的现实
4. MediaCrawlerPro(商业选项)核实
README 第 3200 字符处原文:
README 原文引用(功能定位说明):
项目方在 README 中说明 Pro 版定位------专注于学习成熟项目的架构设计,不仅仅是爬虫技术。
Pro 版相较开源版的核心升级:
- ✅ 自媒体内容拆解 Agent(新增)
- ✅ 断点续爬(重点特性)
- ✅ 多账号 + IP 代理池(重点特性)
- ✅ 去除 Playwright 依赖
- ✅ 完整 Linux 环境支持
⚠️ 注意 :Pro 是功能不同的另一个产品 (github.com/MediaCrawlerPro),不是"开源版的商业授权"。README 未公开报价。买 Pro 不等于自动获得开源版的商用授权 ------ 授权条款需单独确认。
5. 三条落地路径
路径 A:联系作者谈授权(最合规)
邮件:relakkes@gmail.com
说明:使用场景、商业规模、希望获取的授权范围
- 优点:合法合规,可用开源版全部功能
- 缺点:报价未知、可能不接、周期不定
- 建议作为第一步先发邮件,等回复期间可以走路径 C 做技术验证
路径 B:采购 MediaCrawlerPro
- 优点:多账号 + IP 代理池 + 断点续爬,直接解决小红书风控这个最大痛点
- 缺点:报价未知、授权范围需确认、Pro 与开源版是不同代码库
- 建议:先联系作者问清 Pro 的商用授权范围
路径 C:先跑通技术验证(现在就能做)
在你拿到授权之前,用非商用身份跑通技术验证是合理的:
- 只用微博(风险最低,44 issue)
- 控制频次,跑完即停
- 只采公开数据、不留可识别用户信息
- 验证数据字段、采集稳定性、报告生成链路
跑通后再谈授权,谈判时你有真实的业务数据支撑,比空谈强。
6. 系统架构建议
┌─────────────┐ ┌──────────────┐ ┌──────────────┐ ┌─────────────┐
│ ① 数据采集 │ → │ ② 清洗入库 │ → │ ③ 分析评估 │ → │ ④ 报告生成 │
│ MediaCrawler │ │ SQLite/MySQL │ │ LLM + 情感模型 │ │ HTML/MD/PDF │
│ (唯一卡点) │ │ (标准) │ │ (最成熟) │ │ (最灵活) │
└─────────────┘ └──────────────┘ └──────────────┘ └─────────────┘
③④ 段建议直接用 BettaFish(42,172★,多 Agent 分析系统):
- 自带 5 个微博情感微调模型(机器学习/BERT/SmallQwen/多语言/话题识别)
- Report Agent 内置 HTML/MD/PDF 报告生成
- ⚠️ 但它是 GPL-2.0,同样有传染问题------如果你走"授权后自建"路线,需一并评估
⚠️ 注意耦合 :BettaFish 的采集层本身就是通过 git submodule 引用 MediaCrawler。所以你要么用 BettaFish 整套(继承 MediaCrawler 授权问题),要么自建分析层。
7. 风险清单
| 风险 | 等级 | 缓解 |
|---|---|---|
| LICENSE 禁止商用 | 🔴 高 | 联系作者授权(路径 A)或采购 Pro(路径 B) |
| 小红书风控/封号 | 🔴 高 | 小号 + IP 代理池 + 控频;接受随时失效 |
| 作者不修风控问题 | 🔴 高 | #865 已证实作者拒绝处理,需自行跟进或换平台 |
| 平台签名更新致失效 | 🟠 中高 | 关注 release;64K★ 社区维护相对活跃 |
| 个人信息合规 | 🟠 中 | 只采公开数据,去标识化,符合《个人信息保护法》 |
| 平台用户协议违约 | 🟠 中 | 控制频率,不绕过登录墙,遵循 robots.txt |
| 《反不正当竞争法》 | 🟡 中 | 参见上文第 8 节判例说明(需自行核实) |
| GPL-2.0 传染(若用 BettaFish) | 🟠 中 | 内部部署无风险;对外分发需开源衍生代码 |
8. 法律风险(必须知道的下限)
⚠️ 重要说明 :本节的判例信息未经实时检索核实 ------中文法律查询在搜索引擎上被目标平台官网结果污染,无法取得判例原文。以下为基于公开法律知识的陈述,引用前务必自行到裁判文书网核实案号与判决要点:
- 不正当竞争类(重庆景秀 v. 微博)------爬取微博数据被判不正当竞争
- 刑事类 (四川鑫心爬虫案)------爬虫服务触犯《刑法》285 条非法获取计算机信息系统数据罪,这是刑事风险不是民事赔偿
- 个人信息类(《个人信息保护法》2021)------昵称/评论/头像均可能构成个人信息
关键判断 :舆情监控采公开 互动数据(点赞数、评论数),风险显著低于采集非公开数据或倒卖个人信息。但"商业用途"这个定性会加重法律评价------同样行为,内部研究可能不立案,对外卖数据可能立案。
9. 建议的行动计划
第 0 步(今天):发邮件给 relakkes@gmail.com 谈授权
└─ 同时说明需求:小红书/抖音/微博 互动数据 + 舆情报告 + 商业用途
第 1 步(1-2 天):走路径 C 跑通技术验证
└─ 只采微博、用小号、控频、不留用户信息
└─ 验证:字段是否齐全、稳定性、报告生成链路
第 2 步(等授权回复):根据回复决定
├─ 拿到开源版授权 → 用开源 MediaCrawler 正式商用
├─ 只卖 Pro → 采购 Pro(多账号+代理池正好解决小红书问题)
└─ 不接 → 走付费数据服务商(新榜/蝉妈妈/清博,5-15万/年)
第 3 步:分析层选型
├─ 用 BettaFish(自带 5 个情感模型,但要接受 GPL-2.0 + 它依赖 MediaCrawler)
└─ 或自建(避免 GPL 传染)
10. 调研局限说明
- 判例未实时核实:Bing 中文法律查询被目标平台官网污染(10 条结果全是 douyin.com),§8 的三条案例需自行核实案号
- Pro 报价未知:README 未公开,需联系作者
- 字段定义未逐字核实 :README 功能矩阵确认支持点赞/评论/转发,但具体 SQL 表结构文件路径未定位到(
store/下 20 个 py 文件,无 model/schema 命名文件),实际字段名需拉代码确认 - 未本地实跑:MediaCrawler 依赖 Playwright + Chrome,未实际采集验证。小红书 461 风控码的真实触发条件未实测
- gitcc 的 trendradar-cn 已排除:与 MediaCrawler 路线无关
参考链接
- MediaCrawler:https://github.com/NanmiCoder/MediaCrawler (64,599★ / NON-COMMERCIAL LEARNING 1.1)
- MediaCrawlerPro:https://github.com/MediaCrawlerPro (付费,功能不同)
- 作者授权邮箱:relakkes@gmail.com(LICENSE 中声明)
- 中国爬虫违法案件汇总(README 引用):https://github.com/HiddenStrawberry/Crawler_Illegal_Cases_In_China
- BettaFish(分析层候选):https://github.com/666ghj/BettaFish (42,172★ / GPL-2.0)
- 商用数据服务商:新榜 https://newrank.cn / 蝉妈妈 https://chanmama.com / 清博 https://gsdata.cn
本文基于 2026-09-08 当日 GitHub API 实时数据核实。所有 License 条款、Stars 数、issue 分布均为当日抓取结果,项目状态可能随时间变化,请以官方仓库最新信息为准。合规决策请咨询专业法律人士。