做自动化日报两年,最耗时间的不是写代码,是选信源。
我前后测了 40 多个源,最后留下 29 个。这篇把筛选标准和踩到的坑记录下来,做同类「信息聚合」项目的人可以直接抄结论。
一、先明确一件事:RSS 才是可维护的路径
我试过直接抓网页(HTML 解析)。结论是不要做:
- 网站改一次版,你的选择器就失效一次;
- 反爬策略随时加,突然开始返回验证页;
- 拿到的是整页 HTML,清洗成本比抓 RSS 高一个量级。
所以第一轮筛选我把所有「不是 feed 的」全砍了。判断方法很简单:请求回来数一下 <item> 和 <entry> 的数量,是 0 就直接淘汰。
二、被淘汰的四类源
**1. 域名被网络中断的。**Google DeepMind 博客、Google AI 博客、Hugging Face 博客,在部分网络环境下 TLS 握手直接被打断。注意:用 PowerShell 的 Invoke-WebRequest 测能过,用 Python 的 urllib 就失败------一定要用你生产环境里的那套 HTTP 栈去测。
**2. 返回 HTML 的假 feed。**机器之心的 /rss、36氪的非 www 域名、澎湃、虎嗅、品玩,都是 200 但内容是 HTML 页面,不是 feed。这类最坑,因为状态码很好看。
**3. 没有 RSS 的厂商官网。**DeepSeek、智谱、月之暗面、MiniMax 官网都没有 feed。想看它们的动态,只能靠行业媒体转述,或者盯 GitHub Releases(但大部分仓库根本不发 Release,实测多条 atom 都是 0 条entry)。
**4. 公共 RSSHub 实例。**不稳定,时通时不通,不要作为生产依赖。
三、最后留下的 29 个,分四层
- 中文行业媒体:量子位、极客公园、爱范儿、雷峰网、IT之家、36氪、InfoQ、OSCHINA、钛媒体、Solidot;
- 厂商官方:OpenAI News、Qwen 官方博客、NVIDIA 新闻室 + NVIDIA 技术博客 + NVIDIA Blog;
- 英文一手:Hacker News、TechCrunch、The Verge、Ars Technica、Simon Willison、Latent.Space、SemiAnalysis、CNBC Tech;
- 学术与技术:MIT Technology Review、MIT News AI、IEEE Spectrum、Wired AI。
一个反直觉的结论:源不是越多越好。我给自己定的比例是「中文 1/3、厂商官方 1/5、英文一手 1/3、剩下学术」。全是英文源,中文读者看不进去;全是中文源,又会漏掉一手发布。
四、源选完只是开始,还要提要求
第一版跑出来十条里九条是 OpenAI 和 Anthropic,国内厂商一条没有。
后来我在 prompt 里加了一条硬规则(不是「建议」,是规则):
全篇至少收录 2 条国内大模型厂商动态;必须包含至少 1 条 NVIDIA 动态;关键人物的公开表态必须收录并写清是谁说的;素材里没有的不许编。
加完这条,DeepSeek、月之暗面、MiniMax、黄仁勋才真正出现在日报里。模型不会自动帮你平衡覆盖度,你得把要求写成可检验的约束。
五、最后一步:回读验证
每次发布完,我都会重新请求线上页面,确认里面有当天的日期。
因为踩过一次:脚本退出码 0、日志写着「完成」,但线上还是昨天的内容------网络被拦了,抓到 0 条素材,脚本照样「成功」。
退出码 0 不等于做成,这句话值得写在每个自动化项目的 README 第一行。
成品在这儿,可以对照看效果:yanxiuzi.github.io/ai-brief/