筛了 40 多个信源,最后只留 29 个:一份「AI 日报」信源选型笔记

做自动化日报两年,最耗时间的不是写代码,是选信源。

我前后测了 40 多个源,最后留下 29 个。这篇把筛选标准和踩到的坑记录下来,做同类「信息聚合」项目的人可以直接抄结论。

一、先明确一件事:RSS 才是可维护的路径

我试过直接抓网页(HTML 解析)。结论是不要做:

  • 网站改一次版,你的选择器就失效一次;
  • 反爬策略随时加,突然开始返回验证页;
  • 拿到的是整页 HTML,清洗成本比抓 RSS 高一个量级。

所以第一轮筛选我把所有「不是 feed 的」全砍了。判断方法很简单:请求回来数一下 <item> 和 <entry> 的数量,是 0 就直接淘汰。

二、被淘汰的四类源

**1. 域名被网络中断的。**Google DeepMind 博客、Google AI 博客、Hugging Face 博客,在部分网络环境下 TLS 握手直接被打断。注意:用 PowerShell 的 Invoke-WebRequest 测能过,用 Python 的 urllib 就失败------一定要用你生产环境里的那套 HTTP 栈去测。

**2. 返回 HTML 的假 feed。**机器之心的 /rss、36氪的非 www 域名、澎湃、虎嗅、品玩,都是 200 但内容是 HTML 页面,不是 feed。这类最坑,因为状态码很好看。

**3. 没有 RSS 的厂商官网。**DeepSeek、智谱、月之暗面、MiniMax 官网都没有 feed。想看它们的动态,只能靠行业媒体转述,或者盯 GitHub Releases(但大部分仓库根本不发 Release,实测多条 atom 都是 0 条entry)。

**4. 公共 RSSHub 实例。**不稳定,时通时不通,不要作为生产依赖。

三、最后留下的 29 个,分四层

  1. 中文行业媒体:量子位、极客公园、爱范儿、雷峰网、IT之家、36氪、InfoQ、OSCHINA、钛媒体、Solidot;
  2. 厂商官方:OpenAI News、Qwen 官方博客、NVIDIA 新闻室 + NVIDIA 技术博客 + NVIDIA Blog;
  3. 英文一手:Hacker News、TechCrunch、The Verge、Ars Technica、Simon Willison、Latent.Space、SemiAnalysis、CNBC Tech;
  4. 学术与技术:MIT Technology Review、MIT News AI、IEEE Spectrum、Wired AI。

一个反直觉的结论:源不是越多越好。我给自己定的比例是「中文 1/3、厂商官方 1/5、英文一手 1/3、剩下学术」。全是英文源,中文读者看不进去;全是中文源,又会漏掉一手发布。

四、源选完只是开始,还要提要求

第一版跑出来十条里九条是 OpenAI 和 Anthropic,国内厂商一条没有。

后来我在 prompt 里加了一条硬规则(不是「建议」,是规则):

全篇至少收录 2 条国内大模型厂商动态;必须包含至少 1 条 NVIDIA 动态;关键人物的公开表态必须收录并写清是谁说的;素材里没有的不许编。

加完这条,DeepSeek、月之暗面、MiniMax、黄仁勋才真正出现在日报里。模型不会自动帮你平衡覆盖度,你得把要求写成可检验的约束。

五、最后一步:回读验证

每次发布完,我都会重新请求线上页面,确认里面有当天的日期。

因为踩过一次:脚本退出码 0、日志写着「完成」,但线上还是昨天的内容------网络被拦了,抓到 0 条素材,脚本照样「成功」。

退出码 0 不等于做成,这句话值得写在每个自动化项目的 README 第一行。


成品在这儿,可以对照看效果:yanxiuzi.github.io/ai-brief/

相关推荐
粥里有勺糖1 小时前
视野修炼第136期 | 前端小恐龙"Deno"被收购
前端·github·ai编程
金銀銅鐵1 小时前
[Java] 借助GUI展示class文件的版本号
后端·python·ai编程
Solara1 小时前
我重算了 11 天,抓出自己抄错的 1 天:AI 会把"公式"记成"数列"
人工智能·程序员·ai编程
HelloWorld0011 小时前
告别慢吞吞!大模型推理提速 300%:Speculative Decoding(推测解码)原理与生产落地实战
ai编程
柯南46681 小时前
【AI工程师精讲】06:MoE:为什么"万亿参数"的模型,实际只用了很小一部分
人工智能·ai编程
架构师那点事儿1 小时前
Agent Skill: 视频/PPT 内容提取 Skill —— 从 0 到 1 诞生记 + 使用指南
llm·agent·ai编程
全栈Agent 小李2 小时前
【无标题】
前端·后端·agent·ai编程·全栈·cursor·mcp
AINative软件工程3 小时前
LLM 应用的 Adaptive Batching 工程实践:动态合批把吞吐提升 3 倍,但延迟的坑你踩过吗
后端·llm·ai编程