行业动态周报:用新闻 API 追踪一个赛道的声音变化
每个季度做规划、每个月对齐方向,都需要回答同一个问题:我盯的这个赛道,这个月的声音往哪边走?是资本在进、政策在推,还是技术在换代?靠人工刷新闻网站是刷不过来的------一个赛道相关的词有二三十个,每个词每天的新闻量几十条。
这篇给一个能自动跑的赛道声量周报脚本:固定一组赛道查询词,每周拉一次新闻,统计声量、来源集中度、话题构成,输出一张能直接贴进周报的表。参数与字段以 SerpBase 官方文档的 news 端点说明 为准;每次成功请求 1 credit,一个赛道一周的成本是个位数 credits。
为什么用新闻端点而不是搜索端点
搜索端点给你的是"网页",新闻端点给你的是"报道"。两者对一个赛道的声音刻画不一样:
- 搜索"半导体 国产替代",返回的是企业官网、产品页、行业报告 PDF------存量内容,更新慢
- 新闻端点返回的是媒体报道,带来源和时间------增量信号,直接反映"这个月发生了什么"
做赛道声音监测,要的是增量。而且新闻结果自带 source 和 time(解析字段,可能缺失),天然适合做"哪些媒体在报道""报道密度怎么变"这类统计。
赛道声量周报脚本
python
import csv, json, pathlib, requests
from datetime import date
API = "https://api.serpbase.dev/google/news/search" # 注意是 /news/search
KEY = "你的 API Key"
HEADERS = {"X-API-Key": KEY, "Content-Type": "application/json"}
# 赛道词组:核心词 + 子方向,固定不变才能比
TERMS = [
"半导体 国产替代", "半导体 设备", "半导体 材料",
"芯片 先进制程", "芯片 封装测试", "存储芯片 价格",
]
def news(q: str, hl: str = "zh-CN", gl: str = "cn", page: int = 1) -> list:
resp = requests.post(API, headers=HEADERS,
json={"q": q, "hl": hl, "gl": gl, "page": page}, timeout=30)
data = resp.json()
if data.get("status") != 0:
return []
return data.get("news", []) # 数组可选,必须兜底
def weekly_snapshot(terms: list, pages: int = 2) -> dict:
snap = {}
for q in terms:
items, srcs, empty_page = [], [], False
for p in range(1, pages + 1):
got = news(q, page=p)
if not got:
empty_page = True
break # 空页即停
items.extend(got)
for it in items:
s = it.get("source", "") # 解析字段,可能缺失
if s:
srcs.append(s)
snap[q] = {
"条数": len(items),
"来源数": len(set(srcs)),
"来源填充率": round(len(srcs) / len(items), 3) if items else 0,
"首条标题": items[0].get("title", "") if items else "",
}
return snap
if __name__ == "__main__":
hist = pathlib.Path("industry_history")
hist.mkdir(exist_ok=True)
week = date.today().isoformat()
snap = weekly_snapshot(TERMS)
(hist / f"{week}.json").write_text(json.dumps(snap, ensure_ascii=False, indent=1),
encoding="utf-8")
files = sorted(hist.glob("*.json"))
prev = files[-2] if len(files) > 1 else None
rows = []
for q, s in snap.items():
row = {"词组": q, **s, "周环比": ""}
if prev:
old = json.loads(prev.read_text("utf-8")).get(q, {})
if old.get("条数"):
row["周环比"] = f"{(s['条数'] - old['条数']) / old['条数']:+.0%}"
rows.append(row)
with open(f"industry_weekly_{week}.csv", "w", newline="", encoding="utf-8-sig") as f:
w = csv.DictWriter(f, fieldnames=["词组", "条数", "来源数", "来源填充率", "周环比", "首条标题"])
w.writeheader()
w.writerows(rows)
total = sum(s["条数"] for s in snap.values())
print(f"{week} 赛道快照:共 {total} 条,{len(TERMS)} 个词组")
for r in sorted(rows, key=lambda x: -x["条数"]):
print(f" {r['词组']}: {r['条数']} 条 ({r['周环比'] or '首周'}) 来源 {r['来源数']} 家")
三条判读经验
- 条数环比先看来源填充率。 脚本里把"来源填充率"单独存一列,就是为了这个:某周"条数涨了 40% 但填充率从 90% 掉到 55%",更可能是解析退化或布局变化,不是赛道突然升温。先排除数据质量,再谈趋势。
- 来源数比条数更稳。 同一个媒体会把一条新闻拆成多条(不同栏目、不同转载版本),按来源去重后,"多少家不同媒体在报道这个词"比"多少条新闻"更接近真实声量。周报里两个都放,但解读时以来源数为主。
- 首条标题值得人工扫一眼。 统计是横截面,首条标题是当周的具体事件------哪个政策发布了、哪家公司融资了、哪条产线投产了。周报里配一句具体事实,比纯数字有用得多,也是给领导层看的版本里最不能省的一行。
成本账
6 个词组 × 每周 2 页 = 12 credits/周,一个月 48 credits。按 $10/20k 的标准包算,一个月的赛道监测不到一分钱;100 次免费额度够跑两个多月。这是周报类监测里性价比最高的一档------比任何付费舆情工具都便宜,代价是要自己做判读。
FAQ
词组怎么定? 核心词 + 子方向。"半导体"太宽,"半导体 国产替代/设备/材料"才有信息量。一个赛道 6~10 个词组够了,再多周报读不过来。词组定下来就别常换,换一次历史对比就断一截。
time 字段能用来做时效分析吗? 它是解析出来的相对时间文本("3小时前"),可选且格式不保证。周报粒度用不上精确时间;真要分析报道时效,用你自己记录请求的日期做周维度归集,别依赖 time 解析。
gl 设 cn 会不会漏掉海外报道? 会。盯国内赛道用 hl=zh-CN/gl=cn;如果赛道本身是全球性的(比如 AI 芯片),分两组跑:中文组 gl=cn,英文组默认 en/us,两组数据在周报里分开列。混在一起统计会互相污染。
条数为 0 的词组怎么办? 正常,可能是这周确实没新闻,也可能是查询词太窄。连续两三周为 0 的词组,考虑换更宽的上位词,别急着判定"赛道冷了"。
把 TERMS 换成你的赛道词组,先跑四周攒基线,第五周开始你的周报里就会多出一节"用数据说话的赛道声音"------而且这个成本几乎为零。