行业动态周报:用新闻 API 追踪一个赛道的声音变化

行业动态周报:用新闻 API 追踪一个赛道的声音变化

每个季度做规划、每个月对齐方向,都需要回答同一个问题:我盯的这个赛道,这个月的声音往哪边走?是资本在进、政策在推,还是技术在换代?靠人工刷新闻网站是刷不过来的------一个赛道相关的词有二三十个,每个词每天的新闻量几十条。

这篇给一个能自动跑的赛道声量周报脚本:固定一组赛道查询词,每周拉一次新闻,统计声量、来源集中度、话题构成,输出一张能直接贴进周报的表。参数与字段以 SerpBase 官方文档的 news 端点说明 为准;每次成功请求 1 credit,一个赛道一周的成本是个位数 credits。

为什么用新闻端点而不是搜索端点

搜索端点给你的是"网页",新闻端点给你的是"报道"。两者对一个赛道的声音刻画不一样:

  • 搜索"半导体 国产替代",返回的是企业官网、产品页、行业报告 PDF------存量内容,更新慢
  • 新闻端点返回的是媒体报道,带来源和时间------增量信号,直接反映"这个月发生了什么"

做赛道声音监测,要的是增量。而且新闻结果自带 source 和 time(解析字段,可能缺失),天然适合做"哪些媒体在报道""报道密度怎么变"这类统计。

赛道声量周报脚本

python 复制代码
import csv, json, pathlib, requests
from datetime import date

API = "https://api.serpbase.dev/google/news/search"   # 注意是 /news/search
KEY = "你的 API Key"
HEADERS = {"X-API-Key": KEY, "Content-Type": "application/json"}

# 赛道词组:核心词 + 子方向,固定不变才能比
TERMS = [
    "半导体 国产替代", "半导体 设备", "半导体 材料",
    "芯片 先进制程", "芯片 封装测试", "存储芯片 价格",
]

def news(q: str, hl: str = "zh-CN", gl: str = "cn", page: int = 1) -> list:
    resp = requests.post(API, headers=HEADERS,
                         json={"q": q, "hl": hl, "gl": gl, "page": page}, timeout=30)
    data = resp.json()
    if data.get("status") != 0:
        return []
    return data.get("news", [])      # 数组可选,必须兜底

def weekly_snapshot(terms: list, pages: int = 2) -> dict:
    snap = {}
    for q in terms:
        items, srcs, empty_page = [], [], False
        for p in range(1, pages + 1):
            got = news(q, page=p)
            if not got:
                empty_page = True
                break                # 空页即停
            items.extend(got)
        for it in items:
            s = it.get("source", "")     # 解析字段,可能缺失
            if s:
                srcs.append(s)
        snap[q] = {
            "条数": len(items),
            "来源数": len(set(srcs)),
            "来源填充率": round(len(srcs) / len(items), 3) if items else 0,
            "首条标题": items[0].get("title", "") if items else "",
        }
    return snap

if __name__ == "__main__":
    hist = pathlib.Path("industry_history")
    hist.mkdir(exist_ok=True)
    week = date.today().isoformat()
    snap = weekly_snapshot(TERMS)
    (hist / f"{week}.json").write_text(json.dumps(snap, ensure_ascii=False, indent=1),
                                       encoding="utf-8")

    files = sorted(hist.glob("*.json"))
    prev = files[-2] if len(files) > 1 else None
    rows = []
    for q, s in snap.items():
        row = {"词组": q, **s, "周环比": ""}
        if prev:
            old = json.loads(prev.read_text("utf-8")).get(q, {})
            if old.get("条数"):
                row["周环比"] = f"{(s['条数'] - old['条数']) / old['条数']:+.0%}"
        rows.append(row)

    with open(f"industry_weekly_{week}.csv", "w", newline="", encoding="utf-8-sig") as f:
        w = csv.DictWriter(f, fieldnames=["词组", "条数", "来源数", "来源填充率", "周环比", "首条标题"])
        w.writeheader()
        w.writerows(rows)

    total = sum(s["条数"] for s in snap.values())
    print(f"{week} 赛道快照:共 {total} 条,{len(TERMS)} 个词组")
    for r in sorted(rows, key=lambda x: -x["条数"]):
        print(f"  {r['词组']}: {r['条数']} 条 ({r['周环比'] or '首周'}) 来源 {r['来源数']} 家")

三条判读经验

  1. 条数环比先看来源填充率。 脚本里把"来源填充率"单独存一列,就是为了这个:某周"条数涨了 40% 但填充率从 90% 掉到 55%",更可能是解析退化或布局变化,不是赛道突然升温。先排除数据质量,再谈趋势。
  2. 来源数比条数更稳。 同一个媒体会把一条新闻拆成多条(不同栏目、不同转载版本),按来源去重后,"多少家不同媒体在报道这个词"比"多少条新闻"更接近真实声量。周报里两个都放,但解读时以来源数为主。
  3. 首条标题值得人工扫一眼。 统计是横截面,首条标题是当周的具体事件------哪个政策发布了、哪家公司融资了、哪条产线投产了。周报里配一句具体事实,比纯数字有用得多,也是给领导层看的版本里最不能省的一行。

成本账

6 个词组 × 每周 2 页 = 12 credits/周,一个月 48 credits。按 $10/20k 的标准包算,一个月的赛道监测不到一分钱;100 次免费额度够跑两个多月。这是周报类监测里性价比最高的一档------比任何付费舆情工具都便宜,代价是要自己做判读。

FAQ

词组怎么定? 核心词 + 子方向。"半导体"太宽,"半导体 国产替代/设备/材料"才有信息量。一个赛道 6~10 个词组够了,再多周报读不过来。词组定下来就别常换,换一次历史对比就断一截。

time 字段能用来做时效分析吗? 它是解析出来的相对时间文本("3小时前"),可选且格式不保证。周报粒度用不上精确时间;真要分析报道时效,用你自己记录请求的日期做周维度归集,别依赖 time 解析。

gl 设 cn 会不会漏掉海外报道? 会。盯国内赛道用 hl=zh-CN/gl=cn;如果赛道本身是全球性的(比如 AI 芯片),分两组跑:中文组 gl=cn,英文组默认 en/us,两组数据在周报里分开列。混在一起统计会互相污染。

条数为 0 的词组怎么办? 正常,可能是这周确实没新闻,也可能是查询词太窄。连续两三周为 0 的词组,考虑换更宽的上位词,别急着判定"赛道冷了"。

把 TERMS 换成你的赛道词组,先跑四周攒基线,第五周开始你的周报里就会多出一节"用数据说话的赛道声音"------而且这个成本几乎为零。

相关推荐
零域码客1 小时前
零基础Python爬虫入门:从HTTP协议到 requests + BeautifulSoup 实战
爬虫·python·http
“AI国潮设计-小江”2 小时前
【SDXL实战】用AI生成“财神爷蛋糕×英歌舞人物”潮汕国潮甜品IP,附Prompt与批量生成思路
开发语言·人工智能·python·aigc
DD云验证2 小时前
DD云验证,免费网络验证系统
服务器·python·易语言·网络验证·卡密验证
茶栀(*´I`*)2 小时前
【Python数据分析利器】Pandas从入门到实战:核心数据结构DataFrame与Series全解析
python·数据分析·pandas
码云数智-大飞2 小时前
新手写 Python 代码,如何规范命名、减少 Bug
开发语言·python·php
天天被压力2 小时前
【别再到处找免费股票数据API了:官方204个接口,32篇一次讲透 #06】Python实时行情总报错?五档盘口+逐笔一次跑通
java·人工智能·python
智能RPA2 小时前
农业与矿业行业智能体自动化平台对比评测(计量与巡检场景)
运维·人工智能·python·自动化·agent·rpa
溪语流沙2 小时前
Django + Vue电商项目第005讲:后端骨架|Django初始化、配置分层与DRF接入
vue.js·后端·python·django
代码方舟2 小时前
Python数据工程:利用天远全能消金报告优化消费金融合规体验
人工智能·python