抖音创作者数据导出:怎样留下可比较的日报?

抖音创作者数据导出:怎样留下可比较的日报?

douyin-creator-analytics-export-free 是一套创作者数据导出 Skill:让 Agent 通过已登录浏览器读取本人有权限看到的指标,按来源和时间整理报表。需要同口径复盘时,可以将这套流程用于留档;页面没有的数据仍要留空。

这是"我的 100 个开源项目"系列的一篇。后台的数据每天都在变化,只截几张图,后来往往难以确认当时选的是哪段日期、看的是汇总还是单条作品。这个项目把日期、账号、作品和采集来源放进同一份记录,方便后续核对。

导出之前,先固定问题与时间范围

项目第一方入口为 douyin-creator-analytics-export-free。截至 2026 年 10 月 4 日,manifest 版本为 1.0.1,运行前提是 Easy WebBridge 与本人已登录的抖音创作者中心。

这里的"本人"决定了数据边界:公开账号诊断观察外部可见作品,创作者数据导出读取自己有权限查看的后台,两者不能互相替代,更不能拿自己的登录环境去猜他人的后台指标。操作合同

开始前把问题说具体。例如,"整理指定日期范围内的作品表现,保留页面显示的指标与来源",就比"分析一下账号"容易验收。日期范围、作品数量、账号别名和输出目录都是可提供的输入;多账号需要逐个确认已授权环境,不能把不同账号的数据混成一张总表。

CSV、JSON、Markdown,各自留什么?

SKILL.md 要求输出 analytics.json、analytics.csv 和 analytics.md。三种文件服务不同用途:JSON 保留结构与来源字段,CSV 便于继续筛选和计算,Markdown 交代本次采集范围、缺失项与可读摘要。

每条记录至少包含以下字段:

字段 用途
account_alias 区分账号,不公开登录凭据
work_title、work_url 标识作品,便于回到原页面
date 保留记录的日期口径
metrics 存放页面实际显示的指标
source_url 说明数据来自哪个页面
collected_at 记录采集时间

页面显示播放、完播、点击、点赞、评论、收藏、分享或粉丝变化中的哪些字段,就读取哪些;不要因为模板里有一列就补出一个数。报告首页也要说明日期范围、账号别名,以及结果是否为部分数据。

第一次怎么交给 Agent?

从公开仓库取得 Skill 文件,按你使用的 Agent 的方式放到可读取位置,同时确认 Easy WebBridge 能连接目标已登录浏览器。然后给一个范围清楚的任务:

text 复制代码
使用 douyin-creator-analytics-export-free,读取我本人创作者中心。
范围使用我指定的起止日期,先核对账号与页面日期筛选。
整理页面可见作品及指标,输出 analytics.json、analytics.csv、analytics.md。
每条记录附来源页面和采集时间;没有显示的字段留空。
只有汇总卡片时标记 granularity=summary,不伪造逐作品明细。
只读和导出,遇到登录或安全验证就停止该账号。

这是给 Agent 的操作任务,不是终端里的导出命令。当前仓库的 scripts 目录只有 self-test.mjs,没有可以独立执行整套浏览器采集和三格式导出的 CLI。读取、字段整理和文件生成需要 Agent 按 Skill 合同完成,不能把"安装后自动每天拉数据"当成已有实现。

仓库不要求第三方数据 API Key;你所用 Agent 和运行环境是否有费用,是另一个条件,不能由项目名称里的 free 推断为整个流程没有成本。

哪些情况只能导出部分结果?

只有汇总卡片时,记录可见汇总,并标明 granularity=summary;缺少逐作品数据,就不要生成看似完整的作品列表。指标没加载时,合同允许重读一次页面快照,仍缺失就写入 missing_fields。

比较日报时还要固定口径。这是使用建议:同一账号、同一日期范围定义、相同作品范围和相同指标单位,才适合放在一起比较。今天采的累计数据与昨天采的单日数据即使都叫"播放量",也不能直接算涨跌。时间范围与采集时间分别保存,可以帮助发现这类混用。

如果页面只有部分日期或加载了一部分作品,把 partial 标记留在报告里。趋势图、同比环比和归因都需要额外的计算与依据;目前这套 Skill 的代码并没有实现完整趋势分析引擎。

自测通过,能证明什么?

公开仓库提供:

bash 复制代码
git clone https://github.com/xxjrq/douyin-creator-analytics-export-free.git
cd douyin-creator-analytics-export-free
node scripts/self-test.mjs

本次运行通过。源码的断言检查一个本地示例对象的账号别名、数值类型和时间格式,没有连接创作者中心,也没有测试真实页面或三种导出文件。因此这次结果只能记为本地自测通过,不能当成线上数据采集已经完成。

许可证也应按现有文件说明:manifest 声明 MIT,但当前 LICENSE 是简写文本,GitHub 的许可证识别返回 NOASSERTION。若准备分发或复用项目,应先核对许可证文件;本文不把它写成标准 MIT 全文已完整验证。

让报表成为下一次复盘的起点

可以按"账号别名/采集日期"保存文件,在首页记下时间范围、粒度和缺失字段。下一次采集先对照这些条件,再看指标变化;如果口径变了,就分开记录。这个目录组织方式是本文建议,不是仓库自带的定时服务。

项目默认只读取和导出,不修改账号资料、不发布作品、不发送消息。出现登录、验证码、风控或权限不匹配时停止当前账号,保留原因;不要把采不到的数据改成零值,让报表看上去完整。

项目入口:GitHub、SKILL.md、自测源码。本文核验了公开仓库并运行本地自测,没有读取任何真实创作者后台,也没有将示例数据写成账号实绩。

相关推荐
wang_yb1 小时前
面向数据工程师的正则表达式:从日志清洗到字段提取
数据分析·databook
databook1 小时前
面向数据工程师的正则表达式:从日志清洗到字段提取
python·正则表达式·数据分析
Sweet锦2 小时前
不调 Python,不装向量库:我用纯 Java 写了一套以图搜图引擎
java·人工智能·开源·图搜索
网络毒刘3 小时前
开源 AI 编程助手横向对比(Cursor / Continue / Aider):能力边界与 AtomGit 落地建议
人工智能·开源
躺柒3 小时前
读数据架构知识体系指南14数据编织
大数据·数据仓库·数据分析·数据湖·数据编织
盘古开天16663 小时前
windows鱼塘可交互鱼群动态桌面资源
人工智能·chatgpt·开源
计算机毕业编程指导师4 小时前
大数据毕设怎么做?基于Hadoop的多源社交媒体心理健康情感分析与可视化系统从零到一指导 源码 毕业设计 选题推荐 毕设选题 数据分析 机器学习 深度学习
大数据·hadoop·计算机·数据分析·毕业设计·课程设计·媒体
PaperData4 小时前
2001-2025年上市公司数智化水平数据
数据分析
枫叶丹44 小时前
从一次推理请求出发:模型、显存、网络与服务系统如何共同决定性能
网络·人工智能·chatgpt·开源·agent·codex