一个名为 Atenea 的开源平台,在为期 2.5 年的实际部署中,从 Telegram 上持续抓取了 1.91 亿条消息,覆盖 6412 个频道与群组,历史记录最早可追溯到 2016 年。论文由西班牙国家研究委员会(CSIC)的 Alfonso de Paz 与 David Arroyo 撰写,发表在期刊 SoftwareX 上(DOI: 10.1016/j.softx.2026.103067)。

Telegram 在 2025 年报告的月活用户已超过 10 亿,其公开频道既是政治辩论、虚假信息、抗议运动的开放档案,也藏着成规模的犯罪交易市场。研究者长期面临的难题是:想追踪的社群可能一夜之间消失、迁移或清空历史,一次性抓取得到的语料既不完整也无法复现。现有商业服务如 TGStat、Telemetrio 只提供基础指标,过滤规则不透明,数据锁在专有系统里。

作者的判断是,犯罪生态中频道句柄这类低层标识很容易被替换,但语言、商品、网络关系等高层语义结构会持续存在,因此需要连续观察而非快照采样。归档短命社群有助于依据欧盟《数字服务法》识别非法内容、提取失陷指标(IoC)以刻画"犯罪即服务"经济,并最终协助对网络犯罪的起诉。

从功能对比看,pytopicgram 侧重本地抽取与主题建模,4CAT 提供持久数据集与模块化处理器,TeleCatch 提供远程过滤采集接口;文献中提出的 MST 因找不到带版本的公开源码库,被作者仅列为相关工作。按 2026 年 8 月核对的公开仓库与文档,Atenea 是四者中唯一同时具备持续监控、服务端持久消息库、命名实体识别、情感分析、嵌入生成与真正的语义检索的工具。
架构上,Atenea 把采集、处理、存储、检索与探索拆在统一的 REST 接口之后,重推理与核心后端解耦,监控不中断而服务可独立伸缩。数据模型只有三个概念:rooms(可监控的频道或群组)、users(人或机器人)、seeds(邀请链接等外部引用)。专门的 Telegram Auth Manager 管理多组 API 凭证,两种负载均衡策略分别按凭证拆分任务或按凭证归组资源,凭证过期时可恢复访问。
处理层基于 Telethon、Redis、Celery 与 Celery Beat 搭建异步分布式 ETL 流水线,PostgreSQL 作事务记录,Elasticsearch 配合 Kibana 负责词法检索,Qdrant 存放向量嵌入,媒体文件存入兼容 S3 的对象存储(可用 Garagehq 本地部署),PostgreSQL 保留其元数据、哈希与处理状态。数据库级锁与可配置并发避免各阶段 worker 冲突。
富化环节是语言感知的:入库时用 Efficient Language Detector 分配 ISO 639-1 语言码,置信度低于 0.15 的检测直接丢弃;正则检测器提取邮箱、URL、Telegram 提及、话题标签,以及比特币、以太坊、Dash 和门罗币钱包地址。基于模型的命名实体识别目前支持英语与西班牙语,使用 spaCy 3.8.14 的大模型管线,新增语言只需安装对应模型、注册代码并重新部署,无需改动富化 API、任务流水线或数据库结构。
规模数据来自 DarkGram 数据集:从 329 个种子解析出 207 个可监控房间,首次历史回扫存入超过 51 万条消息,单小时峰值 177,357 条,随后转为每 4 小时一次扫描,日均新增约 128 条,最终得到跨越近九年的 574,432 条消息。其中 378,905 条进入英/西语模型处理,混合提取器产出 175,021 个唯一实体。该集合中 PRODUCT 标签占比 4.7%,明显高于基线库的 0.7%,而 URL 标签在两边都在 27% 左右。媒体部分记录了 147,646 个附件、合计 6.41 TiB(约 7.05 TB),其中 .bin 文件与压缩包约占 6.09 TiB(约 6.70 TB)。
语义检索最能说明问题:在配备两块 NVIDIA L40S GPU 的外部硬件上,vLLM 运行 Qwen3-Embedding-4B 模型,约 5 小时为 56.3 万条消息生成 2560 维向量,平均每小时 107,400 条,15 分钟窗口峰值 35,224 条。配合统计异常检测,系统还在 DarkGram 中标记出两个高活跃窗口,其中一个在 2025 年末,一周内出现 11,005 条消息,z 分数达 8.17。
作者把 Atenea 定位为计算社会科学、新闻调查与网络威胁情报的通用后端,可支撑网络分析、叙事检测、抗议与危机期间的社会聆听,以及自动提取 IP 地址、域名、URL、钱包地址和加密哈希。平台以 MIT 许可证发布,附带完整文档、可复现部署包与模块化微服务,降低了研究团队长期、可审计地观察这一平台的门槛。