摘要
本文解读 KDD 2024 论文《Xinyu: An Efficient LLM-based System for Commentary Generation》(Xinyu:面向中文评论生成的高效大模型系统)。该论文提出面向新闻评论的端到端大模型写作系统 Xinyu ,通过融合五步生成流水线 、逐步监督微调(SFT) 与论点排序模型 + 证据库检索增强生成(RAG) ,把评论写作从平均 4 小时压缩到 20 分钟 ,其特别之处在于用「流程解构」与「外部证据」同时满足评论的结构严谨与论据充分。实验表明 Xinyu 以 13B 参数在五维评价中拿到 Overall 7.93,超越 GPT-4(7.78)等全部基线,且人工实测效率提升 12 倍而质量不降,为媒体内容生产的 AI 辅助写作提供了重要借鉴。
视频讲解 :点击观看 B 站视频
- 摘要
- 论文基本信息
- 背景与动机
- 研究主线:从问题到结论
- 基准/方法设计
- 分类全景
- 方法细节
- 实验设计与结果
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- [Xinyu 与直接用 GPT-4 写评论有什么区别?](#Xinyu 与直接用 GPT-4 写评论有什么区别?)
- 证据库里的知识从哪里来?
- 论点排序模型为什么用知乎点赞?
- [4 小时到 20 分钟是怎么测的?](#4 小时到 20 分钟是怎么测的?)
- 这套系统能迁移到英文或其他文体吗?
- [GPT-4 当裁判可靠吗?](#GPT-4 当裁判可靠吗?)
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | Xinyu: An Efficient LLM-based System for Commentary Generation |
| 标题(中文) | Xinyu:面向中文评论生成的端到端大模型系统 |
| 作者 | Yiquan Wu, Bo Tang, Chenyang Xi, Yu Yu, Pengyu Wang, Yifei Liu, Kun Kuang, Haiying Deng, Zhiyu Li, Feiyu Xiong, Jie Hu, Peng Cheng, Zhonghao Wang, Yi Wang, Yi Luo, Mingchuan Yang |
| 机构 | 浙江大学 · 上海高等算法研究院 · 媒体融合生产技术与系统国家重点实验室 · 中国电信研究院 |
| 会议 | KDD 2024(30th ACM SIGKDD,巴塞罗那) |
| arXiv | 2408.11609 |
| 官方页面 | ACM DOI: 10.1145/3637528.3671537 |
背景与动机
为什么评论生成比普通文本生成更难? 评论是一种「观点+证据」型文章,要为读者提供对事件的深度理解。一篇合格的时评有两个层次的要求:基本要求 是结构完整(总-分结构)且内容自洽(论据必须支撑论点);进阶要求是论点具体新颖、论据真实且有说服力------而 LLM 最容易犯的幻觉,恰恰会编造不存在的论据。
现有工作为什么不够? 直接让大模型一次性生成评论,结构容易松散、论据无法溯源;传统的自动评估指标如 ROUGE、BLEU 只衡量与参考文本的相似度,而评论内容高度多样,相似度指标无法全面评估质量。在评论生成方向,过去的工作多为短文本(用户评论、代码注释),缺少面向完整时评的系统;领域大模型(医疗、法律、教育等)主要做知识注入,没有把「写作流程」本身工程化。
RAG 写作系统的历史脉络也印证了这一思路:2020 年 Lewis 等人确立检索增强生成(RAG)范式,2022--2023 年 InstructGPT 与 LIMA 奠定 SFT/RLHF 对齐技术,2024 年 Xinyu 首次把「流程解构 + 证据库 RAG」组合成评论写作系统,此后 GraphRAG 等全局检索与智能体写作系统相继兴起。Xinyu 站在这条脉络上,完成了从通用检索生成到垂直媒体生产的技术迁移。
研究主线:从问题到结论

图 5:Xinyu 研究主线(Mermaid 流程图)------从评论写作的高时耗痛点出发,经流程解构、排序模型与证据库 RAG,最终用五维评测闭环验证 12 倍提速与质量不降。
基准/方法设计
Xinyu 的核心设计思想是把「一篇式生成」解构成「可训练、可干预的流水线」 :结构由分解天然保证,质量由专项组件保障。系统划分为五步主线组件 与两个辅助组件:
| 组件 | 作用 | 关键设计 |
|---|---|---|
| Peg 生成 | 用搜索引擎抓取事件要点,凝练成写作锚点 | 取检索结果前 3 条,LLM 压缩成信息密度高的 peg |
| 主论点生成 | 生成候选主论点 | 按 10 个方向生成:科技/财经/社会/政治/文艺/生活/环境/体育/教育/科学 |
| 支撑论点生成 | 围绕主论点展开多角度论证 | 支持并行/递进/对比三种结构,数量自适应 |
| 证据生成 | 从证据库检索并改写论据 | RAG 检索 + 标注出处编号,缓解幻觉 |
| 成文 | 生成标题与结尾并组装全文 | 整合前面所有输出 |
| 论点排序模型 | 评估主论点新颖性与客观性 | BERT 打分 + 成对损失,24 万对点赞偏序训练 |
| 证据数据库 | 提供可追溯的实时论据 | 20 万事件 + 11 万书籍知识,ElasticSearch 检索 |

图 1:评论生成任务示意------左侧是评论员工作流(论点挖掘、证据检索、文章润色),Xinyu 加速中间步骤;右侧是一篇评论的标准结构:标题、主论点、支撑论点与证据、结尾。
分类全景

图 6:Xinyu 系统组件分类(Mermaid 流程图)------主线五步组件保证基本要求(结构严谨、逻辑自洽),辅助组件保证进阶要求(论点新颖、论据充分)。
方法细节
逐步解构 + 逐步 SFT。 每一步都有专属提示策略与 SFT 数据:Peg 生成以「事件详情→peg」构造训练样本;主论点生成以「peg+方向→主论点」训练;支撑论点生成以「事件+主论点+结构→支撑论点」训练;证据生成以「主论点+支撑论点+检索资料→带编号论据」训练;成文以「前文→标题/结尾」训练。40 万条 SFT 数据覆盖全部步骤。

图 2:Xinyu 整体框架------上方五步生成流程逐步衔接,下方论点排序模型与证据数据库为步骤 2 与步骤 4 提供质量保障。
论点排序模型。 主观的「论点新颖性」没有统一标准,论文把它转化为两两比较问题:BERT 打分器配合成对损失 L(x)=\\sum\\Phi(f(x_a)-f(x_b)),其中 f(x) 是论点打分,\\Phi 是非线性变换。训练数据用知乎文章点赞数构造偏序,共 24 万对------点赞数近似反映新颖性与客观性,替代昂贵的人工标注。
证据数据库与 RAG。 事件知识通过每日抓取网站热榜标题,由 LLM 完成四件事:概括事件、判定方向(科技/财经等 10 类)、抽取六要素(时间/地点/人物/起因/经过/结果)、按六要素成段描述;书籍知识来自法律、财经等经典著作的合法分块。数据库规模为 20 万事件 + 11 万书籍,检索用 ElasticSearch,相似度阈值取 0.6,且事件数据每日更新保证时效性。
训练配置(附录 B)。 基座 LLaMA2-13B 扩充 2.8 万中文 token,用 500B 中英 token 继续预训练 20 天(128 张 A800 80G);SFT 40 万条数据混合各步骤专项数据与 BelleGroup 通用中文数据集,8 张 A800 训练 2 天,框架为 Megatron-DeepSpeed。
实验设计与结果
评测协议。 测试集选自人民日报「三评」栏目的 41 篇 真实评论,覆盖经济、民生、科技、文化、体育等主题。论文提出五维评价体系:结构(层次清晰、谋篇布局)、逻辑(内容自洽、论证合理)、论点(立意新鲜、导向正确)、论据(针对性、合适性)、语言(流畅、深刻、生动),各维度 1--10 分,Overall 取平均,由 GPT-4 按提示词打分;基线模型与 Xinyu 都只输入事件详情以保证公平。
GPT-4 打分可信度(附录 A)。 用 30 篇随机评论对比 GPT-4 与人工打分,各维度 Pearson 相关系数全部超过 0.6:
| 维度 | 结构 | 逻辑 | 论点 | 论据 | 语言 |
|---|---|---|---|---|---|
| Pearson 相关系数 | 0.66 | 0.69 | 0.73 | 0.66 | 0.64 |
主实验结果(GPT-4 评分)。 Xinyu(基于微调 LLaMA2-13B)以 Overall 7.93 超过包括 GPT-4 在内的全部基线:
| 方法 | Overall | 结构 | 逻辑 | 论点 | 论据 | 语言 |
|---|---|---|---|---|---|---|
| GPT-4 | 7.78 | 8.05 | 8.40* | 8.05 | 6.02 | 8.38* |
| GLM-4 | 7.72 | 8.11* | 8.35 | 8.08* | 5.82 | 8.24 |
| ERNIE-4 | 7.71 | 8.05 | 8.35 | 8.03 | 5.73 | 8.38* |
| GPT-3.5-Turbo | 7.70 | 8.00 | 8.08 | 8.00 | 6.39 | 8.05 |
| Baichuan2-Turbo | 7.65 | 8.11* | 8.28 | 8.06 | 5.63 | 8.17 |
| Qwen-72B | 7.37 | 7.90 | 7.88 | 7.87 | 5.28 | 7.90 |
| Xinyu (LLaMA2-13B) | 7.93* | 8.00 | 8.20 | 8.00 | 7.41* | 8.05 |
(表示全部基线中最高分。)Xinyu 的优势集中在 论据维度(7.41 vs 最强基线 6.39)*------这正是排序模型与证据库的功劳。

图 3:人工 vs Xinyu 辅助------写作耗时从 4 小时以上降至 20 分钟,质量评分与纯人工相当。
框架消融(附录 D)。 套用 Xinyu 框架后,GPT-4 达到 8.30 全场最高,Baichuan2-Turbo 到 7.91,Qwen-72B 从 7.37 升到 7.82;而 20B 以下的 Baichuan2-13B 只有 6.31、Qwen-14B 只有 6.22------框架对小模型是负增益,反证 SFT 是让 13B 模型发挥框架价值的关键。
RAG 消融与时效性(附录 E)。 去掉 RAG 时论据 5.60、时效 8.85;加事件库后论据 7.14、时效 9.10;事件+书籍双库达到论据 7.41 、时效 9.30(人工判定,Kappa 超过 0.78):
| 配置 | 论据 | 时效性 |
|---|---|---|
| w/o RAG | 5.60 | 8.85 |
| w/ 事件库 | 7.14 | 9.10 |
| w/ 事件 + 书籍库 | 7.41 | 9.30 |

图 4:SFT 数据分布------各生成步骤都有充足的专项数据配比,这是逐步训练有效性的基础。
结果对比总结

图 7:结果对比总结(Mermaid 流程图)------质量与效率双胜:13B 参数在五维评测上全面领先,论据维度优势来自证据库 RAG,框架增益来自流程解构与逐步 SFT。
关键发现
- 小模型打赢大模型:Xinyu 以 13B 参数拿到 Overall 7.93,超过 GPT-4(7.78)、GLM-4(7.72)、ERNIE-4(7.71)等全部基线,主要靠论据维度 7.41 的显著优势。
- RAG 是论据质量的核心:去掉 RAG 论据仅 5.60,加事件库升至 7.14,加书籍库再到 7.41;时效性从 8.85 升到 9.30。
- 框架对模型有放大效应:Qwen-72B 套框架后 Overall 从 7.37 升至 7.82(+0.45);GPT-4 套框架达 8.30,但 20B 以下模型套框架反而下降,说明分步生成能力需要 SFT 注入。
- 弱监督信号可行:24 万对知乎点赞偏序训练的排序模型上线后,所有维度指标提升(Overall 7.85→7.93),验证了「用平台点赞替代人工标注」的有效性。
- 真实场景 12 倍提速:10 个真实案例中,评论员写作时间从 4 小时以上降至 20 分钟,质量评分与纯人工持平。
- 评价体系可复现:五维 GPT-4 打分与人工 Pearson 相关 0.64--0.73,为评论生成提供了首个可自动复现的评估协议。
- Oral 信号拆解(附录 C):用 ResearchStudio-Idea 框架审视,Xinyu 命中三个创新模式------P11 分解并委托求解器(五步流水线交给专项模型与检索器)、P4 隔离变量诊断测量(逐组件消融)、P7 自造训练信号(知乎点赞偏序替代人工标注),属于可复用基础设施型贡献,社区可在此之上继续构建。
局限性
- 检索精度:证据召回仍可能命中与论点相关性不足的资料,需要更强的查询-文档语义对齐。
- 对齐手段单一:目前以 SFT 为主,尚未引入 RLHF 对齐写作风格与用户偏好。
- 时效性评估受限:GPT-4 训练截止日期导致时效性只能靠人工判定(Kappa 0.78+)。
- 中文场景限定:系统与证据库面向中文评论,跨语言迁移未验证。
- 叙事措辞层面(附录 F 分析):论文摘要存在 "a comprehensive of evaluation metric" 语法笔误,表注中 "Arug." 为不规范缩写------不影响结论,但属于可读性瑕疵。
常见问题(FAQ)
Xinyu 与直接用 GPT-4 写评论有什么区别?
Xinyu 把生成解构成五步流水线并逐步 SFT,再用论点排序与证据库 RAG 兜底质量;直接让 GPT-4 一篇生成,结构容易松散,论据可能编造。实验上 Xinyu 的 Overall 7.93 超过 GPT-4 的 7.78,论据维度 7.41 显著领先。
证据库里的知识从哪里来?
两部分:事件知识来自每日抓取的热榜文章标题,由 LLM 概括事件、判定方向、抽取六要素并成段描述(20 万条,每日更新);书籍知识来自法律、财经等经典著作的合法分块(11 万条)。检索用 ElasticSearch,相似度阈值 0.6。
论点排序模型为什么用知乎点赞?
论点的「新颖性」没有客观标准,论文用知乎文章点赞数构造文本对的偏序------高赞观点通常更新颖、更客观------训练 24 万对数据让 BERT 打分器学会两两比较,避免昂贵的人工标注。
4 小时到 20 分钟是怎么测的?
随机选取 10 个真实案例,让有新闻背景的评论员分别纯手工写作和使用 Xinyu 辅助写作,对比耗时与质量评分。结果平均耗时从 4 小时以上降至 20 分钟,质量评分与纯人工相当。
这套系统能迁移到英文或其他文体吗?
论文只验证了中文评论场景,跨语言迁移未做实验。不过流程解构、排序与 RAG 的设计与语言无关,迁移的主要成本在于重建对应语言的证据库与 SFT 数据。
GPT-4 当裁判可靠吗?
论文用 30 篇评论对比 GPT-4 与人工打分,五个维度的 Pearson 相关系数在 0.64 到 0.73 之间,全部超过 0.6,证明 GPT-4 作为自动评估器胜任该任务;只有时效性维度因模型知识截止由人工判定。
参考链接
- Xinyu 论文 arXiv 摘要页
- ACM 官方页面(KDD 2024)
- RAG:Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (NeurIPS 2020)
- InstructGPT:Training Language Models to Follow Instructions with Human Feedback (NeurIPS 2022)
- LIMA:Less Is More for Alignment (2023)
- LLaMA 2:Open Foundation and Fine-Tuned Chat Models (2023)
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群 :白拾的小屋 (750365700)
⭐B站账号 :白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页 :YhbCode000(工程文件)