论文略读Fewer Truncations Improve Language Modeling

ICML 2024

1 背景

  • 在传统LLM训练过程中,为了提高效率,通常会将多个输入文档拼接在一起,然后将这些拼接的文档分割成固定长度的序列。
    • ------>会造成一个重大问题------文档截断(document truncation),损害了数据完整性(data integrity)
    • 此外,文档截断减少了每个序列中的上下文量,可能导致下一个词的预测与上文不相关,从而使模型更容易产生幻觉 (hallucination)。
      • (a):将变量定义与使用分割到不同的训练序列
        • ------>使得模型学习到错误的模式,并可能在下游任务中产生幻觉。
      • (b):摘要中的"Monday morning"无法与训练序列中的任何上下文匹配,导致内容失实
        • ------>显著降低模型对上下文信息的敏感度,导致生成的内容与实际情况不符,即所谓的不忠实生成 (unfaithful generation)。
      • (c):阻碍训练期间的知识获取,因为知识在文本中的表现形式通常依赖完整的句子或段落
  • ------>论文提出了最佳适配打包 (Best-fit Packing)
    • 使用长度感知的组合优化技术,有效地将文档打包到训练序列中,从而完全消除不必要的截断。
    • 不仅保持了传统方法的训练效率,而且通过减少数据的片段化,实质性地提高了模型训练的质量
相关推荐
别动我齐刘海1 分钟前
ROS2 Jazzy + C++ 实战路线——进阶学习3
c++·人工智能·vscode·python·算法·机器学习·机器人
甲维斯6 分钟前
ZCode 19号更新来了,偷偷上传问题“已修复”?!
人工智能
zhangfeng11337 分钟前
《从“人工适配“到“智能生成“:KernelSwift 跨国产芯片算子迁移全栈方案解读》 —— 强调范式跃迁和跨硬件属性,适合偏架构分析的写法
人工智能·算法·华为·ai编程·npu
是Dream呀14 分钟前
Harness 工程:让 Agent 真正把任务做完
人工智能·分布式·缓存·agent
打工仔折腾 AI26 分钟前
Prometheus 告警推钉钉:从单群 Webhook 到跨网络 Alertmanager 实战
人工智能·后端·python·性能优化
人工智能AI技术28 分钟前
LLM 应用的 Bulkhead 设计
人工智能
Ivanqhz31 分钟前
Ping-Pong 双缓冲
开发语言·人工智能·python·深度学习·mlir
bmxy小明同学39 分钟前
2026-09-18-embedding选型
人工智能
superxxd42 分钟前
基于rust的多平台原生GIS引擎
人工智能·物联网·实时音视频
就叫你天选之人啦43 分钟前
安装torch+vllm+flash_attn的prompt
人工智能·pytorch·python