大语言模型预训练数据——数据采样方法介绍以GPT3为例

大语言模型预训练数据------数据采样方法介绍以GPT3为例

一、数据采样核心逻辑

这是 GPT - 3 训练时的数据集配置,核心是非等比例采样------不按数据集原始大小分配训练占比,而是人工设定不同数据集在训练中被抽取的概率(Weight in training mix ),让小数据集也能被多次学习,大数据集适当降低重复度,平衡模型学习广度与深度。

二、各列数据含义

  1. Dataset:训练 GPT - 3 用到的数据集,像 Common Crawl 是网页抓取数据,Wikipedia 是维基百科内容,Books1/2 是书籍文本等,覆盖不同来源、不同类型的语料。
  2. Quantity (tokens):每个数据集的token总量 ,比如 Common Crawl (filtered) 有 4100 亿 token,代表该数据集文本转成模型可处理的 token 后,总数量是这么多。
  3. Weight in training mix :训练时,从该数据集抽取样本的概率占比 。比如 Common Crawl 占 60%,意味着每一轮训练选样本,60%的概率从它这里选,和数据集本身大小无严格比例关系,是人为调的"采样权重"。
  4. Epochs elapsed when training for 300B tokens :当整体训练到 3000 亿 token 时,该数据集被"完整过几遍(Epoch )"。计算逻辑是:
    • 先算训练 3000 亿 token 时,从该数据集实际用了多少 token:3000 亿 × 该数据集权重
    • 再用"实际用的 token 量 ÷ 该数据集总 token 量",得到被训练的轮次(Epoch )。
    • 举个例子,以 Wikipedia 为例:
      • 按权重,训练 3000 亿 token 时,用了 3000 亿×3% = 90 亿 token
      • Wikipedia 总 token 是 30 亿,所以 Epoch = 90 亿÷30 亿 = 3.4 ,即被完整学习约 3.4 遍;同理,Common Crawl 是 3000 亿×60% = 1800 亿 token ,除以 4100 亿总 token,得到约 0.44 轮。

简单说,就是通过"自定义采样权重"打破数据集大小限制,让不同数据按需被模型学习多轮,最终"Epochs"体现的是:在 3000 亿总训练量下,单个数据集被重复学习的次数 ,背后是"权重×总训练量÷数据集自身大小"的计算逻辑。

相关推荐
甲维斯11 分钟前
Opus5.0首测,瘫坐沙发!效果,时间,token皆无敌!
前端·人工智能
网络工程小王12 分钟前
【HCIE-AI】12.deepspeed分布式并行训练进阶版
人工智能·pytorch·分布式·学习·昇腾·deepspeed
m沐沐17 分钟前
【计算机视觉】人脸识别三大经典算法:LBPH、Eigenfaces、FisherFaces 原理与实战
图像处理·人工智能·深度学习·opencv·算法·机器学习·计算机视觉
安吉升科技22 分钟前
图书馆、博物馆双目ai客流统计摄像头技术机理与运行架构解析
人工智能
武子康23 分钟前
低延迟不是更快地猜:EOU / Barge-in / Turn Protocol 必须统一(4 种结束 + Generation Fencing + 9 类可复现场景)
人工智能·后端·llm
您^_^24 分钟前
使用技巧(十一):Claude Code 最强审问官 —— grill-me 深度指南,装完先别写代码
人工智能·windows·个人开发·claudecode·deepseek v4 pro
ye小杰榨 问鼎中原ZP27 分钟前
初探:用 FastAPI 搭建你的第一个 AI Agent 接口
人工智能·fastapi
AOwhisky29 分钟前
AI审AI:GitLab上线AI代码审查,开发者可以松一口气了吗?
人工智能·gitlab
Asize31 分钟前
别只会改 Prompt:用 AI Loop 把大模型变成可验收的执行系统
人工智能
东风破_31 分钟前
Temperature 越高越有创造力吗?从概率分布、Top-K 到 LangChain 工作流
人工智能