大语言模型预训练数据集及清洗框架介绍【简单版】

目录

[一、常见数据集类型 📚](#一、常见数据集类型 📚)

[二、数据清洗框架对比 🧹](#二、数据清洗框架对比 🧹)

SlimPajama

MNBVC

CC-NET

[三、理想的清洗框架 💯](#三、理想的清洗框架 💯)

[四、数据清洗核心流程 🔄](#四、数据清洗核心流程 🔄)

[五、现有数据集反思 🤔](#五、现有数据集反思 🤔)

[六 中文预训练数据集 🇨🇳](#六 中文预训练数据集 🇨🇳)

[1. Wuanjuan 1.0](#1. Wuanjuan 1.0)

[2. WuDaoCorpora](#2. WuDaoCorpora)

[3. CLUECorpus2020](#3. CLUECorpus2020)

[多语种数据集 🌍](#多语种数据集 🌍)

[1. CC100](#1. CC100)

[2. OSCAR](#2. OSCAR)

[3. ROOTS](#3. ROOTS)

[4. RedPajama-V2](#4. RedPajama-V2)


今天给大家带来一篇超简单的大语言模型预训练数据集及清洗框架总结,建议收藏!👍

一、常见数据集类型 📚

  1. 网页数据 🌐
  2. 书籍 📖
  3. 企业年报 📊
  4. 法律文书 ⚖️
  5. 问答 ❓
  6. 新闻 📰
  7. 百科 🔍
  8. 考试题 ✍️
  9. 专利 💡
  10. 评论 💬
  11. 博客 📝
  12. 歌词 🎵
  13. 古诗文 🖋️
  14. 中英平行语料 🇨🇳🇬🇧

二、数据清洗框架对比 🧹

SlimPajama

  • 擅长:大规模英文数据去重
  • 优点:支持并行和内存优化,可处理万亿级数据
  • 缺点:仅支持英文

MNBVC

  • 擅长:中文语料清洗
  • 优点:支持文本提取、去重和质量评分
  • 缺点:仅支持文档级别去重

CC-NET

  • 擅长:多语种清洗
  • 优点:实现完整清洗链路,包括语种分类、规则过滤等
  • 缺点:安装复杂,缺乏多粒度去重

三、理想的清洗框架 💯

  1. 支持多语种多格式输入 🌍
  2. 具备大规模并行和可扩展能力 🚀
  3. 支持自定义规则和功能 🛠️
  4. 支持多粒度去重(段落、章节、文档) 🔍
  5. 模块化、可配置、可扩展 🧩
  6. 提供丰富的规则库 📚

四、数据清洗核心流程 🔄

  1. 预处理:抽取段落,计算哈希值
  2. 去重、分类和打分:
    • 删除重复段落
    • 语种分类(如中文、英文、德文等)
    • 质量打分(分为Head、Middle、Tail三级)
  3. 重组:按语种和质量分类重组,保存为Json文件

五、现有数据集反思 🤔

  1. 数据规模:中英高质量文本已初步对齐开源模型(约20T Tokens)
  2. 训练语种:从单/双语种向多语种发展
  3. 采样方式:不均匀采样 vs 均匀采样(各有优势)
  4. 去重策略:精确去重+模糊去重结合
  5. 质量评估:缺乏统一标准,常用方法:
    • 质量分类器+阈值筛选
    • 文本困惑度(PPL)指标
    • 多轮人工校验

六 中文预训练数据集 🇨🇳

1. Wuanjuan 1.0

🔍 由上海AI实验室构建

📊 规模:552 GB中文文本

🧹 经过细粒度清洗、去重和价值对齐

⚠️ 注意:与MNBVC有重叠,使用前需去重

2. WuDaoCorpora

🏫 北京智源人工智能研究院出品

📚 包含文本、对话、图文对

🏷️ 50+行业数据标签

🧼 从100TB原始网页数据中清洗而来

3. CLUECorpus2020

🌐 从Common Crawl提取

📏 规模:100 GB

✅ 已用于成功训练Bert-base模型

🚨 仍存在一些质量问题,如繁体字、广告文本等

多语种数据集 🌍

1. CC100

🗣️ 100种语言

📊 总规模:2.5TB

🧠 用于训练XLM-R模型

2. OSCAR

🌐 基于Common Crawl

📊 总规模:6.3TB

🗨️ 151种语言

3. ROOTS

🌈 59种语言(46种自然语言+13种编程语言)

📊 规模:1.6TB

🤖 用于训练BLOOM模型

4. RedPajama-V2

🗣️ 5种主要语言

📊 规模:30T Tokens(约100TB)

🧹 采用CC-NET清洗框架

相关推荐
董厂长2 小时前
langchain :记忆组件混淆概念澄清 & 创建Conversational ReAct后显示指定 记忆组件
人工智能·深度学习·langchain·llm
G皮T5 小时前
【人工智能】ChatGPT、DeepSeek-R1、DeepSeek-V3 辨析
人工智能·chatgpt·llm·大语言模型·deepseek·deepseek-v3·deepseek-r1
九年义务漏网鲨鱼5 小时前
【大模型学习 | MINIGPT-4原理】
人工智能·深度学习·学习·语言模型·多模态
元宇宙时间6 小时前
Playfun即将开启大型Web3线上活动,打造沉浸式GameFi体验生态
人工智能·去中心化·区块链
开发者工具分享6 小时前
文本音频违规识别工具排行榜(12选)
人工智能·音视频
产品经理独孤虾6 小时前
人工智能大模型如何助力电商产品经理打造高效的商品工业属性画像
人工智能·机器学习·ai·大模型·产品经理·商品画像·商品工业属性
老任与码6 小时前
Spring AI Alibaba(1)——基本使用
java·人工智能·后端·springaialibaba
蹦蹦跳跳真可爱5896 小时前
Python----OpenCV(图像増强——高通滤波(索贝尔算子、沙尔算子、拉普拉斯算子),图像浮雕与特效处理)
人工智能·python·opencv·计算机视觉
雷羿 LexChien6 小时前
从 Prompt 管理到人格稳定:探索 Cursor AI 编辑器如何赋能 Prompt 工程与人格风格设计(上)
人工智能·python·llm·编辑器·prompt
两棵雪松7 小时前
如何通过向量化技术比较两段文本是否相似?
人工智能