外观
数据集与基准档案
本页是大模型数据与评测基准的一站式档案:预训练语料(造模型)、后训练指令数据(教模型)、评测基准(量模型)三大类,每项给出规模、构建方式、用途、一句话说明与许可注意。数据与基准的规模、榜单数字会持续更新,本页数据截至 2025 年 8 月,以官方发布为准。
三条使用路径
做预训练/续训 → 看「一、预训练语料」;做微调/对齐 → 看「二、后训练与指令数据」;做评估/选模型 → 看「三、评测基准」与「四、中文与多语言数据」。数据来源与清洗详见预训练:数据与目标。
一、预训练语料
预训练语料是"模型的教材":规模与质量直接决定模型能力上限。互联网爬虫数据(Common Crawl)是绝大多数语料的原材料,需要经过清洗、去重、过滤、配比才可用。
| 语料 | 规模 | 构建方式 | 一句话说明 | 许可注意 |
|---|---|---|---|---|
| Common Crawl | 每月约 30~50 亿网页,PB 级 | 2008 年起每月全量爬取互联网 | 免费公开的网页爬虫语料,是一切大规模预训练语料的"原矿" | 数据公开可下载,但页面内容版权归原网站,需尊重 robots.txt 与版权 |
| The Pile | 约 825 GiB,22 个子集 | EleutherAI 人工挑选书籍/论文/代码/网页等混合 | 首个"精心配比"的开源预训练语料,GPT-NeoX 等模型使用 | 各子集许可不同,含受版权保护文本(如书籍),商用需逐项评估 |
| RedPajama-Data-1T | 约 1.2 万亿 token | TOGETHER 复刻 Llama 语料配比 | 开源复刻 Llama 的 7 类数据配比(网页 67%/代码 4.5%/书籍 4.5% 等) | 宽松可商用,源码与数据均开放 |
| RefinedWeb | 公开版约 6000 亿 token | TII(Falcon 团队)清洗 Common Crawl | 强调"高质清洗 + 严格去重"的纯网络语料,Falcon 系列使用 | 基于 Common Crawl,需遵循原网站版权 |
| CulturaX | 约 6.3 万亿 token,167 种语言 | 清洗 mC4 与 OSCAR 合并去重 | 覆盖 167 种语言的多语言语料,非英语小语种覆盖好 | 多语言数据版权情况复杂,商用前需评估目标语言语料 |
1. 从原始爬虫到训练语料:清洗流水线
原始 Common Crawl 噪声极高(广告、乱码、重复、低质页),不能直接训练。标准流水线四步:
- 采集与解析:下载 WARC 快照,抽取正文文本(去 HTML 标签、导航、广告),按 URL 语言判定语言。
- 质量过滤:按规则(长度、标点密度、符号比例)+ 启发式打分(语言模型困惑度、分类器)剔除低质页;同时做毒性/隐私过滤。
- 去重:MinHash 近似去重 + 精确去重,删除网页间重复片段(重复数据会浪费计算并导致模型"背题")。
- 配比与采样:按多语言/代码/数学/书籍目标比例混料,再按困惑度做上采样或下采样。
为什么都从 Common Crawl 出发
Common Crawl 免费、体量巨大、持续更新,是"数据的原材料";但各家语料的差异主要在于清洗流水线——去重算法、质量打分器、语言配比各不相同。所谓"数据即模型",主要就是在比拼这些处理细节。新语料(如 CulturaX、RefinedWeb)大多是"更好的清洗",而非"更新的来源"。
二、后训练与指令数据
后训练数据规模远小于预训练语料(百万级 vs 万亿级),但质量与多样性决定模型的"听话程度"。注意:大量指令数据由闭源商业模型生成,存在许可与版权争议(见文末提示框)。
| 数据集 | 规模 | 来源 | 一句话说明 | 许可注意 |
|---|---|---|---|---|
| Alpaca | 约 5.2 万条指令-回答 | Stanford,用 text-davinci-003 生成 | self-instruct 方法扩写指令的经典开源 SFT 数据集 | 由 OpenAI 模型生成,官方仅限学术研究使用 |
| ShareGPT | 约 9 万轮对话 | 社区共享的 ChatGPT 对话记录 | 真实用户对话,Vicuna 等对话模型的训练来源 | 由 ChatGPT 生成、用户分享,许可模糊,商用需谨慎 |
| UltraChat | 约 150 万轮对话 | 清华,用 ChatGPT 按 30 个主题生成 | 大规模多轮对话,覆盖指令、问询、闲聊等多种场景 | 由商业模型生成,研究用途为主 |
| OpenAssistant (oasst1) | 约 1.6 万棵对话树 | LAION,众包人工撰写 | 高质量纯人写多轮对话,无需担心"AI 生成"争议 | 开源(Apache 2.0),可商用 |
| Dolly | 约 1.5 万条 | Databricks 员工手写 | 人写的指令-回答对,小但干净,适合测试 | 开源可商用 |
1. 指令数据的三种生产方式
| 方式 | 代表 | 优点 | 缺点 |
|---|---|---|---|
| 人工编写 | oasst1、Dolly | 质量高、版权干净、可商用 | 成本高、规模有限 |
| 模型生成 | Alpaca、UltraChat、ShareGPT | 便宜、可大规模扩量 | 存在版权争议,且"教师模型"的缺陷会传给学生 |
| 人机混合 | 大部分商业 SFT 数据 | 质量与规模的折中 | 流程复杂、成本仍不低 |
2. 数据规模参考值
| 阶段 | 常见规模 | 说明 |
|---|---|---|
| 预训练 | 1B 级模型约 20~30B token;7B 级约 2~4 万亿 token | Chinchilla 建议"参数与数据约 1:20",前沿模型普遍 10T+ token |
| SFT | 1 千~10 万条高质量指令 | 1000 条高质量数据也能明显见效(LIMA 实验),关键是质量与多样性 |
| 偏好对齐(RLHF/DPO) | 数万~数十万条偏好对 | 需覆盖帮助性/诚实性/安全性的典型失败模式 |
AI 生成数据的合规红线
Alpaca、ShareGPT、UltraChat 等由 OpenAI/Anthropic 商业模型生成——OpenAI 服务条款明确禁止"用输出训练竞争模型",且生成内容的版权归属存在法律争议。建议仅用于研究与内部实验;商用产品优先用人工数据或经授权的数据。详见微调:SFT 与参数高效微调对数据质量与数量的讨论。
三、评测基准
评测基准是"模型考试卷",按考察能力分类如下。注意三件事:榜单分数只在"同一套提示与实现"下可比;MMLU 等老基准可能存在数据污染;单点刷分 ≠ 真实能力(详见评测与基准与评估实战)。
1. 综合知识与语言理解
| 基准 | 规模 | 一句话说明 |
|---|---|---|
| GLUE | 9 个任务、约 25 万样本 | 2018 年文本理解基准,BERT 时代的事实标准,现已基本饱和 |
| SuperGLUE | 8 个更难的推理任务 | GLUE 的升级版,2019 年发布,同样已被 LLM 刷爆 |
| MMLU | 57 个学科、约 1.6 万道多选题 | 最经典的综合知识基准,长期是排行榜头号指标 |
| HELM | 42 场景 × 7 指标 | Stanford 的多指标综合评测框架,强调"透明度"与对比公平性 |
2. 数学与推理
| 基准 | 规模 | 一句话说明 |
|---|---|---|
| GSM8K | 约 8 千道数学应用题 | 小学/初中应用题,测多步算术推理,配 CoT 使用 |
| MATH | 约 1.25 万道竞赛题 | 高中到竞赛级数学,5 个难度等级,区分度很高 |
| BBH | BIG-Bench 中 23 个难任务 | 测试逻辑、演绎、多步推理等"聪明题",小模型基本无解 |
| ARC | 约 7.8 千道科学题 | AI2 的科学问答(ARC-Challenge 更难),测常识与科学知识 |
3. 代码
| 基准 | 规模 | 一句话说明 |
|---|---|---|
| HumanEval | 164 道 Python 函数题 | 代码生成的事实标尺,用 pass@k 评估 |
| MBPP | 974 道入门级 Python 题 | 更基础的编程任务,常与 HumanEval 联合报告 |
4. 长文本与对话
| 基准 | 规模 | 一句话说明 |
|---|---|---|
| LongBench | 21 个任务、约 4750 问 | 中英双语长上下文评测,平均输入上万 token,测"真能读到多长" |
| MT-Bench | 80 道多轮开放问题 | 对话质量基准,用 LLM-as-a-judge(GPT-4)打分,Chatbot Arena 重要参考 |
| TruthfulQA | 817 个问题 | 专测"幻觉"与事实性:模型是否编造看似合理但错误的答案 |
5. 指令遵循与更多
| 基准 | 规模 | 一句话说明 |
|---|---|---|
| IFEval | 约 500 条指令 | 专测"是否真的按指令执行"(格式/约束遵循),区分度好 |
| BIG-Bench | 204 个任务 | 规模最大的异构基准,LLM 时代实际常用其难子集 BBH |
| SQuAD | 约 10 万问 | 2016 年抽取式阅读理解基准,BERT 时代经典任务 |
6. 评测基准的四大陷阱
- 数据污染:MMLU 等基准的题目长期公开,可能已混入训练数据,分数虚高。防御:去重、监控、自建私有集。
- 饱和与刷分:GLUE/SuperGLUE 已被刷爆,MMLU 也接近饱和——区分度下降后,榜单第一名与第十名可能是同一个档位。
- 口径不统一:CoT 提示开不开、few-shot 用几 shot、温度设多少,都显著影响分数;跨模型比较必须同一口径。
- 榜单 ≠ 业务:基准测的是"考试能力",真实业务要看你自己的任务分布,务必自建评估集。
评测基准怎么选
- 通用能力对比:MMLU + GSM8K + HumanEval 三件套(成本低、可复现);
- 数学推理:GSM8K + MATH + BBH;
- 代码:HumanEval + MBPP;
- 长上下文:LongBench(+ 自建"大海捞针"任务);
- 对话与"真实感":MT-Bench / Chatbot Arena;
- 中文:见下节 C-Eval / CMMLU。 落地搭建见评估实战。
四、中文与多语言数据
中文任务评估与数据是中文开发者的刚需,这里单列一张表:
| 数据集 | 规模 | 用途 | 一句话说明 |
|---|---|---|---|
| C-Eval | 约 1.4 万道题 | 中文综合知识 | 52 个学科、覆盖初中到研究生,中文版 MMLU |
| CMMLU | 约 1.15 万道题 | 中文综合知识 | 67 个学科、含人文社科细分,与 C-Eval 互补 |
| CLUE | 9 类任务 | 中文语言理解 | 中文版 GLUE,BERT 时代的中文标准 |
| SuperCLUE | 多任务套件 | 中文对话能力 | 中文对话基准,分基础/进阶/高阶难度 |
| BELLE | 约 100 万条中文指令 | 中文 SFT | 百度开源的 self-instruct 中文指令数据 |
| COIG | 约 19 万条中文指令 | 中文 SFT | 智源(BAAI)发布的多来源中文指令语料 |
多语言通用建议
中文大模型测评至少同时跑 C-Eval + CMMLU(知识)+ 中文代码/对话子集,并检查模型词表对中文的分词效率——部分西文优先模型在中文上 token 消耗更高(见分词与词表)。
五、许可与使用注意
版权与生成数据的合规红线
预训练语料:Common Crawl 及衍生语料包含大量受版权保护内容,多国已出现针对训练数据的诉讼;商用产品务必评估数据来源与地区法律。 AI 生成的指令数据:Alpaca、ShareGPT、UltraChat 等由 OpenAI/Anthropic 商业模型生成——OpenAI 服务条款禁止"用输出训练竞争模型",且生成内容的版权归属存在争议,建议仅用于研究与内部实验。 评测基准:多数基准为研究许可(学术用途),大规模商用评估前请核对各数据集 LICENSE。
合规自查四问
① 数据来源是否明确授权?② 模型生成的数据是否被服务条款禁止用于训练?③ 目标地区的法律风险(如欧盟 AI 法案、各国版权判例)?④ 商用产品是否已做数据链路审计?四问全部通过再上线。
六、数据处理工具链
| 工具 | 用途 | 链接 |
|---|---|---|
| Hugging Face Datasets 库 | 数据集加载、流式处理、切分与导出的标准接口 | https://huggingface.co/docs/datasets |
| datatrove | 大规模数据清洗流水线(FineWeb 的清洗工具),去重/过滤/打分全流程 | https://github.com/huggingface/datatrove |
| lm-evaluation-harness | 跑 MMLU/GSM8K/HumanEval 等评测基准的标准框架 | https://github.com/EleutherAI/lm-evaluation-harness |
| OpenCompass | 中文与多模态评测套件,含榜单服务 | https://github.com/open-compass/opencompass |
七、从零搭建数据管线的五个步骤
给"想用自己的数据做预训练/微调"的读者一个最小可行流程:
- 定目标与预算:先定模型规模与训练 token 预算(见上文"数据规模参考值"),反推需要多少原始数据——清洗去重通常会丢掉 50%~90%。
- 选数据源:预训练用开源语料(RedPajama/RefinedWeb)或自建爬虫;指令数据优先人工或混合,避免未经授权的 AI 生成数据(见「五、许可」)。
- 清洗与去重:用 datatrove 跑质量过滤、MinHash 去重、毒性过滤;对多语言语料按语言分流。
- 配比与采样:按任务目标决定多语言/代码/数学/书籍比例;用困惑度上采样提升"有用"语料权重。
- 质量验证:先用 1 亿 token 级别的样本小规模试训,观察损失曲线与下游基准(C-Eval/MMLU)随数据清洗步骤的变化——数据管线的每一步都应被实验验证,而不是凭感觉。
延伸阅读
- 预训练:数据与目标 —— 数据清洗、去重、配比的完整方法
- 评测与基准 —— 基准的局限、数据污染与榜单批判
- 评估实战 —— 用 lm-eval-harness 搭建评估流程
- 微调:SFT 与参数高效微调 —— 指令数据如何用于 SFT
- RAG:检索增强生成 —— 私有数据落地的另一条路(不经过训练)
- 精选资源清单 —— 数据集与评测工具的完整工具链
参考资料
- Common Crawl 官方: https://commoncrawl.org/
- The Pile 论文(Gao et al., 2020): https://arxiv.org/abs/2101.00027
- RedPajama 仓库: https://github.com/togethercomputer/RedPajama-Data
- RefinedWeb 论文(Penedo et al., 2023): https://arxiv.org/abs/2306.01116
- CulturaX 论文(Nguyen et al., 2023): https://arxiv.org/abs/2309.09400
- Stanford Alpaca 仓库: https://github.com/tatsu-lab/stanford_alpaca
- UltraChat 论文(Ding et al., 2023): https://arxiv.org/abs/2305.14233
- OpenAssistant 数据集: https://huggingface.co/datasets/OpenAssistant/oasst1
- MMLU 仓库: https://github.com/hendrycks/test
- GSM8K 论文(Cobbe et al., 2021): https://arxiv.org/abs/2110.14168
- HumanEval 论文(Chen et al., 2021): https://arxiv.org/abs/2107.03374
- BBH 论文(Suzgun et al., 2022): https://arxiv.org/abs/2210.09261
- HELM(Stanford CRFM): https://crfm.stanford.edu/helm/
- TruthfulQA 仓库: https://github.com/sylinrl/TruthfulQA
- LongBench 论文(Bai et al., 2023): https://arxiv.org/abs/2308.14508
- C-Eval 仓库: https://github.com/SJTU-LIT/ceval
- datatrove 仓库: https://github.com/huggingface/datatrove