Skip to content

数据集与基准档案

本页速览 大模型全链路数据档案:预训练语料、后训练指令数据与主流评测基准的规模、用途、获取方式与许可注意,覆盖 Common Crawl 到 MT-Bench、C-Eval 的完整图谱。

本页含时效性内容,数据截止于 2025-08;JD、榜单、产品功能等信息可能已变化,引用前请核对原始出处。

数据集与基准档案

本页是大模型数据与评测基准的一站式档案:预训练语料(造模型)、后训练指令数据(教模型)、评测基准(量模型)三大类,每项给出规模、构建方式、用途、一句话说明与许可注意。数据与基准的规模、榜单数字会持续更新,本页数据截至 2025 年 8 月,以官方发布为准。

三条使用路径

预训练/续训 → 看「一、预训练语料」;做微调/对齐 → 看「二、后训练与指令数据」;做评估/选模型 → 看「三、评测基准」与「四、中文与多语言数据」。数据来源与清洗详见预训练:数据与目标

一、预训练语料

预训练语料是"模型的教材":规模与质量直接决定模型能力上限。互联网爬虫数据(Common Crawl)是绝大多数语料的原材料,需要经过清洗、去重、过滤、配比才可用。

语料规模构建方式一句话说明许可注意
Common Crawl每月约 30~50 亿网页,PB 级2008 年起每月全量爬取互联网免费公开的网页爬虫语料,是一切大规模预训练语料的"原矿"数据公开可下载,但页面内容版权归原网站,需尊重 robots.txt 与版权
The Pile约 825 GiB,22 个子集EleutherAI 人工挑选书籍/论文/代码/网页等混合首个"精心配比"的开源预训练语料,GPT-NeoX 等模型使用各子集许可不同,含受版权保护文本(如书籍),商用需逐项评估
RedPajama-Data-1T约 1.2 万亿 tokenTOGETHER 复刻 Llama 语料配比开源复刻 Llama 的 7 类数据配比(网页 67%/代码 4.5%/书籍 4.5% 等)宽松可商用,源码与数据均开放
RefinedWeb公开版约 6000 亿 tokenTII(Falcon 团队)清洗 Common Crawl强调"高质清洗 + 严格去重"的纯网络语料,Falcon 系列使用基于 Common Crawl,需遵循原网站版权
CulturaX约 6.3 万亿 token,167 种语言清洗 mC4 与 OSCAR 合并去重覆盖 167 种语言的多语言语料,非英语小语种覆盖好多语言数据版权情况复杂,商用前需评估目标语言语料

1. 从原始爬虫到训练语料:清洗流水线

原始 Common Crawl 噪声极高(广告、乱码、重复、低质页),不能直接训练。标准流水线四步:

  1. 采集与解析:下载 WARC 快照,抽取正文文本(去 HTML 标签、导航、广告),按 URL 语言判定语言。
  2. 质量过滤:按规则(长度、标点密度、符号比例)+ 启发式打分(语言模型困惑度、分类器)剔除低质页;同时做毒性/隐私过滤。
  3. 去重:MinHash 近似去重 + 精确去重,删除网页间重复片段(重复数据会浪费计算并导致模型"背题")。
  4. 配比与采样:按多语言/代码/数学/书籍目标比例混料,再按困惑度做上采样或下采样。

为什么都从 Common Crawl 出发

Common Crawl 免费、体量巨大、持续更新,是"数据的原材料";但各家语料的差异主要在于清洗流水线——去重算法、质量打分器、语言配比各不相同。所谓"数据即模型",主要就是在比拼这些处理细节。新语料(如 CulturaX、RefinedWeb)大多是"更好的清洗",而非"更新的来源"。

二、后训练与指令数据

后训练数据规模远小于预训练语料(百万级 vs 万亿级),但质量与多样性决定模型的"听话程度"。注意:大量指令数据由闭源商业模型生成,存在许可与版权争议(见文末提示框)。

数据集规模来源一句话说明许可注意
Alpaca约 5.2 万条指令-回答Stanford,用 text-davinci-003 生成self-instruct 方法扩写指令的经典开源 SFT 数据集由 OpenAI 模型生成,官方仅限学术研究使用
ShareGPT约 9 万轮对话社区共享的 ChatGPT 对话记录真实用户对话,Vicuna 等对话模型的训练来源由 ChatGPT 生成、用户分享,许可模糊,商用需谨慎
UltraChat约 150 万轮对话清华,用 ChatGPT 按 30 个主题生成大规模多轮对话,覆盖指令、问询、闲聊等多种场景由商业模型生成,研究用途为主
OpenAssistant (oasst1)约 1.6 万棵对话树LAION,众包人工撰写高质量纯人写多轮对话,无需担心"AI 生成"争议开源(Apache 2.0),可商用
Dolly约 1.5 万条Databricks 员工手写人写的指令-回答对,小但干净,适合测试开源可商用

1. 指令数据的三种生产方式

方式代表优点缺点
人工编写oasst1、Dolly质量高、版权干净、可商用成本高、规模有限
模型生成Alpaca、UltraChat、ShareGPT便宜、可大规模扩量存在版权争议,且"教师模型"的缺陷会传给学生
人机混合大部分商业 SFT 数据质量与规模的折中流程复杂、成本仍不低

2. 数据规模参考值

阶段常见规模说明
预训练1B 级模型约 20~30B token;7B 级约 2~4 万亿 tokenChinchilla 建议"参数与数据约 1:20",前沿模型普遍 10T+ token
SFT1 千~10 万条高质量指令1000 条高质量数据也能明显见效(LIMA 实验),关键是质量与多样性
偏好对齐(RLHF/DPO)数万~数十万条偏好对需覆盖帮助性/诚实性/安全性的典型失败模式

质量优先是铁律

对后训练数据,"1000 条高质量"的收益常常超过"10 万条凑数"。规模参考只是起点,最终以你任务上的实测为准。详见微调对齐

AI 生成数据的合规红线

Alpaca、ShareGPT、UltraChat 等由 OpenAI/Anthropic 商业模型生成——OpenAI 服务条款明确禁止"用输出训练竞争模型",且生成内容的版权归属存在法律争议。建议仅用于研究与内部实验;商用产品优先用人工数据或经授权的数据。详见微调:SFT 与参数高效微调对数据质量与数量的讨论。

三、评测基准

评测基准是"模型考试卷",按考察能力分类如下。注意三件事:榜单分数只在"同一套提示与实现"下可比;MMLU 等老基准可能存在数据污染;单点刷分 ≠ 真实能力(详见评测与基准评估实战)。

1. 综合知识与语言理解

基准规模一句话说明
GLUE9 个任务、约 25 万样本2018 年文本理解基准,BERT 时代的事实标准,现已基本饱和
SuperGLUE8 个更难的推理任务GLUE 的升级版,2019 年发布,同样已被 LLM 刷爆
MMLU57 个学科、约 1.6 万道多选题最经典的综合知识基准,长期是排行榜头号指标
HELM42 场景 × 7 指标Stanford 的多指标综合评测框架,强调"透明度"与对比公平性

2. 数学与推理

基准规模一句话说明
GSM8K约 8 千道数学应用题小学/初中应用题,测多步算术推理,配 CoT 使用
MATH约 1.25 万道竞赛题高中到竞赛级数学,5 个难度等级,区分度很高
BBHBIG-Bench 中 23 个难任务测试逻辑、演绎、多步推理等"聪明题",小模型基本无解
ARC约 7.8 千道科学题AI2 的科学问答(ARC-Challenge 更难),测常识与科学知识

3. 代码

基准规模一句话说明
HumanEval164 道 Python 函数题代码生成的事实标尺,用 pass@k 评估
MBPP974 道入门级 Python 题更基础的编程任务,常与 HumanEval 联合报告

4. 长文本与对话

基准规模一句话说明
LongBench21 个任务、约 4750 问中英双语长上下文评测,平均输入上万 token,测"真能读到多长"
MT-Bench80 道多轮开放问题对话质量基准,用 LLM-as-a-judge(GPT-4)打分,Chatbot Arena 重要参考
TruthfulQA817 个问题专测"幻觉"与事实性:模型是否编造看似合理但错误的答案

5. 指令遵循与更多

基准规模一句话说明
IFEval约 500 条指令专测"是否真的按指令执行"(格式/约束遵循),区分度好
BIG-Bench204 个任务规模最大的异构基准,LLM 时代实际常用其难子集 BBH
SQuAD约 10 万问2016 年抽取式阅读理解基准,BERT 时代经典任务

6. 评测基准的四大陷阱

  1. 数据污染:MMLU 等基准的题目长期公开,可能已混入训练数据,分数虚高。防御:去重、监控、自建私有集。
  2. 饱和与刷分:GLUE/SuperGLUE 已被刷爆,MMLU 也接近饱和——区分度下降后,榜单第一名与第十名可能是同一个档位
  3. 口径不统一:CoT 提示开不开、few-shot 用几 shot、温度设多少,都显著影响分数;跨模型比较必须同一口径。
  4. 榜单 ≠ 业务:基准测的是"考试能力",真实业务要看你自己的任务分布,务必自建评估集。

评测基准怎么选

  • 通用能力对比:MMLU + GSM8K + HumanEval 三件套(成本低、可复现);
  • 数学推理:GSM8K + MATH + BBH;
  • 代码:HumanEval + MBPP;
  • 长上下文:LongBench(+ 自建"大海捞针"任务);
  • 对话与"真实感":MT-Bench / Chatbot Arena;
  • 中文:见下节 C-Eval / CMMLU。 落地搭建见评估实战

四、中文与多语言数据

中文任务评估与数据是中文开发者的刚需,这里单列一张表:

数据集规模用途一句话说明
C-Eval约 1.4 万道题中文综合知识52 个学科、覆盖初中到研究生,中文版 MMLU
CMMLU约 1.15 万道题中文综合知识67 个学科、含人文社科细分,与 C-Eval 互补
CLUE9 类任务中文语言理解中文版 GLUE,BERT 时代的中文标准
SuperCLUE多任务套件中文对话能力中文对话基准,分基础/进阶/高阶难度
BELLE约 100 万条中文指令中文 SFT百度开源的 self-instruct 中文指令数据
COIG约 19 万条中文指令中文 SFT智源(BAAI)发布的多来源中文指令语料

多语言通用建议

中文大模型测评至少同时跑 C-Eval + CMMLU(知识)+ 中文代码/对话子集,并检查模型词表对中文的分词效率——部分西文优先模型在中文上 token 消耗更高(见分词与词表)。

五、许可与使用注意

版权与生成数据的合规红线

预训练语料:Common Crawl 及衍生语料包含大量受版权保护内容,多国已出现针对训练数据的诉讼;商用产品务必评估数据来源与地区法律。 AI 生成的指令数据:Alpaca、ShareGPT、UltraChat 等由 OpenAI/Anthropic 商业模型生成——OpenAI 服务条款禁止"用输出训练竞争模型",且生成内容的版权归属存在争议,建议仅用于研究与内部实验。 评测基准:多数基准为研究许可(学术用途),大规模商用评估前请核对各数据集 LICENSE。

合规自查四问

① 数据来源是否明确授权?② 模型生成的数据是否被服务条款禁止用于训练?③ 目标地区的法律风险(如欧盟 AI 法案、各国版权判例)?④ 商用产品是否已做数据链路审计?四问全部通过再上线。

六、数据处理工具链

工具用途链接
Hugging Face Datasets 库数据集加载、流式处理、切分与导出的标准接口https://huggingface.co/docs/datasets
datatrove大规模数据清洗流水线(FineWeb 的清洗工具),去重/过滤/打分全流程https://github.com/huggingface/datatrove
lm-evaluation-harness跑 MMLU/GSM8K/HumanEval 等评测基准的标准框架https://github.com/EleutherAI/lm-evaluation-harness
OpenCompass中文与多模态评测套件,含榜单服务https://github.com/open-compass/opencompass

七、从零搭建数据管线的五个步骤

给"想用自己的数据做预训练/微调"的读者一个最小可行流程:

  1. 定目标与预算:先定模型规模与训练 token 预算(见上文"数据规模参考值"),反推需要多少原始数据——清洗去重通常会丢掉 50%~90%。
  2. 选数据源:预训练用开源语料(RedPajama/RefinedWeb)或自建爬虫;指令数据优先人工或混合,避免未经授权的 AI 生成数据(见「五、许可」)。
  3. 清洗与去重:用 datatrove 跑质量过滤、MinHash 去重、毒性过滤;对多语言语料按语言分流。
  4. 配比与采样:按任务目标决定多语言/代码/数学/书籍比例;用困惑度上采样提升"有用"语料权重。
  5. 质量验证:先用 1 亿 token 级别的样本小规模试训,观察损失曲线与下游基准(C-Eval/MMLU)随数据清洗步骤的变化——数据管线的每一步都应被实验验证,而不是凭感觉

延伸阅读

参考资料