Hugging Face Blog·· 2024-03-20精选AI 评分62
Cosmopedia:如何为 LLM 预训练构建大规模合成数据
Cosmopedia: how to create large-scale synthetic data for pre-training Large Language Models
AI 导读
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成预训练数据集,包含超过 3000 万个文件、250 亿 token,目标是复现 Phi-1.5 的训练数据。
推荐理由
Hugging Face 公开了从提示词构建到去污染、训练的完整合成数据流水线,可对照 Phi 系列的做法理解预训练数据如何规模化生成。
来源:Hugging Face Blog · huggingface.co