Hugging Face Blog·· 2024-03-20精选AI 评分76
Cosmopedia:如何为预训练大语言模型创建大规模合成数据
Cosmopedia: how to create large-scale synthetic data for pre-training Large Language Models
AI 导读
Hugging Face 发布了名为 Cosmopedia 的 250 亿 token 合成数据集及配套的 1B 规模模型 cosmo-1b,旨在通过完全开源的端到端流程复现 Microsoft Phi-1.5 的数据集。
推荐理由
原文公开了 250 亿 token 数据集的完整生成链路和 1B 模型评测,读者可据此复现或改进合成数据预训练方法。
来源:Hugging Face Blog · huggingface.co