跳到正文

#数据/训练

今日 0 条
2月12日周三
12月16日周一
3月20日周三
  1. Hugging Face Blog76

    Cosmopedia:如何为预训练大语言模型创建大规模合成数据

    Hugging Face 发布了名为 Cosmopedia 的 250 亿 token 合成数据集及配套的 1B 规模模型 cosmo-1b,旨在通过完全开源的端到端流程复现 Microsoft Phi-1.5 的数据集。

    推荐理由:原文公开了 250 亿 token 数据集的完整生成链路和 1B 模型评测,读者可据此复现或改进合成数据预训练方法。

3月4日周一
  1. Hugging Face Blog40

    Argilla 与 Hugging Face 联合发起集体构建偏好数据集实验

    Argilla 与 Hugging Face 启动“Data is Better Together”实验,通过社区协作构建偏好数据集。该实验在数天内吸引 350 名贡献者完成超过 11,000 条提示词评级,并发布包含 10,000 条提示词的 10k_prompts_ranked 数据集。双方正招募首批社区 cohort,提供 Argilla Space 支持及免费持久化存储资源。

11月2日周一