Hugging Face 发布用于微调视频生成模型的开源数据集工具
Hugging Face 团队发布了适用于小规模场景的开源视频数据集脚本及三阶段处理流水线,旨在降低构建视频生成模型微调数据集的门槛。该工具链集成 Florence-2 与 Qwen2.5 模型,通过运动、美学及水印等多维度过滤与自动字幕生成,显著提升了数据质量与可控性。
Hugging Face 团队发布了适用于小规模场景的开源视频数据集脚本及三阶段处理流水线,旨在降低构建视频生成模型微调数据集的门槛。该工具链集成 Florence-2 与 Qwen2.5 模型,通过运动、美学及水印等多维度过滤与自动字幕生成,显著提升了数据质量与可控性。
Hugging Face 推出合成数据生成器,允许用户通过自然语言描述无代码创建自定义数据集。该工具支持文本分类和聊天数据集生成,底层由 distilabel 和免费的 Hugging Face text-generation API 驱动,并可与 Argilla 集成进行数据审查。
GaLore 利用梯度低秩结构实现显存高效的大语言模型全参数训练,将优化器状态显存降低 82.5% 以上。该方法支持结合 8-bit 优化器,使 7B 参数模型能在 NVIDIA RTX 4090 等消费级 GPU 上完成训练。
Hugging Face 发布了名为 Cosmopedia 的 250 亿 token 合成数据集及配套的 1B 规模模型 cosmo-1b,旨在通过完全开源的端到端流程复现 Microsoft Phi-1.5 的数据集。
推荐理由:原文公开了 250 亿 token 数据集的完整生成链路和 1B 模型评测,读者可据此复现或改进合成数据预训练方法。
Argilla 与 Hugging Face 启动“Data is Better Together”实验,通过社区协作构建偏好数据集。该实验在数天内吸引 350 名贡献者完成超过 11,000 条提示词评级,并发布包含 10,000 条提示词的 10k_prompts_ranked 数据集。双方正招募首批社区 cohort,提供 Argilla Space 支持及免费持久化存储资源。
Hugging Face Transformers 3.1 与 Ray Tune 集成,简化大语言模型超参数调优。实验显示,Population-based Training 在 BERT 上取得 78% 最佳验证准确率,优于网格搜索。用户仅需几行代码即可调用 Ray Tune 算法进行微调。