Hugging Face Xet 存储正式接入 Hub
Hugging Face 官方宣布 Xet 存储架构正式在 Hub 上线,并于 2 月 20 日完成首批约 6% 下载流量、总计 4.5TB 模型与数据集仓库的迁移。
推荐理由:Xet 存储正式接入 Hugging Face Hub 并完成首批 4.5TB 仓库迁移,其内容寻址分块机制让多 GB 级模型更新上传耗时从小时级降至秒级。
Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。
Hugging Face 官方宣布 Xet 存储架构正式在 Hub 上线,并于 2 月 20 日完成首批约 6% 下载流量、总计 4.5TB 模型与数据集仓库的迁移。
推荐理由:Xet 存储正式接入 Hugging Face Hub 并完成首批 4.5TB 仓库迁移,其内容寻址分块机制让多 GB 级模型更新上传耗时从小时级降至秒级。
Google 发布 Gemma 3 开源权重 LLM,包括 1B、4B、12B、27B 参数版本,上下文窗口从 Gemma 2 的 8k 提升至最高 128k tokens。
推荐理由:Gemma 3 支持 128k 上下文和 140 余种语言,并能在 Hugging Face 生态当日通过 pipeline 或 llama.cpp 完成推理部署。
Hugging Face 发布 Open R1 Update #3,公布从 DeepSeek-R1 蒸馏得到近 10 万条高质量 C++ 与 Python 代码推理样本的 CodeForces-CoTs 数据集,并发布基于 IOI 的新基准。
推荐理由:给出了代码推理复现的细节与 7B、32B 模型结果,可参考训练策略与评测方法。
Yaak 与 Hugging Face 联合发布 L2D,这是全球规模最大的开源自动驾驶多模态数据集,包含超过 90TB、5000 小时的德国 30 城驾驶数据,涵盖 6 路环视相机、完整车辆状态、环境条件及自然语言指令。数据将分阶段更新至 R4,并支持接入 LeRobot 流水线进行端到端模型训练,2025 年夏季还将开放带安全员的闭环实测。
推荐理由:L2D 是当前最大的开源自动驾驶多模态数据集,包含 90TB 以上数据,可直接接入 LeRobot 训练端到端模型。
Cohere 开放 Aya Vision 8B 和 32B 权重,支持 23 种语言的图像理解、视觉问答与图文翻译。模型基于 SigLIP2-patch14-384 视觉编码器和 Aya Expanse 语言底座,通过 4 倍 Pixel Shuffle 下采样降低多模态输入开销。
推荐理由:模型在开放权重下支持 23 种语言视觉任务,并配合评测基准发布,可直接复用于多语言视觉落地。
Hugging Face 发布专为 Python 设计实时通信库 FastRTC,简化实时音视频 AI 应用开发。该库内置语音检测、轮替控制和 WebRTC Gradio 界面,支持通过 FastAPI 自定义部署,并提供免费电话接入功能,开发者可结合 Moonshine、Kokoro 等模型快速构建实时语音应用。
推荐理由:为 Python 开发者提供开箱即用的实时音视频通信库,降低 WebRTC 工程门槛,并内置 Gradio 界面和电话接入功能。
Google 发布 SigLIP 2 多语言视觉语言编码器,作者团队在 SigLIP 的 sigmoid loss 之上叠加解码器、全局-局部自蒸馏和掩码预测等辅助目标,以提升语义理解、定位和密集特征能力。
推荐理由:作者拆解了 SigLIP 2 相对 SigLIP 新增的多项训练目标与动态分辨率变体,并给出可直接运行的推理与对比方法。
Hugging Face 发布 SmolVLM2 多模态模型家族,包含 2.2B、500M 和 256M 三个尺寸,用于视频理解任务。2.2B 模型在 Video-MME 基准上超过现有 2B 级别模型;500M 版本支持在 iPhone 本地运行;所有模型均可通过 Transformers 和 MLX 框架进行推理和微调。
推荐理由:SmolVLM2 提供 2.2B、500M 和 256M 三种尺寸视频模型并支持端侧运行,读者可按设备内存直接评估部署门槛。
Google 发布 PaliGemma 2 mix,这是一组在多种视觉语言任务上微调的指令型视觉语言模型,覆盖 3B、10B 和 28B 规模。文章展示了其处理开放式任务提示和检测定位任务的方式,并提供了通过 Transformers 进行推理的代码和在线演示。
推荐理由:文章解释了 mix 变体如何作为预训练模型的下游能力参考,并给出可运行的推理示例。
PaliGemma 2 是由 Google 推出的新一版视觉语言模型,文章作为官方发布介绍。
Hugging Face 发布了名为 Cosmopedia 的 250 亿 token 合成数据集及配套的 1B 规模模型 cosmo-1b,旨在通过完全开源的端到端流程复现 Microsoft Phi-1.5 的数据集。
推荐理由:原文公开了 250 亿 token 数据集的完整生成链路和 1B 模型评测,读者可据此复现或改进合成数据预训练方法。
Hugging Face 在 tokenizer 中新增 chat_template 属性,用于存储模型训练时使用的 Jinja 聊天格式模板。由于不同聊天模型采用各异的消息格式化方式,使用错误格式会导致严重的性能下降且难以调试,该功能将格式逻辑从代码库移至模型仓库,允许用户通过 tokenizer.apply_chat_template() 自动匹配正确格式。
推荐理由:文章解释了 Chat template 如何解决格式错配导致的性能衰减问题,并给出了在 Hugging Face 生态中配置该属性以统一推理流程的具体方法。
TRL 库新集成了 DDPOTrainer 类,用于将 Denoising Diffusion Policy Optimization (DDPO) 应用于 Stable Diffusion 模型,使其输出更符合人类审美等偏好。
推荐理由:通过 TRL 新集成的 DDPOTrainer,读者可以直接在本地用 RL 微调 Stable Diffusion,降低扩散模型对齐人类偏好的门槛。
教程演示了如何使用 Hugging Face Spaces、AutoTrain 和 ChatUI 在不写代码的情况下,基于 LLaMA 2 7B 微调一个开源 LLM 并部署为可共享的聊天应用。
推荐理由:教程面向零基础读者,演示了如何用 AutoTrain 和 Spaces 微调 LLaMA 2 并部署成聊天应用,适合想了解开源模型部署流程的读者。