跳到正文

Hugging Face

Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。

最新精选

第 21–34 条 · 共 34 条
3月18日周二
  1. Hugging Face Blog75

    Hugging Face Xet 存储正式接入 Hub

    Hugging Face 官方宣布 Xet 存储架构正式在 Hub 上线,并于 2 月 20 日完成首批约 6% 下载流量、总计 4.5TB 模型与数据集仓库的迁移。

    推荐理由:Xet 存储正式接入 Hugging Face Hub 并完成首批 4.5TB 仓库迁移,其内容寻址分块机制让多 GB 级模型更新上传耗时从小时级降至秒级。

3月12日周三
3月11日周二
  1. Hugging Face Blog62

    L2D 发布:全球最大开源自动驾驶多模态数据集

    Yaak 与 Hugging Face 联合发布 L2D,这是全球规模最大的开源自动驾驶多模态数据集,包含超过 90TB、5000 小时的德国 30 城驾驶数据,涵盖 6 路环视相机、完整车辆状态、环境条件及自然语言指令。数据将分阶段更新至 R4,并支持接入 LeRobot 流水线进行端到端模型训练,2025 年夏季还将开放带安全员的闭环实测。

    推荐理由:L2D 是当前最大的开源自动驾驶多模态数据集,包含 90TB 以上数据,可直接接入 LeRobot 训练端到端模型。

3月4日周二
  1. Hugging Face Blog69

    Cohere 发布 Aya Vision 8B 与 32B 多语言视觉模型

    Cohere 开放 Aya Vision 8B 和 32B 权重,支持 23 种语言的图像理解、视觉问答与图文翻译。模型基于 SigLIP2-patch14-384 视觉编码器和 Aya Expanse 语言底座,通过 4 倍 Pixel Shuffle 下采样降低多模态输入开销。

    推荐理由:模型在开放权重下支持 23 种语言视觉任务,并配合评测基准发布,可直接复用于多语言视觉落地。

2月25日周二
  1. Hugging Face Blog61

    Hugging Face 发布 Python 实时通信库 FastRTC

    Hugging Face 发布专为 Python 设计实时通信库 FastRTC,简化实时音视频 AI 应用开发。该库内置语音检测、轮替控制和 WebRTC Gradio 界面,支持通过 FastAPI 自定义部署,并提供免费电话接入功能,开发者可结合 Moonshine、Kokoro 等模型快速构建实时语音应用。

    推荐理由:为 Python 开发者提供开箱即用的实时音视频通信库,降低 WebRTC 工程门槛,并内置 Gradio 界面和电话接入功能。

2月21日周五
  1. Hugging Face Blog75

    Google 发布 SigLIP 2 多语言视觉语言编码器

    Google 发布 SigLIP 2 多语言视觉语言编码器,作者团队在 SigLIP 的 sigmoid loss 之上叠加解码器、全局-局部自蒸馏和掩码预测等辅助目标,以提升语义理解、定位和密集特征能力。

    推荐理由:作者拆解了 SigLIP 2 相对 SigLIP 新增的多项训练目标与动态分辨率变体,并给出可直接运行的推理与对比方法。

2月20日周四
  1. Hugging Face Blog60

    Hugging Face 发布 SmolVLM2 系列视频理解模型

    Hugging Face 发布 SmolVLM2 多模态模型家族,包含 2.2B、500M 和 256M 三个尺寸,用于视频理解任务。2.2B 模型在 Video-MME 基准上超过现有 2B 级别模型;500M 版本支持在 iPhone 本地运行;所有模型均可通过 Transformers 和 MLX 框架进行推理和微调。

    推荐理由:SmolVLM2 提供 2.2B、500M 和 256M 三种尺寸视频模型并支持端侧运行,读者可按设备内存直接评估部署门槛。

2月19日周三
  1. Hugging Face Blog66

    Google 发布 PaliGemma 2 Mix 多任务指令视觉语言模型

    Google 发布 PaliGemma 2 mix,这是一组在多种视觉语言任务上微调的指令型视觉语言模型,覆盖 3B、10B 和 28B 规模。文章展示了其处理开放式任务提示和检测定位任务的方式,并提供了通过 Transformers 进行推理的代码和在线演示。

    推荐理由:文章解释了 mix 变体如何作为预训练模型的下游能力参考,并给出可运行的推理示例。

12月5日周四
3月20日周三
  1. Hugging Face Blog76

    Cosmopedia:如何为预训练大语言模型创建大规模合成数据

    Hugging Face 发布了名为 Cosmopedia 的 250 亿 token 合成数据集及配套的 1B 规模模型 cosmo-1b,旨在通过完全开源的端到端流程复现 Microsoft Phi-1.5 的数据集。

    推荐理由:原文公开了 250 亿 token 数据集的完整生成链路和 1B 模型评测,读者可据此复现或改进合成数据预训练方法。

10月3日周二
  1. Hugging Face Blog87

    Hugging Face Tokenizer 新增 chat_template 属性以解决聊天模型格式不匹配问题

    Hugging Face 在 tokenizer 中新增 chat_template 属性,用于存储模型训练时使用的 Jinja 聊天格式模板。由于不同聊天模型采用各异的消息格式化方式,使用错误格式会导致严重的性能下降且难以调试,该功能将格式逻辑从代码库移至模型仓库,允许用户通过 tokenizer.apply_chat_template() 自动匹配正确格式。

    推荐理由:文章解释了 Chat template 如何解决格式错配导致的性能衰减问题,并给出了在 Hugging Face 生态中配置该属性以统一推理流程的具体方法。

9月29日周五
9月28日周四
  1. Hugging Face Blog70

    面向非工程人员的指南:训练一个 LLaMA 2 聊天机器人

    教程演示了如何使用 Hugging Face Spaces、AutoTrain 和 ChatUI 在不写代码的情况下,基于 LLaMA 2 7B 微调一个开源 LLM 并部署为可共享的聊天应用。

    推荐理由:教程面向零基础读者,演示了如何用 AutoTrain 和 Spaces 微调 LLaMA 2 并部署成聊天应用,适合想了解开源模型部署流程的读者。