跳到正文

全部动态

今日 45 条
7月24日周三
  1. Mistral AI75

    Mistral Large 2 发布:123B 参数、128k 上下文,性能对齐 GPT-4o 和 Claude 3 Opus

    Mistral 发布新模型 Mistral Large 2,123B 参数、128k 上下文窗口,MMLU 预训练版本达到 84.0%。Mistral 称其在代码和推理上表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并优化了指令跟随、减少模型幻觉。

    推荐理由:官方给出了 MMLU 84.0%、123B 参数、128k 上下文窗口和 la Plateforme 上的部署入口,可判断它与 GPT-4o、Claude 3 Opus 等模型在性价比上的位置。

7月18日周四
  1. Mistral AI63

    Mistral 发布 12B 参数多语言模型 Mistral NeMo,支持 128k 上下文窗口

    Mistral AI 正式发布 Mistral NeMo 12B,该模型由 NVIDIA 协助构建,提供最高 128k tokens 的上下文窗口。模型采用 Apache 2.0 协议开源,在推理、世界知识和编程能力上达到同规模 SOTA 水平。

    推荐理由:Mistral NeMo 12B 引入 128k 上下文和新 tokenizer Tekken,性能超越同类开源模型且支持 FP8 推理,适合多语言业务部署。

7月16日周二
  1. Mistral AI44

    Mistral 开源数学推理模型 Mathstral

    Mistral AI 在 Project Numina 项目中发布数学推理模型 Mathstral,基于 Mistral 7B 构建。该模型在 MATH 基准测试中得分为 56.6%,MMLU 得分为 63.47%。Mathstral 已在 HuggingFace 开放权重,支持通过 mistral-inference 使用。

3月25日周一
  1. Hugging Face Blog48

    Pollen Robotics 发布开源 Pollen-Vision 库,为机器人提供零样本 3D 物体检测接口

    Pollen Robotics 团队发布开源 pollen-vision 库,该工具包整合了 OWL-VIT、Mobile SAM 和 RAM 等零样本视觉模型,旨在让机器人无需训练即可抓取未知物体。当前版本聚焦于 3D 物体检测,能通过相机内参计算物体在 3D 空间中的 (x, y, z) 坐标,但尚未支持 6D 姿态估计。

3月20日周三
  1. Hugging Face Blog76

    Cosmopedia:如何为预训练大语言模型创建大规模合成数据

    Hugging Face 发布了名为 Cosmopedia 的 250 亿 token 合成数据集及配套的 1B 规模模型 cosmo-1b,旨在通过完全开源的端到端流程复现 Microsoft Phi-1.5 的数据集。

    推荐理由:原文公开了 250 亿 token 数据集的完整生成链路和 1B 模型评测,读者可据此复现或改进合成数据预训练方法。

3月18日周一
3月4日周一
  1. Hugging Face Blog40

    Argilla 与 Hugging Face 联合发起集体构建偏好数据集实验

    Argilla 与 Hugging Face 启动“Data is Better Together”实验,通过社区协作构建偏好数据集。该实验在数天内吸引 350 名贡献者完成超过 11,000 条提示词评级,并发布包含 10,000 条提示词的 10k_prompts_ranked 数据集。双方正招募首批社区 cohort,提供 Argilla Space 支持及免费持久化存储资源。

10月24日周二
10月19日周四
10月3日周二
  1. Hugging Face Blog87

    Hugging Face Tokenizer 新增 chat_template 属性以解决聊天模型格式不匹配问题

    Hugging Face 在 tokenizer 中新增 chat_template 属性,用于存储模型训练时使用的 Jinja 聊天格式模板。由于不同聊天模型采用各异的消息格式化方式,使用错误格式会导致严重的性能下降且难以调试,该功能将格式逻辑从代码库移至模型仓库,允许用户通过 tokenizer.apply_chat_template() 自动匹配正确格式。

    推荐理由:文章解释了 Chat template 如何解决格式错配导致的性能衰减问题,并给出了在 Hugging Face 生态中配置该属性以统一推理流程的具体方法。

10月2日周一
9月29日周五
9月28日周四
  1. Hugging Face Blog70

    面向非工程人员的指南:训练一个 LLaMA 2 聊天机器人

    教程演示了如何使用 Hugging Face Spaces、AutoTrain 和 ChatUI 在不写代码的情况下,基于 LLaMA 2 7B 微调一个开源 LLM 并部署为可共享的聊天应用。

    推荐理由:教程面向零基础读者,演示了如何用 AutoTrain 和 Spaces 微调 LLaMA 2 并部署成聊天应用,适合想了解开源模型部署流程的读者。

7月17日周一
7月14日周五
7月5日周三
3月23日周三
3月22日周二
  1. Hugging Face Blog27

    Hugging Face 宣布启动 AI 研究驻留项目

    Hugging Face 推出为期 9 个月的 AI 研究驻留项目,参与者将与科学团队合作探索机器学习前沿技术并公开发表研究成果。该项目旨在推动 AI 领域的多样性与包容性,特别鼓励来自边缘化群体或致力于社会正向影响的研究者申请。申请需展示编程能力与数学基础,截止日期为 4 月 3 日,且仅接受全职参与。

3月16日周三
3月2日周三
  1. Hugging Face Blog23

    BERT 101:解读 NLP 领域尖端模型

    BERT 是由 Google AI Language 于 2018 年开发的自然语言处理模型,利用 Transformer 架构实现了双向文本理解。该模型通过 3.3 亿词的数据集训练,解决了情感分析等 11 类常见 NLP 任务。其衍生版本 DistilBERT 速度提升 60%,同时保持了 95% 以上的性能。

2月11日周五
2月2日周三
1月25日周二
6月3日周四
  1. Hugging Face Blog38

    GPT-Neo 与 Hugging Face 加速推理 API 中的少样本学习实践

    EleutherAI GPT-Neo 结合 Hugging Face 加速推理 API 支持少样本学习,API 提供高达 100 倍推理加速。GPT-Neo (2.7B) 需 3-4 个示例即可实现良好泛化,相比 GPT-3 (175B) 在零样本任务上表现较弱。通过调节温度、最大新 token 数及结束序列等超参数,可控制生成结果,但需注意情感分析等场景可能出现的错误预测风险。