跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

29条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 21–29 条 · 共 29 条
7月18日周四
  1. Mistral AI63

    Mistral 发布 12B 参数多语言模型 Mistral NeMo,支持 128k 上下文窗口

    Mistral AI 正式发布 Mistral NeMo 12B,该模型由 NVIDIA 协助构建,提供最高 128k tokens 的上下文窗口。模型采用 Apache 2.0 协议开源,在推理、世界知识和编程能力上达到同规模 SOTA 水平。

    推荐理由:Mistral NeMo 12B 引入 128k 上下文和新 tokenizer Tekken,性能超越同类开源模型且支持 FP8 推理,适合多语言业务部署。

3月20日周三
  1. Hugging Face Blog76

    Cosmopedia:如何为预训练大语言模型创建大规模合成数据

    Hugging Face 发布了名为 Cosmopedia 的 250 亿 token 合成数据集及配套的 1B 规模模型 cosmo-1b,旨在通过完全开源的端到端流程复现 Microsoft Phi-1.5 的数据集。

    推荐理由:原文公开了 250 亿 token 数据集的完整生成链路和 1B 模型评测,读者可据此复现或改进合成数据预训练方法。

12月11日周一
  1. Mistral AI62

    Mistral AI 开放 la plateforme 平台服务 beta 权限

    Mistral AI 开放了首个平台服务的 beta 权限,提供三个文本生成端点和一个嵌入端点。Mistral-tiny 端点基于 Mistral 7B Instruct v0.2,Mistral-small 基于 Mixtral 8x7B,Mistral-medium 基于原型模型,三者分别在 MT-Bench 上取得 7.6、8.3 和 8.6 分。

    推荐理由:Mistral AI 开放了首个平台服务 beta 权限,并给出了三个推理端点与嵌入端点的基准表现,方便开发者对比选择。

10月3日周二
  1. Hugging Face Blog87

    Hugging Face Tokenizer 新增 chat_template 属性以解决聊天模型格式不匹配问题

    Hugging Face 在 tokenizer 中新增 chat_template 属性,用于存储模型训练时使用的 Jinja 聊天格式模板。由于不同聊天模型采用各异的消息格式化方式,使用错误格式会导致严重的性能下降且难以调试,该功能将格式逻辑从代码库移至模型仓库,允许用户通过 tokenizer.apply_chat_template() 自动匹配正确格式。

    推荐理由:文章解释了 Chat template 如何解决格式错配导致的性能衰减问题,并给出了在 Hugging Face 生态中配置该属性以统一推理流程的具体方法。

9月29日周五
9月21日周三
4月30日周四
8月20日周二
  1. OpenAI News65

    OpenAI 发布 GPT-2 774M 参数模型及开源协议

    OpenAI 发布 7.74 亿参数的 GPT-2 语言模型,这是继今年 2 月发布 1.24 亿参数小模型、5 月发布 3.55 亿参数中等模型后的后续行动。官方同步推出开源法律协议以便机构建立模型共享伙伴关系,并发表技术报告说明与 AI 研究界协调发布规范的经验。

    推荐理由:官方说明分阶段发布774M参数模型及开源协议,展示了协调AI社区处理潜在滥用的具体实践。

5月15日周一