跳到正文

技术方向

开源生态 最新动态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

86 条精选近 30 天 25 条共收录 276 条

更新

精选归档 · 第 3 页

6月3日周二第 41–60 条
3月20日周四
3月18日周二
3月12日周三
3月11日周二
  1. Hugging Face Blog62

    L2D 发布:全球最大开源自动驾驶多模态数据集

    Yaak 与 Hugging Face 联合发布 L2D,这是全球规模最大的开源自动驾驶多模态数据集,包含超过 90TB、5000 小时的德国 30 城驾驶数据,涵盖 6 路环视相机、完整车辆状态、环境条件及自然语言指令。数据将分阶段更新至 R4,并支持接入 LeRobot 流水线进行端到端模型训练,2025 年夏季还将开放带安全员的闭环实测。

    推荐理由:L2D 是当前最大的开源自动驾驶多模态数据集,包含 90TB 以上数据,可直接接入 LeRobot 训练端到端模型。

3月4日周二
  1. Hugging Face Blog69

    Cohere 发布 Aya Vision 8B 与 32B 多语言视觉模型

    Cohere 开放 Aya Vision 8B 和 32B 权重,支持 23 种语言的图像理解、视觉问答与图文翻译。模型基于 SigLIP2-patch14-384 视觉编码器和 Aya Expanse 语言底座,通过 4 倍 Pixel Shuffle 下采样降低多模态输入开销。

    推荐理由:模型在开放权重下支持 23 种语言视觉任务,并配合评测基准发布,可直接复用于多语言视觉落地。

2月21日周五
  1. Hugging Face Blog75

    Google 发布 SigLIP 2 多语言视觉语言编码器

    Google 发布 SigLIP 2 多语言视觉语言编码器,作者团队在 SigLIP 的 sigmoid loss 之上叠加解码器、全局-局部自蒸馏和掩码预测等辅助目标,以提升语义理解、定位和密集特征能力。

    推荐理由:作者拆解了 SigLIP 2 相对 SigLIP 新增的多项训练目标与动态分辨率变体,并给出可直接运行的推理与对比方法。

2月19日周三
  1. Hugging Face Blog66

    Google 发布 PaliGemma 2 Mix 多任务指令视觉语言模型

    Google 发布 PaliGemma 2 mix,这是一组在多种视觉语言任务上微调的指令型视觉语言模型,覆盖 3B、10B 和 28B 规模。文章展示了其处理开放式任务提示和检测定位任务的方式,并提供了通过 Transformers 进行推理的代码和在线演示。

    推荐理由:文章解释了 mix 变体如何作为预训练模型的下游能力参考,并给出可运行的推理示例。

7月24日周三
  1. Mistral AI75

    Mistral Large 2 发布:123B 参数、128k 上下文,性能对齐 GPT-4o 和 Claude 3 Opus

    Mistral 发布新模型 Mistral Large 2,123B 参数、128k 上下文窗口,MMLU 预训练版本达到 84.0%。Mistral 称其在代码和推理上表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并优化了指令跟随、减少模型幻觉。

    推荐理由:官方给出了 MMLU 84.0%、123B 参数、128k 上下文窗口和 la Plateforme 上的部署入口,可判断它与 GPT-4o、Claude 3 Opus 等模型在性价比上的位置。

7月18日周四
  1. Mistral AI63

    Mistral 发布 12B 参数多语言模型 Mistral NeMo,支持 128k 上下文窗口

    Mistral AI 正式发布 Mistral NeMo 12B,该模型由 NVIDIA 协助构建,提供最高 128k tokens 的上下文窗口。模型采用 Apache 2.0 协议开源,在推理、世界知识和编程能力上达到同规模 SOTA 水平。

    推荐理由:Mistral NeMo 12B 引入 128k 上下文和新 tokenizer Tekken,性能超越同类开源模型且支持 FP8 推理,适合多语言业务部署。

4月29日周一
  1. Hugging Face Blog66

    StarCoder2-15B-Instruct 发布:开源完全透明的自对齐代码模型

    Hugging Face 和 BigCode 团队发布 StarCoder2-15B-Instruct-v0.1,这是一个完全基于自生成数据(self-aligned)训练的代码语言模型,其 HumanEval 得分达 72.6。该模型训练过程完全透明,不依赖 GPT-4 等专有模型的蒸馏数据,并已在 LiveCodeBench 上展现出优于使用 GPT-4 蒸馏数据微调模型的代码生成能力。

    推荐理由:该模型完全通过自生成数据实现指令微调,证明不依赖外部教师模型也能获得强代码能力,并开源了全流程。

4月18日周四
4月15日周一
4月9日周二
  1. Hugging Face Blog86

    CodeGemma 发布:面向代码的 LLM

    Google 发布了 CodeGemma 模型,包含 2B、7B 和 7B Instruct 三种版本,专为代码生成、补全和推理设计。CodeGemma 7B 在 Python、JavaScript 和 C++ 的 HumanEval 评测中表现优于其他 7B 模型,但在中文代码方面尚未测试。

    推荐理由:三个模型直接开源可下载,附 transformers 代码和量化部署方案,方便读者在本地复现。

4月2日周二
  1. Hugging Face Blog65

    Hugging Face 上线 Cloudflare Workers AI 无服务器 GPU 推理功能

    Hugging Face 推出与 Cloudflare Workers AI 的新集成,开发者可通过按请求付费的方式,在全球边缘 GPU 上运行热门开源模型。该功能支持 Meta Llama 2 7B、Mistral 7B 等模型,用户可在模型页面直接选择部署并通过 REST API 或 Cloudflare AI SDK 发起请求。

    推荐理由:将热门开源模型集成至 Cloudflare 无服务器推理平台,开发者可按请求付费运行。

3月20日周三
  1. Hugging Face Blog76

    Cosmopedia:如何为预训练大语言模型创建大规模合成数据

    Hugging Face 发布了名为 Cosmopedia 的 250 亿 token 合成数据集及配套的 1B 规模模型 cosmo-1b,旨在通过完全开源的端到端流程复现 Microsoft Phi-1.5 的数据集。

    推荐理由:原文公开了 250 亿 token 数据集的完整生成链路和 1B 模型评测,读者可据此复现或改进合成数据预训练方法。

2月28日周三
2月21日周三
  1. Hugging Face Blog94

    Google 发布 Gemma 开源大语言模型

    Google 发布名为 Gemma 的 4 个开源 LLM 模型,其中 7B 参数版本采用 6T token 预训练,8K context 下得分 63.75。Hugging Face 提供 transformers 4.38 集成支持,并说明使用 QLoRA 在单张 A10G GPU 上微调 gemma-7b 需约 9 小时。

    推荐理由:Hugging Face 给出了 Gemma 与同级模型的基准对比,以及消费级 GPU 微调实践入口。

2月8日周四
1月10日周三
  1. Hugging Face Blog70

    使用 Unsloth 和 Hugging Face TRL 实现 2 倍速 LLM 微调

    Hugging Face 团队介绍了由社区开发的轻量级工具 Unsloth,可将 LLM 微调速度提升至 2 倍并降低 40% 内存占用。该工具通过重写 PyTorch 模块为 Triton 内核优化运算,兼容 Llama 和 Mistral 架构,且支持 TRL 训练器套件。

    推荐理由:提供可复现的加速微调方案,实测数据清晰展示了显存与速度优化幅度。