NVIDIA GTC 2025 发布开源物理 AI 模型 Isaac GR00T N1 与数据集
NVIDIA 在 GTC 2025 大会上发布了三项开源成果:Cosmos Transfer 世界基础模型、15TB 物理 AI 数据集以及通用类人推理模型 Isaac GR00T N1。
推荐理由:NVIDIA 在 GTC 2025 开源了 Cosmos Transfer 与 Isaac GR00T N1 模型及数据集,为开发者提供了训练具身智能体的完整工具链。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
NVIDIA 在 GTC 2025 大会上发布了三项开源成果:Cosmos Transfer 世界基础模型、15TB 物理 AI 数据集以及通用类人推理模型 Isaac GR00T N1。
推荐理由:NVIDIA 在 GTC 2025 开源了 Cosmos Transfer 与 Isaac GR00T N1 模型及数据集,为开发者提供了训练具身智能体的完整工具链。
Google 发布 Gemma 3 开源权重 LLM,包括 1B、4B、12B、27B 参数版本,上下文窗口从 Gemma 2 的 8k 提升至最高 128k tokens。
推荐理由:Gemma 3 支持 128k 上下文和 140 余种语言,并能在 Hugging Face 生态当日通过 pipeline 或 llama.cpp 完成推理部署。
Cohere 开放 Aya Vision 8B 和 32B 权重,支持 23 种语言的图像理解、视觉问答与图文翻译。模型基于 SigLIP2-patch14-384 视觉编码器和 Aya Expanse 语言底座,通过 4 倍 Pixel Shuffle 下采样降低多模态输入开销。
推荐理由:模型在开放权重下支持 23 种语言视觉任务,并配合评测基准发布,可直接复用于多语言视觉落地。
Google 发布 SigLIP 2 多语言视觉语言编码器,作者团队在 SigLIP 的 sigmoid loss 之上叠加解码器、全局-局部自蒸馏和掩码预测等辅助目标,以提升语义理解、定位和密集特征能力。
推荐理由:作者拆解了 SigLIP 2 相对 SigLIP 新增的多项训练目标与动态分辨率变体,并给出可直接运行的推理与对比方法。
Hugging Face 发布 SmolVLM2 多模态模型家族,包含 2.2B、500M 和 256M 三个尺寸,用于视频理解任务。2.2B 模型在 Video-MME 基准上超过现有 2B 级别模型;500M 版本支持在 iPhone 本地运行;所有模型均可通过 Transformers 和 MLX 框架进行推理和微调。
推荐理由:SmolVLM2 提供 2.2B、500M 和 256M 三种尺寸视频模型并支持端侧运行,读者可按设备内存直接评估部署门槛。
Google 发布 PaliGemma 2 mix,这是一组在多种视觉语言任务上微调的指令型视觉语言模型,覆盖 3B、10B 和 28B 规模。文章展示了其处理开放式任务提示和检测定位任务的方式,并提供了通过 Transformers 进行推理的代码和在线演示。
推荐理由:文章解释了 mix 变体如何作为预训练模型的下游能力参考,并给出可运行的推理示例。
OpenAI 正式发布 o1 模型,重点提升复杂推理能力。同时推出了 Realtime API 改进和新微调方法,旨在增强开发者的工具可用性。
推荐理由:OpenAI 官方宣布推出 o1 模型及实时 API 改进,同时引入新的微调方法,为开发者提供了处理复杂推理任务和更灵活定制的基础能力。
PaliGemma 2 是由 Google 推出的新一版视觉语言模型,文章作为官方发布介绍。
Mistral 发布新模型 Mistral Large 2,123B 参数、128k 上下文窗口,MMLU 预训练版本达到 84.0%。Mistral 称其在代码和推理上表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并优化了指令跟随、减少模型幻觉。
推荐理由:官方给出了 MMLU 84.0%、123B 参数、128k 上下文窗口和 la Plateforme 上的部署入口,可判断它与 GPT-4o、Claude 3 Opus 等模型在性价比上的位置。
Mistral AI 正式发布 Mistral NeMo 12B,该模型由 NVIDIA 协助构建,提供最高 128k tokens 的上下文窗口。模型采用 Apache 2.0 协议开源,在推理、世界知识和编程能力上达到同规模 SOTA 水平。
推荐理由:Mistral NeMo 12B 引入 128k 上下文和新 tokenizer Tekken,性能超越同类开源模型且支持 FP8 推理,适合多语言业务部署。
OpenAI 在 DevDay 发布 GPT-4 Turbo、128K 上下文版本、Assistants API、GPT-4 Turbo with Vision、DALL·E 3 API 及更低价模型。
Mistral AI 发布 7B 参数模型 Mistral 7B,其在标准英语和代码基准测试中超越所有目前可用的 13B 及以下开源模型。该模型基于 Apache 2.0 协议发布,运行速度更快且成本更低,适用于摘要、问答等任务。公司计划在未来几个月内逐步发布缩小黑盒与开源模型性能差距的新模型。
推荐理由:原文展示了 7B 模型超越 13B 开源模型的性能对比,并明确采用 Apache 2.0 协议,为开发者提供了低成本且可控的替代方案。
Mistral AI 发布 Mistral 7B,这是一个 7.3B 参数的大语言模型,采用 Apache 2.0 许可协议,可在本地、HuggingFace、vLLM 等环境中部署使用。
推荐理由:官方给出 7.3B 模型相对 Llama 2 13B 的推理、代码表现和部署路径,可作为 7B 级开源模型能力对比的参照。
OpenAI 宣布开发者可使用自有数据对 GPT-3.5 Turbo 进行微调,以适配特定用例。同时,相关 API 进行了更新,支持这一自定义能力。
推荐理由:原文说明开发者可用自有数据定制 GPT-3.5 Turbo,读者可据此评估其微调能力。
OpenAI发布GPT-4大模型,该模型为大型多模态模型,接受图像和文本输入并输出文本。尽管在许多现实场景中能力不及人类,但GPT-4在各类专业与学术基准测试中展现出人类水平的表现。
推荐理由:原文给出GPT-4的多模态定位和基准表现描述,读者可据此判断该模型在专业场景中的能力边界。
OpenAI 发布 Point-E 模型,该系统能够从复杂提示词生成 3D 点云。
推荐理由:官方发布3D点云生成模型,展示了从复杂提示词生成三维空间结构的技术能力。
OpenAI 发布能进行对话式交互的模型 ChatGPT,支持回答追问、承认错误、反驳错误前提并拒绝不当请求。
推荐理由:ChatGPT 官方首次介绍,明确了对话式交互和纠正错误、拒绝不当请求等能力边界。
OpenAI 训练并开源了名为 Whisper 的神经网络,其在英语语音识别上具备接近人类水平的鲁棒性和精度。
推荐理由:官方开源了具备类人鲁棒性和精度的英语语音识别模型。
OpenAI 发布了 InstructGPT 模型,该模型比 GPT-3 更擅长遵循用户意图,同时具有更高的真实性且毒性更低。InstructGPT 通过人类在环的技术进行训练,目前已成为 OpenAI API 的默认语言模型。
推荐理由:InstructGPT 将人类在环训练引入默认 API 模型,展示了提升指令遵循与降低毒性对齐的具体路径。
OpenAI 微调 GPT-3,利用文本网页浏览器回答开放性问题,以提升模型的事实准确性。