Meta 发布开源多模态模型 Muse Glimmer:30B 参数,支持本地智能体应用
Meta 发布开源多模态模型 Muse Glimmer,模型为 30B 参数,基于 Muse 蒸馏而来,采用 Apache 2.0 许可,专为本地智能体应用场景设计。
推荐理由:文章展示了Muse Glimmer在本地部署场景下的自优化演示,为隐私敏感应用提供了低成本运行方案。
技术方向
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
47 条精选近 30 天 16 条共收录 135 条
Meta 发布开源多模态模型 Muse Glimmer,模型为 30B 参数,基于 Muse 蒸馏而来,采用 Apache 2.0 许可,专为本地智能体应用场景设计。
推荐理由:文章展示了Muse Glimmer在本地部署场景下的自优化演示,为隐私敏感应用提供了低成本运行方案。
OpenAI 更新了适用于 macOS 和 Windows 的 Codex 应用,新增电脑操作、应用内浏览、图像生成、记忆和插件功能,以加速开发者工作流。
推荐理由:介绍了 Codex 在 macOS 和 Windows 应用上新增的电脑操作、应用内浏览、图像生成、记忆和插件功能,便于开发者评估其工作流变化。
Meta 发布的 Muse Spark 模型现已在 Meta AI App 和 meta.ai 中上线,核心特性是支持并行启动多个 Subagents 处理任务。该模型专为多模态感知设计,后续将集成至 Facebook、Instagram、WhatsApp 及 Meta 眼镜等全产品线。
推荐理由:原文拆解了 Muse Spark 如何将 Subagents 作为核心功能嵌入 Meta 核心应用,揭示了其争夺日常助手入口的深层战略意图。
OpenAI 发布 GPT-5.4 mini 和 nano,两者是 GPT-5.4 更小更快的版本。新模型优化了编码、工具调用和多模态推理能力,以支持大规模 API 请求及子智能体工作负载。
推荐理由:官方明确了 GPT-5.4 mini 和 nano 针对编码与子智能体等高负载场景的优化方向,方便开发者评估替代方案。
Gemini 应用上线了最新的生成音乐模型 Lyria 3,用户可以通过文本描述或上传图片生成 30 秒的音乐片段。Lyria 3 支持自动作词,用户可对风格、人声和节奏进行更多控制,生成的音频将嵌入 SynthID 水印,并支持通过 Nano Banana 自动生成封面艺术。
推荐理由:该功能通过文本或图像直接生成带词曲的30秒音乐,将多模态生成扩展到音频领域。
OpenAI 发布 Sora 2 系统卡,介绍其作为最新视频和音频生成模型的能力。Sora 2 在物理准确性、画面真实感、音频同步、可控性以及风格范围上较前代有所提升。
Hugging Face 在 TRL 中新增了针对视觉语言模型(VLM)的多模态对齐方法,包括混合偏好优化(MPO)、群组相对策略优化(GRPO)和群组序列策略优化(GSPO)。这些方法扩展了成对 DPO 的信号提取能力,并支持 RLOO 和 Online DPO。TRL 还集成了 vLLM 以支持在线对齐训练,并提供了原生 SFT 支持及演示笔记本。
推荐理由:原文提供了MPO、GRPO和GSPO在视觉语言模型对齐中的具体实现方法,并给出了训练脚本与vLLM集成支持。
Hugging Face 发布 3B 参数规模的 SmolLM3 模型,包括 Base 和 Instruct 两种变体,完全开源模型权重、架构细节和三阶段预训练配方。
推荐理由:Hugging Face 发布并完全开源 SmolLM3 模型及完整训练配方,为构建同类 3B 模型提供了可复现的工程蓝图。
Gemma 3n 正式发布,支持本地运行多模态输入。该模型分为 E2B 和 E4B 两个版本,实际参数为 5B 和 8B,但显存占用仅相当于 2B 和 4B 模型,分别只需 2GB 和 3GB 显存。
推荐理由:Gemma 3n 以 2B/4B 显存实现 5B/8B 性能,支持文本、图像、音频和视频多模态输入,并开放主流开源框架支持。
Google 发布 Gemma 3 开源权重 LLM,包括 1B、4B、12B、27B 参数版本,上下文窗口从 Gemma 2 的 8k 提升至最高 128k tokens。
推荐理由:Gemma 3 支持 128k 上下文和 140 余种语言,并能在 Hugging Face 生态当日通过 pipeline 或 llama.cpp 完成推理部署。
Cohere 开放 Aya Vision 8B 和 32B 权重,支持 23 种语言的图像理解、视觉问答与图文翻译。模型基于 SigLIP2-patch14-384 视觉编码器和 Aya Expanse 语言底座,通过 4 倍 Pixel Shuffle 下采样降低多模态输入开销。
推荐理由:模型在开放权重下支持 23 种语言视觉任务,并配合评测基准发布,可直接复用于多语言视觉落地。
Google 发布 SigLIP 2 多语言视觉语言编码器,作者团队在 SigLIP 的 sigmoid loss 之上叠加解码器、全局-局部自蒸馏和掩码预测等辅助目标,以提升语义理解、定位和密集特征能力。
推荐理由:作者拆解了 SigLIP 2 相对 SigLIP 新增的多项训练目标与动态分辨率变体,并给出可直接运行的推理与对比方法。
Hugging Face 发布 SmolVLM2 多模态模型家族,包含 2.2B、500M 和 256M 三个尺寸,用于视频理解任务。2.2B 模型在 Video-MME 基准上超过现有 2B 级别模型;500M 版本支持在 iPhone 本地运行;所有模型均可通过 Transformers 和 MLX 框架进行推理和微调。
推荐理由:SmolVLM2 提供 2.2B、500M 和 256M 三种尺寸视频模型并支持端侧运行,读者可按设备内存直接评估部署门槛。
Google 发布 PaliGemma 2 mix,这是一组在多种视觉语言任务上微调的指令型视觉语言模型,覆盖 3B、10B 和 28B 规模。文章展示了其处理开放式任务提示和检测定位任务的方式,并提供了通过 Transformers 进行推理的代码和在线演示。
推荐理由:文章解释了 mix 变体如何作为预训练模型的下游能力参考,并给出可运行的推理示例。
PaliGemma 2 是由 Google 推出的新一版视觉语言模型,文章作为官方发布介绍。
Mistral 发布新模型 Mistral Large 2,123B 参数、128k 上下文窗口,MMLU 预训练版本达到 84.0%。Mistral 称其在代码和推理上表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并优化了指令跟随、减少模型幻觉。
推荐理由:官方给出了 MMLU 84.0%、123B 参数、128k 上下文窗口和 la Plateforme 上的部署入口,可判断它与 GPT-4o、Claude 3 Opus 等模型在性价比上的位置。
Google 发布开源视觉语言模型 PaliGemma,架构结合 SigLIP-So400m 图像编码器与 Gemma-2B 文本解码器。模型在 Hugging Face 提供预训练(pt)、混合任务微调(mix)及特定基准微调(ft)三种类型,支持 224x224 至 896x896 分辨率与多种精度。
推荐理由:PaliGemma提供预训练与微调混合权重,适合在多模态任务中复用SigLIP加Gemma的组合流程。
Hugging Face 发布 Idefics2,一个 8B 参数量的通用多模态视觉语言模型,支持输入文本与图像序列并生成文本响应,Apache 2.0 开源。
推荐理由:Idefics2 采用 Apache 2.0 协议开源 8B 多模态模型,并提供配套微调数据 The Cauldron,为多模态社区提供了易用的基础与工具。
Hugging Face 博客解析视觉语言模型(VLM)架构原理,介绍 LLaVA、Qwen-VL 等主流开源模型及其应用场景。指南详细说明了如何使用 transformers 库进行推理,并利用 TRL 的 SFTTrainer 在 llava-instruct 数据集上对 VLM 进行指令微调的完整流程。
推荐理由:提供VLM结构与微调指南,并给出基于TRL的完整代码示例,帮助降低多模态模型使用门槛。
OpenAI 宣布 ChatGPT 现具备视觉、听觉和语音交互功能。