跳到正文

技术方向

多模态 最新动态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

47 条精选近 30 天 16 条共收录 135 条

更新

精选归档 · 第 2 页

8月10日周一第 21–40 条
4月16日周四
  1. OpenAI News64

    OpenAI 更新 Codex 桌面应用

    OpenAI 更新了适用于 macOS 和 Windows 的 Codex 应用,新增电脑操作、应用内浏览、图像生成、记忆和插件功能,以加速开发者工作流。

    推荐理由:介绍了 Codex 在 macOS 和 Windows 应用上新增的电脑操作、应用内浏览、图像生成、记忆和插件功能,便于开发者评估其工作流变化。

  2. The AI POV80

    Meta 发布 Muse Spark 将 Subagents 确立为 Meta AI 核心

    Meta 发布的 Muse Spark 模型现已在 Meta AI App 和 meta.ai 中上线,核心特性是支持并行启动多个 Subagents 处理任务。该模型专为多模态感知设计,后续将集成至 Facebook、Instagram、WhatsApp 及 Meta 眼镜等全产品线。

    推荐理由:原文拆解了 Muse Spark 如何将 Subagents 作为核心功能嵌入 Meta 核心应用,揭示了其争夺日常助手入口的深层战略意图。

3月17日周二
  1. OpenAI News75

    OpenAI 发布 GPT-5.4 mini 和 nano

    OpenAI 发布 GPT-5.4 mini 和 nano,两者是 GPT-5.4 更小更快的版本。新模型优化了编码、工具调用和多模态推理能力,以支持大规模 API 请求及子智能体工作负载。

    推荐理由:官方明确了 GPT-5.4 mini 和 nano 针对编码与子智能体等高负载场景的优化方向,方便开发者评估替代方案。

2月19日周四
  1. Google DeepMind74

    Gemini 应用引入 Lyria 3 音乐生成模型

    Gemini 应用上线了最新的生成音乐模型 Lyria 3,用户可以通过文本描述或上传图片生成 30 秒的音乐片段。Lyria 3 支持自动作词,用户可对风格、人声和节奏进行更多控制,生成的音频将嵌入 SynthID 水印,并支持通过 Nano Banana 自动生成封面艺术。

    推荐理由:该功能通过文本或图像直接生成带词曲的30秒音乐,将多模态生成扩展到音频领域。

9月30日周二
8月7日周四
  1. Hugging Face Blog62

    Hugging Face TRL 新增视觉语言模型多模态对齐方法 MPO、GRPO 和 GSPO

    Hugging Face 在 TRL 中新增了针对视觉语言模型(VLM)的多模态对齐方法,包括混合偏好优化(MPO)、群组相对策略优化(GRPO)和群组序列策略优化(GSPO)。这些方法扩展了成对 DPO 的信号提取能力,并支持 RLOO 和 Online DPO。TRL 还集成了 vLLM 以支持在线对齐训练,并提供了原生 SFT 支持及演示笔记本。

    推荐理由:原文提供了MPO、GRPO和GSPO在视觉语言模型对齐中的具体实现方法,并给出了训练脚本与vLLM集成支持。

7月8日周二
  1. Hugging Face Blog73

    Hugging Face 发布完全开源的 SmolLM3 模型

    Hugging Face 发布 3B 参数规模的 SmolLM3 模型,包括 Base 和 Instruct 两种变体,完全开源模型权重、架构细节和三阶段预训练配方。

    推荐理由:Hugging Face 发布并完全开源 SmolLM3 模型及完整训练配方,为构建同类 3B 模型提供了可复现的工程蓝图。

6月26日周四
  1. Hugging Face Blog82

    Gemma 3n 在开源生态中全面可用

    Gemma 3n 正式发布,支持本地运行多模态输入。该模型分为 E2B 和 E4B 两个版本,实际参数为 5B 和 8B,但显存占用仅相当于 2B 和 4B 模型,分别只需 2GB 和 3GB 显存。

    推荐理由:Gemma 3n 以 2B/4B 显存实现 5B/8B 性能,支持文本、图像、音频和视频多模态输入,并开放主流开源框架支持。

3月12日周三
3月4日周二
  1. Hugging Face Blog69

    Cohere 发布 Aya Vision 8B 与 32B 多语言视觉模型

    Cohere 开放 Aya Vision 8B 和 32B 权重,支持 23 种语言的图像理解、视觉问答与图文翻译。模型基于 SigLIP2-patch14-384 视觉编码器和 Aya Expanse 语言底座,通过 4 倍 Pixel Shuffle 下采样降低多模态输入开销。

    推荐理由:模型在开放权重下支持 23 种语言视觉任务,并配合评测基准发布,可直接复用于多语言视觉落地。

2月21日周五
  1. Hugging Face Blog75

    Google 发布 SigLIP 2 多语言视觉语言编码器

    Google 发布 SigLIP 2 多语言视觉语言编码器,作者团队在 SigLIP 的 sigmoid loss 之上叠加解码器、全局-局部自蒸馏和掩码预测等辅助目标,以提升语义理解、定位和密集特征能力。

    推荐理由:作者拆解了 SigLIP 2 相对 SigLIP 新增的多项训练目标与动态分辨率变体,并给出可直接运行的推理与对比方法。

2月20日周四
  1. Hugging Face Blog60

    Hugging Face 发布 SmolVLM2 系列视频理解模型

    Hugging Face 发布 SmolVLM2 多模态模型家族,包含 2.2B、500M 和 256M 三个尺寸,用于视频理解任务。2.2B 模型在 Video-MME 基准上超过现有 2B 级别模型;500M 版本支持在 iPhone 本地运行;所有模型均可通过 Transformers 和 MLX 框架进行推理和微调。

    推荐理由:SmolVLM2 提供 2.2B、500M 和 256M 三种尺寸视频模型并支持端侧运行,读者可按设备内存直接评估部署门槛。

2月19日周三
  1. Hugging Face Blog66

    Google 发布 PaliGemma 2 Mix 多任务指令视觉语言模型

    Google 发布 PaliGemma 2 mix,这是一组在多种视觉语言任务上微调的指令型视觉语言模型,覆盖 3B、10B 和 28B 规模。文章展示了其处理开放式任务提示和检测定位任务的方式,并提供了通过 Transformers 进行推理的代码和在线演示。

    推荐理由:文章解释了 mix 变体如何作为预训练模型的下游能力参考,并给出可运行的推理示例。

12月5日周四
7月24日周三
  1. Mistral AI75

    Mistral Large 2 发布:123B 参数、128k 上下文,性能对齐 GPT-4o 和 Claude 3 Opus

    Mistral 发布新模型 Mistral Large 2,123B 参数、128k 上下文窗口,MMLU 预训练版本达到 84.0%。Mistral 称其在代码和推理上表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并优化了指令跟随、减少模型幻觉。

    推荐理由:官方给出了 MMLU 84.0%、123B 参数、128k 上下文窗口和 la Plateforme 上的部署入口,可判断它与 GPT-4o、Claude 3 Opus 等模型在性价比上的位置。

5月14日周二
  1. Hugging Face Blog75

    Google开源视觉语言模型PaliGemma:基于SigLIP与Gemma-2B的开放权重

    Google 发布开源视觉语言模型 PaliGemma,架构结合 SigLIP-So400m 图像编码器与 Gemma-2B 文本解码器。模型在 Hugging Face 提供预训练(pt)、混合任务微调(mix)及特定基准微调(ft)三种类型,支持 224x224 至 896x896 分辨率与多种精度。

    推荐理由:PaliGemma提供预训练与微调混合权重,适合在多模态任务中复用SigLIP加Gemma的组合流程。

4月15日周一
4月11日周四
  1. Hugging Face Blog62

    Vision Language Models 原理与微调指南

    Hugging Face 博客解析视觉语言模型(VLM)架构原理,介绍 LLaVA、Qwen-VL 等主流开源模型及其应用场景。指南详细说明了如何使用 transformers 库进行推理,并利用 TRL 的 SFTTrainer 在 llava-instruct 数据集上对 VLM 进行指令微调的完整流程。

    推荐理由:提供VLM结构与微调指南,并给出基于TRL的完整代码示例,帮助降低多模态模型使用门槛。

9月25日周一