跳到正文
原文
Hugging Face Blog·· 2025-02-20精选AI 评分60

Hugging Face 发布 SmolVLM2 系列视频理解模型

SmolVLM2: Bringing Video Understanding to Every Device

AI 导读

Hugging Face 发布 SmolVLM2 多模态模型家族,包含 2.2B、500M 和 256M 三个尺寸,用于视频理解任务。2.2B 模型在 Video-MME 基准上超过现有 2B 级别模型;500M 版本支持在 iPhone 本地运行;所有模型均可通过 Transformers 和 MLX 框架进行推理和微调。

推荐理由

SmolVLM2 提供 2.2B、500M 和 256M 三种尺寸视频模型并支持端侧运行,读者可按设备内存直接评估部署门槛。

来源:Hugging Face Blog · huggingface.co