Hugging Face Blog·· 2025-08-07精选AI 评分62
Hugging Face TRL 新增视觉语言模型多模态对齐方法 MPO、GRPO 和 GSPO
Vision Language Model Alignment in TRL ⚡️
AI 导读
Hugging Face 在 TRL 中新增了针对视觉语言模型(VLM)的多模态对齐方法,包括混合偏好优化(MPO)、群组相对策略优化(GRPO)和群组序列策略优化(GSPO)。这些方法扩展了成对 DPO 的信号提取能力,并支持 RLOO 和 Online DPO。TRL 还集成了 vLLM 以支持在线对齐训练,并提供了原生 SFT 支持及演示笔记本。
推荐理由
原文提供了MPO、GRPO和GSPO在视觉语言模型对齐中的具体实现方法,并给出了训练脚本与vLLM集成支持。
来源:Hugging Face Blog · huggingface.co