跳到正文
原文
Hugging Face Blog·· 2025-08-07精选AI 评分62

Hugging Face TRL 新增视觉语言模型多模态对齐方法 MPO、GRPO 和 GSPO

Vision Language Model Alignment in TRL ⚡️

AI 导读

Hugging Face 在 TRL 中新增了针对视觉语言模型(VLM)的多模态对齐方法,包括混合偏好优化(MPO)、群组相对策略优化(GRPO)和群组序列策略优化(GSPO)。这些方法扩展了成对 DPO 的信号提取能力,并支持 RLOO 和 Online DPO。TRL 还集成了 vLLM 以支持在线对齐训练,并提供了原生 SFT 支持及演示笔记本。

推荐理由

原文提供了MPO、GRPO和GSPO在视觉语言模型对齐中的具体实现方法,并给出了训练脚本与vLLM集成支持。

来源:Hugging Face Blog · huggingface.co