Hugging Face Blog·· 2023-08-08精选AI 评分82
Hugging Face 教程:使用 DPO 微调 Llama 2
Fine-tune Llama 2 with DPO
AI 导读
Hugging Face 在 TRL 库中引入了 DPO(Direct Preference Optimization)功能,允许开发者跳过复杂的 RLHF 奖励模型构建环节,直接通过偏好数据微调大模型。教程展示了如何使用 QLoRA 技术对 Llama v2 7B 模型进行 SFT 和 DPO 两阶段训练,并提供了基于 Stack-Exchange 偏好数据集的完整代码示例与训练指标监控方法。
推荐理由
教程结合官方库演示了如何用 DPO 替代复杂 RLHF 流程微调 Llama 2,提供了可直接运行的 QLoRA 训练代码。
来源:Hugging Face Blog · huggingface.co