Hugging Face Blog·· 2023-09-29精选AI 评分61
通过 TRL 使用 DDPO 微调 Stable Diffusion 模型
Finetune Stable Diffusion Models with DDPO via TRL
AI 导读
TRL 库新集成了 DDPOTrainer 类,用于将 Denoising Diffusion Policy Optimization (DDPO) 应用于 Stable Diffusion 模型,使其输出更符合人类审美等偏好。
推荐理由
通过 TRL 新集成的 DDPOTrainer,读者可以直接在本地用 RL 微调 Stable Diffusion,降低扩散模型对齐人类偏好的门槛。
来源:Hugging Face Blog · huggingface.co