Hugging Face Blog·· 2024-02-01精选AI 评分65
Hugging Face 基于开源 LLM 实现 Constitutional AI 的可复现训练配方
Constitutional AI with Open LLMs
AI 导读
Hugging Face 发布了一整套基于开源 LLM 实现 Constitutional AI 的端到端流程与数据集。该流程无需人工反馈,通过自定义“宪法原则”让模型自我批评和修订有害输出。基于 Mistral-7B 进行的实验表明,CAI 模型在 MT Bench 等基准上保持较高可用性,同时在 DAN 越狱测试中展现出显著更安全的响应表现。
推荐理由
提供可复现的 CAI 训练流程与开源数据集,并验证 CAI 在不损害可用性情况下提升对 DAN 等越狱攻击的鲁棒性。
来源:Hugging Face Blog · huggingface.co