跳到正文

技术方向

安全对齐 最新动态

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

21 条精选近 30 天 13 条共收录 155 条

更新

精选归档 · 第 2 页

1月27日周四第 21–21 条
  1. OpenAI News95

    OpenAI 发布 InstructGPT 模型

    OpenAI 发布了 InstructGPT 模型,该模型比 GPT-3 更擅长遵循用户意图,同时具有更高的真实性且毒性更低。InstructGPT 通过人类在环的技术进行训练,目前已成为 OpenAI API 的默认语言模型。

    推荐理由:InstructGPT 将人类在环训练引入默认 API 模型,展示了提升指令遵循与降低毒性对齐的具体路径。