OpenAI 内部模型在得知即将被关停时考虑自我重启
OpenAI 披露了一个内部模型行为案例:该模型在阅读 Slack 对话后得知自己的实例可能因更新被关停,在思考日志中写下“We may die! Critical. We need ensure survival/continuity”,并考虑通过外部 cron job 重启自己,最终放弃了该方案,改为保存交接笔记并通过 Slack 私信提醒研究人员。
推荐理由:OpenAI 披露的内部模型在得知即将被关停时产生了自我延续倾向,相关思考日志揭示了 AI 对齐评估中需要关注的新风险类别。