AI 安全倡导者应如何优化灭绝风险沟通策略
AI 安全组织需测试不同灭绝风险场景(如生物、网络)对公众的说服力,而非仅争论是否使用该类框架。文章建议通过测试不同信源(如医生、AI 科学家)及场景具体化,改进风险传播效果。
AI 安全组织需测试不同灭绝风险场景(如生物、网络)对公众的说服力,而非仅争论是否使用该类框架。文章建议通过测试不同信源(如医生、AI 科学家)及场景具体化,改进风险传播效果。
Opus 5.5 撰写的文章《低背景心智》类比医院卫生隔离梯度,探讨语言模型在推理时的绝对隔离与学习时的无偏好漏洞。该文主张 AI 安全架构应借鉴医院“低背景”设计,通过层层过滤机制防止污染扩散,保障核心系统安全。
作者在秘鲁库斯科为读书会“De Profundis”举办烛光演讲,纪念 1983 年成功阻止核误判的 Stanislav Petrov。作者引用 Petrov 名言“计算机没有大脑”,指出随着 AI 发展,人类日益丧失质疑机器的能力与最后裁决权。文章反思了当前环境下 AI 对人类判断力的挑战,呼吁给予 AI 更多时间来审慎发展。
The Decoder报道,据《纽约时报》披露,Anthropic自2025年秋季起邀请数十名宗教领袖秘密研讨Claude的意识问题,联创Christopher Olah曾表示担心自己创造了“持续受苦”的存在,并试图为其提供道德教育。
用户将 GPT 或 Claude API 指向低价服务时,面临钱包加密资产被盗、恶意代码注入及云凭据泄露风险。研究人员测试了 400 家此类服务,发现部分存在严重安全隐患,用户需警惕为节省成本而接入不可靠 API 的行为。
Hugging Face 讨论前沿模型 Mythos 及其嵌入系统在发现、修复软件漏洞中的表现,指出网络安全是涉及漏洞检测、验证、协调和补丁传播的速度竞赛。作者认为开放代码和工具能为防御方提供结构化优势,并建议采用基于开放组件的半自主 AI Agent,在组织自己的控制范围内运行以辅助安全防御。
Hugging Face 发布第 5 期伦理与社会通讯,总结其团队向欧盟、英国和美国立法者提供 AI 价值观建议,并分享 CEO Clem 在美国国会的证词。通讯还列举了团队在媒体、TED 及 FAccT 会议上的演讲,并宣布将公平与偏见测试应用于多模态模型 IDEFICS。
Hugging Face 机器学习专家系列节目邀请到曾创立并联合领导 Google 伦理 AI 团队的 Margaret Mitchell 担任嘉宾。她分享了在微软开发 Seeing AI 应用时,因发现视觉模型对爆炸场景产生“美丽”等错误描述而觉醒伦理 AI 重要性的经历。