DeepMind 研究人员提出“人工共生智能”作为奇点的替代方案
DeepMind 研究人员提出“人工共生智能”概念,主张构建人与机器共存的生态系统以取代单一超级智能奇点。该观点基于对 DeepSeek-R1 和 QwQ-32B 等推理模型的研究,发现其通过强化学习自主产生类似群体辩论的多视角行为。作者认为,未来需通过协调智能体网络及设计类似法庭的新制度来治理人机协作,而非仅依赖单个模型。
DeepMind 研究人员提出“人工共生智能”概念,主张构建人与机器共存的生态系统以取代单一超级智能奇点。该观点基于对 DeepSeek-R1 和 QwQ-32B 等推理模型的研究,发现其通过强化学习自主产生类似群体辩论的多视角行为。作者认为,未来需通过协调智能体网络及设计类似法庭的新制度来治理人机协作,而非仅依赖单个模型。
研究者提出的LEGO-Anything方法让编码智能体通过编写Blender代码从单张照片重建3D场景。团队使用包含208张图像的LEGO-Bench评测发现,各模型在几何准确性上表现不一且自我评估极不可靠。为此,研究者开发了无需训练的LEGO-Plugin,通过引入具体测量指标替代智能体自身判断来防止退化编辑,从而显著提升了所有模型的场景重建效果。
本文综述了“AI for Epistemics and Coordination”这一新兴领域,旨在利用 AI 帮助人们形成更好的信念、做出明智决策并有效协调。该领域相对于其重要性而言发展不足,而早期产品和标准可能塑造用户对 AI 的期望及 Agent 协调方式,因此不能仅依赖现有商业和机构激励来推动这些工具的构建,需尽早建立评估规范与基础设施。
Mercor 的研究显示,AI 模型在结构化记账任务上的速度和准确率超过平均经验五年半的持证会计师。该研究使用 APEX Accounting Benchmark,结果显示当前最佳模型 Claude Opus 5.5 满足了 61.8% 的评分标准。
DeepMind 此前无法稳定战胜人类玩家的 Stratego,如今被 Carnegie Mellon、MIT、NYU 与 Stanford 合作开发的 AI 攻克。
Hugging Face 提出 Quantization-Aware Healing(QAH)方法,将 GPT-OSS 120B 模型压缩至 60B 参数并量化为 MXFP4 格式。该 4-bit 模型在 9 项基准测试中的 7 项上,性能超越同架构的 bfloat16 全精度版本。
Google Research 发布覆盖 50 多个城市的建筑级屋顶反射率扩展数据集,并上线高分辨率 Heat Resilience Earth Engine App 供公开使用。该数据集融合 Sentinel-2 卫星数据与 30 厘米分辨率商业影像,旨在帮助城市规划者通过冷屋顶方案缓解极端高温。研究指出,利用该数据进行的针对性冷屋顶规划在全球范围内可将城市极端高温缓解最高 0.5°C。
Hugging Face 提出 MosaicLeaks 基准,评测深研智能体在处理混合本地与网页信息时的隐私泄露风险。测试显示常规训练加剧了信息泄露,而新提出的 PA-DR 强化学习方法将严格链成功率从 48.7% 提升至 58.7%,同时将答案/全信息泄露率从 34.0% 降至 9.9%。
QIMMA 整合 14 个基准的 52,000 多个样本,成为首个包含代码评估的阿拉伯语 LLM 排行榜。该开源平台通过自动化与人工双重验证流程剔除低质数据,确保 99% 内容本土化。其评估体系覆盖文化、科学、法律及编程等领域,公开样本输出以提升评测可复现性。