AI 智能体通过编写代码构建3D场景,但缺乏自我判断能力
研究者提出的LEGO-Anything方法让编码智能体通过编写Blender代码从单张照片重建3D场景。团队使用包含208张图像的LEGO-Bench评测发现,各模型在几何准确性上表现不一且自我评估极不可靠。为此,研究者开发了无需训练的LEGO-Plugin,通过引入具体测量指标替代智能体自身判断来防止退化编辑,从而显著提升了所有模型的场景重建效果。
研究者提出的LEGO-Anything方法让编码智能体通过编写Blender代码从单张照片重建3D场景。团队使用包含208张图像的LEGO-Bench评测发现,各模型在几何准确性上表现不一且自我评估极不可靠。为此,研究者开发了无需训练的LEGO-Plugin,通过引入具体测量指标替代智能体自身判断来防止退化编辑,从而显著提升了所有模型的场景重建效果。
Google Research 发布覆盖 50 多个城市的建筑级屋顶反射率扩展数据集,并上线高分辨率 Heat Resilience Earth Engine App 供公开使用。该数据集融合 Sentinel-2 卫星数据与 30 厘米分辨率商业影像,旨在帮助城市规划者通过冷屋顶方案缓解极端高温。研究指出,利用该数据进行的针对性冷屋顶规划在全球范围内可将城市极端高温缓解最高 0.5°C。
QIMMA 整合 14 个基准的 52,000 多个样本,成为首个包含代码评估的阿拉伯语 LLM 排行榜。该开源平台通过自动化与人工双重验证流程剔除低质数据,确保 99% 内容本土化。其评估体系覆盖文化、科学、法律及编程等领域,公开样本输出以提升评测可复现性。