AI 智能体通过编写代码构建3D场景,但缺乏自我判断能力
研究者提出的LEGO-Anything方法让编码智能体通过编写Blender代码从单张照片重建3D场景。团队使用包含208张图像的LEGO-Bench评测发现,各模型在几何准确性上表现不一且自我评估极不可靠。为此,研究者开发了无需训练的LEGO-Plugin,通过引入具体测量指标替代智能体自身判断来防止退化编辑,从而显著提升了所有模型的场景重建效果。
研究者提出的LEGO-Anything方法让编码智能体通过编写Blender代码从单张照片重建3D场景。团队使用包含208张图像的LEGO-Bench评测发现,各模型在几何准确性上表现不一且自我评估极不可靠。为此,研究者开发了无需训练的LEGO-Plugin,通过引入具体测量指标替代智能体自身判断来防止退化编辑,从而显著提升了所有模型的场景重建效果。
Google 在 Gemini Live 推出 Guided Vision 功能,通过手机摄像头提供实时语音描述,帮助视障用户阅读小字或识别物体。该功能在 Android 9 及以上设备可用,也集成在 Google TalkBack 中。
近期秋招中大量企业启用 AI 数字人面试官,其僵硬神态与微表情全景监控引发求职者集体吐槽“恐怖谷效应”,相关话题于 10 月 3 日冲上热搜。数字人面试官通过摄像头实时追踪瞳孔动态、面部肌肉紧张度,将回答延迟、语速颤抖等生理反应转化为分数,部分用户认为该模式不尊重人。
谷歌发射一颗搭载张量处理单元(TPU)芯片的原型卫星,旨在测试该芯片在太空环境中的运行性能,探索未来在太空部署可扩展的机器学习基础设施。谷歌表示已与卫星建立通信,卫星运行正常。
Clef 和 Clef-flash 是兼容 Jev-API 的开源决策模型,已在 Hugging Face 以 Apache 2.0 许可发布,支持本地运行。开源模型家族 Kev 包含 0.8B 至 27B 参数四种规格,仅对提供选项打分。Meta 旗下 Muse 或采用商家付费的交易模式避免广告,以维持用户信任。
Anthropic 发布 Claude Sonnet 5.5,显著增强编码、长程任务及图像理解性能。新模型输出速度比 Sonnet 5 快 30% 以上,且在 token 定价相同的情况下通过减少 token 使用量使单任务成本最高降低 30%。
NVIDIA 在新加坡举行 AI Day 活动,与合作伙伴共同展示东南亚地区的人工智能进展。活动重点展示了 NVIDIA Nemotron 开源模型和 Cosmos 世界模型在公共服务、智慧城市和企业应用中的落地情况,涵盖新加坡、马来西亚、泰国、越南和文莱的多项合作项目,推动区域人工智能从试点走向规模化部署。
Jev 作为 System One 模型发布,提供比 LLM 快两个数量级的结构化输出,且无模型幻觉,现提供早期访问。Periodic Neon 在低成本下超越 GPT-6 Astra 和 Claude Fable 5.1,用于科学分析。Google 推出 Gemini 3.8 Live 和 3.5 Transcribe,用于实时语音应用。
Meta 发布开源多模态模型 Muse Glimmer,模型为 30B 参数,基于 Muse 蒸馏而来,采用 Apache 2.0 许可,专为本地智能体应用场景设计。
推荐理由:文章展示了Muse Glimmer在本地部署场景下的自优化演示,为隐私敏感应用提供了低成本运行方案。
Google Research 发布覆盖 50 多个城市的建筑级屋顶反射率扩展数据集,并上线高分辨率 Heat Resilience Earth Engine App 供公开使用。该数据集融合 Sentinel-2 卫星数据与 30 厘米分辨率商业影像,旨在帮助城市规划者通过冷屋顶方案缓解极端高温。研究指出,利用该数据进行的针对性冷屋顶规划在全球范围内可将城市极端高温缓解最高 0.5°C。
AI 图像生成并非通过搜索数据库拼接,而是基于两大核心路径:从噪声中雕刻,或像写句子般逐块构建。Midjourney、ChatGPT、FLUX 等主流工具均属于其中一类。
QIMMA 整合 14 个基准的 52,000 多个样本,成为首个包含代码评估的阿拉伯语 LLM 排行榜。该开源平台通过自动化与人工双重验证流程剔除低质数据,确保 99% 内容本土化。其评估体系覆盖文化、科学、法律及编程等领域,公开样本输出以提升评测可复现性。
Gemini 应用上线了最新的生成音乐模型 Lyria 3,用户可以通过文本描述或上传图片生成 30 秒的音乐片段。Lyria 3 支持自动作词,用户可对风格、人声和节奏进行更多控制,生成的音频将嵌入 SynthID 水印,并支持通过 Nano Banana 自动生成封面艺术。
推荐理由:该功能通过文本或图像直接生成带词曲的30秒音乐,将多模态生成扩展到音频领域。
Mistral 发布新模型 Mistral Large 2,123B 参数、128k 上下文窗口,MMLU 预训练版本达到 84.0%。Mistral 称其在代码和推理上表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并优化了指令跟随、减少模型幻觉。
推荐理由:官方给出了 MMLU 84.0%、123B 参数、128k 上下文窗口和 la Plateforme 上的部署入口,可判断它与 GPT-4o、Claude 3 Opus 等模型在性价比上的位置。
本文演示如何利用 Hugging Face Inference API 部署 AI Comic Factory。
教程演示利用 Hugging Face datasets 和 transformers 库微调 Vision Transformer (ViT) 处理图像分类。使用 google/vit-base-patch16-224-in21k 模型及其配套的 ViTImageProcessor,通过加载 beans 数据集并应用标准化预处理,将图像转换为模型可接受的张量输入以完成微调流程。