NVIDIA AI Day Singapore:展示东南亚人工智能进展
NVIDIA 在新加坡举行 AI Day 活动,与合作伙伴共同展示东南亚地区的人工智能进展。活动重点展示了 NVIDIA Nemotron 开源模型和 Cosmos 世界模型在公共服务、智慧城市和企业应用中的落地情况,涵盖新加坡、马来西亚、泰国、越南和文莱的多项合作项目,推动区域人工智能从试点走向规模化部署。
NVIDIA 在新加坡举行 AI Day 活动,与合作伙伴共同展示东南亚地区的人工智能进展。活动重点展示了 NVIDIA Nemotron 开源模型和 Cosmos 世界模型在公共服务、智慧城市和企业应用中的落地情况,涵盖新加坡、马来西亚、泰国、越南和文莱的多项合作项目,推动区域人工智能从试点走向规模化部署。
Meta 发布开源多模态模型 Muse Glimmer,模型为 30B 参数,基于 Muse 蒸馏而来,采用 Apache 2.0 许可,专为本地智能体应用场景设计。
推荐理由:文章展示了Muse Glimmer在本地部署场景下的自优化演示,为隐私敏感应用提供了低成本运行方案。
Google Research 发布覆盖 50 多个城市的建筑级屋顶反射率扩展数据集,并上线高分辨率 Heat Resilience Earth Engine App 供公开使用。该数据集融合 Sentinel-2 卫星数据与 30 厘米分辨率商业影像,旨在帮助城市规划者通过冷屋顶方案缓解极端高温。研究指出,利用该数据进行的针对性冷屋顶规划在全球范围内可将城市极端高温缓解最高 0.5°C。
QIMMA 整合 14 个基准的 52,000 多个样本,成为首个包含代码评估的阿拉伯语 LLM 排行榜。该开源平台通过自动化与人工双重验证流程剔除低质数据,确保 99% 内容本土化。其评估体系覆盖文化、科学、法律及编程等领域,公开样本输出以提升评测可复现性。
Gemini 应用上线了最新的生成音乐模型 Lyria 3,用户可以通过文本描述或上传图片生成 30 秒的音乐片段。Lyria 3 支持自动作词,用户可对风格、人声和节奏进行更多控制,生成的音频将嵌入 SynthID 水印,并支持通过 Nano Banana 自动生成封面艺术。
推荐理由:该功能通过文本或图像直接生成带词曲的30秒音乐,将多模态生成扩展到音频领域。
Mistral 发布新模型 Mistral Large 2,123B 参数、128k 上下文窗口,MMLU 预训练版本达到 84.0%。Mistral 称其在代码和推理上表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并优化了指令跟随、减少模型幻觉。
推荐理由:官方给出了 MMLU 84.0%、123B 参数、128k 上下文窗口和 la Plateforme 上的部署入口,可判断它与 GPT-4o、Claude 3 Opus 等模型在性价比上的位置。
Pollen Robotics 团队发布开源 pollen-vision 库,该工具包整合了 OWL-VIT、Mobile SAM 和 RAM 等零样本视觉模型,旨在让机器人无需训练即可抓取未知物体。当前版本聚焦于 3D 物体检测,能通过相机内参计算物体在 3D 空间中的 (x, y, z) 坐标,但尚未支持 6D 姿态估计。
本文演示如何利用 Hugging Face Inference API 部署 AI Comic Factory。
教程演示利用 Hugging Face datasets 和 transformers 库微调 Vision Transformer (ViT) 处理图像分类。使用 google/vit-base-patch16-224-in21k 模型及其配套的 ViTImageProcessor,通过加载 beans 数据集并应用标准化预处理,将图像转换为模型可接受的张量输入以完成微调流程。