跳到正文

#多模态

今日 0 条
9月23日周三
  1. NVIDIA Blog42

    NVIDIA AI Day Singapore:展示东南亚人工智能进展

    NVIDIA 在新加坡举行 AI Day 活动,与合作伙伴共同展示东南亚地区的人工智能进展。活动重点展示了 NVIDIA Nemotron 开源模型和 Cosmos 世界模型在公共服务、智慧城市和企业应用中的落地情况,涵盖新加坡、马来西亚、泰国、越南和文莱的多项合作项目,推动区域人工智能从试点走向规模化部署。

8月10日周一
7月1日周三
  1. Google Research41

    Google Research 将热韧性数据扩展至全球 50 多个城市

    Google Research 发布覆盖 50 多个城市的建筑级屋顶反射率扩展数据集,并上线高分辨率 Heat Resilience Earth Engine App 供公开使用。该数据集融合 Sentinel-2 卫星数据与 30 厘米分辨率商业影像,旨在帮助城市规划者通过冷屋顶方案缓解极端高温。研究指出,利用该数据进行的针对性冷屋顶规划在全球范围内可将城市极端高温缓解最高 0.5°C。

4月21日周二
2月19日周四
  1. Google DeepMind74

    Gemini 应用引入 Lyria 3 音乐生成模型

    Gemini 应用上线了最新的生成音乐模型 Lyria 3,用户可以通过文本描述或上传图片生成 30 秒的音乐片段。Lyria 3 支持自动作词,用户可对风格、人声和节奏进行更多控制,生成的音频将嵌入 SynthID 水印,并支持通过 Nano Banana 自动生成封面艺术。

    推荐理由:该功能通过文本或图像直接生成带词曲的30秒音乐,将多模态生成扩展到音频领域。

7月24日周三
  1. Mistral AI75

    Mistral Large 2 发布:123B 参数、128k 上下文,性能对齐 GPT-4o 和 Claude 3 Opus

    Mistral 发布新模型 Mistral Large 2,123B 参数、128k 上下文窗口,MMLU 预训练版本达到 84.0%。Mistral 称其在代码和推理上表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并优化了指令跟随、减少模型幻觉。

    推荐理由:官方给出了 MMLU 84.0%、123B 参数、128k 上下文窗口和 la Plateforme 上的部署入口,可判断它与 GPT-4o、Claude 3 Opus 等模型在性价比上的位置。

3月25日周一
  1. Hugging Face Blog48

    Pollen Robotics 发布开源 Pollen-Vision 库,为机器人提供零样本 3D 物体检测接口

    Pollen Robotics 团队发布开源 pollen-vision 库,该工具包整合了 OWL-VIT、Mobile SAM 和 RAM 等零样本视觉模型,旨在让机器人无需训练即可抓取未知物体。当前版本聚焦于 3D 物体检测,能通过相机内参计算物体在 3D 空间中的 (x, y, z) 坐标,但尚未支持 6D 姿态估计。

10月2日周一
2月11日周五