跳到正文

技术方向

多模态 最新动态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

47 条精选近 30 天 16 条共收录 135 条

更新

精选归档 · 第 3 页

9月18日周一第 41–47 条
  1. Hugging Face Blog65

    3D Gaussian Splatting 技术原理与工程实践解读

    3D Gaussian Splatting 是一种利用高斯点替代三角形网格的实时光栅化技术,能够从少量图像中学习并渲染照片级真实感场景。该技术将 SfM 点云转化为可训练的高斯参数(位置、协方差、颜色、透明度),通过可微光栅化器进行前向渲染与梯度优化,并利用自动加密(分裂/克隆)和剪枝策略提升细节恢复质量。

    推荐理由:基于官方开源实现和 COLMAP 流程,拆解 3D Gaussian Splatting 的网格化训练过程及其在现有渲染管线中的适配限制。

8月22日周二
7月27日周四
  1. Hugging Face Blog72

    Stable Diffusion XL 支持 Mac 端侧运行及 Core ML 高级量化

    Hugging Face 与 Apple 合作实现 Stable Diffusion XL 在 Apple Silicon Mac 上的本地运行,通过混合位调色(Mixed-Bit Palettization)技术将 UNet 模型压缩至等效 4.5 bit/参数,体积从 4.8 GB 降至 1.4 GB(减少71%)且生成质量优良。

    推荐理由:介绍了混合位调色量化技术,可将模型尺寸降低71%且保持质量,为本地化部署提供了实用方法。

3月14日周二
  1. OpenAI News95

    OpenAI发布GPT-4大模型

    OpenAI发布GPT-4大模型,该模型为大型多模态模型,接受图像和文本输入并输出文本。尽管在许多现实场景中能力不及人类,但GPT-4在各类专业与学术基准测试中展现出人类水平的表现。

    推荐理由:原文给出GPT-4的多模态定位和基准表现描述,读者可据此判断该模型在专业场景中的能力边界。

2月15日周三
  1. Hugging Face Blog70

    BLIP-2 实现零样本图像到文本生成的指南

    Salesforce Research 的 BLIP-2 模型已集成至 Hugging Face Transformers,支持零样本图像描述、带提示的图像描述、视觉问答和聊天式提示。

    推荐理由:解释了BLIP-2如何用轻量级Q-Former桥接图像编码器和大语言模型,给出了零样本图像描述、问答和聊天式提示的完整代码流程。

7月12日周二
  1. Hugging Face Blog89

    Hugging Face 发布 BLOOM:世界最大开源多语言大模型

    Hugging Face 发布 176B 参数开源模型 BLOOM,支持 46 种自然语言和 13 种编程语言。该模型由 70 多个国家的 1000 余名研究者历时一年协作完成,并首次开放训练中间检查点与推理 API,支持学术界和独立开发者下载、运行及基于 Responsible AI 许可进行二次开发。

    推荐理由:BLOOM 作为 176B 参数开源模型,开放了 46 种自然语言和 13 种编程语言的能力验证与二次开发入口。

1月5日周二
  1. OpenAI News76

    OpenAI 发布 CLIP:连接文本与图像的神经网络

    OpenAI 介绍了一种名为 CLIP 的神经网络,它通过自然语言监督高效学习视觉概念。CLIP 可用于任何视觉分类基准,只需提供要识别的视觉类别名称即可,具有类似 GPT-2 和 GPT-3 的零样本能力。

    推荐理由:展示了通过自然语言监督学习视觉概念的方法,确立了零样本图像分类的新范式。