跳到正文
10月3日周六
  1. 机器之心40

    亚马逊与杜克大学研究:大模型后训练中极端稀疏监督提升推理能力

    亚马逊公司和杜克大学最新研究表明,大模型后训练中仅需保留极少量 token 的梯度信号即可显著提升推理能力。实验中,对 Qwen3 系列模型仅随机保留 0.025% 的 token 进行监督,学生模型的推理性能不仅未下降,反而超过全信号训练甚至教师模型本身。该极端稀疏监督机制在代码推理、Llama 系列及 RLVR 场景中均得到验证,且仅更新了 10% 的网络参数。

9月30日周三
9月26日周六
7月26日周日
  1. Berkeley AI Research38

    ABBEL:通过信念状态更新优化长程交互 LLM 效率

    Berkeley AI Research 提出 ABBEL 框架,将摘要重构为受监督的自然语言信念状态,以解决递归摘要导致的性能损耗。 在 CollabBench 协作编码任务中,结合重构型信念评分的 ABBEL 将全上下文模型的性能差距缩小约 50%,且训练步数减少 50%,峰值上下文 token 数显著低于全上下文设置。

8月12日周二
7月4日周五
3月15日周五
  1. Hugging Face Blog39

    Hugging Face 发布 WebSight 数据集,助力 VLM 将网页截图转换为 HTML

    Hugging Face 开源了 WebSight-v0.2 数据集及微调模型 Sightseer,旨在利用视觉语言模型将网页截图转换为 HTML 代码。该数据集包含 200 万个合成示例,相比 v0.1 版本采用了真实图像和 Tailwind CSS,显著提升了数据质量。Sightseer 模型基于此微调,能够生成包含图像的功能性 HTML,致力于简化 UI 设计到代码的转化流程。

11月17日周四
12月15日周三
  1. Hugging Face Blog33

    Perceiver IO:适用于任意模态的可扩展全注意力模型

    Hugging Face Transformers 新增 Perceiver IO,这是首个基于 Transformer 且适用于文本、图像、音频、视频及点云等任意模态及其组合的模型。该架构在潜在变量上使用自注意力,使计算量独立于输入大小,仅线性依赖输入规模。模型支持 256 或 512 个潜在变量,可实现图像分类及光流预测等任务。

3月20日周一