跳到正文
10月3日周六
  1. 机器之心40

    亚马逊与杜克大学研究:大模型后训练中极端稀疏监督提升推理能力

    亚马逊公司和杜克大学最新研究表明,大模型后训练中仅需保留极少量 token 的梯度信号即可显著提升推理能力。实验中,对 Qwen3 系列模型仅随机保留 0.025% 的 token 进行监督,学生模型的推理性能不仅未下降,反而超过全信号训练甚至教师模型本身。该极端稀疏监督机制在代码推理、Llama 系列及 RLVR 场景中均得到验证,且仅更新了 10% 的网络参数。

9月30日周三
9月26日周六
7月26日周日
  1. Berkeley AI Research38

    ABBEL:通过信念状态更新优化长程交互 LLM 效率

    Berkeley AI Research 提出 ABBEL 框架,将摘要重构为受监督的自然语言信念状态,以解决递归摘要导致的性能损耗。 在 CollabBench 协作编码任务中,结合重构型信念评分的 ABBEL 将全上下文模型的性能差距缩小约 50%,且训练步数减少 50%,峰值上下文 token 数显著低于全上下文设置。

8月12日周二
3月15日周五
  1. Hugging Face Blog39

    Hugging Face 发布 WebSight 数据集,助力 VLM 将网页截图转换为 HTML

    Hugging Face 开源了 WebSight-v0.2 数据集及微调模型 Sightseer,旨在利用视觉语言模型将网页截图转换为 HTML 代码。该数据集包含 200 万个合成示例,相比 v0.1 版本采用了真实图像和 Tailwind CSS,显著提升了数据质量。Sightseer 模型基于此微调,能够生成包含图像的功能性 HTML,致力于简化 UI 设计到代码的转化流程。