亚马逊与杜克大学研究:大模型后训练中极端稀疏监督提升推理能力
亚马逊公司和杜克大学最新研究表明,大模型后训练中仅需保留极少量 token 的梯度信号即可显著提升推理能力。实验中,对 Qwen3 系列模型仅随机保留 0.025% 的 token 进行监督,学生模型的推理性能不仅未下降,反而超过全信号训练甚至教师模型本身。该极端稀疏监督机制在代码推理、Llama 系列及 RLVR 场景中均得到验证,且仅更新了 10% 的网络参数。
亚马逊公司和杜克大学最新研究表明,大模型后训练中仅需保留极少量 token 的梯度信号即可显著提升推理能力。实验中,对 Qwen3 系列模型仅随机保留 0.025% 的 token 进行监督,学生模型的推理性能不仅未下降,反而超过全信号训练甚至教师模型本身。该极端稀疏监督机制在代码推理、Llama 系列及 RLVR 场景中均得到验证,且仅更新了 10% 的网络参数。
SpatialClaw 重新思考智能体空间推理的动作接口 论文: https://huggingface.co/papers/2606.13673
Training Object Permanence in World Models paper: https://huggingface.co/papers/2609.28654
Berkeley AI Research 提出 ABBEL 框架,将摘要重构为受监督的自然语言信念状态,以解决递归摘要导致的性能损耗。 在 CollabBench 协作编码任务中,结合重构型信念评分的 ABBEL 将全上下文模型的性能差距缩小约 50%,且训练步数减少 50%,峰值上下文 token 数显著低于全上下文设置。
Hugging Face 发布了 FilBench 评测套件,专门评估 LLM 在 Tagalog、Filipino 和 Cebuano 三种语言中的流畅度、语言学能力、翻译能力及文化知识。
Hugging Face 开源了 WebSight-v0.2 数据集及微调模型 Sightseer,旨在利用视觉语言模型将网页截图转换为 HTML 代码。该数据集包含 200 万个合成示例,相比 v0.1 版本采用了真实图像和 Tailwind CSS,显著提升了数据质量。Sightseer 模型基于此微调,能够生成包含图像的功能性 HTML,致力于简化 UI 设计到代码的转化流程。