极端稀疏监督显著提升大模型推理能力
热点事件观察中
极端稀疏监督显著提升大模型推理能力
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
2026年10月3日,机器之心报道了亚马逊与杜克大学的最新研究。该研究表明,在大模型后训练阶段,保留极少量 token 的梯度信号即可提升推理能力。 实验在 Qwen3 系列模型上进行,仅随机保留 0.025% 的 token 进行监督。结果显示,学生模型的推理性能不仅未下降,反而超过全信号训练及教师模型。该机制在代码推理、Llama 系列及 RLVR 场景中得到验证,且仅更新了 10% 的网络参数。
AI 根据报道生成 · 3 小时前更新
最新进展10月3日 10:00
亚马逊与杜克大学研究:大模型后训练中极端稀疏监督提升推理能力报道时间线
沿着报道,了解事件的不同侧面。
10月3日
- 机器之心亚马逊与杜克大学研究:大模型后训练中极端稀疏监督提升推理能力
亚马逊公司和杜克大学最新研究表明,大模型后训练中仅需保留极少量 token 的梯度信号即可显著提升推理能力。实验中,对 Qwen3 系列模型仅随机保留 0.025% 的 token 进行监督,学生模型的推理性能不仅未下降,反而超过全信号训练甚至教师模型本身。该极端稀疏监督机制在代码推理、Llama 系列及 RLVR 场景中均得到验证,且仅更新了 10% 的网络参数。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。