跳到正文
机器之心·· 1 天前AI 评分40

亚马逊与杜克大学研究:大模型后训练中极端稀疏监督提升推理能力

万分之一——大模型后训练中的极端稀疏监督

AI 导读

亚马逊公司和杜克大学最新研究表明,大模型后训练中仅需保留极少量 token 的梯度信号即可显著提升推理能力。实验中,对 Qwen3 系列模型仅随机保留 0.025% 的 token 进行监督,学生模型的推理性能不仅未下降,反而超过全信号训练甚至教师模型本身。该极端稀疏监督机制在代码推理、Llama 系列及 RLVR 场景中均得到验证,且仅更新了 10% 的网络参数。

来源:机器之心 · mp.weixin.qq.com