热点事件观察中
Qwen2.5单步梯度放大在MATH上超越多步RL
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
2026年10月2日8时,AIHOT公开聚合了一项原始报道发现,该发现关注Qwen2.5单步梯度的不合理效率。报道称,将Qwen2.5-1.5B的第一步梯度放大1000倍,在MATH上准确率达66.7%,超过500步强化学习模型的63.8%。作者称提升主要来自修复基座模型的重复循环:1155道被纠正题中,72.0%的基座输出出现大量重复。
AI 根据报道生成 · 1 小时前更新
最新进展10月2日 08:00
AIHOT于10月2日公开聚合该发现,称放大第一步梯度后MATH准确率达66.7%。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- AIHOT公开聚合:原始报道发现Qwen2.5 单步梯度的不合理效率
将 Qwen2.5-1.5B 的第一步梯度放大 1000x,在 MATH 上准确率达 66.7%,超过 500 步 RL 模型的 63.8%。作者称提升主要来自修复基座模型的重复循环:1,155 道被纠正题中,72.0% 的基座输出出现大量重复。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。