跳到正文
热点事件观察中

Qwen2.5单步梯度放大在MATH上超越多步RL

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

2026年10月2日8时,AIHOT公开聚合了一项原始报道发现,该发现关注Qwen2.5单步梯度的不合理效率。报道称,将Qwen2.5-1.5B的第一步梯度放大1000倍,在MATH上准确率达66.7%,超过500步强化学习模型的63.8%。作者称提升主要来自修复基座模型的重复循环:1155道被纠正题中,72.0%的基座输出出现大量重复。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. AIHOT公开聚合:原始报道发现
    Qwen2.5 单步梯度的不合理效率

    将 Qwen2.5-1.5B 的第一步梯度放大 1000x,在 MATH 上准确率达 66.7%,超过 500 步 RL 模型的 63.8%。作者称提升主要来自修复基座模型的重复循环:1,155 道被纠正题中,72.0% 的基座输出出现大量重复。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。