跳到正文
原文
AIHOT公开聚合:原始报道发现·· AI 评分47

Qwen2.5 单步梯度的不合理效率

The Unreasonable Efficiency of a Single Gradient Step

AI 导读

将 Qwen2.5-1.5B 的第一步梯度放大 1000x,在 MATH 上准确率达 66.7%,超过 500 步 RL 模型的 63.8%。作者称提升主要来自修复基座模型的重复循环:1,155 道被纠正题中,72.0% 的基座输出出现大量重复。

来源:AIHOT公开聚合:原始报道发现 · labs.baseten.co