Qwen2.5 单步梯度的不合理效率
将 Qwen2.5-1.5B 的第一步梯度放大 1000x,在 MATH 上准确率达 66.7%,超过 500 步 RL 模型的 63.8%。作者称提升主要来自修复基座模型的重复循环:1,155 道被纠正题中,72.0% 的基座输出出现大量重复。
将 Qwen2.5-1.5B 的第一步梯度放大 1000x,在 MATH 上准确率达 66.7%,超过 500 步 RL 模型的 63.8%。作者称提升主要来自修复基座模型的重复循环:1,155 道被纠正题中,72.0% 的基座输出出现大量重复。
何恺明团队提出纯视觉方案NAT-ARC,用ImageNet做MAE预训练、不靠LLM,0.6B单模型在ARC-1上pass@2达63.4%。集成三种预训练策略后达70.2%、总参数约2B,论文称这是纯视觉方案首次逼近8B语言模型The ARChitects的71.6%。