Qwen2.5 单步梯度的不合理效率
将 Qwen2.5-1.5B 的第一步梯度放大 1000x,在 MATH 上准确率达 66.7%,超过 500 步 RL 模型的 63.8%。作者称提升主要来自修复基座模型的重复循环:1,155 道被纠正题中,72.0% 的基座输出出现大量重复。
将 Qwen2.5-1.5B 的第一步梯度放大 1000x,在 MATH 上准确率达 66.7%,超过 500 步 RL 模型的 63.8%。作者称提升主要来自修复基座模型的重复循环:1,155 道被纠正题中,72.0% 的基座输出出现大量重复。
丘成桐参与的最新论文在致谢中感谢GPT 6 Astra和Claude Pro,称它们在部分证明策略的探索和计算中提供了帮助。该论文宣称已证明七维空间全部28种球面都能配上截面曲率严格为正的度量,这一问题由丘成桐于1982年列入其问题清单。
何恺明团队提出纯视觉方案NAT-ARC,用ImageNet做MAE预训练、不靠LLM,0.6B单模型在ARC-1上pass@2达63.4%。集成三种预训练策略后达70.2%、总参数约2B,论文称这是纯视觉方案首次逼近8B语言模型The ARChitects的71.6%。
斯坦福团队HomeBody项目将GPT-6 Astra接上宇树G1,机器人可在未见过的厨房按语言指令收拾物品、丢纸盒并找出不在眼前的药。团队表示,部署到该新厨房无需额外采集训练数据,也无须再训练专用动作策略,由Astra调用导航、抓取、开抽屉等技能完成任务。感知与规划运行在搭载RTX 4090的笔记本上,Astra在远端决策,但仍有API成本、推理等待和手指舵机过热等限制。