LEGO-Anything:AI 智能体能从照片构建 3D 场景,却无法判断是否正确
LEGO-Anything 让编码智能体从单张照片编写可执行 Blender 程序构建 3D 场景,但智能体的几何判断接近或低于随机水平。团队在含 208 张图像、104 个场景的 LEGO-Bench 上测试,六种 GPT 配置几乎总能交出可用场景,最佳的 GPT-6 Astra 室内准确率为 53.4%、室外为 39.6%,较弱配置约 15%。
LEGO-Anything 让编码智能体从单张照片编写可执行 Blender 程序构建 3D 场景,但智能体的几何判断接近或低于随机水平。团队在含 208 张图像、104 个场景的 LEGO-Bench 上测试,六种 GPT 配置几乎总能交出可用场景,最佳的 GPT-6 Astra 室内准确率为 53.4%、室外为 39.6%,较弱配置约 15%。
将 Qwen2.5-1.5B 的第一步梯度放大 1000x,在 MATH 上准确率达 66.7%,超过 500 步 RL 模型的 63.8%。作者称提升主要来自修复基座模型的重复循环:1,155 道被纠正题中,72.0% 的基座输出出现大量重复。
何恺明团队提出纯视觉方案NAT-ARC,用ImageNet做MAE预训练、不靠LLM,0.6B单模型在ARC-1上pass@2达63.4%。集成三种预训练策略后达70.2%、总参数约2B,论文称这是纯视觉方案首次逼近8B语言模型The ARChitects的71.6%。
斯坦福团队HomeBody项目将GPT-6 Astra接上宇树G1,机器人可在未见过的厨房按语言指令收拾物品、丢纸盒并找出不在眼前的药。团队表示,部署到该新厨房无需额外采集训练数据,也无须再训练专用动作策略,由Astra调用导航、抓取、开抽屉等技能完成任务。感知与规划运行在搭载RTX 4090的笔记本上,Astra在远端决策,但仍有API成本、推理等待和手指舵机过热等限制。