⏶18
EdgeBench: 揭示从真实世界环境学习的扩展定律
发表
由
taesiri 提交
作者: Deyao Zhu, Xin Zhou, Shengling Qin, Xuekai Zhu, Hangliang Ding, Shu Zhong, Zixin Wen, Zhonglin Xie, Chenhui Gou, Linxuan Ren, Yueyang Wang, Junfeng Zhong, Rui Liu, Tian Gao, Yangguang Lin, Jingyuan Zhang, Maojia Song, Xuan Qi, Jinhong Wu, Chenyang Zhang, Yinzhu Piao, Ziru Niu, Hongbin Lin, Lingxiang Meng, Peng Tang, Chengyao Tang, Shanyu Wu, Huanyu Zheng, Yu Liu, Liya Zhu, He Wang, Ming Ding, Ziyu Wan, Hao Liu, Sibo Wang, Haotian Zhu, Xintian Zhang, Nan Chai, Yipeng Liu, Panhao Lai, Sihang Yuan, Zixin Su, Ge Zhang, Wangchunshu Zhou, Yantao Du, Wenhao Huang, Guang Shi
摘要
AI 生成总结
对 38,000 小时真实世界智能体交互的分析揭示了在 134 项不同任务中,性能的对数 sigmoid 缩放定律和指数级学习速度提升。预训练缩放定律表明,模型能力会随着数据和计算的增加而可预测地提高。但在部署后从真实世界环境中学习的机制仍然知之甚少。通过分析智能体在 134 个真实世界任务中与环境交互的大约 38,000 小时,我们首次发现(据我们所知),环境学习期间的整体性能遵循对数-S 形缩放定律,精度极高,R^2 达到 0.998。在不同模型世代中,我们还发现智能体的学习速度大约每三个月翻一番。这一发现源于 EdgeBench,一个包含 134 个超长时程真实世界任务的套件,涵盖科学发现、软件工程、组合优化、专业知识工作、形式数学和交互式游戏。每个任务都在丰富、多层次的反馈下维持至少 12 小时的连续智能体操作,并通过大量的专家努力构建。我们公开了 51 个任务和我们完整的评估框架,以加速对智能体如何从真实世界经验中学习的研究。