资讯
Can LLMs Engineer Their Own Agent Harness? ByteDance Seed’s HarnessDev Says Only 34 of 64 Changes Generalize
📋总体概括
字节跳动Seed联合SUTD、佐治亚理工、M-A-P和TokenWave.AI推出HarnessDev基准,评估模型自主构建的「可运行agent harness」而非其给出的答案。6个创建型LLM从0分种子出发,在5个基准、2207个任务上迭代进化harness。结果显示自建harness在写作与ML实验任务上追平人类参考实现,但在代码与搜索任务上落后;64项进化改动中仅34项在保留任务上方向一致,泛化能力仍是硬伤。
⚡关键信息
- ▸字节Seed联合SUTD、佐治亚理工等机构发布HarnessDev基准,评估模型构建的可运行harness而非答案本身
- ▸6个创建型LLM从0分种子harness起步,基于执行反馈迭代进化
- ▸实验覆盖5个基准、共2207个任务
- ▸自建harness在写作和ML实验任务上追平人类参考,代码与搜索任务仍落后
- ▸64项进化改动中仅34项在保留任务上方向一致,泛化性有限
🔥犀利点评
这个基准戳中了agent领域的软肋:大家都在卷模型答题,却没人测模型能不能造好答题的脚手架。结果很诚实——一半的『自我改进』换到新任务就翻车,说明所谓的进化更多是过拟合执行反馈,而非真正理解harness设计原理。写作类任务能追平人类,本质是这类任务容错高、反馈信号清晰;代码和搜索落后则暴露反馈稀疏时自我进化就失灵。别急着喊『AI造AI』,离稳定自举还远。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文 →