资讯

Can LLMs Engineer Their Own Agent Harness? ByteDance Seed’s HarnessDev Says Only 34 of 64 Changes Generalize

marktechpost.com·2026/9/11 22:01:08🔗 原文

📋总体概括

字节跳动Seed联合SUTD、佐治亚理工、M-A-P和TokenWave.AI推出HarnessDev基准,评估模型自主构建的「可运行agent harness」而非其给出的答案。6个创建型LLM从0分种子出发,在5个基准、2207个任务上迭代进化harness。结果显示自建harness在写作与ML实验任务上追平人类参考实现,但在代码与搜索任务上落后;64项进化改动中仅34项在保留任务上方向一致,泛化能力仍是硬伤。

关键信息

  • 字节Seed联合SUTD、佐治亚理工等机构发布HarnessDev基准,评估模型构建的可运行harness而非答案本身
  • 6个创建型LLM从0分种子harness起步,基于执行反馈迭代进化
  • 实验覆盖5个基准、共2207个任务
  • 自建harness在写作和ML实验任务上追平人类参考,代码与搜索任务仍落后
  • 64项进化改动中仅34项在保留任务上方向一致,泛化性有限

🔥犀利点评

这个基准戳中了agent领域的软肋:大家都在卷模型答题,却没人测模型能不能造好答题的脚手架。结果很诚实——一半的『自我改进』换到新任务就翻车,说明所谓的进化更多是过拟合执行反馈,而非真正理解harness设计原理。写作类任务能追平人类,本质是这类任务容错高、反馈信号清晰;代码和搜索落后则暴露反馈稀疏时自我进化就失灵。别急着喊『AI造AI』,离稳定自举还远。

本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文