资讯

Sierra Open-Sources Hyper-τ-Bench, a Benchmark for Agent Construction

unite.ai·2026/9/8 22:57:02🔗 原文

📋总体概括

Sierra于2026年9月8日宣布开源hyper-τ-bench,这是一个长时程基准,用于评测AI编码智能体能否真正构建出一个可用的客服智能体。结果显示,最强的自动化配置在留出评测任务上的通过率仅为23.9%,而一名工程师搭配前沿模型的参考组合通过率达82.2%,两者差距近60个百分点。该基准将行业关注点从「智能体执行任务」推进到「智能体构建智能体」,暴露出当前自动化编码智能体在长时程复杂工程任务上的真实能力远低于宣传水平。

关键信息

  • Sierra于2026年9月8日开源hyper-τ-bench,评测对象为能否构建可用客服智能体的AI编码智能体
  • 最强自动化配置通过率仅23.9%,人机参考组合达82.2%,差距约58个百分点
  • 该基准属于长时程评测,考察多步骤复杂工程能力而非单轮编码
  • Sierra曾于2024年推出原版τ-bench,主题是评测智能体自身执行任务的能力
  • 新基准把评测维度从「执行智能体」升级为「构建智能体」

🔥犀利点评

23.9%对82.2%,这组数字比任何营销文案都诚实。行业天天喊「智能体取代工程师」,hyper-τ-bench直接把最难的工程活儿——构建一个能扛住真实用户的客服智能体——摆上台面,结果自动化方案连四分之一都过不了。Sierra作为客服智能体公司亲自下场出题,等于告诉市场:别再拿单轮代码生成刷分了,长时程多步骤的系统性工程才是照妖镜。这个基准的开源价值在于给所有人一把统一的尺子,也让「AGI快来了」的叙事多了一道冷水的闸门。

本文由本站自动聚合,以下为原始来源:前往 unite.ai 阅读全文