资讯

我用 Hermes 极限测试了 GPT-6/Astra:这真的是 AGI 吗?

B站-科技区·2026/9/7 22:26:05🔗 原文

📋总体概括

UP主借助Hermes(可通过Discord等聊天工具远程控制电脑的AI助手)对OpenAI新发布的Astra(即GPT-6)进行极限测试,验证其是否达到传言中的AGI水平。测试包含四个硬核任务:在Blender中生成含埃菲尔铁塔、凯旋门、卢浮宫等地标的巴黎城市3D模型,以及从零手搓一款游戏等。视频通过真实操作展示GPT-6在多步骤、跨软件复杂任务中的实际能力边界。

关键信息

  • OpenAI发布全新模型Astra(GPT-6),外界传言其已达到AGI水平
  • 测试工具Hermes是可通过Discord等聊天应用直接控制电脑的AI助手
  • 3D建模测试中GPT-6在Blender生成巴黎城市模型,包含埃菲尔铁塔、凯旋门和卢浮宫等地标
  • 测试共设四个硬核任务,涵盖3D建模、游戏开发等多个领域
  • 测试思路是让模型在真实软件环境中执行端到端任务,而非仅做问答评测

🔥犀利点评

用『能不能干活』而非『答得对不对』来检验AGI,这个思路比跑分榜单靠谱得多。但注意:跑通Blender脚本和真的具备持续自主完成复杂项目的能力之间隔着鸿沟,演示视频最容易把一次成功剪辑成『稳定能力』。AGI的定义模糊恰恰是营销最好的温床,先看这四个任务里翻车了几个再下结论。

本文由本站自动聚合,以下为原始来源:前往 B站-科技区 阅读全文