资讯
基元律动发布模型NeoHorse,探索Harness驱动的RSI路径
📋总体概括
基元律动(TokenRhythm)联合无问芯穹、清华、北大、阿里等机构发布首个Agent-Native模型NeoHorse-1,含4B与9B两个版本。该公司由前华为诺亚方舟实验室主任王云鹤创办,此前的开源Routing Harness系统OpenSquilla负责为Agent任务选择和组织模型,NeoHorse则将这条路线延伸到模型训练本身:以Routing Harness产生的执行轨迹为核心语料做后训练,并结合在策略蒸馏。报告称4B版本在11项基准中未加权平均分居4B级最高,并在五项基准上超过Qwen3.5-9B底座,被团队定位为递归自我改进(RSI)的单轮工程验证。
⚡关键信息
- ▸NeoHorse-1为首个Agent-Native模型,含4B/9B两版本,由基元律动联合无问芯穹、清华、北大、阿里等机构推出
- ▸训练语料以Routing Harness(含OpenSquilla)产生的执行轨迹为核心,保留路由选择、工具调用和环境反馈,经多重质量评估后用于后训练
- ▸采用路由信号安排训练顺序,结合Agent执行监督和在策略蒸馏更新模型
- ▸在11项Agent执行、工具交互、代码和指令遵循基准评测中,NeoHorse 4B未加权平均分居4B级最高,五项基准超过Qwen3.5-9B底座
- ▸改善集中在流程清晰、结果可验证的任务,复杂状态维护、长程调试等场景大模型仍占优势,该工作被定位为RSI的单轮工程验证
🔥犀利点评
把Harness的路由轨迹变成训练数据,思路确实新鲜——相当于让模型吃自己运行时的经验,而不是堆静态语料。但要看清两点:一是4B靠流程性任务刷分超过9B底座,赢的多是可验证的短链路任务,长程调试照样打不过大模型,这说明小模型Agent化的天花板仍在;二是RSI单轮验证离真正的递归自我改进差得很远,目前只是数据飞轮的第一圈。方向值得押注,成色还需看这轮飞轮能不能转起来。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 雷峰网 阅读全文 →