资讯

机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理

量子位3·2026/9/4 09:19:29🔗 原文

📋总体概括

星尘智能(Astribot)基座模型团队发布SmoothRL,一个支持异步执行的在线强化学习框架,定位解决机器人学习中物理执行与模型推理速度不匹配的问题。传统在线RL需机器人动作与环境交互逐步进行,受限于真实物理执行节奏,难以借力大模型推理吞吐。SmoothRL将策略推理与执行解耦异步化,让训练和交互流程跟上大模型的异步推理架构,为具身智能模型的高效在线训练提供工程框架。

关键信息

  • 星尘智能基座模型团队正式发布SmoothRL在线强化学习框架
  • 核心卖点是支持异步执行,将机器人交互与模型推理解耦
  • 定位解决机器人动作执行节奏慢于大模型推理的瓶颈问题
  • 目标是让在线RL训练流程能适配大模型的异步推理架构
  • 属于具身智能基座模型训练基础设施层面的技术发布

🔥犀利点评

机器人在线RL的痛点确实真实:物理世界不打折速,动作等待推理是常态。星尘点出「机器人不能停下来等模型」这个矛盾是对的,异步化也是能想到的正路。但这类框架发布和「落地有效」之间隔着十万八千里——异步执行的稳定性、收敛性、跨本体泛化,没有实验数据和开源细节之前,更像团队基建成果的PR稿。具身智能领域框架满天飞,最后比拼的还是谁家的机器人真的在物理世界里学得更快,先看后续开源和复现。

本文由本站自动聚合,以下为原始来源:前往 量子位3 阅读全文