资讯

机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理

量子位2·2026/9/4 09:19:29🔗 原文

📋总体概括

星尘智能(Astribot)基座模型团队发布名为SmoothRL的在线强化学习框架,核心特点是支持异步执行,使在线强化学习训练能够跟上大模型的异步推理速度。该框架瞄准机器人领域一个现实痛点:真实环境中机器人无法像离线训练那样停下来等待模型推理完成,异步设计让策略学习与推理流水线并行,缩短训练反馈周期。这反映出具身智能公司开始自研底层训练框架,而非仅依赖通用RL库。

关键信息

  • 星尘智能基座模型团队发布在线强化学习框架SmoothRL,主打异步执行能力
  • 核心卖点是让在线RL跟上大模型异步推理的节奏,解决训练与推理速度不匹配问题
  • 针对机器人真实交互场景:机器人不能停下来等待模型,训练必须实时在线进行
  • 发布主体为具身智能公司自研的基座模型团队,而非学术机构或通用框架厂商

🔥犀利点评

别急着高潮,这是一条信息量极低的官宣:没有性能对比、没有开源细节、没有论文支撑,所谓「跟上大模型异步推理」更像是工程优化的包装话术。但方向本身值得肯定——机器人在线RL的瓶颈确实在采样与推理的时延错配上,谁先把异步流水线做扎实,谁就在真机训练上抢出实打实的数据优势。星尘自研框架说明他们已越过拼demo阶段,开始囤训练基础设施,这比发布一支会叠衣服的机械臂更有长期价值。

本文由本站自动聚合,以下为原始来源:前往 量子位2 阅读全文