Simplex 全双工交互模型预览:让 Agent 走进物理世界
将流式交互、社会化感知、长期记忆、编程与具身行动放进统一框架,分享小型人形机器人上的初步 PoC。
过去一年,我们一直在探索一个问题:能否把旗舰大模型的推理与编程能力,带进一个能看、能听、能说、能行动,而且随时可以被打断的机器人?
我们已经完成了初步模型构建,并在一台小型人形机器人上进行了概念验证。这篇文章先分享 Simplex 全双工交互模型的研究路线,以及目前这个原型能让我们看到什么。
把旗舰模型的能力带进连续的现场
传统的轮次式交互有一个清楚的边界:用户输入结束,模型开始生成,再等待下一次输入。但物理世界不会等待一段回答完成。人会插话、转身,物体会移动,新事件也可能改变机器人正在执行的任务。
我们希望模型能够一边接收新的视觉与音频信息,一边思考、表达和行动;新信息到来时,可以插入当前过程,改变或中断接下来的输出。这也是我们所说的全双工多模态交互:输入与输出在时间上持续交织,而不是一问一答地排队。
这条路线另一个重要目标,是控制 alignment tax(对齐与适配带来的原有能力损失)。把模型改造成实时交互系统,不应该轻易牺牲它原有的推理、编程和常识理解。初步探索让我们看到了有限损失下保留这些能力的可能性,完整的前后对照评测仍将另行整理。
一套预训练框架,多种时间尺度
我们的方法围绕特殊构造的预训练任务,以及一种全双工时分复用策略展开。本文先不展开任务构造和内部实现,重点介绍它要解决的矛盾:机器人不同能力的时间尺度并不相同。
动作控制需要频繁更新;外部事件需要及时判断;长期记忆检索和编程则可能持续更久。我们尝试将传统大模型、coding agent、具身导航与操作、社会化感知、多模态长期记忆,以及流式语音交互放进同一套预训练框架,让这些能力能够协作。
| 能力环节 | 当前探索中的节奏与作用 |
|---|---|
| 动作指令下发 | 以 200 Hz 连续下发,维持动作控制节奏 |
| 外部视听事件判断 | 约 200 ms 的自主判断触发节奏,决定是否需要介入 |
| 记忆与编程 | 按任务需要低频调用,与持续交互配合 |
| 训练 | 面向预训练与后训练 RL,探索全链路可微优化 |
200 Hz 指的是动作指令下发频率,不表示旗舰模型每秒独立完成 200 次完整推理。 同样,事件判断节奏与机器人完成一次外部响应的延迟,是不同的测量对象。
为什么我们相信这条路线
我们倾向于把 VLA、WAM 等能力理解为更大智能系统中的组成部分,而不是具身智能的全部终点。导航和操作很重要,但一个通用机器人还可能需要读文档、写代码、理解社会情境、回忆之前发生的事,再把这些能力连接到眼前的任务。
我们的判断是:值得投入的方向,是尽可能激发旗舰模型对物理世界的理解,同时保留它在数字世界中的能力,并让推理以低延迟、可扩展、能接受实时反馈和随时被打断的形式运行。
这是我们选择研究路线的理由,不是关于某一模型家族必然胜出、或者现有路线已经失效的结论。
当现成数据没有覆盖这种交互
一段机器人任务可能同时包含多人交谈、记忆调用、移动和操作,途中甚至需要写一段代码。这样的组合,并不是现有机器人数采流程通常覆盖的内容。
过去一年的探索中,我们找到了一种处理这类训练需求的方法,并完成了支持这些能力的初步模型构建。具体数据构造与训练细节会在适当阶段分享。目前,我们也在人的状态感知与意图理解、长期记忆及全双工交互方向,以较低成本取得了一些主流评测上的阶段性进展;各项结果会分别报告,避免用单一数字概括整套系统。
在小型人形机器人上的 PoC
按照团队当前原型测试,小型人形机器人已经将多人交互、社会化感知、长期记忆、编程,以及导航能力放进同一个验证系统中;它能够实时以 200 Hz 下发动作指令,并在已测场景中于 300 ms 内对外界刺激作出反应。
这里的 300 ms 是当前 PoC 场景的观察结果,不是所有输入、负载与动作下的延迟保证。后续演示与报告会进一步说明响应的起止点、测试条件和延迟分布。框架对全身导航操作与更广泛任务的支持,也需要继续在实际场景中验证。
每天看着这个有点“活”的、胖胖的小东西来回转头、看人、走动和玩耍,还是很有意思的。它让我们觉得,把 agent 的能力伸入物理世界,做一个能做、能看、能听、能说、能走的机器人,也许已经有了一个不错的起点。
研究预览:演示视频与完整评测正在整理中。本文介绍初步模型和 PoC 进展,尚非公开产品发布或通用能力验收。