← 全部文章

Simplex P0:从看见人,到理解交互意图

融合声音、目光、姿态与表情,让机器人持续理解现场;分享在地瓜 S100 上实现 10 fps 连续决策的阶段性进展。

人类意图理解,是人机交互中一个重要而具体的问题:眼前的人是在和 AI 说话,还是在和旁边的人聊天?他只是路过,还是正准备发起一次交互?

今天,我们分享 Simplex P0 的最新进展。它面向下一代人机交互感知系统,希望让 AI 在听到一句指令之前,就能持续理解现场,以及人和它之间的关系。

唤醒词之后,交互还缺少什么

唤醒词为语音系统建立了一个明确入口,也降低了误唤醒的机会。常见流程是:检测到唤醒词,再把随后的一句话交给 AI 处理,最后返回回答。

这套方式很实用,但面对多人、移动和持续交谈的现场,仅靠一次唤醒很难回答后续问题:谁在说话?话是对谁说的?用户是否还在参与?机器人现在应该回应、等待,还是把注意力转向别处?

我们希望把“是否正在与我交互”变成持续更新的判断,而不是只在一句话开始前判断一次。

把分散的信号放回同一个现场

P0 的感知方向覆盖声纹特征、阵列麦克风方向、语音语义内容,以及人的手势、头部朝向、眼神、脸部表情、面部特征和说话状态。这些线索需要与时间和人物对应起来,才能帮助系统理解意图。

看向机器人,不一定是在请求回答;有人开口,也不意味着机器人应该接话。目光、声音、动作和对话上下文相互补充,系统才有机会分辨“准备交互”“仍在倾听”“转身离开”以及一些简单动作意图。

除了这些面向交互的信号,P0 也探索视频 VLM 所支持的场景理解能力,让现场判断能够利用更丰富的视觉信息。

感知表现与连续决策

按照团队目前的评测结论,P0 在眼神追踪、说话人检测,以及手势、表情和人脸识别等任务中,达到或超过所比较的前沿单任务模型,取得 SOTA 水平的阶段性结果

这里描述的是团队当前测试范围内的结论,并不意味着所有数据集、所有硬件与所有条件下都领先。各任务的对照模型、数据划分和指标将随后续评测报告分别展开;本文先介绍系统方向与交互价值。

面向实际交互,我们追求 10 Hz 以上的连续决策。感谢合作伙伴 地瓜机器人:在地瓜 S100 上,我们已经能够运行 10 fps 的连续决策。这个数字对应当前部署配置的处理频率,不等同于任意视频 VLM 请求都能在 100 ms 内完成,也不替代端到端延迟测量。

从被叫醒,到自然地参与

连续感知让机器人有机会在用户正式开口之前,察觉即将发起交互的信号;也能在用户离开、转向他人或结束交流时,及时调整自己的行为。

这为无需唤醒词的自然交互提供了基础。感知输出仍需要与对话状态、行动规则和不确定性处理共同工作:不确定时继续观察,而不是把每次目光接触都当作指令。

接下来,我们会用实际演示呈现多人交互、接近与离开、说话对象判断等场景,并补充各任务的评测口径。

演示视频整理中:S100 连续感知与免唤醒词交互。