Simplex VM0:让长期记忆回到可核对的证据
从生活记录到多模态对话:分享 VM0 在 EgoLifeQA、ATM-Bench 与 Mem-Gallery 上的阶段性测试结果,以及我们对长期交互记忆的思考。
“上次提到的那件事,后来怎么样了?”
对一个长期陪伴用户的机器人或交互系统来说,这类问题很自然。对系统来说,它要求的不只是找到一句相似的话:它需要辨认同一件事在不同时间的变化,把回答放回正确的时间点,并找到能够支持答案的记录。
Simplex VM0 是我们面向长期交互场景持续探索的记忆系统。最近,我们在 EgoLifeQA、ATM-Bench 和 Mem-Gallery 上做了一轮测试。这篇文章先分享阶段性结果,以及这些结果对长期记忆意味着什么。
阶段性 SOTA:让成绩与评测口径一起呈现
根据团队目前的评测与对比,Simplex VM0 在所评估的长期记忆任务上取得了 SOTA 水平的阶段性成绩。下面保留各项结果与测试口径,便于理解这一结论的适用范围。它是团队评测结论,不等同于已经获得官方榜单认证;不同输入、数据划分和评审模型下的数字不能直接横向比较。
从“记得”到“能回答”
长期记忆的难点往往出现在信息之间。一个名字可能在多次对话里出现,一张图片可能补充文字没有描述的细节,一条新消息也可能更新此前的计划。检索到相关内容只是第一步;系统还需要判断哪些内容属于同一个事件、哪些信息在问题所指的时间仍然有效。
我们的关注点是让回答能够回到来源与时间,而不只是生成一个听起来合理的故事。VM0 的这轮评测覆盖了生活记录问答、多来源个人信息,以及多模态对话记忆三个方向。
EgoLifeQA:在长期生活记录中找答案
在内部整理的 manual-2.9K 评测集合上,VM0 答对了 2,905 道题中的 2,150 道,准确率为 74.01%。其中一道题因时间戳异常未能正常作答,仍计入总题数。
在官方 A1_JAKE 的 500 道题上,结果为 421 / 500,准确率 84.20%。两个集合存在重叠,覆盖范围也不同:A1_JAKE 是单一佩戴者的子集,因此不能把这两个数字当作同一难度下的直接比较。
本轮输入使用数据集提供的稠密视频描述与生活日志文本,并按问题时间截断可见记录,避免使用未来信息。因此,这里的结果衡量的是基于这些描述的记忆与问答能力,而不是从原始视频像素开始的端到端理解能力。
ATM-Bench 与 Mem-Gallery:换一种方式考记忆
ATM-Bench 把问题放进更多样的个人信息环境中;Mem-Gallery 则关注多模态长期对话记忆。它们补充了单一选择题准确率看不到的一些能力。
| 评测范围 | 规模 | 本轮结果 |
|---|---|---|
| ATM-Bench 普通集 | 1,013 题 | QS 85.78% |
| ATM-Bench Hard | 31 题 | QS 66.91% |
| Mem-Gallery | 1,711 题 | 归一化评审均分 91.64% |
这些都是我们的内部系统评测结果,尚不是官方榜单认证成绩。ATM-Bench 的 QS 和 Mem-Gallery 的评审均分也不是选择题准确率,不能横向相加或平均。
这两项测试使用 GLM-5.3-Flash 进行评审;评审模型差异会影响与其他报告的可比性。ATM-Bench 普通集与 Hard 集使用了不同版本的评测流程,Hard 集增加了原始图像核验;这些数据也参与过开发迭代,因此应作为阶段性开发评测阅读,而不是未接触过的独立测试结果。
对长期交互意味着什么
这些结果让我们更有信心继续把记忆接入持续运行的交互系统:让系统能接上过去的话题,在记录发生变化时更新理解,并在需要的时候找到可核对的依据。
它们也留下了明确的问题。ATM-Bench Hard 上的结果仍有较大改进空间;不同评测里的错误,也不能都归因于“没有记住”。检索、时间理解、视觉信息利用和最终回答都可能影响结果。这次公布的是完整系统的表现,我们还没有据此把收益分配给某一个模块。
后续我们会补充更完整的测试整理与实际交互案例。对 VM0 来说,长期目标始终很具体:当用户回到一件过去的事时,系统能够接得上,也说得清。