← 全部文章

MicroCF 发布:理解对话中的接话与让话时机

我们发布 MicroCF:结合 VAD 与,判断何时接话、何时让出话轮,并分享 TurnBench 公开评测结果。

对话,不只是轮流输出答案

一个好用的语音智能体,需要在合适的时刻回应,也需要在人开始接话时及时让出话轮。我们发布 MicroCF,围绕 Conversation Flow,也就是对话的流动,处理其中两个具体问题:轮次结束检测(EOT)打断检测(INT)

MicroCF 是我们在 Interaction Model 方向上的一次发布。目前可以阅读完整的项目介绍,以及 TurnBench 公开模型页面。该评测条目于 2026 年 9 月 13 日由 SPX-AI(Simplex AI)提交。

既看现在有没有声音,也看对话是否还会继续

语音活动检测 VAD 描述当前是否存在语音。但一句话中的停顿,并不一定意味着说话者已经表达完毕。语音活动预测 则依据已经观察到的音频,估计接下来的说话活动。

MicroCF 结合这两类信号,判断话轮是否结束,以及另一位参与者是否正在接过话轮。EOT 与 INT 使用各自的时序状态和评测配置。事件在满足确认条件时发出,而不会被提前记到停顿刚开始的时刻。

TurnBench 公开测试集成绩

截至 2026 年 9 月 21 日,MicroCF 在 TurnBench 模型页面展示的结果为:

任务 召回率 误触发率 检测延迟中位数 按召回率排名
轮次结束检测 90.6% 7.9% 678 ms 第 3 / 20
打断检测 98.4% 7.3% 747 ms 第 1 / 18

这组数字来自页面中的 Test Performance,即独立测试集结果。榜单按召回率排序;排名本身不能概括误触发和延迟表现。后续有新提交时,排名也可能变化。

TurnBench 模型页面中 MicroCF 的测试集成绩

图片来源:TurnBench — SPX-AI MicroCF,截图于 2026 年 9 月 21 日。此面板展示测试集表现。

开发集结果,单独呈现

项目页记录了 38 段开发集对话,约 7.31 小时音频上的结果:EOT 召回率 90.13%、误触发率 10.16%、延迟中位数 681.5 ms;INT 召回率 98.56%、误触发率 7.05%、延迟中位数 771 ms。下面的 TurnBench 图表展示了经过取整的开发集数值。

MicroCF 开发集 EOT 的召回率、误触发率与延迟分布

TurnBench 开发集 EOT 面板,截图于 2026 年 9 月 21 日。这是开发集结果,与上面的测试集表格分开解读。

MicroCF 开发集 INT 的召回率、误触发率与延迟分布

TurnBench 开发集 INT 面板,截图于 2026 年 9 月 21 日。延迟分布用于补充理解中位数。

开发集参与了评测配置选择。此前已查看过的内部验证子集,也不作为完全未接触的保留集来表述。项目页的开发集延迟以决策所需的音频时间边界计算,不包含推理和传输开销,不能直接等同于应用的完整响应时间。

让交互时机成为可构建的能力

MicroCF 聚焦于对话时机。它不替代语音识别、语音生成,也不负责决定具体说什么,而是为交互补上一个明确环节:什么时候开始回应,什么时候让对方继续说。

项目中也介绍了 MacroCF,作为面向上下文感知 Conversation Flow 的后续研究方向。它与本次已经评测的 MicroCF 及其成绩分开呈现。

欢迎阅读 MicroCF 项目页了解策略与评测细节,或打开 TurnBench 模型页查看最新公开成绩和逐段对话的开发集分析。