← 全部文章

RESEARCH / MULTIMODAL DECISIONS

CMDB-1500多模态决策模型基准测试

Comprehensive Multimodal Decision Benchmark 1500

1,200 道文本题,300 道原图题,评估模型的选择与概率判断。

筛选
SPX-CDJev通用推理模型其他决策模型

查看文本榜精确数值
CMDB-1500 文本榜,固定分母 1,200,有效回答为整个评测范围覆盖
排名模型 / 版本准确率 · 0–100%答对 / 固定分母有效 / 全评测范围
01GPT 6.1 Sol · low80.00%960 / 1,2001,500 / 1,500
02SPX-CD-Pro (2026-10-04)79.33%952 / 1,2001,500 / 1,500
03Claude Sonnet 5.5 · low78.00%936 / 1,2001,500 / 1,500
04StartLux-Decision-27B · BF1677.92%935 / 1,2001,500 / 1,500
05SPX-CD-Flash77.58%931 / 1,2001,500 / 1,500
06GPT 6 Luna · low76.58%919 / 1,2001,500 / 1,500
07GLM 5.3 Flash · low75.75%909 / 1,2001,500 / 1,500
08StartLux-Decision-35B-A3B · BF1675.67%908 / 1,2001,500 / 1,500
09SPX-CD-Omni74.67%896 / 1,2001,500 / 1,500
10Mercury Decide73.92%887 / 1,2001,200 / 1,200
11pplx-decider 27B72.83%874 / 1,2001,500 / 1,500
12Jev72.17%866 / 1,2001,200 / 1,200
13Cloudflare Clef71.50%858 / 1,2001,485 / 1,500
14JPT · 9B71.33%856 / 1,2001,500 / 1,500
15Qwen 3.8 Flash71.08%853 / 1,2001,500 / 1,500
16Kimi K2.671.00%852 / 1,2001,500 / 1,500
17Mapika · Decider 4B v2.169.83%838 / 1,2001,200 / 1,200
18Cloudflare Clef-Flash69.67%836 / 1,2001,485 / 1,500
19Imajev-9B68.83%826 / 1,2001,478 / 1,500
20Kev · 9B68.67%824 / 1,2001,200 / 1,200
21DeepSeek V4.1 Flash68.58%823 / 1,2001,500 / 1,500
22JPT · 4B67.67%812 / 1,2001,500 / 1,500
23Decision Lux · 9B67.42%809 / 1,2001,200 / 1,200
24Jet · v6.2 4B66.92%803 / 1,2001,200 / 1,200
25Open-Jev · Zefan 9B66.67%800 / 1,2001,199 / 1,200
26Nimble · v2 9B66.58%799 / 1,2001,200 / 1,200
27Hopper G · 4B v1.365.92%791 / 1,2001,200 / 1,200
28Malkuth · 4B65.58%787 / 1,2001,200 / 1,200
29Hopper · 4B65.50%786 / 1,2001,200 / 1,200
30Winnow · 12B Q865.33%784 / 1,2001,410 / 1,500
31JevK564.83%778 / 1,2001,200 / 1,200
32Lev · 4B64.58%775 / 1,2001,200 / 1,200
33Mica · 4B BF16 GGUF64.25%771 / 1,2001,200 / 1,200
34Kev · 4B64.17%770 / 1,2001,200 / 1,200
35Jev-Omni · 12B63.58%763 / 1,2001,493 / 1,500
36APUS OpenJev · 9B 3000 High61.42%737 / 1,2001,085 / 1,200
37OpenDecider · Small61.25%735 / 1,2001,200 / 1,200
38APUS OpenJev · 9B 5949 High61.08%733 / 1,2001,085 / 1,200
39OpenDecider · Small TD60.67%728 / 1,2001,200 / 1,200
40APUS OpenJev · 4B 5949 High60.08%721 / 1,2001,085 / 1,200
41Ateve Jev59.75%717 / 1,2001,087 / 1,200
42Bocha Jev58.92%707 / 1,2001,087 / 1,200
43Winnow · E4B Q858.92%707 / 1,2001,410 / 1,500
44Reflex · Stable 4B58.50%702 / 1,2001,387 / 1,500
45Plumb · v5.2 4B58.08%697 / 1,2001,085 / 1,200
46FLock THIS/THAT57.67%692 / 1,2001,156 / 1,200
47Kev · 0.8B51.75%621 / 1,2001,200 / 1,200
48Bosun v3.1 · 1.7B49.75%597 / 1,2001,200 / 1,200
49OpenDecider · Nano46.75%561 / 1,2001,143 / 1,200
50CalDec · Laya46.08%553 / 1,2001,189 / 1,200
51Bosun v3.1 · 0.6B45.58%547 / 1,2001,200 / 1,200
52Laya · Typed Decisions44.58%535 / 1,2001,189 / 1,200
53CalDec · GLiNER43.17%518 / 1,2001,200 / 1,200
54Laya · English41.00%492 / 1,2001,189 / 1,200
55Laya · Multilingual40.25%483 / 1,2001,192 / 1,200
56GLiNER2.5-Decide38.58%463 / 1,2001,200 / 1,200
57Julia-135.75%429 / 1,2001,079 / 1,200
58CLM v0.1 · 8B34.92%419 / 1,2001,200 / 1,200

文本榜 58 条记录;图片榜与全题榜各 22 条。筛选保留原排名。多模态筛选包含本次有图片评测成绩的模型。

综合 ECE 校准榜

高柱 = 低误差 = 更好 ↑
查看ECE榜精确数值
ECE榜完整数值
排名模型 / 版本ECE ↓
01SPX-CD-Pro2.46%
02SPX-CD-Flash2.49%
03StartLux-Decision-27B · BF162.65%
04StartLux-Decision-35B-A3B · BF162.71%
05pplx-decider 27B3.08%
06Reflex · Stable 4B3.33%
07JPT · 9B3.47%
08Plumb · v5.2 4B3.53%
09Imajev-9B3.74%
10GLiNER2.5-Decide3.98%
11Mapika · Decider 4B v2.14.08%
12Kev · 9B4.09%
13OpenDecider · Small TD4.21%
14Decision Lux · 9B4.36%
15Malkuth · 4B4.43%
16Winnow · E4B Q84.56%
17OpenDecider · Small4.58%
18Laya · Typed Decisions4.86%
19Jev4.99%
20OpenDecider · Nano5.00%
21JevK55.05%
22SPX-CD-Omni5.11%
23Kev · 0.8B5.27%
24Nimble · v2 9B5.28%
25Kev · 4B5.63%
26JPT · 4B5.97%
27Ateve Jev6.09%
28Hopper · 4B6.23%
29Bocha Jev6.57%
30Lev · 4B6.78%
31Cloudflare Clef-flash7.90%
32Jet · v6.2 4B7.91%
33Jev-Omni · 12B8.08%
34Open-Jev · Zefan 9B8.62%
35Mica · 4B BF16 GGUF8.66%
36Winnow · 12B Q89.07%
37CalDec · Laya9.24%
38Hopper G · 4B v1.39.29%
39Cloudflare Clef9.40%
40CalDec · GLiNER9.40%
41Bosun v3.1 · 0.6B10.67%
42Mercury Decide10.77%
43APUS OpenJev · 9B 3000 High12.68%
44Bosun v3.1 · 1.7B13.01%
45Laya · English14.42%
46APUS OpenJev · 4B 5949 High14.86%
47APUS OpenJev · 9B 5949 High15.45%
48Laya · Multilingual19.74%
49FLock THIS/THAT30.09%
50CLM v0.1 · 8B31.16%
51Julia-140.55%

反向刻度:柱越高,误差越小;柱顶标注真实 ECE。采用 10 分箱,统计各模型评测范围内有原生概率的有效单选与是/否题;文本与多模态模型的覆盖范围不同。

I/C 指数榜

两项均为 0–100 分,越高越好 ↑ · 点击切换指标

查看I/C榜精确数值
I/C榜完整数值
排名模型 / 版本I ↑C ↑
01SPX-CD-Pro65.4183.58
02Mercury Decide64.5474.53
03StartLux-Decision-27B · BF1664.4883.63
04Winnow · 12B Q860.6068.72
05StartLux-Decision-35B-A3B · BF1660.0582.74
06JPT · 9B59.7083.87
07Cloudflare Clef59.4279.68
08Cloudflare Clef-flash57.4682.20
09pplx-decider 27B57.3680.56
10Plumb · v5.2 4B55.9073.01
11Jev55.4076.52
12Imajev-9B54.7682.45
13Open-Jev · Zefan 9B54.1778.80
14SPX-CD-Flash53.7983.25
15APUS OpenJev · 4B 5949 High53.6458.56
16APUS OpenJev · 9B 3000 High53.0464.91
17Malkuth · 4B52.3081.90
18Jev-Omni · 12B52.3064.26
19JPT · 4B52.2679.91
20APUS OpenJev · 9B 5949 High51.7957.45
21Jet · v6.2 4B51.4080.01
22Ateve Jev48.0775.22
23Hopper G · 4B v1.347.6874.10
24Hopper · 4B47.6179.12
25FLock THIS/THAT47.5943.08
26JevK546.7679.66
27SPX-CD-Omni46.6680.19
28Lev · 4B44.6672.91
29Decision Lux · 9B44.1578.17
30Kev · 4B44.0279.79
31Mapika · Decider 4B v2.143.9479.68
32Bocha Jev42.4673.37
33Kev · 9B41.5980.70
34Nimble · v2 9B39.7683.89
35Mica · 4B BF16 GGUF39.6672.19
36OpenDecider · Small39.4181.38
37Winnow · E4B Q834.4876.40
38OpenDecider · Small TD33.9879.02
39Reflex · Stable 4B31.9777.79
40Bosun v3.1 · 1.7B29.5466.11
41Laya · English25.2567.96
42Bosun v3.1 · 0.6B22.3067.78
43OpenDecider · Nano19.8276.75
44Laya · Typed Decisions18.6878.89
45Laya · Multilingual18.4353.67
46CalDec · Laya15.8578.49
47Kev · 0.8B13.4574.45
48Julia-110.3427.00
49CLM v0.1 · 8B5.0155.44
50CalDec · GLiNER0.0067.28
51GLiNER2.5-Decide0.0074.53

I · 智能指数:扣除随机猜测的基线,衡量模型做出正确判断的能力。C · 校准指数:衡量模型给出的概率与实际答案的匹配程度。

I/C 使用共同 900 道有效文本概率题,按 JevBench v1.5 公式适配,非官方 JevBench 成绩。无原生概率的模型不列入 ECE 与 I/C 榜。

添加模型到榜单

希望你的模型参与 CMDB-1500 评测?

联系我们 ↗

CMDB-1500,全称 Comprehensive Multimodal Decision Benchmark 1500,将不同领域的任务整理为结构化决策:给定证据与候选,选择答案、判断是非、给出有序评分或选出多个适用项。共 1,500 道题、322 张唯一原图,覆盖 79 个来源或子任务标识。

1,500 道题,如何组成?
1,500全部题目

点击分类查看占比;再次点击恢复总览。

题目从已有题库分层选取,保留候选与原图。准确率使用固定分母 1,200 / 300 / 1,500,拒答与缺答计为未答对;仅测文本的模型不生成全题成绩。

从语言判断到工具调用,再到图像与动作选择。展开每类,可查看整合的测试集与本次使用范围。

语言、知识与判断450 题

从 JevBench 选取 19 个配置,考察知识选择、意图路由、证据核验、语义判断、情绪与回答质量。

ARC-Challenge · MMLU · Banking77 · CLINC150 · MASSIVE · BoolQ · MNLI · ChaosNLI · FEVER · PAWS · SST-5 · STS-B · StrategyQA · Civil Comments · Measuring Hate Speech · SMS Spam · HelpSteer2

StrategyQA 含有/无证据两种配置;HelpSteer2 包含有用性与冗长程度评分。本次不复现完整 JevBench。

专业与业务决策300 题

从 Atlan Decision Bench · bench-v4 选取 31 个文本任务,覆盖 Agent、工程、商务、数据、文档、金融、法律、产品、安全与客服。

选择工具 · 检查任务完成情况 · 判断注入是否成功 · 核对引用证据 · 选择 SQL · 识别条款 · 业务路由

部分题目经该集合整合自 BFCL、AgentDojo、τ-bench、MT-Bench、Spider 等来源;评估已有记录上的判断,不是重新运行这些环境的完整测试。

图像决策300 题

10 个视觉来源各 30 题,考察图像数学、跨学科图文理解、科学图解、服装分类与基于图像的判断;保留多图题所需的全部原图。

MathVista · MMMU · MMMU-Pro · AI2D · ScienceQA · Fashion200k · GQA · VQAv2 · TextVQA · VizWiz

GQA、VQAv2、TextVQA、VizWiz 使用已有是/否决策子集;TextVQA 不代表完整开放式 OCR 测试。

安全与对抗100 题

Aegis 44 题、PhishNChips 43 题、JevAdvBench 13 题,考察内容安全类别、钓鱼邮件与 URL 判断,以及扰动后的决策。

保留原标签来源;对抗子集不全部来自人工金标。

游戏动作100 题

OpenJev 游戏与规则记录覆盖赛车进站、超车、贪吃蛇、井字棋、平台跳跃、跑酷和 ViZDoom,考察给定状态下的动作选择。

这是固定记录上的决策准确率,不是闭环游戏通关率。

多选判断100 题

MultiRC 与 GoEmotions 各 50 题,分别考察阅读理解中的多个正确答案,以及同一文本的多个情绪标签。

具身动作50 题

ALFRED 19 题、ALFWorld 18 题、VirtualHome 13 题:根据任务、观察与已有动作,选择下一步示范动作。

以专家轨迹为参考,不表示其他候选动作都不可行,也不表示完整环境任务成功率。

中文转写候选50 题

ChineseHP 的 AISHELL-4 N-best 文本候选,考察模型能否选出更接近参考转写的候选句;按字符编辑距离标注。

输入只有文本候选,不含音频;不是端到端语音识别测试。

工具调用25 题

BFCL v3 的二选一适配题,判断当前请求是否需要调用工具。

这里考察调用必要性,不是完整函数参数生成或工具执行。

空间与复杂规则25 题

THIS-THAT complex 19 题、spatial 6 题,考察规则冲突下的选择与空间关系判断,沿用来源的规则或模拟器答案。

Surd AI

原生决策模型

SPX-CD-Pro / Flash / Omni 与 Jev、StartLux 等同属原生决策模型,直接返回结构化选择与候选概率。本次 SPX-CD 三款模型使用 effort=2;Pro 和 Flash 的全题准确率分别为 81.20% 与 79.53%。

TypeSafeStartLuxHugging Face

更多原生决策模型

Jev、StartLux、Mercury Decide、pplx-decider,以及 JPT、Winnow、Kev 等模型使用原生决策或概率接口。榜单分别保留尺寸、版本与量化精度;有有效概率的记录参与 ECE 与 I/C 比较。

GPTClaudeGLM

通用推理模型

GPT、Claude、GLM、Qwen、Kimi 和 DeepSeek 在相同题目与候选上作答。GPT、Claude 与 GLM 的 low 设置标在模型名中;本次接口未提供原生候选概率,列入准确率榜。

SPX-CD-Pro · 全题第 281.20%1,218 / 1,500 题答对
SPX-CD-Flash · 全题第 579.53%1,193 / 1,500 题答对

Pro 的文本/图片准确率为 79.33% / 88.67%,Flash 为 77.58% / 87.33%。22 条模型记录包含图像评测成绩,多模态能力与上述模型类别交叉。

如果模型对一批答案都给出 80% 的概率,实际答对的比例是否也接近 80%?ECE 衡量这种概率与实际表现的偏差,越低越好。本次综合 ECE:Pro 为 2.46%,Flash 为 2.49%。

在 Hugging Face 查看 CMDB-1500 ↗