RESEARCH / MULTIMODAL DECISIONS
CMDB-1500多模态决策模型基准测试
Comprehensive Multimodal Decision Benchmark 1500
1,200 道文本题,300 道原图题,评估模型的选择与概率判断。
查看文本榜精确数值
| 排名 | 模型 / 版本 | 准确率 · 0–100% | 答对 / 固定分母 | 有效 / 全评测范围 |
|---|---|---|---|---|
| 01 | GPT 6.1 Sol · low | 80.00% | 960 / 1,200 | 1,500 / 1,500 |
| 02 | SPX-CD-Pro (2026-10-04) | 79.33% | 952 / 1,200 | 1,500 / 1,500 |
| 03 | Claude Sonnet 5.5 · low | 78.00% | 936 / 1,200 | 1,500 / 1,500 |
| 04 | StartLux-Decision-27B · BF16 | 77.92% | 935 / 1,200 | 1,500 / 1,500 |
| 05 | SPX-CD-Flash | 77.58% | 931 / 1,200 | 1,500 / 1,500 |
| 06 | GPT 6 Luna · low | 76.58% | 919 / 1,200 | 1,500 / 1,500 |
| 07 | GLM 5.3 Flash · low | 75.75% | 909 / 1,200 | 1,500 / 1,500 |
| 08 | StartLux-Decision-35B-A3B · BF16 | 75.67% | 908 / 1,200 | 1,500 / 1,500 |
| 09 | SPX-CD-Omni | 74.67% | 896 / 1,200 | 1,500 / 1,500 |
| 10 | Mercury Decide | 73.92% | 887 / 1,200 | 1,200 / 1,200 |
| 11 | pplx-decider 27B | 72.83% | 874 / 1,200 | 1,500 / 1,500 |
| 12 | Jev | 72.17% | 866 / 1,200 | 1,200 / 1,200 |
| 13 | Cloudflare Clef | 71.50% | 858 / 1,200 | 1,485 / 1,500 |
| 14 | JPT · 9B | 71.33% | 856 / 1,200 | 1,500 / 1,500 |
| 15 | Qwen 3.8 Flash | 71.08% | 853 / 1,200 | 1,500 / 1,500 |
| 16 | Kimi K2.6 | 71.00% | 852 / 1,200 | 1,500 / 1,500 |
| 17 | Mapika · Decider 4B v2.1 | 69.83% | 838 / 1,200 | 1,200 / 1,200 |
| 18 | Cloudflare Clef-Flash | 69.67% | 836 / 1,200 | 1,485 / 1,500 |
| 19 | Imajev-9B | 68.83% | 826 / 1,200 | 1,478 / 1,500 |
| 20 | Kev · 9B | 68.67% | 824 / 1,200 | 1,200 / 1,200 |
| 21 | DeepSeek V4.1 Flash | 68.58% | 823 / 1,200 | 1,500 / 1,500 |
| 22 | JPT · 4B | 67.67% | 812 / 1,200 | 1,500 / 1,500 |
| 23 | Decision Lux · 9B | 67.42% | 809 / 1,200 | 1,200 / 1,200 |
| 24 | Jet · v6.2 4B | 66.92% | 803 / 1,200 | 1,200 / 1,200 |
| 25 | Open-Jev · Zefan 9B | 66.67% | 800 / 1,200 | 1,199 / 1,200 |
| 26 | Nimble · v2 9B | 66.58% | 799 / 1,200 | 1,200 / 1,200 |
| 27 | Hopper G · 4B v1.3 | 65.92% | 791 / 1,200 | 1,200 / 1,200 |
| 28 | Malkuth · 4B | 65.58% | 787 / 1,200 | 1,200 / 1,200 |
| 29 | Hopper · 4B | 65.50% | 786 / 1,200 | 1,200 / 1,200 |
| 30 | Winnow · 12B Q8 | 65.33% | 784 / 1,200 | 1,410 / 1,500 |
| 31 | JevK5 | 64.83% | 778 / 1,200 | 1,200 / 1,200 |
| 32 | Lev · 4B | 64.58% | 775 / 1,200 | 1,200 / 1,200 |
| 33 | Mica · 4B BF16 GGUF | 64.25% | 771 / 1,200 | 1,200 / 1,200 |
| 34 | Kev · 4B | 64.17% | 770 / 1,200 | 1,200 / 1,200 |
| 35 | Jev-Omni · 12B | 63.58% | 763 / 1,200 | 1,493 / 1,500 |
| 36 | APUS OpenJev · 9B 3000 High | 61.42% | 737 / 1,200 | 1,085 / 1,200 |
| 37 | OpenDecider · Small | 61.25% | 735 / 1,200 | 1,200 / 1,200 |
| 38 | APUS OpenJev · 9B 5949 High | 61.08% | 733 / 1,200 | 1,085 / 1,200 |
| 39 | OpenDecider · Small TD | 60.67% | 728 / 1,200 | 1,200 / 1,200 |
| 40 | APUS OpenJev · 4B 5949 High | 60.08% | 721 / 1,200 | 1,085 / 1,200 |
| 41 | Ateve Jev | 59.75% | 717 / 1,200 | 1,087 / 1,200 |
| 42 | Bocha Jev | 58.92% | 707 / 1,200 | 1,087 / 1,200 |
| 43 | Winnow · E4B Q8 | 58.92% | 707 / 1,200 | 1,410 / 1,500 |
| 44 | Reflex · Stable 4B | 58.50% | 702 / 1,200 | 1,387 / 1,500 |
| 45 | Plumb · v5.2 4B | 58.08% | 697 / 1,200 | 1,085 / 1,200 |
| 46 | FLock THIS/THAT | 57.67% | 692 / 1,200 | 1,156 / 1,200 |
| 47 | Kev · 0.8B | 51.75% | 621 / 1,200 | 1,200 / 1,200 |
| 48 | Bosun v3.1 · 1.7B | 49.75% | 597 / 1,200 | 1,200 / 1,200 |
| 49 | OpenDecider · Nano | 46.75% | 561 / 1,200 | 1,143 / 1,200 |
| 50 | CalDec · Laya | 46.08% | 553 / 1,200 | 1,189 / 1,200 |
| 51 | Bosun v3.1 · 0.6B | 45.58% | 547 / 1,200 | 1,200 / 1,200 |
| 52 | Laya · Typed Decisions | 44.58% | 535 / 1,200 | 1,189 / 1,200 |
| 53 | CalDec · GLiNER | 43.17% | 518 / 1,200 | 1,200 / 1,200 |
| 54 | Laya · English | 41.00% | 492 / 1,200 | 1,189 / 1,200 |
| 55 | Laya · Multilingual | 40.25% | 483 / 1,200 | 1,192 / 1,200 |
| 56 | GLiNER2.5-Decide | 38.58% | 463 / 1,200 | 1,200 / 1,200 |
| 57 | Julia-1 | 35.75% | 429 / 1,200 | 1,079 / 1,200 |
| 58 | CLM v0.1 · 8B | 34.92% | 419 / 1,200 | 1,200 / 1,200 |
查看图片榜精确数值
| 排名 | 模型 / 版本 | 准确率 · 0–100% | 答对 / 固定分母 | 有效 / 全评测范围 |
|---|---|---|---|---|
| 01 | Claude Sonnet 5.5 · low | 92.67% | 278 / 300 | 1,500 / 1,500 |
| 02 | GPT 6.1 Sol · low | 92.00% | 276 / 300 | 1,500 / 1,500 |
| 03 | GLM 5.3 Flash · low | 90.67% | 272 / 300 | 1,500 / 1,500 |
| 04 | StartLux-Decision-35B-A3B · BF16 | 89.67% | 269 / 300 | 1,500 / 1,500 |
| 05 | GPT 6 Luna · low | 89.33% | 268 / 300 | 1,500 / 1,500 |
| 06 | SPX-CD-Pro (2026-10-04) | 88.67% | 266 / 300 | 1,500 / 1,500 |
| 07 | SPX-CD-Flash | 87.33% | 262 / 300 | 1,500 / 1,500 |
| 08 | StartLux-Decision-27B · BF16 | 87.00% | 261 / 300 | 1,500 / 1,500 |
| 09 | pplx-decider 27B | 86.33% | 259 / 300 | 1,500 / 1,500 |
| 10 | JPT · 9B | 85.67% | 257 / 300 | 1,500 / 1,500 |
| 11 | Imajev-9B | 83.67% | 251 / 300 | 1,478 / 1,500 |
| 12 | Qwen 3.8 Flash | 83.00% | 249 / 300 | 1,500 / 1,500 |
| 13 | SPX-CD-Omni | 82.67% | 248 / 300 | 1,500 / 1,500 |
| 14 | Kimi K2.6 | 81.33% | 244 / 300 | 1,500 / 1,500 |
| 15 | JPT · 4B | 81.00% | 243 / 300 | 1,500 / 1,500 |
| 16 | Reflex · Stable 4B | 80.33% | 241 / 300 | 1,387 / 1,500 |
| 17 | DeepSeek V4.1 Flash | 79.67% | 239 / 300 | 1,500 / 1,500 |
| 18 | Jev-Omni · 12B | 79.00% | 237 / 300 | 1,493 / 1,500 |
| 19 | Winnow · 12B Q8 | 77.33% | 232 / 300 | 1,410 / 1,500 |
| 20 | Winnow · E4B Q8 | 66.33% | 199 / 300 | 1,410 / 1,500 |
| 21 | Cloudflare Clef | 42.33% | 127 / 300 | 1,485 / 1,500 |
| 22 | Cloudflare Clef-Flash | 41.67% | 125 / 300 | 1,485 / 1,500 |
查看全题榜精确数值
| 排名 | 模型 / 版本 | 准确率 · 0–100% | 答对 / 固定分母 | 有效 / 全评测范围 |
|---|---|---|---|---|
| 01 | GPT 6.1 Sol · low | 82.40% | 1,236 / 1,500 | 1,500 / 1,500 |
| 02 | SPX-CD-Pro (2026-10-04) | 81.20% | 1,218 / 1,500 | 1,500 / 1,500 |
| 03 | Claude Sonnet 5.5 · low | 80.93% | 1,214 / 1,500 | 1,500 / 1,500 |
| 04 | StartLux-Decision-27B · BF16 | 79.73% | 1,196 / 1,500 | 1,500 / 1,500 |
| 05 | SPX-CD-Flash | 79.53% | 1,193 / 1,500 | 1,500 / 1,500 |
| 06 | GPT 6 Luna · low | 79.13% | 1,187 / 1,500 | 1,500 / 1,500 |
| 07 | GLM 5.3 Flash · low | 78.73% | 1,181 / 1,500 | 1,500 / 1,500 |
| 08 | StartLux-Decision-35B-A3B · BF16 | 78.47% | 1,177 / 1,500 | 1,500 / 1,500 |
| 09 | SPX-CD-Omni | 76.27% | 1,144 / 1,500 | 1,500 / 1,500 |
| 10 | pplx-decider 27B | 75.53% | 1,133 / 1,500 | 1,500 / 1,500 |
| 11 | JPT · 9B | 74.20% | 1,113 / 1,500 | 1,500 / 1,500 |
| 12 | Qwen 3.8 Flash | 73.47% | 1,102 / 1,500 | 1,500 / 1,500 |
| 13 | Kimi K2.6 | 73.07% | 1,096 / 1,500 | 1,500 / 1,500 |
| 14 | Imajev-9B | 71.80% | 1,077 / 1,500 | 1,478 / 1,500 |
| 15 | DeepSeek V4.1 Flash | 70.80% | 1,062 / 1,500 | 1,500 / 1,500 |
| 16 | JPT · 4B | 70.33% | 1,055 / 1,500 | 1,500 / 1,500 |
| 17 | Winnow · 12B Q8 | 67.73% | 1,016 / 1,500 | 1,410 / 1,500 |
| 18 | Jev-Omni · 12B | 66.67% | 1,000 / 1,500 | 1,493 / 1,500 |
| 19 | Cloudflare Clef | 65.67% | 985 / 1,500 | 1,485 / 1,500 |
| 20 | Cloudflare Clef-Flash | 64.07% | 961 / 1,500 | 1,485 / 1,500 |
| 21 | Reflex · Stable 4B | 62.87% | 943 / 1,500 | 1,387 / 1,500 |
| 22 | Winnow · E4B Q8 | 60.40% | 906 / 1,500 | 1,410 / 1,500 |
文本榜 58 条记录;图片榜与全题榜各 22 条。筛选保留原排名。多模态筛选包含本次有图片评测成绩的模型。
综合 ECE 校准榜
高柱 = 低误差 = 更好 ↑查看ECE榜精确数值
| 排名 | 模型 / 版本 | ECE ↓ |
|---|---|---|
| 01 | SPX-CD-Pro | 2.46% |
| 02 | SPX-CD-Flash | 2.49% |
| 03 | StartLux-Decision-27B · BF16 | 2.65% |
| 04 | StartLux-Decision-35B-A3B · BF16 | 2.71% |
| 05 | pplx-decider 27B | 3.08% |
| 06 | Reflex · Stable 4B | 3.33% |
| 07 | JPT · 9B | 3.47% |
| 08 | Plumb · v5.2 4B | 3.53% |
| 09 | Imajev-9B | 3.74% |
| 10 | GLiNER2.5-Decide | 3.98% |
| 11 | Mapika · Decider 4B v2.1 | 4.08% |
| 12 | Kev · 9B | 4.09% |
| 13 | OpenDecider · Small TD | 4.21% |
| 14 | Decision Lux · 9B | 4.36% |
| 15 | Malkuth · 4B | 4.43% |
| 16 | Winnow · E4B Q8 | 4.56% |
| 17 | OpenDecider · Small | 4.58% |
| 18 | Laya · Typed Decisions | 4.86% |
| 19 | Jev | 4.99% |
| 20 | OpenDecider · Nano | 5.00% |
| 21 | JevK5 | 5.05% |
| 22 | SPX-CD-Omni | 5.11% |
| 23 | Kev · 0.8B | 5.27% |
| 24 | Nimble · v2 9B | 5.28% |
| 25 | Kev · 4B | 5.63% |
| 26 | JPT · 4B | 5.97% |
| 27 | Ateve Jev | 6.09% |
| 28 | Hopper · 4B | 6.23% |
| 29 | Bocha Jev | 6.57% |
| 30 | Lev · 4B | 6.78% |
| 31 | Cloudflare Clef-flash | 7.90% |
| 32 | Jet · v6.2 4B | 7.91% |
| 33 | Jev-Omni · 12B | 8.08% |
| 34 | Open-Jev · Zefan 9B | 8.62% |
| 35 | Mica · 4B BF16 GGUF | 8.66% |
| 36 | Winnow · 12B Q8 | 9.07% |
| 37 | CalDec · Laya | 9.24% |
| 38 | Hopper G · 4B v1.3 | 9.29% |
| 39 | Cloudflare Clef | 9.40% |
| 40 | CalDec · GLiNER | 9.40% |
| 41 | Bosun v3.1 · 0.6B | 10.67% |
| 42 | Mercury Decide | 10.77% |
| 43 | APUS OpenJev · 9B 3000 High | 12.68% |
| 44 | Bosun v3.1 · 1.7B | 13.01% |
| 45 | Laya · English | 14.42% |
| 46 | APUS OpenJev · 4B 5949 High | 14.86% |
| 47 | APUS OpenJev · 9B 5949 High | 15.45% |
| 48 | Laya · Multilingual | 19.74% |
| 49 | FLock THIS/THAT | 30.09% |
| 50 | CLM v0.1 · 8B | 31.16% |
| 51 | Julia-1 | 40.55% |
反向刻度:柱越高,误差越小;柱顶标注真实 ECE。采用 10 分箱,统计各模型评测范围内有原生概率的有效单选与是/否题;文本与多模态模型的覆盖范围不同。
I/C 指数榜
两项均为 0–100 分,越高越好 ↑ · 点击切换指标
查看I/C榜精确数值
| 排名 | 模型 / 版本 | I ↑ | C ↑ |
|---|---|---|---|
| 01 | SPX-CD-Pro | 65.41 | 83.58 |
| 02 | Mercury Decide | 64.54 | 74.53 |
| 03 | StartLux-Decision-27B · BF16 | 64.48 | 83.63 |
| 04 | Winnow · 12B Q8 | 60.60 | 68.72 |
| 05 | StartLux-Decision-35B-A3B · BF16 | 60.05 | 82.74 |
| 06 | JPT · 9B | 59.70 | 83.87 |
| 07 | Cloudflare Clef | 59.42 | 79.68 |
| 08 | Cloudflare Clef-flash | 57.46 | 82.20 |
| 09 | pplx-decider 27B | 57.36 | 80.56 |
| 10 | Plumb · v5.2 4B | 55.90 | 73.01 |
| 11 | Jev | 55.40 | 76.52 |
| 12 | Imajev-9B | 54.76 | 82.45 |
| 13 | Open-Jev · Zefan 9B | 54.17 | 78.80 |
| 14 | SPX-CD-Flash | 53.79 | 83.25 |
| 15 | APUS OpenJev · 4B 5949 High | 53.64 | 58.56 |
| 16 | APUS OpenJev · 9B 3000 High | 53.04 | 64.91 |
| 17 | Malkuth · 4B | 52.30 | 81.90 |
| 18 | Jev-Omni · 12B | 52.30 | 64.26 |
| 19 | JPT · 4B | 52.26 | 79.91 |
| 20 | APUS OpenJev · 9B 5949 High | 51.79 | 57.45 |
| 21 | Jet · v6.2 4B | 51.40 | 80.01 |
| 22 | Ateve Jev | 48.07 | 75.22 |
| 23 | Hopper G · 4B v1.3 | 47.68 | 74.10 |
| 24 | Hopper · 4B | 47.61 | 79.12 |
| 25 | FLock THIS/THAT | 47.59 | 43.08 |
| 26 | JevK5 | 46.76 | 79.66 |
| 27 | SPX-CD-Omni | 46.66 | 80.19 |
| 28 | Lev · 4B | 44.66 | 72.91 |
| 29 | Decision Lux · 9B | 44.15 | 78.17 |
| 30 | Kev · 4B | 44.02 | 79.79 |
| 31 | Mapika · Decider 4B v2.1 | 43.94 | 79.68 |
| 32 | Bocha Jev | 42.46 | 73.37 |
| 33 | Kev · 9B | 41.59 | 80.70 |
| 34 | Nimble · v2 9B | 39.76 | 83.89 |
| 35 | Mica · 4B BF16 GGUF | 39.66 | 72.19 |
| 36 | OpenDecider · Small | 39.41 | 81.38 |
| 37 | Winnow · E4B Q8 | 34.48 | 76.40 |
| 38 | OpenDecider · Small TD | 33.98 | 79.02 |
| 39 | Reflex · Stable 4B | 31.97 | 77.79 |
| 40 | Bosun v3.1 · 1.7B | 29.54 | 66.11 |
| 41 | Laya · English | 25.25 | 67.96 |
| 42 | Bosun v3.1 · 0.6B | 22.30 | 67.78 |
| 43 | OpenDecider · Nano | 19.82 | 76.75 |
| 44 | Laya · Typed Decisions | 18.68 | 78.89 |
| 45 | Laya · Multilingual | 18.43 | 53.67 |
| 46 | CalDec · Laya | 15.85 | 78.49 |
| 47 | Kev · 0.8B | 13.45 | 74.45 |
| 48 | Julia-1 | 10.34 | 27.00 |
| 49 | CLM v0.1 · 8B | 5.01 | 55.44 |
| 50 | CalDec · GLiNER | 0.00 | 67.28 |
| 51 | GLiNER2.5-Decide | 0.00 | 74.53 |
I · 智能指数:扣除随机猜测的基线,衡量模型做出正确判断的能力。C · 校准指数:衡量模型给出的概率与实际答案的匹配程度。
I/C 使用共同 900 道有效文本概率题,按 JevBench v1.5 公式适配,非官方 JevBench 成绩。无原生概率的模型不列入 ECE 与 I/C 榜。
希望你的模型参与 CMDB-1500 评测?
从文本到原图,
做出结构化选择。
CMDB-1500,全称 Comprehensive Multimodal Decision Benchmark 1500,将不同领域的任务整理为结构化决策:给定证据与候选,选择答案、判断是非、给出有序评分或选出多个适用项。共 1,500 道题、322 张唯一原图,覆盖 79 个来源或子任务标识。
点击分类查看占比;再次点击恢复总览。
题目从已有题库分层选取,保留候选与原图。准确率使用固定分母 1,200 / 300 / 1,500,拒答与缺答计为未答对;仅测文本的模型不生成全题成绩。
这些题,
考察什么?
从语言判断到工具调用,再到图像与动作选择。展开每类,可查看整合的测试集与本次使用范围。
语言、知识与判断450 题
从 JevBench 选取 19 个配置,考察知识选择、意图路由、证据核验、语义判断、情绪与回答质量。
ARC-Challenge · MMLU · Banking77 · CLINC150 · MASSIVE · BoolQ · MNLI · ChaosNLI · FEVER · PAWS · SST-5 · STS-B · StrategyQA · Civil Comments · Measuring Hate Speech · SMS Spam · HelpSteer2
StrategyQA 含有/无证据两种配置;HelpSteer2 包含有用性与冗长程度评分。本次不复现完整 JevBench。
专业与业务决策300 题
从 Atlan Decision Bench · bench-v4 选取 31 个文本任务,覆盖 Agent、工程、商务、数据、文档、金融、法律、产品、安全与客服。
选择工具 · 检查任务完成情况 · 判断注入是否成功 · 核对引用证据 · 选择 SQL · 识别条款 · 业务路由
部分题目经该集合整合自 BFCL、AgentDojo、τ-bench、MT-Bench、Spider 等来源;评估已有记录上的判断,不是重新运行这些环境的完整测试。
图像决策300 题
10 个视觉来源各 30 题,考察图像数学、跨学科图文理解、科学图解、服装分类与基于图像的判断;保留多图题所需的全部原图。
MathVista · MMMU · MMMU-Pro · AI2D · ScienceQA · Fashion200k · GQA · VQAv2 · TextVQA · VizWiz
GQA、VQAv2、TextVQA、VizWiz 使用已有是/否决策子集;TextVQA 不代表完整开放式 OCR 测试。
安全与对抗100 题
Aegis 44 题、PhishNChips 43 题、JevAdvBench 13 题,考察内容安全类别、钓鱼邮件与 URL 判断,以及扰动后的决策。
保留原标签来源;对抗子集不全部来自人工金标。
游戏动作100 题
OpenJev 游戏与规则记录覆盖赛车进站、超车、贪吃蛇、井字棋、平台跳跃、跑酷和 ViZDoom,考察给定状态下的动作选择。
这是固定记录上的决策准确率,不是闭环游戏通关率。
多选判断100 题
MultiRC 与 GoEmotions 各 50 题,分别考察阅读理解中的多个正确答案,以及同一文本的多个情绪标签。
具身动作50 题
ALFRED 19 题、ALFWorld 18 题、VirtualHome 13 题:根据任务、观察与已有动作,选择下一步示范动作。
以专家轨迹为参考,不表示其他候选动作都不可行,也不表示完整环境任务成功率。
中文转写候选50 题
ChineseHP 的 AISHELL-4 N-best 文本候选,考察模型能否选出更接近参考转写的候选句;按字符编辑距离标注。
输入只有文本候选,不含音频;不是端到端语音识别测试。
工具调用25 题
BFCL v3 的二选一适配题,判断当前请求是否需要调用工具。
这里考察调用必要性,不是完整函数参数生成或工具执行。
空间与复杂规则25 题
THIS-THAT complex 19 题、spatial 6 题,考察规则冲突下的选择与空间关系判断,沿用来源的规则或模拟器答案。
相同候选,
不同的判断方式。
原生决策模型
SPX-CD-Pro / Flash / Omni 与 Jev、StartLux 等同属原生决策模型,直接返回结构化选择与候选概率。本次 SPX-CD 三款模型使用 effort=2;Pro 和 Flash 的全题准确率分别为 81.20% 与 79.53%。
更多原生决策模型
Jev、StartLux、Mercury Decide、pplx-decider,以及 JPT、Winnow、Kev 等模型使用原生决策或概率接口。榜单分别保留尺寸、版本与量化精度;有有效概率的记录参与 ECE 与 I/C 比较。
通用推理模型
GPT、Claude、GLM、Qwen、Kimi 和 DeepSeek 在相同题目与候选上作答。GPT、Claude 与 GLM 的 low 设置标在模型名中;本次接口未提供原生候选概率,列入准确率榜。
Pro 的文本/图片准确率为 79.33% / 88.67%,Flash 为 77.58% / 87.33%。22 条模型记录包含图像评测成绩,多模态能力与上述模型类别交叉。
模型是否真的
确信自己的答案?
如果模型对一批答案都给出 80% 的概率,实际答对的比例是否也接近 80%?ECE 衡量这种概率与实际表现的偏差,越低越好。本次综合 ECE:Pro 为 2.46%,Flash 为 2.49%。
在 Hugging Face 查看 CMDB-1500 ↗