SciCode
DeepSeek V4 Flash得分变化+14.44 个百分点

QUANTUMMIND
QART 是我们的框架与方法体系,QuantumMind v1 是基于它实现的第一版模型。技术内容以公开报告为准。
理解任务背景与约束
探索复杂推理的方法
通过实验检验方法表现
模型对比与方法实验分别呈现,并说明各自的评测口径。
将随技术报告提供同口径的评测结果与方法说明。
内部配对测试 · 以下为现有方法实验,不作为 QuantumMind v1 横评
| BENCHMARK | DeepSeek V4 Flash | GLM-5.3 |
|---|---|---|
| τ²-Bench | +4.0% | +5.9% |
| τ³-Bench | +47.6% | +4.8% |
| SciCode | +84.1% | +10.1% |
| LHTB | +35.9% | 未提供 |
| DeepSWE | −7.8% | +19.1% |
| Terminal-Bench 4.0 | +44.4% | +44.4% |
本页展示 2 款模型、6 项基准的 11 组内部配对结果,10 组提升、1 组下降。
相对变化 =(接入 QART 后分数 − Direct 分数)/ Direct 分数 × 100%。
Direct 表示未接入 QART 的对照结果。LHTB 使用原生奖励指标;未提供不代表零分。
DeepSeek V4 Flash 在 DeepSWE 上下降 7.8%,增益受模型与任务适配影响。
结果可能与官方模型分数不同,不构成生产效果承诺。
来源:现有内部评测材料,后续与技术报告核对。
现有配对实验比较同一模型接入 QART 前后的表现。QuantumMind v1 的模型对比将单独展示。
相对提升、实际得分与百分点分别标注。不同基准的指标不合并为一个总分。
完整呈现本页范围内的负向结果和缺失项。公开实验条件及局限以技术报告为准。
QuantumMind v1 · 公开方法与评测
完成后将在此提供下载