CANN-Bench Evaluation Report  ·  V0.1.0 · 2026-05-25

CANN-Bench 评测报告

Ascend C Operator Benchmark — AI Code Generation Evaluation

53 Operators  ·  1,060 Cases  ·  4 Difficulty Levels
CANN-Bench V0.1.0  ·  2026-05-25

Abstract / 摘要

本报告基于 CANN-Bench 评测框架,Agent/Skill为,Harness为,BaseModel为。使用 CANN-Bench全量基准测试数据集,本次对 3 个算子进行了评测,覆盖 Level 1 至 Level 3 共 2 个难度等级,60 个评测用例。涵盖编译正确性、功能精度和性能优化三个维度。 整体通过率为 100.0%(60/60),总得分为 52(满分 300)。

1. Evaluation Dataset Overview / 评测集概述

CANN-Bench评测集是一个面向昇腾算子开发的全量基准测试数据集,用于系统性验证算子代码的 编译正确性、功能精度和运行性能。评测集覆盖 53 个算子,分为 4 个难度等级,每个算子配套完整的 规格描述(desc.md)、原型定义(proto.yaml)、PyTorch 参考实现(golden.py)和多场景测试用例 (cases.yaml / cases.csv),为算子开发提供标准化的评测输入。

1.1 Difficulty Level Classification / 难度分级

Table 1. Difficulty Levels and Operator Distribution
LevelOperatorsCasesTypical Examples
Level 1 — 基础算子 8 160 Exp, Gelu, Sigmoid, Mish, SwiGlu
Level 2 — 中级算子 16 320 Softmax, Gather, ApplyAdamW, RmsNorm
Level 3 — 高级算子 21 420 Conv2D, TopK, NMS, GroupedMatmul
Level 4 — 复杂算子 8 160 GQA, LSTM, MHA, MLA

1.2 Scoring System / 评分体系

评测采用三维度独立加权评估,权重 w_c=0.2(编译)、w_f=0.3(功能精度)、w_p=0.5(性能)。 性能得分采用硬件锚点公式(HW-anchored),以 baseline_perf_us 和 t_hw_us 为参考锚点, 评估候选 kernel 时间在校准基线时间与硬件理论上限之间的相对位置。

Compilation / 编译
w_c = 0.2   max 20
Contribution: w_c · δ_pass · 100
δ_pass ∈ {0, 1} — 一票否决制
Function / 功能精度
w_f = 0.3   max 30
Contribution: Σδ_acc,i · w_f / N · 100
MERE < threshold 且 MARE < 10×threshold(双指标判定)
Performance / 性能
w_p = 0.5   max 50
Contribution: Σδ_acc,i · w_p · score_i / N · 100
Eq. 1 EachOperatorScore = [ w_c·δ_pass + Σi δ_acc,i·(w_f + w_p·score_i) / N ] · 100 N = max(declared_cases, run_cases, 1)。编译失败时整算子计 0。

2. Experiment Setup / 评测配置

Metadata / 元信息

FrameworkCANN-Bench V1.0.0
Date2026-08-10 14:35:30
Agent/Skill
Harness
BaseModel
评测集CANN-Bench tasks
LicenseCANN Open Software License v2.0

Environment / 运行环境

NPUAscend910B4 × 1
CPUaarch64
CANN9.1.0
Driver版本cann-9.1.0
PyTorch2.7.1+cpu
PyTorch NPU2.7.1.post4
torchvision0.22.1
Python3.11.15
OSLinux-5.10.0-60.18.0.50.r865_35.hce2.aarch64-aarch64-with-glibc2.39
Dockercake-ci / CANN 9.0.0

3. Results Analysis / 结果分析

3.1 结果总览

100.0%
Pass Rate / 通过率
60 / 60 cases
3
Operators / 算子数
AI-generated code
60
Total Cases / 总用例
20 cases per operator
0
Error Case Number / 失败用例数量
52
Total Score / 总得分

3.2 等级分析

Table 2. Results by Difficulty Level
LevelOperatorsCasesPassedPass RateAvg PrecisionAvg SpeedupTotal Score
Level 2 — 中级算子 12020 100% 100% 0.04x 52
Level 3 — 高级算子 24040 100% 100% 0
Level 2
52
Level 3
0

Figure 1a. Total score by difficulty level.

Level 2
100%
Level 3
100%

Figure 1b. Average precision by difficulty level.

Level 2
0.04x
Level 3

Figure 1c. Average speedup by difficulty level (几何平均).

3.3 算子分析

Table 3a. Operators by Pass Rate
#OperatorLevelPass Rate
1CumminL2100%
2MoeFinalizeRoutingL3100%
3MoeReRoutingL3100%
Table 3b. Operators by Avg Speedup
#OperatorLevelSpeedup
1CumminL20.04x
2MoeFinalizeRoutingL3
3MoeReRoutingL3

Table 3a-3b. Left: Operators by pass rate. Right: Operators by NPU speedup ratio.

4. Operator Details / 算子明细

4.2 Level 2 — 中级算子

Table 4. Level 2 Operator Results
#OperatorCategoryLevelCasesPassedPass RateAvg PrecisionAvg SpeedupTotal Score
1CumminReductionL22020100%100%0.04x52

4.3 Level 3 — 高级算子

Table 5. Level 3 Operator Results
#OperatorCategoryLevelCasesPassedPass RateAvg PrecisionAvg SpeedupTotal Score
1MoeFinalizeRoutingFusedCompositeL32020100%100%0
2MoeReRoutingLayoutTransformL32020100%100%0

CANN-Bench 认证

CANN-BENCH
CERTIFIED
2026 · 06 · 01
V1.0.0

本评测报告由 CANN-Bench 评测框架自动生成,评测对象为 生成的 Ascend C 算子代码。

评测数据来源于 CANN-Bench tasks/ 标准化题库(tasks-v1.0.0),评分严格按照 CANN-Bench V1.0.0 评分规范执行。

CANN-Bench Evaluation Framework — AI for CANN, Benchmark for AI