在「速度 · 多语言 · 必须中文 · 轻量」四个约束下的开源 ASR 模型评估
起点:一张 Hugging Face 模型列表截图(任务 = Automatic Speech Recognition,排序 = Trending,26 个模型)。结论由公开基准 + 本机同口径实测得出。
截图是 Hugging Face 模型列表页。右上角的过滤器标签写作 ⚡ Inference Available,行尾的 ⚡ 徽标是同一件事:
⚡ = 该模型在 HF 上有托管推理(Inference Providers),可用 HF token 直接调 API,无需下载权重。
它不是「效果更好」,也不是「更轻量」。最轻的那几个(SenseVoiceSmall / whisper.cpp / faster-whisper)反而都没有 ⚡ —— 因为它们是拿来本地跑的。租用是按供应商计费的。
验证方式:截图 26 行中,元数据行尾部存在琥珀色徽标的行,与 HF API 返回 inference:"warm" + inferenceProviderMapping 的行 7/7 完全吻合、0 误报。
| 带 ⚡ 的 7 个模型 | 托管方 |
|---|---|
| openai/whisper-large-v3 | deepinfra, fal-ai, hf-inference, replicate, together |
| openai/whisper-large-v3-turbo | deepinfra, hf-inference |
| nvidia/parakeet-tdt-0.6b-v3 | together |
| nvidia/nemotron-3.5-asr-streaming-0.6b | deepinfra, fal-ai, together |
| Qwen/Qwen3-ASR-1.7B | deepinfra |
| Qwen/Qwen3-ASR-0.6B | deepinfra |
| CohereLabs/cohere-transcribe-03-2026 | fal-ai |
数据源:hf-audio/open-asr-leaderboard-results → english_short_latest.csv。前三名全是闭源 API,开源第一是 Qwen3-ASR-1.7B。
| 模型 | avg WER↓ | RTFx↑ | 参数 | 语言 |
|---|---|---|---|---|
| zoom/scribe_v2_pro 闭源 API | 3.59 | – | – | 11 |
| modulate/multilingual 闭源 API | 3.84 | – | – | 99 |
| elevenlabs/scribe_v2 闭源 API | 3.97 | – | – | 90 |
| Qwen/Qwen3-ASR-1.7B-hf | 4.31 | 820 | 2.04 B | 52 |
| HojoAI/Hojo-ASR-V1 | 4.33 | 72.5 | 5.18 B | 2 |
| CohereLabs/cohere-transcribe-03-2026 | 4.67 | 907 | 2 B | 14 |
| nvidia/parakeet-tdt-0.6b-v3 | 4.86 | 6076 | 0.6 B | 26 |
| Qwen/Qwen3-ASR-0.6B-hf | 5.05 | 744 | 0.78 B | 52 |
| nvidia/canary-1b-v2 | 5.71 | 1825 | 1 B | 25 |
| openai/whisper-large-v3 | 5.78 | 470 | 2 B | 99 |
| openai/whisper-large-v3-turbo | 6.36 | 792 | 0.8 B | 99 |
| mistralai/Voxtral-Mini-4B-Realtime | 6.46 | 103 | 4 B | 13 |
| nvidia/nemotron-3.5-asr-streaming-0.6b | 7.88 | 1472 | 0.64 B | 40 |
长音频(longform 平均)冠军换人:cohere-transcribe 9.73 > parakeet 10.72 > whisper-large-v3 11.23 > turbo 11.01。
数据源:Qwen3-ASR 模型卡与 GPT-4o-Transcribe / Gemini-2.5-Pro / 豆包-ASR / Whisper-large-v3 / Fun-ASR-MLT-Nano 的同表对比(厂商自测,非第三方复现)。
| 中文数据集 | Qwen3-ASR-1.7B | Qwen3-ASR-0.6B | Whisper-large-v3 | 豆包-ASR |
|---|---|---|---|---|
| WenetSpeech net | meeting | 4.97 | 5.88 | 5.97 | 6.88 | 9.86 | 19.11 | N/A |
| AISHELL-2-test | 2.71 | 3.15 | 5.06 | 2.85 |
| SpeechIO | 2.88 | 3.44 | 7.56 | 2.93 |
| Fleurs-zh | 2.41 | 2.88 | 4.09 | 2.69 |
| KeSpeech(方言) | 5.10 | 7.08 | 28.79 | 5.27 |
| WenetSpeech-Yue short | long | 5.82 | 8.85 | 7.54 | 9.92 | 32.26 | 46.64 | 9.74 | 11.40 |
中文场景下 Whisper 与 Qwen3-ASR 差一个数量级。连 0.6B 的 Qwen3-ASR 都稳压 Whisper-large-v3。
同一台机器、同一个运行时(sherpa-onnx 1.13.8 / CPU / int8)、同一批音频,4 个模型跑同一套用例。这是本文最有价值的一节 —— 公开榜单的 RTFx 是 H200 GPU 上的数字,与「能不能在普通 CPU 上跑」无关。
| 模型 | int8 体积 | 峰值内存 | RTFx @1线程 | RTFx @8线程 | 平均 CER↓ | 1 小时音频 |
|---|---|---|---|---|---|---|
| SenseVoiceSmall | 239 MB | 1.13 GB | 30.8 | 115.0 | 3.1 % | 31 s |
| Fun-ASR-Nano | 993 MB | 2.82 GB | 7.9 | 20.2 | 2.4 % | 178 s |
| Qwen3-ASR-0.6B | 983 MB | 5.91 GB | 5.4 | 11.4 | 7.0 % * | 316 s |
| Whisper-large-v3-turbo | 1036 MB | 3.03 GB | 5.5 | 10.6 | 32.4 % | 340 s |
* Qwen3-ASR 的 7.0% 全部来自中英混说那一句(它把 "mixed recognition" 翻译成了「麦克风识别」)。4 个纯中文用例它全是 0% CER —— 逐字准确率其实第一。
RTFx = 音频时长 ÷ 处理耗时,越大越快。
SenseVoice 比第二快的 Fun-ASR-Nano 快 5.7×、比 Qwen3-ASR 快 10×,体积只有 1/4,内存只有 Qwen 的 1/5。
| 模型 | 普通话 8.5 s | 数字实体 8.4 s | 粤语 3.8 s | 中英混说 7.1 s | 长文 70.4 s |
|---|---|---|---|---|---|
| SenseVoiceSmall | 0 % | 5.7 % | 0 % | 8.7 % | 1.0 % |
| Fun-ASR-Nano | 0 % | 5.7 % | 0 % | 4.3 % | 2.0 % |
| Qwen3-ASR-0.6B | 0 % | 0 % | 0 % | 34.8 % | 0 % |
| Whisper-large-v3-turbo | 31.6 % | 20.0 % | 31.3 % | 10.9 % | 68.4 % |
真值由 macOS say 合成(Tingting zh_CN / Sinji zh_HK),因此真值确定。CER 打分前统一去标点、小写、中文数字转阿拉伯数字(模型 ITN 行为不同不等于准确率不同)。
1 · Whisper:30 秒硬上限,超出静默丢弃
运行时直接打印Only waves less than 30 seconds are supported. We process only the first 30 seconds and discard the remaining data。70 秒长文实测只处理了前 30 秒,CER 68.4%。不会报错,只会少字,生产上极难发现。
2 · Fun-ASR-Nano:通用 sherpa int8 导出 KV 上限 512,单段约 20 秒
超出即静默截断:Context_len (522) exceeds KV capacity (512). Truncating audio placeholders。30 秒切分时它直接丢掉了前 60 秒内容;按 20 秒切分后才跑出 2.4% CER。必须配 VAD 切句。需要更长上下文可换zengshuishui/FunASR-nano-onnx的大 KV 导出。
3 · Qwen3-ASR:CPU 上是自回归 LLM 解码器
精度最高(纯中文 4/4 用例 0% CER,长文标点完整),但 70 秒长文要自回归生成 300+ token,RTFx 掉到 4.8,峰值内存 5.91 GB。它的流式推理只支持 vLLM 后端,等于要 GPU。
另一个特性:面对 code-switch 会把英文词「翻译」成中文(mixed recognition → 麦克风识别),这在加字幕/会议记录场景是致命伤害。
必须中文
├─ 中 / 粤 / 英 / 日 / 韩 够用
│ └─ ✅ SenseVoiceSmall int8 239MB · RTFx 115 · 原生长音频 · 自带标点 ITN
│
├─ 需要 30+ 语 / 7 大方言,且能接受 VAD 切句
│ └─ Fun-ASR-Nano int8 993MB · RTFx 20 · 必须切 ≤20s · 远场噪声优化
│
├─ 精度优先,且已具备 GPU
│ └─ Qwen3-ASR-0.6B 983MB · CPU RTFx 11 · vLLM 才有流式
│
└─ 必须真流式(边说边出字)
└─ nemotron-3.5-asr-streaming-0.6b 742MB GGUF · 含中文 · 精度低一档
| 模型 | 语言覆盖 | 流式 | 热词 | int8 体积 | CPU RTFx@8 | 定位 |
|---|---|---|---|---|---|---|
| SenseVoiceSmall | 中(方言)·粤·英·日·韩 | 否 | 否 | 239 MB | 115 | 轻量速度冠军 |
| Fun-ASR-Nano | 31 语 + 7 大方言 | 否 | 是 | 993 MB | 20 | 多语言 + 方言 |
| Qwen3-ASR-0.6B | 52 语 + 22 中文方言 | 需 vLLM | 是 | 983 MB | 11 | 精度优先 |
| parakeet-tdt-0.6b-v3 | 25 语 · 无中文 | 否 | 是 | 714 MB | – | 纯英文极速 |
| nemotron-3.5-streaming-0.6b | 40 语 · 含中文 | 是 | 是 | 742 MB | – | 低延迟语音 Agent |
| Voxtral-Mini-4B-Realtime | 13 语 | 是 | – | 8.86 GB | – | RTFx 103,不划算 |
| whisper.cpp / faster-whisper | 99 语 | 否 | 否 | 0.25–1.5 GB | 11 | 中文不可用 |
运行时 sherpa-onnx 1.13.8
C++ 单库;Python / C / C++ / Java / Go / Swift / Node 绑定 + 预编译二进制
无需 Python 环境可独立部署
文件 model.int8.onnx 239 MB
tokens.txt 316 KB ← 就这两个文件
加载 0.47 s / 8 线程
内存 1.13 GB 峰值(处理 70 秒音频)
能力 中文(含方言)· 粤语 · 英 · 日 · 韩;自动语种识别
内置 ITN + 标点(无需额外标点模型)
非自回归结构,整句一次解码
备选路径 官方 SenseVoiceSmall-GGUF(q8 仅 254 MB)+ llama.cpp
纯单二进制、内置 VAD,适合边缘设备
| 模型 | 权重体积 | 可用量化格式 |
|---|---|---|
| SenseVoiceSmall | 936 MB (pt) → 254 MB (GGUF q8) | GGUF, ONNX int8, libtorch |
| Qwen3-ASR-0.6B | 1.88 GB (bf16) / 1.56 GB (fp16 -hf) | 社区 ONNX / GGUF |
| Qwen3-ASR-1.7B | 4.70 GB / 4.08 GB (-hf) | 无官方量化 |
| parakeet-tdt-0.6b-v3 | 2.51 GB (fp16) / 714 MB (q8_0 GGUF) | GGUF · NeMo-Speech.cpp |
| nemotron-3.5-streaming-0.6b | 2.55 GB / 742 MB (q8_0 GGUF) | GGUF · NeMo-Speech.cpp |
| whisper-large-v3-turbo | 1.62 GB (fp16) | ggml / CTranslate2 |
| faster-whisper-large-v3 | 3.09 GB (CTranslate2) | int8 ≈ 1.5 GB |
| Voxtral-Mini-4B-Realtime | 8.86 GB (fp16) | 无 |
| VibeVoice-ASR-7B | 17.35 GB | 无 |
other;Fun-ASR-Nano 的 license 字段为空。商用前以官方仓库 LICENSE 为准,不要信模型页标签。硬件 Apple M4 Pro (14 核) · macOS 26.5
运行时 sherpa-onnx 1.13.8 · onnxruntime 1.30.0 · CPU only · int8
语料 macOS `say` 合成,16 kHz 单声道 PCM16,共 5 段 / 98.2 s
普通话 8.5 s · 数字实体 8.4 s · 粤语 3.8 s · 中英混说 7.1 s · 长文 70.4 s
打分 去标点空格、小写、中文数字→阿拉伯数字 后计算 CER
(各模型 ITN 行为不同 ≠ 准确率不同,故须归一化)
长音频 Fun-ASR-Nano 按 20 s 切分(其 KV 上限 512);其余整段送入
重复 每种配置取 3 次最优;线程数 1 / 8
final_bench.py 4 模型同口径跑分(含公平 CER 打分实现)
results.json 全部原始输出文本 + 分项 CER
memchk.py 峰值内存测量
gt/*.wav 5 段中文真值音频
模型来源(ModelScope 镜像,比 HF 直连快约 40×)
pengzhendong/sherpa-onnx-sense-voice-zh-en-ja-ko-yue model.int8.onnx
pengzhendong/Fun-ASR-Nano-int8 encoder_adaptor + llm + embedding
jkman2023/sherpa-onnx-qwen3-asr-0.6B-int8-2026-03-25 encoder + decoder + conv_frontend
pengzhendong/sherpa-onnx-whisper-turbo turbo-encoder.int8 + decoder.int8
csukuangfj/sherpa-onnx-punct-ct-transformer-zh-en-... 标点模型(SenseVoice 自带,未使用)