语音识别模型选型报告

在「速度 · 多语言 · 必须中文 · 轻量」四个约束下的开源 ASR 模型评估

起点:一张 Hugging Face 模型列表截图(任务 = Automatic Speech Recognition,排序 = Trending,26 个模型)。结论由公开基准 + 本机同口径实测得出。

硬件  Apple M4 Pro (14 核) · macOS 26.5
运行时  sherpa-onnx 1.13.8 · CPU only · int8
实测集  5 段中文/粤语/中英混说/长文,共 98.2 s
日期  2026-09-11

一、结论

首选
SenseVoiceSmall int8 ONNX —— 239 MB,8 线程 RTFx 115(1 小时音频 31 秒转完),中文/粤语/英/日/韩,原生吃下 70 秒长音频。是唯一同时满足四个约束的模型。
只在
语言需求超出中/粤/英/日/韩时才换 Fun-ASR-Nano int8(31 语 + 7 大方言,但 993 MB、慢 5.7×、且必须 VAD 切成 ≤20 s)。
淘汰
Whisper 全系不适合中文:本机 int8 实测平均 CER 32.4%(中文句丢字、数字句出幻觉),且运行时硬上限 30 秒、超出静默丢弃。

二、截图里的「闪电」是什么

截图是 Hugging Face 模型列表页。右上角的过滤器标签写作 ⚡ Inference Available,行尾的 ⚡ 徽标是同一件事:

⚡ = 该模型在 HF 上有托管推理(Inference Providers),可用 HF token 直接调 API,无需下载权重。
它不是「效果更好」,也不是「更轻量」。最轻的那几个(SenseVoiceSmall / whisper.cpp / faster-whisper)反而都没有 ⚡ —— 因为它们是拿来本地跑的。租用是按供应商计费的。

验证方式:截图 26 行中,元数据行尾部存在琥珀色徽标的行,与 HF API 返回 inference:"warm" + inferenceProviderMapping 的行 7/7 完全吻合、0 误报

带 ⚡ 的 7 个模型托管方
openai/whisper-large-v3deepinfra, fal-ai, hf-inference, replicate, together
openai/whisper-large-v3-turbodeepinfra, hf-inference
nvidia/parakeet-tdt-0.6b-v3together
nvidia/nemotron-3.5-asr-streaming-0.6bdeepinfra, fal-ai, together
Qwen/Qwen3-ASR-1.7Bdeepinfra
Qwen/Qwen3-ASR-0.6Bdeepinfra
CohereLabs/cohere-transcribe-03-2026fal-ai

三、公开基准:谁最准

3.1 Open ASR Leaderboard · 英文短音频平均 WER(62 个模型,2026-09 版本)

数据源:hf-audio/open-asr-leaderboard-results → english_short_latest.csv。前三名全是闭源 API,开源第一是 Qwen3-ASR-1.7B。

模型avg WER↓RTFx↑参数语言
zoom/scribe_v2_pro 闭源 API3.5911
modulate/multilingual 闭源 API3.8499
elevenlabs/scribe_v2 闭源 API3.9790
Qwen/Qwen3-ASR-1.7B-hf4.318202.04 B52
HojoAI/Hojo-ASR-V14.3372.55.18 B2
CohereLabs/cohere-transcribe-03-20264.679072 B14
nvidia/parakeet-tdt-0.6b-v34.8660760.6 B26
Qwen/Qwen3-ASR-0.6B-hf5.057440.78 B52
nvidia/canary-1b-v25.7118251 B25
openai/whisper-large-v35.784702 B99
openai/whisper-large-v3-turbo6.367920.8 B99
mistralai/Voxtral-Mini-4B-Realtime6.461034 B13
nvidia/nemotron-3.5-asr-streaming-0.6b7.8814720.64 B40

长音频(longform 平均)冠军换人:cohere-transcribe 9.73 > parakeet 10.72 > whisper-large-v3 11.23 > turbo 11.01。

3.2 中文能力:Whisper 系直接出局

数据源:Qwen3-ASR 模型卡与 GPT-4o-Transcribe / Gemini-2.5-Pro / 豆包-ASR / Whisper-large-v3 / Fun-ASR-MLT-Nano 的同表对比(厂商自测,非第三方复现)。

中文数据集Qwen3-ASR-1.7BQwen3-ASR-0.6BWhisper-large-v3豆包-ASR
WenetSpeech net | meeting4.97 | 5.885.97 | 6.889.86 | 19.11N/A
AISHELL-2-test2.713.155.062.85
SpeechIO2.883.447.562.93
Fleurs-zh2.412.884.092.69
KeSpeech(方言)5.107.0828.795.27
WenetSpeech-Yue short | long5.82 | 8.857.54 | 9.9232.26 | 46.649.74 | 11.40

中文场景下 Whisper 与 Qwen3-ASR 差一个数量级。连 0.6B 的 Qwen3-ASR 都稳压 Whisper-large-v3。

四、本机同口径实测

同一台机器、同一个运行时(sherpa-onnx 1.13.8 / CPU / int8)、同一批音频,4 个模型跑同一套用例。这是本文最有价值的一节 —— 公开榜单的 RTFx 是 H200 GPU 上的数字,与「能不能在普通 CPU 上跑」无关。

4.1 总表

模型int8 体积峰值内存RTFx @1线程RTFx @8线程平均 CER↓1 小时音频
SenseVoiceSmall239 MB1.13 GB30.8115.03.1 %31 s
Fun-ASR-Nano993 MB2.82 GB7.920.22.4 %178 s
Qwen3-ASR-0.6B983 MB5.91 GB5.411.47.0 % *316 s
Whisper-large-v3-turbo1036 MB3.03 GB5.510.632.4 %340 s

* Qwen3-ASR 的 7.0% 全部来自中英混说那一句(它把 "mixed recognition" 翻译成了「麦克风识别」)。4 个纯中文用例它全是 0% CER —— 逐字准确率其实第一。
RTFx = 音频时长 ÷ 处理耗时,越大越快。
SenseVoice 比第二快的 Fun-ASR-Nano 快 5.7×、比 Qwen3-ASR 快 10×,体积只有 1/4,内存只有 Qwen 的 1/5。

4.2 分用例 CER

模型普通话 8.5 s数字实体 8.4 s粤语 3.8 s中英混说 7.1 s长文 70.4 s
SenseVoiceSmall0 %5.7 %0 %8.7 %1.0 %
Fun-ASR-Nano0 %5.7 %0 %4.3 %2.0 %
Qwen3-ASR-0.6B0 %0 %0 %34.8 %0 %
Whisper-large-v3-turbo31.6 %20.0 %31.3 %10.9 %68.4 %

4.3 同一句,四份输出

真值由 macOS say 合成(Tingting zh_CN / Sinji zh_HK),因此真值确定。CER 打分前统一去标点、小写、中文数字转阿拉伯数字(模型 ITN 行为不同不等于准确率不同)。

普通话真值 — 人工智能语音识别技术正在改变我们的生活方式,请帮我核对这条测试音频的识别准确率。

SenseVoice 人工智能语音识别技术正在改变我们的生活方式,请帮我核对这条测试音频的识别准确率。 0%
Fun-ASR-Nano 人工智能语音识别技术正在改变我们的生活方式,请帮我核对这条测试音频的识别准确率。 0%
Qwen3-ASR 人工智能语音识别技术正在改变我们的生活方式。请帮我核对这条测试音频的识别准确率。 0%
Whisper 人工音别技正在我们的生活方式请对这条音频的别率 31.6%

数字/实体真值 — 订单编号是 87654321,预计在 9 月 11 日下午 3 点 20 分送到科技园 A 座。

SenseVoice 订单编号是87654321,预计在9月11日下午3点20分送到科技园阿佐 5.7%
Fun-ASR-Nano 订单编号是87654321,预计在9月11日下午3点20分送到科技园阿左 5.7%
Qwen3-ASR 订单编号是八七六五四三二一,预计在九月十一日下午三点二十分送到科技园A座 0%
Whisper 号是87654321,9月11日下午3点20分送到科技,啊,坐 20.0%

中英混说真值 — 我们需要部署一个 lightweight 的 ASR 模型,支持多语言 mixed recognition。

SenseVoice 我们需要部署一个light weightAR模型,支持多语言max recognition 8.7%
Fun-ASR-Nano 我们需要部署一个LightweightASR模型,支持多语言MIX RECOGNITION 4.3%
Qwen3-ASR 我们需要部署一个 lightweight 的 A S R 模型,支持多语言麦克风识别 34.8%
Whisper 我们需要一个lightweightASR模型,支持多max recognition 10.9%

五、三个硬约束(比跑分更容易踩)

1 · Whisper:30 秒硬上限,超出静默丢弃
运行时直接打印 Only waves less than 30 seconds are supported. We process only the first 30 seconds and discard the remaining data。70 秒长文实测只处理了前 30 秒,CER 68.4%。不会报错,只会少字,生产上极难发现。

2 · Fun-ASR-Nano:通用 sherpa int8 导出 KV 上限 512,单段约 20 秒
超出即静默截断:Context_len (522) exceeds KV capacity (512). Truncating audio placeholders。30 秒切分时它直接丢掉了前 60 秒内容;按 20 秒切分后才跑出 2.4% CER。必须配 VAD 切句。需要更长上下文可换 zengshuishui/FunASR-nano-onnx 的大 KV 导出。

3 · Qwen3-ASR:CPU 上是自回归 LLM 解码器
精度最高(纯中文 4/4 用例 0% CER,长文标点完整),但 70 秒长文要自回归生成 300+ token,RTFx 掉到 4.8,峰值内存 5.91 GB。它的流式推理只支持 vLLM 后端,等于要 GPU
另一个特性:面对 code-switch 会把英文词「翻译」成中文(mixed recognition → 麦克风识别),这在加字幕/会议记录场景是致命伤害。

六、推荐与决策树

必须中文
├─ 中 / 粤 / 英 / 日 / 韩 够用
│   └─ ✅ SenseVoiceSmall int8    239MB · RTFx 115 · 原生长音频 · 自带标点 ITN
│
├─ 需要 30+ 语 / 7 大方言,且能接受 VAD 切句
│   └─ Fun-ASR-Nano int8          993MB · RTFx 20 · 必须切 ≤20s · 远场噪声优化
│
├─ 精度优先,且已具备 GPU
│   └─ Qwen3-ASR-0.6B            983MB · CPU RTFx 11 · vLLM 才有流式
│
└─ 必须真流式(边说边出字)
    └─ nemotron-3.5-asr-streaming-0.6b   742MB GGUF · 含中文 · 精度低一档
模型语言覆盖流式热词int8 体积CPU RTFx@8定位
SenseVoiceSmall中(方言)·粤·英·日·韩239 MB115轻量速度冠军
Fun-ASR-Nano31 语 + 7 大方言993 MB20多语言 + 方言
Qwen3-ASR-0.6B52 语 + 22 中文方言需 vLLM983 MB11精度优先
parakeet-tdt-0.6b-v325 语 · 无中文714 MB纯英文极速
nemotron-3.5-streaming-0.6b40 语 · 含中文742 MB低延迟语音 Agent
Voxtral-Mini-4B-Realtime13 语8.86 GBRTFx 103,不划算
whisper.cpp / faster-whisper99 语0.25–1.5 GB11中文不可用

七、SenseVoiceSmall 落地配方

运行时   sherpa-onnx 1.13.8
         C++ 单库;Python / C / C++ / Java / Go / Swift / Node 绑定 + 预编译二进制
         无需 Python 环境可独立部署

文件     model.int8.onnx   239 MB
         tokens.txt        316 KB          ← 就这两个文件

加载     0.47 s / 8 线程
内存     1.13 GB 峰值(处理 70 秒音频)

能力     中文(含方言)· 粤语 · 英 · 日 · 韩;自动语种识别
         内置 ITN + 标点(无需额外标点模型)
         非自回归结构,整句一次解码

备选路径 官方 SenseVoiceSmall-GGUF(q8 仅 254 MB)+ llama.cpp
         纯单二进制、内置 VAD,适合边缘设备

模型体积对照(公开仓库实测)

模型权重体积可用量化格式
SenseVoiceSmall936 MB (pt) → 254 MB (GGUF q8)GGUF, ONNX int8, libtorch
Qwen3-ASR-0.6B1.88 GB (bf16) / 1.56 GB (fp16 -hf)社区 ONNX / GGUF
Qwen3-ASR-1.7B4.70 GB / 4.08 GB (-hf)无官方量化
parakeet-tdt-0.6b-v32.51 GB (fp16) / 714 MB (q8_0 GGUF)GGUF · NeMo-Speech.cpp
nemotron-3.5-streaming-0.6b2.55 GB / 742 MB (q8_0 GGUF)GGUF · NeMo-Speech.cpp
whisper-large-v3-turbo1.62 GB (fp16)ggml / CTranslate2
faster-whisper-large-v33.09 GB (CTranslate2)int8 ≈ 1.5 GB
Voxtral-Mini-4B-Realtime8.86 GB (fp16)
VibeVoice-ASR-7B17.35 GB

八、另外三个必须知道的坑

九、证据边界与复现

证据分级

测试环境

硬件      Apple M4 Pro (14 核) · macOS 26.5
运行时    sherpa-onnx 1.13.8 · onnxruntime 1.30.0 · CPU only · int8
语料      macOS `say` 合成,16 kHz 单声道 PCM16,共 5 段 / 98.2 s
          普通话 8.5 s · 数字实体 8.4 s · 粤语 3.8 s · 中英混说 7.1 s · 长文 70.4 s
打分      去标点空格、小写、中文数字→阿拉伯数字 后计算 CER
          (各模型 ITN 行为不同 ≠ 准确率不同,故须归一化)
长音频    Fun-ASR-Nano 按 20 s 切分(其 KV 上限 512);其余整段送入
重复      每种配置取 3 次最优;线程数 1 / 8

复现材料

final_bench.py   4 模型同口径跑分(含公平 CER 打分实现)
results.json     全部原始输出文本 + 分项 CER
memchk.py        峰值内存测量
gt/*.wav         5 段中文真值音频

模型来源(ModelScope 镜像,比 HF 直连快约 40×)
  pengzhendong/sherpa-onnx-sense-voice-zh-en-ja-ko-yue          model.int8.onnx
  pengzhendong/Fun-ASR-Nano-int8                                encoder_adaptor + llm + embedding
  jkman2023/sherpa-onnx-qwen3-asr-0.6B-int8-2026-03-25          encoder + decoder + conv_frontend
  pengzhendong/sherpa-onnx-whisper-turbo                        turbo-encoder.int8 + decoder.int8
  csukuangfj/sherpa-onnx-punct-ct-transformer-zh-en-...         标点模型(SenseVoice 自带,未使用)