本地语音识别选型实测:7个开源引擎对标讯飞,显存/速度/准确度全数据

2026-09-18 · AI智工坊 · 约 11 分钟读完 · 本文全部数据来自我们数字人产线的真实同题测试(RTX 4060 Ti 16GB,508秒现场录音切出的15条真实语音)

做语音交互数字人,第一个绕不开的问题就是:语音识别(ASR)用云端还是本地?本地的能不能替代讯飞、省下调用费?网上的说法两极分化——有人说 whisper 已经封神,有人说本地模型根本不能用。

我们没有引用任何人的观点,直接在数字人产线上做了一次同题实测:7 个本地开源引擎 + 讯飞 mulacc,同批 15 条真实客户语音,逐条对比输出,同时用 nvidia-smi 100ms 采样测出每个模型的真实净占显存。这篇文章只放数据和结论。

一、三个结论(赶时间只看这段)

  1. 本地开源模型目前没有一个能在真实客户对话场景追上讯飞。同题对比下,讯飞输出通顺正确的句子(「今天中午刚到苏州」),本地六家输出的是「今天通膜肝很到處的」这类听音写字失败的乱句。
  2. 换更好的 GPU 解决不了准确度问题。我们在 16G 显存的 RTX 4060 Ti 上跑遍了最强本地候选,包括理论上最对口的阿里 Qwen3-ASR(支持 22 种中文方言含吴语),准确度仍不及讯飞。速度是显卡决定的,准确度是模型决定的。
  3. 显存需求远低于官方标称。Qwen3-ASR-1.7B 官方文档说需要 16G 显存,实测净占只有 4.57G(单路、短音频)。一张 6G 的卡能跑下全部主流本地 ASR。

二、显存与速度实测(已扣基线的净占用)

测试机为集群视频节点(RTX 4060 Ti 16GB),显存用 nvidia-smi 100ms 间隔采样取峰值、扣除基线占用,耗时为 15 条样本(单条 1.5~5.0 秒)的平均值:

引擎净占显存单条均耗时4G卡6G卡16G卡
SenseVoice-Small1.12G0.064s
Paraformer-large1.09G0.151s
Qwen3-ASR-0.6B1.88G0.522s⚠️ 紧
whisper-v3-turbo2.16G0.259s⚠️ 紧
whisper-large-v33.78G0.412s⚠️ 余量小
Qwen3-ASR-1.7B4.57G0.385s⚠️ 单路可行
讯飞 mulacc(云端)0.395s

量化变体更省:whisper-large-v3 int8 量化后净占 1.96G,turbo int8 后 1.19G。所以"要多大显卡才够"这个问题的答案是:本地 ASR 推理对显存的要求低得出乎意料,6G 显存已经不是瓶颈——瓶颈在准确度。

三、准确度同题对比:差距比想象中大

样本是从一段 508 秒的现场长录音里按能量切出的 15 条真实语音,典型几条的对比如下:

真值(人工听标)讯飞 mulaccParaformer-largewhisper-large-v3Qwen3-ASR-1.7B
今天中午刚到苏州✅ 今天中午刚到苏州。今天中午刚到苏国今天通膜肝很到處的今天通红干到处。
然后吃完以后呢?✅ 然后吃完以后呢?拿红一起买礼物的啊清仓的…我只是懷疑不難因為我從未遇過…好,八千三年,我have幫你申請會。
线下的那个客户✅ 线下的那个客户。线下的卸下的线下的推广。

三个值得单独说的现象:

四、最大的方法论陷阱:别用"多引擎共识"评估准确度

这是我们这次测试最值钱的一条教训。一开始为了省事,我们算过每个引擎与其他 6 家输出的平均相似度,想用"共识度"代替人工听标:

引擎与其他6家的共识相似度
SenseVoice-Small0.395
Qwen3-ASR-1.7B0.385
Qwen3-ASR-0.6B0.383
Paraformer-large0.378
whisper-large-v30.306
whisper-v3-turbo0.257
讯飞 mulacc0.237(全场最低)

如果只看这张表,结论会是"讯飞最差"——完全错误。真相是:N 个本地弱模型共享同一种"听音写字失败"的模式,所以它们的输出彼此很像;而讯飞用大模型做了语义纠正、输出通顺句子,所以"最不合群"。同一条音频,六家本地给出「今天通膜肝很到處的」「今天冲目干粗数」「今天通红干到处」——它们"共识"了,但全错;讯飞给「今天中午刚到苏州」,它对

多数表决只在错误独立分布时有效。当弱模型共享同一失败模式、而唯一的强者与之不同时,共识指标会把结果反向排序。评估 ASR 必须有真值(人工听标),任何"引擎互比"的自动化评估都不可信。

五、Qwen3-ASR 环境搭建:五个实打实的坑

Qwen3-ASR 是理论上最对口的本地候选(52 种语言 + 22 种中文方言含吴语),但环境极其苛刻,我们全部踩过:

  1. transformers 必须是 4.57.6,不能新版。新版 transformers 5.x 虽然有 Qwen3ASR 类,但模型权重的 safetensors 键名是 thinker.* 前缀(源自 Qwen3-Omni),与 5.x 期望的 model.* 不匹配——加载时全量 MISSING、参数随机初始化,推理直接报维度错误。判断依据:读模型 config.json 里的 transformers_version 字段。
  2. torch 必须 2.5.1。transformers 4.57.6 依赖的 torch.utils._pytree.register_pytree_node 在 torch 2.13 已被移除改名,版本不对直接 AttributeError。
  3. 运行必须带 USE_TF=0venv 用 --system-site-packages 会继承用户目录下一个损坏的 tensorflow,transformers 的 image_transforms 会尝试 import 它,一崩全崩。
  4. 下载源选清华。实测清华源 33MB/s,阿里云源 906MB 的模型下了 20 分钟没下完。
  5. 磁盘预留 16G。独立 venv 5.2G + Qwen 模型 6.2G + whisper 模型 4.5G ≈ 15.9G。
# 正确姿势(独立 venv,隔离版本)
~/dh_env_new/bin/python -m venv --system-site-packages ~/qwen_env
~/qwen_env/bin/pip install -U qwen-asr -i https://pypi.tuna.tsinghua.edu.cn/simple
~/qwen_env/bin/pip install 'torch==2.5.1' 'torchaudio==2.5.1' -i https://pypi.tuna.tsinghua.edu.cn/simple
USE_TF=0 ~/qwen_env/bin/python script.py

六、落地建议:我们产线的最终架构

用途选型
客户对话主链路讯飞 mulacc——准确度最高,单条 0.4s,调用成本极低
离线兜底 / 云端挂了的备灾Paraformer-large——1.09G 显存、0.15s、无幻觉,最稳
省云端额度的粗筛本地模型先判"对方是不是在跟机器说话",像人话的才送云端(讯飞 mulacc 并发仅 2,粗筛还能护并发)
不建议用任何本地模型直接替代云端识别做客户对话——省下的调用费抵不上答非所问丢掉的客户
一句话总结本次实测:ASR 的决策不是"云还是本地",而是"主链路用云、兜底用本地、粗筛降额度"的三层结构。显卡决定你跑多快,模型决定你听多准,而评估方法决定你会不会把差的当成好的。

写在最后

这次测试的 15 条样本音频已全部导出等待人工听标,补齐真值后我们会给出量化准确率(目前为定性对比)。如果你正在给数字人、语音客服或会议转写做 ASR 选型,希望这份带真值、带显存数据的实测能帮你跳过我们踩过的坑。

我们做数字人语音交互的完整链路(ASR + 大模型 + TTS + 形象驱动)落地与定制,也提供方言语音场景(苏州话等吴语)的专项方案。

聊聊你的语音交互场景 →

常见问题

本地语音识别模型需要多大显存?

远低于官方标称。实测净占显存:SenseVoice-Small 1.12G、Paraformer-large 1.09G、whisper-large-v3 3.78G(int8 后 1.96G)、Qwen3-ASR-1.7B 官方标称 16G 实测仅 4.57G。6G 显存的卡在单路短音频场景已够用。

本地 ASR 能替代讯飞等云端识别吗?

真实客户对话场景下目前不能。同题 15 条真实语音测试,讯飞输出通顺正确,六个本地引擎全部出现听音写字失败或幻觉。本地适合兜底、备灾和粗筛,主链路仍建议云端。

换更好的 GPU 能提升识别准确度吗?

不能。速度由显卡决定,准确度由模型决定。16G 显存上跑最强本地候选仍不及云端讯飞,升级显卡只提升速度。

whisper 做中文识别可靠吗?

我们的真实口语样本上它是七家里最不可靠的:听不懂时会输出与音频无关的幻觉文本(如"请点赞订阅转发"),客服场景属于事故级问题。

能用多引擎互相投票评估准确度吗?

不能。弱模型共享同一失败模式会彼此"共识"但全错,唯一正确的强引擎反而相似度最低(讯飞实测 0.237 全场垫底但唯一正确)。评估必须有真值,不能引擎互比。

离线兜底选哪个模型?

Paraformer-large:1.09G 显存、0.15s、无幻觉,最省最稳。备选 Qwen3-ASR-0.6B,但注意 transformers 必须 4.57.6、torch 必须 2.5.1、必须 USE_TF=0。