本地语音识别选型实测:7个开源引擎对标讯飞,显存/速度/准确度全数据
做语音交互数字人,第一个绕不开的问题就是:语音识别(ASR)用云端还是本地?本地的能不能替代讯飞、省下调用费?网上的说法两极分化——有人说 whisper 已经封神,有人说本地模型根本不能用。
我们没有引用任何人的观点,直接在数字人产线上做了一次同题实测:7 个本地开源引擎 + 讯飞 mulacc,同批 15 条真实客户语音,逐条对比输出,同时用 nvidia-smi 100ms 采样测出每个模型的真实净占显存。这篇文章只放数据和结论。
一、三个结论(赶时间只看这段)
- 本地开源模型目前没有一个能在真实客户对话场景追上讯飞。同题对比下,讯飞输出通顺正确的句子(「今天中午刚到苏州」),本地六家输出的是「今天通膜肝很到處的」这类听音写字失败的乱句。
- 换更好的 GPU 解决不了准确度问题。我们在 16G 显存的 RTX 4060 Ti 上跑遍了最强本地候选,包括理论上最对口的阿里 Qwen3-ASR(支持 22 种中文方言含吴语),准确度仍不及讯飞。速度是显卡决定的,准确度是模型决定的。
- 显存需求远低于官方标称。Qwen3-ASR-1.7B 官方文档说需要 16G 显存,实测净占只有 4.57G(单路、短音频)。一张 6G 的卡能跑下全部主流本地 ASR。
二、显存与速度实测(已扣基线的净占用)
测试机为集群视频节点(RTX 4060 Ti 16GB),显存用 nvidia-smi 100ms 间隔采样取峰值、扣除基线占用,耗时为 15 条样本(单条 1.5~5.0 秒)的平均值:
| 引擎 | 净占显存 | 单条均耗时 | 4G卡 | 6G卡 | 16G卡 |
|---|---|---|---|---|---|
| SenseVoice-Small | 1.12G | 0.064s | ✅ | ✅ | ✅ |
| Paraformer-large | 1.09G | 0.151s | ✅ | ✅ | ✅ |
| Qwen3-ASR-0.6B | 1.88G | 0.522s | ⚠️ 紧 | ✅ | ✅ |
| whisper-v3-turbo | 2.16G | 0.259s | ⚠️ 紧 | ✅ | ✅ |
| whisper-large-v3 | 3.78G | 0.412s | ❌ | ⚠️ 余量小 | ✅ |
| Qwen3-ASR-1.7B | 4.57G | 0.385s | ❌ | ⚠️ 单路可行 | ✅ |
| 讯飞 mulacc(云端) | — | 0.395s | — | — | — |
量化变体更省:whisper-large-v3 int8 量化后净占 1.96G,turbo int8 后 1.19G。所以"要多大显卡才够"这个问题的答案是:本地 ASR 推理对显存的要求低得出乎意料,6G 显存已经不是瓶颈——瓶颈在准确度。
三、准确度同题对比:差距比想象中大
样本是从一段 508 秒的现场长录音里按能量切出的 15 条真实语音,典型几条的对比如下:
| 真值(人工听标) | 讯飞 mulacc | Paraformer-large | whisper-large-v3 | Qwen3-ASR-1.7B |
|---|---|---|---|---|
| 今天中午刚到苏州 | ✅ 今天中午刚到苏州。 | 今天中午刚到苏国 | 今天通膜肝很到處的 | 今天通红干到处。 |
| 然后吃完以后呢? | ✅ 然后吃完以后呢? | 拿红一起买礼物的啊清仓的… | 我只是懷疑不難因為我從未遇過… | 好,八千三年,我have幫你申請會。 |
| 线下的那个客户 | ✅ 线下的那个客户。 | 线下的 | 卸下的 | 线下的推广。 |
三个值得单独说的现象:
- whisper 系是七家里最不可用的:听不懂时不报错,而是喷训练集里的幻觉文本——「请不吝点赞 订阅 转发 打赏支持」「中文字幕志愿者」「早安早安早安早安」。识别不准尚能容错,编造内容在客服场景就是事故。
- Qwen3-ASR 会串语言:输出中混入英文整句(「Yes, you two are behind.」)和中英混杂(「我have幫你申請會」),在远场带口音样本上不稳定。
- 讯飞也不是神:15 条里有 1 条输出为空、2 条疑似有错。但它的问题是"偶尔失手",本地六家的问题是"稳定地写不对句子",性质不同。
四、最大的方法论陷阱:别用"多引擎共识"评估准确度
这是我们这次测试最值钱的一条教训。一开始为了省事,我们算过每个引擎与其他 6 家输出的平均相似度,想用"共识度"代替人工听标:
| 引擎 | 与其他6家的共识相似度 |
|---|---|
| SenseVoice-Small | 0.395 |
| Qwen3-ASR-1.7B | 0.385 |
| Qwen3-ASR-0.6B | 0.383 |
| Paraformer-large | 0.378 |
| whisper-large-v3 | 0.306 |
| whisper-v3-turbo | 0.257 |
| 讯飞 mulacc | 0.237(全场最低) |
如果只看这张表,结论会是"讯飞最差"——完全错误。真相是:N 个本地弱模型共享同一种"听音写字失败"的模式,所以它们的输出彼此很像;而讯飞用大模型做了语义纠正、输出通顺句子,所以"最不合群"。同一条音频,六家本地给出「今天通膜肝很到處的」「今天冲目干粗数」「今天通红干到处」——它们"共识"了,但全错;讯飞给「今天中午刚到苏州」,它对。
多数表决只在错误独立分布时有效。当弱模型共享同一失败模式、而唯一的强者与之不同时,共识指标会把结果反向排序。评估 ASR 必须有真值(人工听标),任何"引擎互比"的自动化评估都不可信。
五、Qwen3-ASR 环境搭建:五个实打实的坑
Qwen3-ASR 是理论上最对口的本地候选(52 种语言 + 22 种中文方言含吴语),但环境极其苛刻,我们全部踩过:
- transformers 必须是 4.57.6,不能新版。新版 transformers 5.x 虽然有 Qwen3ASR 类,但模型权重的 safetensors 键名是
thinker.*前缀(源自 Qwen3-Omni),与 5.x 期望的model.*不匹配——加载时全量 MISSING、参数随机初始化,推理直接报维度错误。判断依据:读模型config.json里的transformers_version字段。 - torch 必须 2.5.1。transformers 4.57.6 依赖的
torch.utils._pytree.register_pytree_node在 torch 2.13 已被移除改名,版本不对直接 AttributeError。 - 运行必须带
USE_TF=0。venv 用--system-site-packages会继承用户目录下一个损坏的 tensorflow,transformers 的 image_transforms 会尝试 import 它,一崩全崩。 - 下载源选清华。实测清华源 33MB/s,阿里云源 906MB 的模型下了 20 分钟没下完。
- 磁盘预留 16G。独立 venv 5.2G + Qwen 模型 6.2G + whisper 模型 4.5G ≈ 15.9G。
# 正确姿势(独立 venv,隔离版本) ~/dh_env_new/bin/python -m venv --system-site-packages ~/qwen_env ~/qwen_env/bin/pip install -U qwen-asr -i https://pypi.tuna.tsinghua.edu.cn/simple ~/qwen_env/bin/pip install 'torch==2.5.1' 'torchaudio==2.5.1' -i https://pypi.tuna.tsinghua.edu.cn/simple USE_TF=0 ~/qwen_env/bin/python script.py
六、落地建议:我们产线的最终架构
| 用途 | 选型 |
|---|---|
| 客户对话主链路 | 讯飞 mulacc——准确度最高,单条 0.4s,调用成本极低 |
| 离线兜底 / 云端挂了的备灾 | Paraformer-large——1.09G 显存、0.15s、无幻觉,最稳 |
| 省云端额度的粗筛 | 本地模型先判"对方是不是在跟机器说话",像人话的才送云端(讯飞 mulacc 并发仅 2,粗筛还能护并发) |
| 不建议 | 用任何本地模型直接替代云端识别做客户对话——省下的调用费抵不上答非所问丢掉的客户 |
写在最后
这次测试的 15 条样本音频已全部导出等待人工听标,补齐真值后我们会给出量化准确率(目前为定性对比)。如果你正在给数字人、语音客服或会议转写做 ASR 选型,希望这份带真值、带显存数据的实测能帮你跳过我们踩过的坑。
我们做数字人语音交互的完整链路(ASR + 大模型 + TTS + 形象驱动)落地与定制,也提供方言语音场景(苏州话等吴语)的专项方案。
聊聊你的语音交互场景 →常见问题
本地语音识别模型需要多大显存?
远低于官方标称。实测净占显存:SenseVoice-Small 1.12G、Paraformer-large 1.09G、whisper-large-v3 3.78G(int8 后 1.96G)、Qwen3-ASR-1.7B 官方标称 16G 实测仅 4.57G。6G 显存的卡在单路短音频场景已够用。
本地 ASR 能替代讯飞等云端识别吗?
真实客户对话场景下目前不能。同题 15 条真实语音测试,讯飞输出通顺正确,六个本地引擎全部出现听音写字失败或幻觉。本地适合兜底、备灾和粗筛,主链路仍建议云端。
换更好的 GPU 能提升识别准确度吗?
不能。速度由显卡决定,准确度由模型决定。16G 显存上跑最强本地候选仍不及云端讯飞,升级显卡只提升速度。
whisper 做中文识别可靠吗?
我们的真实口语样本上它是七家里最不可靠的:听不懂时会输出与音频无关的幻觉文本(如"请点赞订阅转发"),客服场景属于事故级问题。
能用多引擎互相投票评估准确度吗?
不能。弱模型共享同一失败模式会彼此"共识"但全错,唯一正确的强引擎反而相似度最低(讯飞实测 0.237 全场垫底但唯一正确)。评估必须有真值,不能引擎互比。
离线兜底选哪个模型?
Paraformer-large:1.09G 显存、0.15s、无幻觉,最省最稳。备选 Qwen3-ASR-0.6B,但注意 transformers 必须 4.57.6、torch 必须 2.5.1、必须 USE_TF=0。