上一篇《方言TTS落地实战》里我们提过一个判断:方言AI应用的坑,八成出在文本层,不在语音层。通用大模型写的"苏州话"文案,经常混进上海话说法甚至普通话直译,TTS 音色克隆得再像,念出来的词就是错的。这篇文章把解决这个问题的核心资产——3550条苏州话标准词库——拆开讲:真实数据长什么样、覆盖率多少、在产线里怎么用、建设时踩过的坑。
不讲感觉,直接上统计。以下数字来自词库文件(343KB,JSON,3550个键)的全量扫描:
| 指标 | 实测值 | 说明 |
|---|---|---|
| 词条总数 | 3550 | dict 键数实测,无重复 |
| 字段结构 | word / pinyin / ipa / meaning | 四字段 JSON 字典 |
| 释义覆盖率 | 695 条,约 19.6% | 常用词优先有释义,长尾词条占位待补 |
| 词条长度分布 | 2字 1545 / 3字 1376 / 4字 399 | 三言四言熟语占大头(合计约 93% 为 2–4 字) |
| 超长词条 | 5–9字 119 条,最长 15 字 | 完整俗语、歇后语整句收录 |
这个分布本身就说明问题:方言的精髓不在单字,在三言四言的固定说法。"呒手抓锣"(手足无措)、"阿作兴"(像话吗/怎么可以)、"坏脱哉"(糟糕了)——这些才是苏州人开口就来的东西,也恰恰是通用语料里最缺的部分。
{
"倷": {"word": "倷", "pinyin": "n", "meaning": "你"},
"白相": {"word": "白相", "pinyin": "b", "meaning": "玩儿"},
"呒手抓锣": {"word": "呒手抓锣", "pinyin": "m",
"meaning": "常用来形容忙乱时手足无措"},
"结棍": {"word": "结棍", "pinyin": "c", "meaning": "②厉害"}
}
我们的苏州话 TTS 产线是"DeepSeek 翻译层(普通话→苏州白话)→ 词库校验 → TTS 合成"。翻译层输出的每一句,先拆词过词库:命中即安全;未命中的三言四言短语进复核队列,确认是苏州本土说法才放行或入库。跑通这个闭环后,"上海话词混进苏州话音频"这类事故基本绝迹。
展会数字人、方言客服的预设问答,全部用词库倒查一遍:凡是词库里没有的"方言词",要么改回普通话表达,要么核实后补进词库。宁可说地道的普通话,不说不地道的方言。
产线每天产出数百条语料,质量分级(能用/噪声/兜底回复)的第一刀就是词密度:一条语料里词库命中率高、且命中的是三言四言熟语,基本就是高质量方言句;命中率异常低的,多半是模型开始说普通话了。
这份词库已在站内上架(¥99,JSON+CSV 双格式,含字段说明与样例),所见即本文披露的这份数据,不注水。
查看《苏州话标准词典词库 3550 条》商品页 →因为方言的错误大多出在文本层而不是语音层。通用大模型生成的"苏州话文案"经常混入上海话、普通话说法,TTS 读得再标准也是错的词。词库是文本层的"白名单+校验器",先把词选对,语音模型才有意义。
够做校验,不够做穷尽。日常高频口语核心词在两三千条量级,3550条已覆盖常用对话的绝大部分;但方言是活的,所以词库必须支持增量维护。本词库释义覆盖率约19.6%,常用词优先,长尾占位滚动补全。
文本生成后逐词比对词库,命中即安全;未命中的三言四言短语进人工或二次模型复核,确认是苏州本土说法才放行或入库。持续跑这个流程,文本纯度就稳定。
最小可用结构是 word / pinyin / meaning 三字段,建议再加 ipa 与 source。JSON 字典按词索引,校验是 O(1) 查找,几千条规模无需数据库。
可以。3550条标准词条(JSON+CSV 双格式)已在站内商品页上架,适合方言TTS文本校验、方言学习产品、语言研究三类用途。