3550条苏州话词条怎么变成AI可用的标准词库:一份方言数据工程实录

2026-09-20 · AI智工坊 · 方言数据工程

上一篇《方言TTS落地实战》里我们提过一个判断:方言AI应用的坑,八成出在文本层,不在语音层。通用大模型写的"苏州话"文案,经常混进上海话说法甚至普通话直译,TTS 音色克隆得再像,念出来的词就是错的。这篇文章把解决这个问题的核心资产——3550条苏州话标准词库——拆开讲:真实数据长什么样、覆盖率多少、在产线里怎么用、建设时踩过的坑。

一、先看真实数据:3550条词条的全量体检

不讲感觉,直接上统计。以下数字来自词库文件(343KB,JSON,3550个键)的全量扫描:

指标实测值说明
词条总数3550dict 键数实测,无重复
字段结构word / pinyin / ipa / meaning四字段 JSON 字典
释义覆盖率695 条,约 19.6%常用词优先有释义,长尾词条占位待补
词条长度分布2字 1545 / 3字 1376 / 4字 399三言四言熟语占大头(合计约 93% 为 2–4 字)
超长词条5–9字 119 条,最长 15 字完整俗语、歇后语整句收录

这个分布本身就说明问题:方言的精髓不在单字,在三言四言的固定说法。"呒手抓锣"(手足无措)、"阿作兴"(像话吗/怎么可以)、"坏脱哉"(糟糕了)——这些才是苏州人开口就来的东西,也恰恰是通用语料里最缺的部分。

二、真实样例:词库里的一条数据长什么样

{
  "倷":     {"word": "倷", "pinyin": "n", "meaning": "你"},
  "白相":   {"word": "白相", "pinyin": "b", "meaning": "玩儿"},
  "呒手抓锣": {"word": "呒手抓锣", "pinyin": "m",
              "meaning": "常用来形容忙乱时手足无措"},
  "结棍":   {"word": "结棍", "pinyin": "c", "meaning": "②厉害"}
}
说明:pinyin 字段当前为声母索引(用于按音序检索),ipa 字段预留待补。词库是持续维护的活资产,释义覆盖率按"常用词优先"策略滚动提升——这也是我们敢公开 19.6% 这个数字的原因:买的人有权知道真实完成度。

三、词库在产线里的三个实际用法

1. 文本纯度校验(防上海话污染)

我们的苏州话 TTS 产线是"DeepSeek 翻译层(普通话→苏州白话)→ 词库校验 → TTS 合成"。翻译层输出的每一句,先拆词过词库:命中即安全;未命中的三言四言短语进复核队列,确认是苏州本土说法才放行或入库。跑通这个闭环后,"上海话词混进苏州话音频"这类事故基本绝迹。

2. 数字人话术的用词白名单

展会数字人、方言客服的预设问答,全部用词库倒查一遍:凡是词库里没有的"方言词",要么改回普通话表达,要么核实后补进词库。宁可说地道的普通话,不说不地道的方言。

3. 语料分级的基准尺

产线每天产出数百条语料,质量分级(能用/噪声/兜底回复)的第一刀就是词密度:一条语料里词库命中率高、且命中的是三言四言熟语,基本就是高质量方言句;命中率异常低的,多半是模型开始说普通话了。

四、词库建设的四条工程纪律(踩坑换的)

  1. 来源必须可追溯。我们的词库整理自吴语学堂公开资料,参考《苏州方言志》《邢晏春苏州话语音词典》。来路不明的网络词表混进去,后面所有校验都失效。
  2. 先占位后补义,不许编造释义。吃不准的词条留空 meaning,等查辞书或问本地人。一条编造的释义比十条空缺危害大。
  3. 字长分布是健康指标。如果你的"方言词库"九成是双字词,那它大概率只是普通话词表换了皮——真正的方言库,三言四言熟语必须占大头。
  4. 词库跟着产线长。每次复核确认的新说法当天入库,词库版本与产线绑定,不做"一锤子买卖"的死数据。

五、这套资产适合谁

这份词库已在站内上架(¥99,JSON+CSV 双格式,含字段说明与样例),所见即本文披露的这份数据,不注水。

查看《苏州话标准词典词库 3550 条》商品页 →

常见问题

做方言AI应用,为什么需要先建词库而不是先调模型?

因为方言的错误大多出在文本层而不是语音层。通用大模型生成的"苏州话文案"经常混入上海话、普通话说法,TTS 读得再标准也是错的词。词库是文本层的"白名单+校验器",先把词选对,语音模型才有意义。

3550条词条够覆盖日常苏州话吗?

够做校验,不够做穷尽。日常高频口语核心词在两三千条量级,3550条已覆盖常用对话的绝大部分;但方言是活的,所以词库必须支持增量维护。本词库释义覆盖率约19.6%,常用词优先,长尾占位滚动补全。

词库怎么防止苏州话被上海话"污染"?

文本生成后逐词比对词库,命中即安全;未命中的三言四言短语进人工或二次模型复核,确认是苏州本土说法才放行或入库。持续跑这个流程,文本纯度就稳定。

词库的数据结构应该长什么样?

最小可用结构是 word / pinyin / meaning 三字段,建议再加 ipa 与 source。JSON 字典按词索引,校验是 O(1) 查找,几千条规模无需数据库。

这份词库可以直接拿到手用吗?

可以。3550条标准词条(JSON+CSV 双格式)已在站内商品页上架,适合方言TTS文本校验、方言学习产品、语言研究三类用途。