建立长期维护机制,核心是把中文分词算法从“一次性调参”变成“可回归、可监控、可迭代”的工程流程。具体做法是:先确定分词标准与评测集,再固定版本与配置,接着用对照测试验证效果,最后通过定期回归、词表更新和异常监控维持质量。对多数内容型项目,最关键的一步是建立一份小而稳定的标注评测集,否则后续任何改动都无法判断是变好还是变坏。
中文分词没有唯一正确答案,同一句话在不同业务下可以有不同的合理切分。因此维护机制的第一步不是选工具,而是写清楚判断依据。可以从三个维度定义:
把标准写成简短文档,并从中挑选一批有代表性的句子,人工标注正确结果,形成评测集。评测集不需要很大,但必须覆盖常见歧义、专有名词、数字与英文混排、标点边界等情况。这份集合就是后续所有对比的依据。
选择分词方案时,通常要在两类做法之间比较:
判断适用条件可以看两点:如果业务术语固定、要求结果稳定可追溯,词典方法更容易长期维护;如果文本来源多样、新词频繁出现,统计方法更合适,但必须配套固定随机种子、模型版本和训练数据版本。
无论选哪种,都要把算法版本、词典版本、参数配置写入配置文件并纳入版本管理。维护机制失效的常见原因,就是某次更新只改了本地环境,导致线上与测试结果不一致。
每次调整词表、更换模型或升级依赖后,都应运行同一套评测集,比较改动前后的结果。可执行的检查步骤是:
如果改对的数量明显多于改错,并且没有破坏关键领域词的切分,就可以合入;反之则回退。这里要区分“可能原因”和“已经定位的原因”:某句切分变化可能来自词表新增、模型更新或预处理改动,不能只看一个现象就断定是某一项造成的,需要逐项隔离验证。
长期维护不是定期重训一次,而是把几件事固定成节奏:
对词典方法,重点是控制词表膨胀,定期清理长期未命中的词条;对统计方法,重点是固定训练与推理环境,避免依赖升级带来不可复现的变化。两种方案都可以用同一份评测集来衡量,因此评测集是维护机制中最值得优先投入的部分。
下一步建议先整理二十到五十条覆盖主要业务场景的句子,完成人工标注,并把它接入一次改动前后的对比流程。跑通这一轮之后,再逐步把回归测试自动化。