中文语句里词与词之间没有空格作为天然边界,机器想要理解一句话,首先要解决“哪里该断开”的问题。这个环节被称为分词,它是搜索召回、文本分类、智能推荐甚至大模型理解语义的地基。分词切得准不准,直接影响下游任务的效果上限。目前业界的主流分词方案大致可归纳为四类,它们在响应速度、算力需求和应对新词的能力上差异明显,适用于不同的应用场景。
这类方法把所有判断依据都放在预先整理好的词库上,通过字符串比对来确定词语边界。扫描方向不同,衍生出几种常见策略:正向最大匹配从句子开头向右延伸,尽量截取最长的词;逆向最大匹配则从句子末尾向左推进。以句子“我们研究生命起源”为例,正向切分通常能得到“我们/研究/生命/起源”的理想结果,但遇到“这课程研究生命的意义”这类结构时,从后往前的逆向策略往往更能避开动宾搭配的歧义。双向匹配则是同时执行两个方向,再把结果结合词频信息进行仲裁。
词典方案的最大价值在于部署门槛极低,无需任何标注数据即可上线运行,处理几万条文本通常只需几十毫秒,因此在弹幕过滤、实时评论审核等对延迟敏感的环节应用广泛。然而它的短板也相当突出:词库是静态的,追不上语言演变的脚步。当新闻里的新造词、网络热梗未被收录时,很容易被拦腰切断。在医疗、法律这类术语密集的领域,这种误切会显著推高整体错误率。
维护词库不必每次都推倒重来。可以定期从同领域的高质量报道或论文中抽取出现频次高的词组,将它们并入主词库的扩展区;同时保存用户搜索后的纠错反馈,当同一歧义片段反复触发修改时,自动提升对应切分结果的优先级。这种方式不增加服务器负担,却能一步步压缩常见误切的发生概率。
统计方法不再死守词表,而是从大规模语料中挖掘汉字与邻近字的共现规律。隐马尔可夫模型(HMM)为每个汉字预设一个隐状态,比如词首、词中或词尾,再利用维特比算法寻找全局概率最高的状态序列。只要某个字组在语料中频繁一同出现,即便从未被任何词典收录,模型也能将它识别为一个词。
条件随机场(CRF)则是更进一步,它允许相邻位置的标签决策相互影响,能捕捉到更复杂的边界线索,对成语、缩写词这类边界模糊的片段判断更为精准。代价是训练耗时更长,且模型学到的规律带有明显的领域偏向——换到风格迥异的文本上,效果会明显缩水。若手头语料仅几万条且无标注,HMM 能更快跑通;但若已拥有数十万条人工精标数据,并愿意投入足够时间调参,CRF 通常能换来更稳健的准确率。
神经网络的普及让分词从手工设计特征跃迁为自动提取特征。BiLSTM 依靠双向循环结构,同时读取目标汉字左右两侧的上下文,对长距离语义依赖的把握远超传统统计模型。以 BERT 为代表的预训练语言模型则更进一步,先在大规模无标注文本上习得通用语言表示,再用少量标注数据微调,即可在公开测试集上取得接近满分的结果。
这类方案的核心竞争力在于真正的语境感知能力。当模型读到“研究生命科学”时,能根据“研究”与“科学”的搭配习惯,正确切出“研究/生命/科学”,而词典方案很可能因为“研究生”词频更高,输出“研究生/命”这样令用户困惑的碎片。需要注意的是,这一路线的算力开销常被低估——模型参数动辄上亿,仅靠普通 CPU 很难实现毫秒级响应。小型团队在资源有限时,可优先考虑蒸馏后的轻量版模型,或借助 GPU 实例进行推理加速,否则容易陷入成本失控的困境。
现实业务很少只押注单一方案,更常见的做法是组合拳:先用词典做快速初切,保证高吞吐;再用统计或深度学习模型处理歧义片段与未登录词;最后辅以领域术语表做结果纠偏。例如在电商搜索场景中,先用双向最大匹配快速分割查询词,随后利用深度学习模型对疑似歧义的片段进行二次判定,最后将品牌名、型号等专属词汇表作为强制匹配项覆盖结果。
选择方案时需权衡三个维度:数据规模决定能否走深度学习路线,响应时间决定词典与模型的配比,新词出现频率决定词库更新的投入力度。若业务对实时性要求极高且资源有限,优先保障词典的敏捷更新;若追求高精度且积累了大量标注数据,则应果断转向序列标注或预训练模型。
影响是传导性的。搜索场景中,分词错误直接导致召回不全或匹配错位;文本分类任务里,错误的词边界会引入噪声特征,拉低分类准确率;在知识图谱构建或舆情分析中,误切甚至会使实体识别和情感判断出现偏差。可以说,分词质量是下游效果的天花板之一。
依赖静态词库的方案最难适应新词。行之有效的做法是建立“动态词库”机制:定期从同领域新闻、用户查询日志中抽取高频新组合,自动审核后并入词库;同时借助统计模型对未登录词进行候选召回,将置信度高的候选补充为临时词条。对于深度学习方案,则需要通过周期性增量训练来保持对新词的敏感度。
可以,但需精打细算。优先选用开源的中文预训练小模型(如蒸馏版或轻量 Transformer),参数量可压缩至百万级,在普通 CPU 上也能达到每秒数百句的处理速度。此外,可利用成熟的在线分词 API 作为兜底,只在本地保留词典快速方案,既能控制成本,又不至于牺牲过多精度。
分词没有放之四海而皆准的银弹选项。词典匹配适合快速响应与低资源场景,但需保持词库活力;统计模型在标注数据有限时是性价比之选;深度学习方案效果最佳,却要用算力换取精度。建议在动手前先厘清自己的数据量、响应时间与硬件预算,再选定主线方案,并预留动态词库或混合判定机制作为纠偏手段。从实际需求出发,才能选择最合适的分词方案。