用 AI 算朴素贝叶斯词频:这个词更像甲类,最终为何仍判乙类
AI解释文本分类时,如果只看“某个词在哪一类更常见”,可能漏掉类别本身出现的频率。多项式朴素贝叶斯提供了一个很小却完整的练习:同一个偏向甲类的词,出现一次和出现两次,最后判断可以不同。
AI模型生成的概念插图:重复词项与类别权重共同参与分类;篮中卡片数量不代表正文样本数或模型概率。
词项总数与文档类别比例分开给
固定词表只有“圆”和“角”两个符号。甲类训练文本的累计词频为[8,2],乙类为[2,8]。这是词项出现总数,不是文档篇数。另行指定类别先验P(甲)=0.2、P(乙)=0.8;先验在本例中明确给定,不从两类相同的总词数倒推。
采用加一平滑α=1,词表大小为2。甲类“圆”的条件概率为(8+1)/(10+2)=3/4,“角”为1/4;乙类相反,分别为1/4与3/4。分母必须对两个词都加上平滑量,不能只给分子加一。
这些数估计的是给定类别后词项出现的分布。P(圆|甲)=3/4不等于P(甲|圆)=3/4,方向不能交换。后者还要结合先验与归一化,下面正好能检查这个差别。
出现一次,词项优势仍不足以压过先验
输入文本的计数向量取[1,0],即一个“圆”、没有“角”。甲的未归一权重为0.2×0.75=0.15,乙为0.8×0.25=0.2。两者总和0.35,所以后验分别为3/7与4/7,约0.428571与0.571429,最终选择乙。
从赔率看更简洁:甲乙先验比为1/4,一个“圆”的似然比为3,乘后为3/4,仍小于1。这个词确实把判断往甲推近了,却没有完全抵消乙在先验上的优势。它不是无用证据,只是力度有限。
计数翻倍,会把同一似然再乘一次
将输入改为[2,0]。甲权重是0.2×0.75²=0.1125,乙为0.8×0.25²=0.05;归一后甲为9/13,约0.692308,乙为4/13,判断变成甲。赔率也变为(1/4)×3²=9/4。
两次“圆”不能只记成“出现过圆”再套相同答案。多项式模型使用计数,伯努利变体则对词是否出现采用不同建模,不能在中途切换。对于同一条输入,多项式组合系数与类别无关,做类别比较时可约去,并非随意丢弃了一部分概率。
还可检查[1,1]:两类的词项乘积都是0.75×0.25,互相抵消后后验恢复为给定先验0.2与0.8。交换两词的先后顺序也不会改变这一词袋表示;模型只读计数,无法据此理解语序。
把 AI 的分类解释拆成四行证据
让AI依次交词表与计数、平滑分母、类别对数分数、归一后的概率。长文本可把乘积改成“log先验+各词计数×log条件概率”的和,防止小数连乘下溢;比较分数和报告概率是两项不同操作。
这些后验是模型假设下的结果,不等于经过现实校准的可靠置信度。词项依赖、训练分布变化与词表外词的处理都会影响应用;独立复算只能证明本例算式一致,不能证明分类假设适合某份真实语料。
资料核对日期:2026年10月2日。算例为原创教学设定,已用独立Python计算复核,不代表真实模型训练或性能测试。


