用 AI 给分类树选分叉:一边已经纯了,整次切分仍可能更差
给AI一棵分类树的候选分叉,它可能优先赞成“左边已经全是同一类”的方案。纯净的小分支确实有价值,但如果大多数样本仍挤在混杂的另一边,整次切分未必更好。八张卡片就能把这个差异算清楚。
AI模型生成的概念插图:不等大小的分支放在权衡结构上,提示按样本量评价;不代表软件截图、真实实验或精确数据图。
两种特征对应两份分组
准备八张虚构分类卡:A1、A2、A3、A4属于A类,B1、B2、B3、B4属于B类。每张样本权重相同,父节点两类各占一半。Gini不纯度定义为1-各类别比例平方之和,所以父节点为1-(1/2)²-(1/2)²=0.5。
候选特征X把A1独自分到左边,其余七张到右边。候选特征Y把A1、A2、A3、B1分到左边,其余四张到右边。这里比较的是已经给定的两个合法二分候选,不是让AI随意重贴类别或修改卡片成员。
小分支不能获得一半话语权
X的左节点只有A1,不纯度为0;右节点有3张A、4张B,不纯度为1-(3/7)²-(4/7)²=24/49。按节点样本数加权,切分后的总不纯度是(1/8)×0+(7/8)×(24/49)=3/7,约0.428571429。
Y的两边分别是3比1与1比3,不纯度都为1-(3/4)²-(1/4)²=3/8。两边各占四张,加权结果仍为3/8=0.375。Y虽然没有纯节点,整体不纯度却更低;相对于父节点,X下降1/14,Y下降1/8,应优先选择Y。
如果错误地把两个子节点简单平均,X会被算成12/49,约0.244897959,看起来反而好于Y的0.375。这等于让只有一张卡的左节点与七张卡的右节点各占一半影响,悄悄换了评价对象。scikit-learn的数学说明明确使用左右样本比例来加权子节点损失。
让AI交一张可追溯的分裂评分卡
可用提示词:“用八张等权卡A1至A4、B1至B4比较分裂X与Y。X左边仅A1;Y左边为A1、A2、A3、B1。列各子节点成员、类别计数、Gini、节点占比、加权贡献及总不纯度,再算相对父节点的下降。另列简单平均的错误对照,说明为什么结论会反转。”
核对时先检查两边无重复、无遗漏且加起来正好八张,再看公式。成员抄错后,分数即使每一步算对,也不是原来的候选比较。
这只是当前节点的一步贪心选择,不保证整棵树最优,也不证明真实预测能力提升。如果设置每个叶节点至少两条样本,X会直接不合法;若使用样本权重,节点比例与类别比例也都要按对应权重重新计算。
资料核对日期:2026年10月2日。数值为原创教学设定,已用独立Python计算复核,不代表真实模型性能测试。


