最新调整Rand指数为何能为负:六个样本怎样低于随机配对基线 比较两次聚类时,不能直接数“标签相同的样本有几个”:某个算法的0号簇完全可能对应另一算法的2号簇。调整Rand指数,也就是ARI,比较的是样本之间同组或异组的关系,并扣除一种明确随机模型下的基线。一个负分不是负准确率... yunqueblog/ AI分享/ 2026-10-04/ 1 阅读
最新MMD平方估计为何是负数:删除对角项后的无偏代价 比较两批特征分布时,MMD常被当成一种距离。于是程序输出负数,第一反应往往是核矩阵不合法,或者浮点误差太大。但如果计算的是MMD平方的无偏估计,负数完全可能是正确结果。先确认估计对象与求和规则,才知道应该检查什么。 yunqueblog/ AI分享/ 2026-10-04/ 1 阅读
最新标签传播何时有唯一答案:从调和解检查无标签分量 只有少量样本有标签时,可以把相似样本连接成图,让已知标签影响邻近节点。这里最容易漏掉的条件是:一个待预测区域,究竟能不能通过边走到已知标签。即使程序返回了整齐的零和一,也不能据此认为每个分量都获得了监督信息。 yunqueblog/ AI分享/ 2026-10-04/ 1 阅读
最新PageRank遇到无出链页面:漏掉的概率去了哪里 PageRank实现里有一种故障很隐蔽:每个节点都算出了正数,排行榜也正常出现,但所有分数之和逐轮缩小。问题常出在没有出链的节点上。流入它的概率下一轮应怎样分配,必须是模型的一部分,不能等计算结束才凭感觉补救。 yunqueblog/ AI分享/ 2026-10-04/ 2 阅读
最新BM25词频为什么会饱和:把长度惩罚和IDF约定拆开算 做知识库检索时,很容易把“关键词出现四次”理解成“比出现两次更相关”。BM25恰好提醒我们,次数、文档长度和词的稀有程度是不同的量。要检查排序实现,先做一个能拆出每项贡献的小例子,比直接对照最终名次更有效。 yunqueblog/ AI分享/ 2026-10-04/ 2 阅读
最新GNU numfmt 单位转换:同一个 1K,为什么可能是1000也可能是1024 监控报表里都写1K,一处还原成一千,另一处却是一千零二十四,数据并不一定有错,只是单位规则没写清楚。更隐蔽的是,把精确字节数格式化成短标签再转回来,可能得到另一个整数。numfmt能够处理常见缩放与显示,但它不会替你... yunqueblog/ 技术教程/ 2026-10-04/ 2 阅读
最新JavaScript matchAll 的游标副本:遍历已到末尾,原正则的位置为什么没动 把exec循环换成matchAll以后,匹配结果已经读到最后,原正则的lastIndex却仍停在一。接着重新调用,又从同一个非零位置开始。这种行为来自matchAll为普通正则创建匹配副本:它保留创建时的起点,遍历推... yunqueblog/ 技术教程/ 2026-10-04/ 2 阅读
最新Python 格式化的转换顺序:加了 !r,为什么数字格式 d 反而不能用了 给调试输出加上!r以后,原本能使用的整数格式04d突然报错;自定义对象的对齐逻辑也不再被调用。原因是!r不是给最终文字加上一层引号,它先把原对象转换为repr字符串,再让字符串处理后面的格式规范。理解转换和格式化的先... yunqueblog/ 技术教程/ 2026-10-04/ 2 阅读
最新Python harmonic_mean:结果返回零,后面的非法数据为什么没有报错 统计函数成功返回一个数字,很容易被调用者当成“所有输入都有效”的证据。但harmonic_mean在本例版本中遇到零会提前返回,因此零后面还有负数,也可能没有报错。把同一组数据换个顺序,负数先被看到,结果又变成异常。... yunqueblog/ 技术教程/ 2026-10-04/ 1 阅读
最新Python file_digest 的输入分支:同样读过两字节,为什么 BytesIO 与文件摘要不同 单元测试用BytesIO代替文件,先读掉一个头部,再调用file_digest。测试算出了全体字节的摘要,换成真实文件后却得到剩余尾部摘要。两者都接受二进制文件对象,但在本文运行版本里走了不同实现分支。这个反例提醒我... yunqueblog/ 技术教程/ 2026-10-04/ 1 阅读