让 AI 追一次反向传播:同一权重走了两条路,梯度就要相加 AI讲反向传播时,常能写出“沿链式法则求导”,却没有说明同一个参数用两次怎么办。下面做一张只含一个权重的计算卡:让它沿两条路参与输出,再检查反向返回的贡献是否都到齐。 yunqueblog/ AI分享/ 2026-10-02/ 2 阅读
用 AI 拆一层 LoRA:训练的是低秩增量,原权重仍然要保留 “LoRA只训练少量参数”不等于把原模型删到只剩那些参数。可以让AI拆开一个很小的线性层:原权重照常计算,旁边另有一条低秩更新分支。把两条分支都算出具体数值,就能检查说明有没有偷换对象。 yunqueblog/ AI分享/ 2026-10-02/ 2 阅读
让 AI 做量化误差卡:舍入以后,还可能被范围边界截住 看见“4位量化”时,很容易只想到文件变小。要理解它改变了什么,可以让AI为五个数字制作来回转换卡:先写成有限整数,再还原到实数,逐项记录丢掉了多少。这个练习也能识别“误差永远不超过半格”的过度概括。 yunqueblog/ AI分享/ 2026-10-02/ 3 阅读
用 AI 画因果注意力掩码:挡住未来位置,要在归一以前完成 学习Transformer时,看到一个下三角格子容易记住形状,却未必知道它挡住了什么。让AI制作四个位置的可见性练习,再故意提交一个“乘零掩码”的错误版本,比只背术语更容易定位问题。 yunqueblog/ AI分享/ 2026-10-02/ 2 阅读
让 AI 拆开温度与核采样:概率变尖以后,候选还要重新归一 调低temperature以后,模型是否就更准确?这个问题不能只看参数名字。温度会改变下一步的概率分布,核采样会缩小候选集合;它们都没有替候选内容补充事实证据。可以让AI交一张逐步计算卡,把两个动作拆开。 yunqueblog/ AI分享/ 2026-10-02/ 2 阅读
用 AI 做 BPE 合并练习:词表学完以后,新句子不会再现场造规则 AI服务按token计算输入量时,一个词不一定只占一个token。与其让模型猜“这段大约几个”,可以先让它制作一份很小的BPE训练记录,亲手看一次字符怎样合成片段,再回到实际工具查询真实数量。 yunqueblog/ AI分享/ 2026-10-02/ 2 阅读