Unsloth更新0.1.902 Beta:量化权重保持打包训练,桌面参数分享与失败日志同步改善
2026年10月1日14:06 UTC,即北京时间22:06,Unsloth发布0.1.902-beta。此次更新同时覆盖桌面交互、模型训练和Decision API:用户可以用命令面板导航、分享GGUF运行设置,并在部分量化模型的LoRA训练中保留打包权重。版本名称仍带Beta,支持范围和测试数字需要逐项阅读。
训练不必先把所有权重展开
官方介绍,本版对NVFP4、INT4和MXFP4等部分预量化检查点扩展了训练路径,按已发布的量化权重读取并在需要时逐层反量化,避免预先保留一整份高精度权重副本。LoRA训练中的小型适配参数仍需要更新,降低的是特定权重存储开销,不能据此认为训练总显存只等于模型文件大小。
发布说明举出的测量包括:Qwen3.8-27B-NVFP4在一张RTX PRO 6000上,峰值显存从72.9GB降至40.2GB。这个比较有明确模型、量化格式和设备条件;换成不同上下文长度、批大小或优化器后,不能直接套用同一结果。本文未复现该测量,也不把它扩展成所有模型的通用节省比例。
AI模型生成的概念插图:打包的模型权重与旁侧适配参数共同参与训练;并非真实显存布局、硬件照片或性能图表。
能复现的运行设置更容易交接
桌面端加入Cmd/Ctrl+P命令面板,GGUF运行设置可以分享为链接,也可在不加载模型时先保存。失败的加载和生成操作提供更明确说明及查看日志入口,模型只能部分装入GPU时也会提示。这些改变对排查问题有直接价值:参数、设备状态和错误信息更容易一起留给接手的人。
不过,分享设置并不包含另一台机器的算力条件。两人使用同一份参数,若模型文件、GPU内存或运行时版本不同,结果和速度仍可能变化。本文建议在交接时同时记录模型版本、量化格式、上下文设置以及硬件信息,避免把“设置一样”误当成环境已经一致。
Decision API扩展也有具体前提
更新还允许连接TypeSafe等托管决策提供方,并在启用Decision API后,通过聊天的MCP菜单让模型使用decide工具。官方对Laya报告的加速集中在短请求:所列B200三问题检查从11.6毫秒变为2.8毫秒,而长输入速度大致不变。这个边界说明,应先看自己的请求长度分布,再判断是否受益。
对既用聊天又做微调的用户,升级验收可以分两段:先加载代表模型,检查保存、分享、失败日志和继续回复;再跑一段可回退的小规模训练,观察峰值显存、检查点保存与恢复。若把远程Decision API接进本地界面,还应核对请求送往的提供方,不能因为界面在本机运行就认定所有推理都发生在本机。
本次更新提供了几条可具体检查的改进路径。真正适合自己的部分,取决于所用模型格式、硬件和工作流,而不是单凭发布页中的最高加速倍数决定。
来源与核对时间
资料核对:2026年10月2日。本文依据公开资料整理,未安装或实测所述产品及服务。


