Magnitude首发自优化本地推理引擎:按设备调优内核,速度差异取决于模型和硬件
Magnitude创始人于2026年9月30日在Hacker News介绍面向智能体的本地推理引擎。项目以Apache-2.0开放源码,提供macOS、Windows和Linux桌面应用,重点是根据用户实际设备编译和调节计算内核,让开放模型更适合本机的运行条件。
在设备上调优,服务多个本地会话
官方仓库列出Apple Silicon、NVIDIA、AMD以及纯CPU运行路径。应用内可下载模型,并连接Pi、OpenCode、Codex等智能体工具;其他程序可以通过兼容OpenAI格式的API接入。支持设备类型并不意味着所有设备上的每个模型都已有相同程度的优化。
创始人的发布说明还介绍了动态内存分配与会话间前缀缓存共享:会话增长时增加使用空间,停止后释放相关内存,重复的上下文可以被复用。这些设计针对的是多个长对话同时运行时的资源使用,而非只追求一段短回答的峰值速度。
AI模型生成的设备调优与本地计算概念插图,并非Magnitude界面、芯片照片或性能测试图。
“接近两倍”对应一组明确测试条件
发布者给出的比较使用Qwen 3.6 35B A3B的4位版本、64k上下文,关闭推测解码。以llama.cpp为基线,M4 Pro 48GB上的解码速度从约30提升到57 token/秒;DGX Spark上的结果则从49提升到58 token/秒。这两组都是项目方公布的数据。
两种设备的差距并不相同,已经说明不能把“最高两倍”当作普遍承诺。创始人在后续答疑中也表示,当前尚不支持多GPU,M5系列Mac仍存在未充分利用Metal 4矩阵运算的优化缺口。路线图中的多设备利用能力,不应提前算入现有功能。
本地评估应该看整个工作,而不仅看输出速率
以下为本文分析。智能体会反复读取上下文、调用工具并等待外部结果。生成token更快,只有在模型计算确实占用较多时间时,才会明显缩短任务。评估时可以固定模型文件、量化方式、上下文长度和同一组任务,再比较首次响应、后续回复及最终完成时间。
还应分别记录冷启动和已有缓存的结果。若一个引擎预热后更快,却需要较长初始化时间,持续工作的用户和偶尔发起短任务的用户会得到不同体验。多会话测试则应关注内存峰值和前台应用是否仍流畅,而不只计算各会话速度相加。
本地推理减少了模型请求离开设备的需要,但接入的智能体工具仍可能自行访问网络。选择这一引擎后,应继续按照实际工具链判断数据去向。项目提供了值得尝试的设备调优方案,是否适合替换现有引擎,需要用自己的硬件与任务说明。
资料核对日期:2026年10月2日。首发日期按HN原始时间记录;本文未独立复现厂商速度与内存指标。


