llama.cpp接入System One决策API:五类模型可本地评分,图像、语言与许可范围各不相同
2026年10月2日,ggml-org发布技术文章,介绍llama.cpp服务器新增的/v1/systemone决策模型接口;对应PR29818已在当天合并到主分支。文章元数据时间为14:22 UTC,即北京时间22:22。新增的是推理引擎接入能力,不是再次发布这些模型,也不表示所有现有llama.cpp安装包已包含改动。
把问题变成有定义的候选项
这个接口接收状态材料和有类型的问题,返回各选项的概率。官方列出三类问题:choice选择候选并给出分布,noul回答“是”的概率,score处理按顺序排列的等级。score返回的是期望等级,可以落在两个等级之间,不能直接把小数值当成选中了某个整数标签。
以客服分派为例,输入是一段来信,候选可以是账单、物流和技术支持。接口有结构化结果,应用省去从一段自由回答中提取标签的步骤;但候选集合本身必须覆盖实际需求。若用户问题不属于三类中的任何一种,系统仍需要“其他”或人工接手路径,不能把最高概率自动等同于正确答案。
AI模型生成的概念插图:处理单元比较预先定义的候选块;不是模型架构的精确表示,也不代表实际概率或测试结果。
五类接入不能合并成一种能力
本次列出的模型包括Julia-1、Laya、Kev-4B、lev和OpenJev。官方支持表显示,它们的语言与图像能力不同:OpenJev在这组模型中支持图像输入,Julia-1列出多语言范围,而若干其他模型侧重英语。收到截图时,不能只因为接口格式相同就假定每个模型都能读取。
许可也有区别:文章列出的前四类采用Apache 2.0,OpenJev为CC BY-NC 4.0。准备部署前需要查看所选模型的原始许可和具体版本,不能把推理引擎能够加载理解为所有模型都有相同商业使用条件。文中还把Cloudflare Clef列为后续接入目标,当前这次合并不包含该项。
迁移接口之后,阈值仍要重新校准
官方文章用不同模型对同一模糊工单给出明显不同分数的例子,提醒不要直接复用置信度门槛。为选项添加描述也可能改变分类结果。因此,模型名称、量化版本、选项定义和阈值应一起作为配置保存,而不是只替换服务地址后就沿用旧的自动处理规则。
本文建议先用一组已核对的历史样本评估:包含明确类别、信息不足、多个诉求和完全不匹配的输入,统计错误会落到哪里,以及多少需要人工判断。涉及实际动作时,分类正确与动作获准仍是两道判断,例如识别出退款诉求,并不自动授予退款权限。
对本地部署者,这次接入让小型决策模型更容易进入既有llama.cpp服务流程。下一步应先确认所用构建包含合并代码,再检查支持的模型文件及接口响应。本文未安装或压测该接口,官方单卡速度示例也不能替代目标硬件和真实请求长度下的测量。
来源与核对时间
资料核对:2026年10月2日。本文依据公开资料整理,未安装或实测所述产品及服务。


