ServiceNow介绍AutoSynthData训练方法:从智能体失败生成新任务,先验证题目再训练
2026年10月2日,ServiceNow CoreAI在官方Hugging Face博客介绍AutoSynthData:先观察目标智能体在哪些任务上失败,再参考更强教师模型的成功表现,生成对应能力的新训练任务。文章展示的是方法与受控实验,不能直接解释为一款面向所有客户正式上线的商业功能。
生成训练题之前,先确定题目能被完成
该方法把任务组织为系统约束、用户请求和结果验证器。新的请求需要适配环境已有的工具、权限和状态变化;验证器既要拒绝错误结果,也要接受不同但有效的解决路径。
团队会从诊断任务中提炼经过清理的能力说明卡。生成器使用这些说明创建新任务,不接收原评测题的提示词、实体、轨迹和验证器细节。候选还要经过执行检查、正反例验证和有限次数修复,才能进入训练集合。
AI模型生成的任务生成与验证循环概念插图,并非AutoSynthData真实流程界面或研究结果图。
实验改善发生在特定环境和训练方式中
官方在EnterpriseOps Gym的Hybrid与ITSM环境展示监督微调结果。Hybrid实验报告平均Pass@1提高7.2个百分点;ITSM实验从18.77%升至27.18%。这些都是团队在指定模型、数据和评测设置下给出的结果,尚不能推断为任意企业流程的提升幅度。
文章将进一步尝试强化学习列为后续计划。因此,当前能确认的是监督微调中的实验收益,而不是一个已经验证完毕、会持续自主训练的通用系统。
验证器本身也需要被检查
以下是本文分析。设想训练任务要求“为符合条件的工单补上分类,并保持其他字段不变”。如果验证器只检查分类字段,它可能给同时改坏负责人或截止日期的执行轨迹判成功。合成任务越多,这种遗漏越可能被重复放大。
相反,若验证器强制要求完全复刻某条参考轨迹,又可能拒绝另一条同样正确的操作顺序。实用的验收条件应尽量对应最终业务状态与必须遵守的约束,并额外检查不应该发生的副作用。
在企业中试用类似方法时,可以先挑一类边界清楚、结果容易核验的任务。分别保留原始失败、能力说明、生成题和验收规则,人工抽查它们是否仍在训练同一项能力。题目表面换了名称,不代表已经形成新的情境覆盖。
还应把训练收益与生成成本一起记录。某轮通过率提高以后,继续生产同类简单题可能不再有价值;而一味增加复杂约束,也可能让题目脱离真实工作。这个研究方向的重点,是让失败反馈帮助选择下一轮练习,并让练习质量先过验证。
资料核对日期:2026年10月2日。本文未独立复现实验,文中百分比为ServiceNow团队披露。


