SkillOpt 架构拆解:把 Skill 文本当参数,用执行轨迹训练 Agent

这份文本可能叫
SKILL.md,也可能是工具调用说明、流程手册、输出规范、故障补救规则。它不参与模型训练,却会持续改变 Agent 的判断路径。问题在于,我们通常把它当文档维护:专家凭经验写一版,线上出问题再补几句,偶尔让模型帮忙重写。这个过程很快会失控,因为没人能说清楚哪条规则真的改善了任务表现,哪次改动只是看起来更合理。

赞(0)
未经允许不得转载:小狮博客 » SkillOpt 架构拆解:把 Skill 文本当参数,用执行轨迹训练 Agent
分享到: 更多 (0)

联系我们