斯坦福推出TRACE:通过针对性能力训练将Agent反复失败转化为合成RL环境
Decision Brief
变化斯坦福大学提出TRACE系统,从Agent自身轨迹诊断能力缺陷,为每个能力合成可验证的训练环境,训练独立LoRA适配器并通过专家路由提升性能。
为什么重要TRACE让开发者不再需要手动标注或构造失败案例,直接利用Agent自己的轨迹自动生成针对性训练环境,显著提升Agent在编程和通用任务上的泛化能力。
谁该关注所有 AI builder
受影响技术栈未识别出特定技术栈
来源可信度中 · 可靠媒体或一手报导
斯坦福大学研究人员提出的TRACE(Capability-Targeted Agentic Training System)是一种针对Agent能力缺陷的强化学习训练系统。它首先从Agent的自身执行轨迹中诊断出反复失败的具体能力缺口,然后为每个缺失能力自动合成一个可验证的训练环境,并训练对应的LoRA适配器作为专家模块。推理时,系统通过路由机制将不同token分配给最合适的专家,实现动态组合。在τ²-Bench上,TRACE提升了15.3个点;在SWE-bench Verified上达到73.2%的Pass@1。 对于开发Agent应用的工程师团队,TRACE提供了一种自动化的能力诊断与补强方案:不需要人工分析失败案例或额外标注数据,只需Agent的历史轨迹即可生成针对性的训练环境。这一方法特别适合需要长期稳定执行复杂任务的Agent系统,例如代码生成、自动化编程或多步骤决策场景。使用开源LLM和LoRA微调的团队可以较容易地复现该方案。
摘要依据:官方/RSS 来源详摘依据上方标注的来源范围整理,内容以原文为准。
来源
- MarkTechPost
Fast research-paper and ML tooling summaries, useful for infra and agent updates.
- MarkTechPost
留言
登入后即可留言,和其他 builder 交换实测心得。
还没有留言,抢头香。