1. 项目概述:SWE智能体训练的革命性突破
在代码智能体研究领域,软件工程智能体(SWE Agent)一直面临着"重环境依赖"的困境。传统训练方法需要为每个任务构建完整的Docker执行环境,这不仅导致计算资源消耗巨大,更使得训练流程难以规模化。我们团队开发的SWE-Master和SWE-World双系统,通过创新性的架构设计,成功实现了从数据合成到强化学习的全流程优化,将开源代码智能体的性能提升至行业前沿水平。
SWE-Master的核心价值在于首次完整公开了SWE智能体后训练的全套方法论。从轨迹合成、监督微调(SFT)到强化学习(RL)和测试时扩展(TTS),每个环节都经过精心设计和验证。特别值得一提的是,在SWE-bench Verified基准测试中,我们的方案将Qwen2.5-Coder-32B模型的解决率从基线6.2%提升至70.8%,创造了开源代码智能体的新纪录。
而SWE-World则从根本上重构了智能体训练范式。通过构建世界模型来模拟环境反馈,我们实现了完全脱离Docker依赖的训练流程。实验证明,基于纯模拟训练的智能体仍能达到68.2%的解决率,与真实环境训练仅有2.6个百分点的差距,却节省了90%以上的环境构建成本。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术架构深度解析
2.1 SWE-Master的四大核心模块
2.1.1 智能数据工程体系
传统SWE训练面临的首要难题就是数据质量不稳定。我们开发了多级数据筛选机制:
- 原始数据归一化:整合了SWE-bench、HumanEval等7个主流开源数据集,统一为标准的API接口
- 难度分级算法:对每个issue进行N次采样生成,计算平均解决率作为难度指标
- 黄金区间筛选:剔除两端各15%的极端简单/困难样本,保留最具训练价值的中间70%数据
实际测试表明,经过筛选的数据集使SFT阶段的收敛速度提升2.3倍,最终准确率提高18%
2.1.2 长程监督微调设计
针对GitHub任务中的"奖励黑客"现象(模型通过表面合规但实际无效的方案骗取奖励),我们创新性地引入了:
- 轨迹完整性验证:要求每个解决方案必须通过静态检查+动态执行双重验证
- 多轮对话记忆:保留最多128轮的历史交互上下文,避免模型"遗忘"早期约束条件
- 渐进式难度提升:按照2:5:3的比例
