mini swe agent prompt search notes 这套仓库原本就分成两层能力,但之前入口不清楚,很容易让人误以为“agent 会在单次运行里自己联网、自己改 prompt”。 1. 运行时联网 src/minisweagent/config/benchmarks/swebench.yaml 会把 mswea web search 和 mswea web fetch 装进容器,并且 prompt 里会提示模型可以用它们查公开文档。 2. Prompt 迭代 scripts/search system prompt.py 会跑一个离线的 prompt policy search。它会: 生成 prompt override 跑一轮 SWE bench canary 分析失败轨迹 把失败模式反馈到下一轮 prompt 搜索 它不是 agent 在同一次任务里“边做边改 system prompt”,而是外部搜索脚本驱动的多轮评测闭环。 现在可直接从主脚本开启 prompt search run swebench full.sh 现在支持先做 prompt search,再自动拿最佳 override 继续正式 generation/evaluation。 另外也支持一个更轻量的 8 题验证模式,专门用来做 prompt / model 快速迭代,尽量复用已有产物并减少磁盘占用: 这个模式会默认: 把 generation slice 收缩到前 8 题(可用 VALIDATION CASES 或 VALIDATION SLICE SPEC 覆盖) 输出到更小的目录(默认 runs/validation 8 ) evaluation 直接只评这 8 题,不再额外做二次截断 关闭激进清理,并默认单 worker,避免无意义重复构建/清理 默认不重跑已有预测;如果想强制重做,显式加 REDO EXISTING=1 推荐迭代命令: 只复用现有预测重评: 500 题稳定跑 对大批量评估, run swebench full.sh 现在默认会自动加存储保护: generation 默认 GEN WORKERS=2 评估规模达到 60 题以上时,自动切到 chunked cleanup 模式 评估规模达到 300 题以上时,进一步自动收紧到更稳的模式: EVAL CHUNK SIZE=2 、 EVAL MAX WORKERS=1 、 DISK GB THRESHOLD=15 推荐直接用: 如果你优先追求“尽量多解出 case”,而不是更省 token / 时间,主入口现在可以直接切到 clean profile: 这档会保留 full multi agent prompt 栈,但额外打开更偏高召回的 clean overlay,并关闭大批量评估时的自动存储保护…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy