近日,来自Meta、斯坦福大学、哈佛大学和华盛顿大学的研究者联合发布了一项名为SWE-Sweep的新基准测试,旨在评估AI模型在不被告知具体问题的情况下,主动发现并修复代码缺陷的能力。该研究团队成员曾参与SWE-bench、ProgramBench等项目。相关论文与数据集已以MIT许可证在GitHub开源。

发生了什么

现有大多数基准测试主要检验AI能否修复已被明确指出的问题,而SWE-Sweep则尝试衡量模型在用户或开发者尚未报告缺陷前,自主识别并解决实际代码问题的能力。研究者构建了包含100个代码仓库、覆盖22种编程语言、合计4000个真实缺陷的测试集,所有缺陷均来自GitHub上的真实项目,并经过多重筛选以确保可在该设定下解决。

测试结果显示,当前模型在该任务上的表现普遍不佳。在研究者测试的最佳配置中,Sol 5.6(xhigh)仅修复了4.7%的缺陷,成本为7230美元;Luna 5.6(xhigh)修复率为2.5%,成本224美元;Terra 5.6(xhigh)为1.5%,成本357美元。其他模型如Luna 5.6(high)、Opus 5(xhigh)、Kimi K3、Luna 5.6、GPT-5.4 Mini(high)、GPT-5.4 Mini以及Gemini 3.5 Flash Lite的修复率从1.4%到0.1%不等,成本差异显著。

研究者指出,表现最好的模型成本极高,而低成本模型的修复率则进一步下降。他们希望这一基准能推动AI在软件工程中从被动修复向主动发现缺陷的方向发展。

为什么重要

在软件开发中,等待用户提交工单后才修复缺陷是常见流程,但若AI能提前发现并解决潜在问题,将有望减少线上故障和维护成本。SWE-Sweep的测试结果表明,尽管AI在修复已知缺陷方面取得进展,但在主动发现缺陷这一更具挑战性的任务上仍有很大提升空间。该基准的开源也为后续研究提供了可复现的评估平台。

背景补充

SWE-bench等早期基准主要关注模型对已定位问题的修复能力,而SWE-Sweep将评估重点转向缺陷的自主发现,反映了AI智能体在软件工程领域应用场景的扩展。研究者表示,更多常见问题解答已发布在项目网站上。

来源:Show HN: Benchmark: AI doesn't find bugs unless you tell it …(发布于 2026-10-01)