Skip to content
THE AI WIREINTELLIGENCE THAT MATTERS
Agents

SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents

arXiv:2609.08149v2 Announce Type: replace Abstract: SWE-Bench Pro has emerged as a standard benchmark for evaluating software engineering agents on challenging repository-level tasks. However, our analysis work show that its evaluation is undermined by two sou

arXiv cs.AI··Updated just now·38 sightings