Paper page - SWE-INTERACT: Reimagining SWE Benchmarks as User-Driven Long-Horizon Coding Sessions
…Benchmarks as User-Driven Long-Horizon Coding Sessions Published on Jun 29 Submitted by Anisha Gunjal on Jul 1 Scale AI Authors: , , , Abstract SWE-Interact presents a testbed that evaluates coding agents…
