swebench-2026

modified: 2026-08-03 12:18 · canonical

SWE-bench — source snapshot

SWE-bench — ориентир для оценки coding agents на реальных GitHub issues. В проекте используется как conceptual benchmark: задача должна иметь воспроизводимую среду, критерий прохождения и объективную проверку.

Для automation-проектов аналог SWE-bench — набор сценариев end-to-end: входные данные, ожидаемый побочный эффект, логи, rollback и тест результата.