AI 인사이트 목록
Agent2026년 8월 10일

깃허브 이슈로 코드 에이전트를 시험하는 SWE-bench

SWE-bench는 12개 파이썬 오픈소스 저장소의 실제 깃허브 이슈 2,294건을 언어 모델이 해결할 수 있는지 테스트로 검증하는 벤치마크로, 발표 당시 최고 모델의 해결률은 1.96%에 그쳤습니다. 이후 코드 에이전트 경쟁의 표준 척도가 된 이 벤치마크는 개발 업무 자동화의 성숙도를 기업이 수치로 추적할 수 있게 해줍니다.

원문 논문 보기코드 에이전트 · SWE-bench · 소프트웨어 엔지니어링 · 벤치마크

코드 에이전트의 성적표로 가장 널리 인용되는 벤치마크가 2023년 프린스턴 대학에서 나온 SWE-bench입니다. 각 사가 코딩 에이전트를 발표할 때마다 이 점수를 앞세우게 되면서, 개발 업무 자동화의 성숙도를 추적하는 사실상의 표준 척도가 됐습니다.

문제 배경

코드 생성 평가는 오랫동안 함수 하나를 채우는 수준의 문제에 머물렀습니다. 그러나 실제 개발 업무는 수만 줄 코드베이스에서 이슈를 읽고 원인을 찾아 여러 파일에 걸친 수정을 조율하는 일입니다. 함수 완성 벤치마크의 포화된 점수로는 모델이 실제 소프트웨어 엔지니어링을 어디까지 할 수 있는지 알 수 없었습니다.

방법

SWE-bench는 이 현실을 평가에 그대로 가져왔습니다. django, scikit-learn 등 12개 인기 파이썬 저장소에서 실제 깃허브 이슈와 이를 해결한 풀 리퀘스트 2,294쌍을 수집했습니다. 모델은 코드베이스와 이슈 설명을 받아 코드베이스를 수정하는 패치를 생성하고, 채점은 해당 저장소의 실제 테스트 실행으로 이루어집니다. 정답 코드와 비슷한지가 아니라 테스트가 통과하는지를 봅니다. 문제 해결에는 여러 함수와 클래스와 파일에 걸친 변경 조율, 실행 환경과의 상호작용, 매우 긴 컨텍스트 처리가 요구됩니다.

이슈와 코드베이스를 받아 패치를 생성하고 테스트로 검증하는 SWE-bench의 구조

결과

발표 당시 결과는 냉정했습니다.

항목수치
저장소12개 파이썬 오픈소스
문제 수2,294건
최고 해결률 (Claude 2)1.96%

검색 증강을 붙인 최고 성능 모델도 가장 단순한 이슈만 풀 수 있었습니다. 이 낮은 출발점이 오히려 기준선이 되어, 이후 코드 에이전트들이 이 수치를 끌어올리는 경쟁이 시작됐습니다.

한계와 주의점

벤치마크는 파이썬 오픈소스 저장소만 다루므로 다른 언어와 사내 코드베이스로의 일반화에는 주의가 필요합니다. 또한 대상 저장소가 공개돼 있어 모델 학습 데이터에 포함됐을 가능성이 논의돼 왔고, 이후 검증된 부분집합인 SWE-bench Verified 같은 정제판이 나온 배경이기도 합니다. 점수를 읽을 때는 어떤 변형판 기준인지 확인해야 합니다.

기업 적용 관점

SWE-bench 계열 점수는 코드 에이전트 도입 시점을 판단하는 유용한 신호지만, 자사 스택과 벤치마크의 차이를 감안해야 합니다. 더 중요한 시사점은 채점 방식에 있습니다. 테스트 통과라는 객관적 판정이 있었기에 에이전트 경쟁과 개선이 가능했던 것처럼, 사내에서도 에이전트에 맡길 업무에는 성공을 판정할 테스트가 먼저 있어야 합니다. 반복적인 버그 수정이나 의존성 갱신처럼 테스트로 검증 가능한 업무부터 맡기는 것이 안전한 순서이며, 코텍시스는 이를 위한 테스트 기반 검증 체계 구축을 함께 지원합니다.

코텍시스 AI사업부는 sLLM 최적화, Advanced RAG, AI Agent 개발을 수행합니다. 이런 기법의 도입을 검토 중이라면 문의를 남겨주세요.

AI 개발 문의

같은 주제의 다른 인사이트