에이전트에게 진짜 컴퓨터를 쥐여준 벤치마크, OSWorld
OSWorld는 Ubuntu와 Windows 등 실제 운영체제 위에서 369개 과업으로 멀티모달 에이전트를 평가하는 최초의 확장 가능한 실컴퓨터 벤치마크로, 사람은 72.36%를 해내는 과업을 최고 모델이 12.24%밖에 완수하지 못함을 보였습니다. 화면을 보고 업무 프로그램을 조작하는 자동화를 검토하는 기업에게 현재 기술의 위치와 도입 시 안전장치의 필요성을 알려주는 기준선입니다.
Computer use 에이전트의 실력을 실제 컴퓨터 위에서 처음으로 엄밀하게 잰 벤치마크가 2024년 발표된 OSWorld입니다. 이후 각 사가 화면 조작 에이전트를 발표할 때마다 이 벤치마크 점수를 성적표로 제시하게 되면서, GUI 자동화 기술의 성숙도를 추적하는 공통 기준선이 됐습니다.
문제 배경
사람의 사무 업무 상당수는 API가 아니라 화면 위에서 이루어집니다. 스프레드시트를 편집하고 여러 프로그램을 오가며 파일을 옮기는 일입니다. 그러나 기존 벤치마크는 상호작용 환경이 없거나 특정 앱과 도메인에 갇혀 있어, 임의의 애플리케이션을 넘나드는 실제 컴퓨터 사용의 복잡성을 반영하지 못했습니다. 시연 영상 속 에이전트가 실무에서 어느 정도 통할지 판단할 근거가 없었던 셈입니다.
방법
OSWorld는 Ubuntu, Windows, macOS를 아우르는 실제 운영체제 환경에서 과업 설정, 실행, 평가를 지원하는 확장 가능한 실컴퓨터 환경입니다. 이 위에 실제 사용 사례에서 도출한 369개 과업의 벤치마크를 구축했는데, 실제 웹과 데스크톱 앱 사용, 운영체제 파일 입출력, 여러 애플리케이션에 걸친 워크플로를 포함합니다. 각 과업은 상세한 초기 상태 설정과 실행 기반 채점 스크립트를 갖추고 있어, 화면이 비슷해 보이는지가 아니라 과업이 실제로 완수됐는지를 재현 가능하게 판정합니다.

결과
당시 최고 수준의 LLM과 VLM 기반 에이전트를 평가한 결과는 냉정했습니다.
| 수행 주체 | 과업 성공률 |
|---|---|
| 사람 | 72.36% |
| 최고 성능 모델 | 12.24% |
일부 애플리케이션 영역에서는 모델 성공률이 0%까지 떨어졌습니다. 격차의 주요 원인으로는 GUI 그라운딩 부족과 운영 지식 부족이 지목됐습니다. 화면 어디를 눌러야 하는지 아는 능력 자체가 병목이라는 뜻입니다.
한계와 주의점
사람의 성공률이 72.36%라는 점도 눈여겨볼 부분입니다. 과업 자체가 쉽지 않다는 뜻이므로 모델 점수를 절대 평가로 읽기보다 사람 대비 격차로 읽어야 합니다. 발표 이후 모델들의 점수가 빠르게 오르고 있으므로 특정 시점의 수치보다 추세를 보는 것이 실무 판단에 유용합니다.
기업 적용 관점
Computer use 에이전트는 발전 속도가 빠르지만 이 벤치마크가 보여주듯 아직 사람과 격차가 큽니다. 도입한다면 실패해도 되돌릴 수 있는 업무부터 시작하고, 실행 전 승인 단계와 결과 검증을 워크플로에 내장해야 합니다. 또한 화면 조작은 API 연동보다 본질적으로 취약하므로, 코텍시스는 GUI 자동화 검토 시 API로 대체 가능한 구간을 먼저 분리하고 화면 조작은 API가 없는 레거시 구간에만 한정하는 설계를 권합니다.
코텍시스 AI사업부는 sLLM 최적화, Advanced RAG, AI Agent 개발을 수행합니다. 이런 기법의 도입을 검토 중이라면 문의를 남겨주세요.
AI 개발 문의같은 주제의 다른 인사이트
깃허브 이슈로 코드 에이전트를 시험하는 SWE-bench
SWE-bench는 12개 파이썬 오픈소스 저장소의 실제 깃허브 이슈 2,294건을 언어 모델이 해결할 수 있는지 테스트로 검증하는 벤치마크로, 발표 당시 최고 모델의 해결률은 1.96%에 그쳤습니다. 이후 코드 에이전트 경쟁의 표준 척도가 된 이 벤치마크는 개발 업무 자동화의 성숙도를 기업이 수치로 추적할 수 있게 해줍니다.
MCP 생태계의 구조와 보안 위협을 정리한 첫 체계적 분석
이 논문은 AI 모델과 외부 도구를 잇는 표준인 Model Context Protocol의 아키텍처와 생태계를 정리하고, 서버 생명주기 4단계에 걸친 16개 위협 시나리오의 보안 분류체계를 제시한 첫 체계적 연구입니다. MCP로 사내 시스템을 에이전트에 연결하려는 기업에게 표준 도입의 이점과 함께 서버 검증 절차가 왜 필수인지를 알려줍니다.
언어 모델이 스스로 도구 사용을 배우는 방법, Toolformer
Meta AI의 Toolformer는 언어 모델이 사람의 개입 없이 스스로 API 호출 시점과 인자를 학습하는 자기지도 방식을 제시한 논문입니다. 업무 자동화 에이전트를 도입하려는 기업에게는 도구 호출 능력이 별도의 대규모 수작업 라벨링 없이도 학습될 수 있다는 근거가 되어 사내 시스템 연동 에이전트 설계의 출발점이 됩니다.