AI 인사이트 목록
Agent2026년 6월 12일

에이전트에게 진짜 컴퓨터를 쥐여준 벤치마크, OSWorld

OSWorld는 Ubuntu와 Windows 등 실제 운영체제 위에서 369개 과업으로 멀티모달 에이전트를 평가하는 최초의 확장 가능한 실컴퓨터 벤치마크로, 사람은 72.36%를 해내는 과업을 최고 모델이 12.24%밖에 완수하지 못함을 보였습니다. 화면을 보고 업무 프로그램을 조작하는 자동화를 검토하는 기업에게 현재 기술의 위치와 도입 시 안전장치의 필요성을 알려주는 기준선입니다.

원문 논문 보기Computer Use · GUI 에이전트 · 벤치마크 · 멀티모달

Computer use 에이전트의 실력을 실제 컴퓨터 위에서 처음으로 엄밀하게 잰 벤치마크가 2024년 발표된 OSWorld입니다. 이후 각 사가 화면 조작 에이전트를 발표할 때마다 이 벤치마크 점수를 성적표로 제시하게 되면서, GUI 자동화 기술의 성숙도를 추적하는 공통 기준선이 됐습니다.

문제 배경

사람의 사무 업무 상당수는 API가 아니라 화면 위에서 이루어집니다. 스프레드시트를 편집하고 여러 프로그램을 오가며 파일을 옮기는 일입니다. 그러나 기존 벤치마크는 상호작용 환경이 없거나 특정 앱과 도메인에 갇혀 있어, 임의의 애플리케이션을 넘나드는 실제 컴퓨터 사용의 복잡성을 반영하지 못했습니다. 시연 영상 속 에이전트가 실무에서 어느 정도 통할지 판단할 근거가 없었던 셈입니다.

방법

OSWorld는 Ubuntu, Windows, macOS를 아우르는 실제 운영체제 환경에서 과업 설정, 실행, 평가를 지원하는 확장 가능한 실컴퓨터 환경입니다. 이 위에 실제 사용 사례에서 도출한 369개 과업의 벤치마크를 구축했는데, 실제 웹과 데스크톱 앱 사용, 운영체제 파일 입출력, 여러 애플리케이션에 걸친 워크플로를 포함합니다. 각 과업은 상세한 초기 상태 설정과 실행 기반 채점 스크립트를 갖추고 있어, 화면이 비슷해 보이는지가 아니라 과업이 실제로 완수됐는지를 재현 가능하게 판정합니다.

여러 애플리케이션에 걸친 OSWorld 과업의 예시

결과

당시 최고 수준의 LLM과 VLM 기반 에이전트를 평가한 결과는 냉정했습니다.

수행 주체과업 성공률
사람72.36%
최고 성능 모델12.24%

일부 애플리케이션 영역에서는 모델 성공률이 0%까지 떨어졌습니다. 격차의 주요 원인으로는 GUI 그라운딩 부족과 운영 지식 부족이 지목됐습니다. 화면 어디를 눌러야 하는지 아는 능력 자체가 병목이라는 뜻입니다.

한계와 주의점

사람의 성공률이 72.36%라는 점도 눈여겨볼 부분입니다. 과업 자체가 쉽지 않다는 뜻이므로 모델 점수를 절대 평가로 읽기보다 사람 대비 격차로 읽어야 합니다. 발표 이후 모델들의 점수가 빠르게 오르고 있으므로 특정 시점의 수치보다 추세를 보는 것이 실무 판단에 유용합니다.

기업 적용 관점

Computer use 에이전트는 발전 속도가 빠르지만 이 벤치마크가 보여주듯 아직 사람과 격차가 큽니다. 도입한다면 실패해도 되돌릴 수 있는 업무부터 시작하고, 실행 전 승인 단계와 결과 검증을 워크플로에 내장해야 합니다. 또한 화면 조작은 API 연동보다 본질적으로 취약하므로, 코텍시스는 GUI 자동화 검토 시 API로 대체 가능한 구간을 먼저 분리하고 화면 조작은 API가 없는 레거시 구간에만 한정하는 설계를 권합니다.

코텍시스 AI사업부는 sLLM 최적화, Advanced RAG, AI Agent 개발을 수행합니다. 이런 기법의 도입을 검토 중이라면 문의를 남겨주세요.

AI 개발 문의

같은 주제의 다른 인사이트