언어 모델이 스스로 도구 사용을 배우는 방법, Toolformer
Meta AI의 Toolformer는 언어 모델이 사람의 개입 없이 스스로 API 호출 시점과 인자를 학습하는 자기지도 방식을 제시한 논문입니다. 업무 자동화 에이전트를 도입하려는 기업에게는 도구 호출 능력이 별도의 대규모 수작업 라벨링 없이도 학습될 수 있다는 근거가 되어 사내 시스템 연동 에이전트 설계의 출발점이 됩니다.
오늘날 대부분의 상용 언어 모델이 제공하는 function calling 기능의 원형을 제시한 논문이 2023년 Meta AI가 공개한 Toolformer입니다. 언어 모델이 외부 도구를 언제 어떻게 부를지 사람이 일일이 가르치지 않아도 스스로 익힐 수 있다는 것을 처음으로 체계적으로 보여주었습니다.
문제 배경
대규모 언어 모델은 몇 개의 예시만으로 새로운 과업을 푸는 능력을 보이지만, 역설적으로 사칙연산이나 사실 조회처럼 훨씬 작은 시스템이 잘하는 기본 기능에는 취약합니다. 학습 시점 이후의 정보를 알 수 없고, 계산은 토큰 예측으로 흉내 낼 뿐 정확성이 보장되지 않습니다. 외부 도구를 연결하면 해결되지만, 어느 위치에서 어떤 도구를 어떤 인자로 불러야 하는지 사람이 대량의 예시를 만들어 가르치는 것은 비용이 큽니다.
방법
Toolformer의 핵심은 자기지도 학습입니다. 도구별로 소수의 시연 예시만 주면, 모델이 학습 텍스트 곳곳에 API 호출 후보를 직접 삽입해 봅니다. 그리고 호출 결과를 넣었을 때 이후 토큰 예측의 손실이 실제로 줄어드는 경우만 남기고 나머지는 버립니다. 이렇게 걸러진 텍스트로 다시 학습하면, 모델은 어느 시점에 어떤 도구를 어떤 인자로 부르고 결과를 어떻게 반영할지 익히게 됩니다. 논문은 계산기, 질의응답 시스템, 검색 엔진, 번역 시스템, 캘린더의 다섯 가지 도구를 연동했습니다.
결과
6.7B 파라미터의 GPT-J를 기반으로 학습한 Toolformer는 여러 다운스트림 과업의 제로샷 평가에서 훨씬 큰 모델을 능가했습니다.
| 항목 | 내용 |
|---|---|
| 기반 모델 | GPT-J 6.7B |
| 비교 대상 | OPT 66B, GPT-3 175B |
| 사실 조회(LAMA) | 최고 베이스라인 대비 11.7, 5.2, 18.6점 개선 |
특히 사실 조회 과업에서는 모델이 스스로 질의응답 도구를 호출하기로 판단해 25배 큰 GPT-3보다 나은 결과를 냈고, 도구 사용을 배운 뒤에도 언어 모델링 능력 자체는 손상되지 않았습니다.
한계와 주의점
논문이 밝힌 한계도 분명합니다. 도구를 연쇄적으로 사용하지 못하고 한 번의 호출로 끝나며, 검색 결과를 훑어보며 재질의하는 것 같은 상호작용적 사용도 지원하지 않습니다. 호출 후보를 대량으로 샘플링해 걸러내는 방식이라 계산기처럼 유용한 호출이 드물게 발견되는 도구에는 데이터 효율이 낮고, 도구 호출의 비용 자체는 고려하지 않습니다. 실무에서는 이 지점들이 이후 등장한 에이전트 프레임워크가 채운 공백이기도 합니다.
도입 검토 가이드
사내 ERP, 상담 이력, 지식베이스처럼 문서화된 API를 이미 갖추고 있고, 에이전트가 이 도구들을 언제 부를지 판단하는 품질이 만족스럽지 않은 조직에 해당하는 논문입니다. 도구 호출용 학습 데이터를 대량 수작업 라벨링으로 만들려던 계획이 있다면, 그 전에 이 논문의 자기지도 방식으로 라벨링 비용을 줄일 수 있는지 검토할 가치가 있습니다.
| 구분 | 내용 |
|---|---|
| 검토 주체 | 에이전트의 도구 연동을 설계하는 AI 플랫폼팀 또는 ML 엔지니어링 담당 |
| 전제 조건 | 도구별 소수의 시연 예시를 작성할 수 있는 문서화된 API, 그리고 호출 삽입 후보를 걸러낼 사내 텍스트 데이터. 논문은 도구당 시연 예시 몇 개와 대량의 비라벨 텍스트만으로 학습을 구성했습니다 |
| 첫 적용 지점 | 사실 조회형 도구 한 개. 논문에서 개선 폭이 가장 컸던 영역이 질의응답 도구를 통한 사실 조회였습니다. 반대로 계산기처럼 유용한 호출이 드물게 발견되는 도구는 데이터 효율이 낮다고 논문이 밝혔으므로 뒤로 미룹니다 |
| 판단 기준 | 도구 연동 전후의 과업 정확도 비교와 함께, 불필요한 시점의 호출 비율과 필요한 시점의 미호출 비율을 별도 지표로 측정합니다. 논문이 사실 조회에서 얻은 개선처럼 호출 판단이 정확도 향상으로 이어지는지, 언어 능력이 유지되는지를 함께 봅니다 |
코텍시스는 Agentic Workflow 구축 시 이 호출 판단 품질을 평가 지표로 먼저 정의하고 도구 연동 범위를 단계적으로 넓히는 접근을 권합니다.
코텍시스 AI사업부는 sLLM 최적화, Advanced RAG, AI Agent 개발을 수행합니다. 이런 기법의 도입을 검토 중이라면 문의를 남겨주세요.
AI 개발 문의기술 블로그 최신 글
AI 네이티브 SDLC 플레이북, 여섯 단계 중 먼저 바꿀 곳
코드 작성이 병목에서 빠지면 계획·리뷰·배포가 새 병목이 됩니다. Anthropic Applied AI 팀의 AI 네이티브 SDLC 플레이북을 여섯 단계 전환표, 통제 계층, 측정 지표로 정리하고 국내 도입 시 확인할 것을 덧붙였습니다.
Anthropic이 AI 교육을 설계한 다섯 원칙과 한국 기업교육의 거리
Anthropic이 Claude Academy를 공개하며 밝힌 AI 교육 설계 원칙 다섯 가지를 정리하고, 국내 기업교육 발주에 옮길 때 제안서에서 확인할 질문과 실패 유형을 덧붙였습니다.
Slack에 상주하는 에이전트, Claude Tag가 실제로 한 일
Anthropic 사내에서 Claude Tag가 처리한 세 가지 업무를 소요 시간과 산출물 기준으로 정리하고, 잘 작동한 지시의 공통 구조와 국내 조직 도입 시 확인할 항목을 덧붙였습니다.
같은 주제의 다른 인사이트
깃허브 이슈로 코드 에이전트를 시험하는 SWE-bench
SWE-bench는 12개 파이썬 오픈소스 저장소의 실제 깃허브 이슈 2,294건을 언어 모델이 해결할 수 있는지 테스트로 검증하는 벤치마크로, 발표 당시 최고 모델의 해결률은 1.96%에 그쳤습니다. 이후 코드 에이전트 경쟁의 표준 척도가 된 이 벤치마크는 개발 업무 자동화의 성숙도를 기업이 수치로 추적할 수 있게 해줍니다.
MCP 생태계의 구조와 보안 위협을 정리한 첫 체계적 분석
이 논문은 AI 모델과 외부 도구를 잇는 표준인 Model Context Protocol의 아키텍처와 생태계를 정리하고, 서버 생명주기 4단계에 걸친 16개 위협 시나리오의 보안 분류체계를 제시한 첫 체계적 연구입니다. MCP로 사내 시스템을 에이전트에 연결하려는 기업에게 표준 도입의 이점과 함께 서버 검증 절차가 왜 필수인지를 알려줍니다.
운영체제에서 배운 에이전트 장기 메모리, MemGPT
MemGPT는 운영체제의 계층적 메모리 관리에서 착안해 언어 모델이 제한된 컨텍스트 창 안팎으로 정보를 스스로 옮기는 가상 컨텍스트 관리를 제안했습니다. 고객 이력이나 프로젝트 맥락을 오래 기억해야 하는 업무 에이전트를 설계할 때 컨텍스트 창 확장 경쟁 대신 메모리 계층 설계로 접근할 수 있음을 보여줍니다.