운영체제에서 배운 에이전트 장기 메모리, MemGPT
MemGPT는 운영체제의 계층적 메모리 관리에서 착안해 언어 모델이 제한된 컨텍스트 창 안팎으로 정보를 스스로 옮기는 가상 컨텍스트 관리를 제안했습니다. 고객 이력이나 프로젝트 맥락을 오래 기억해야 하는 업무 에이전트를 설계할 때 컨텍스트 창 확장 경쟁 대신 메모리 계층 설계로 접근할 수 있음을 보여줍니다.
에이전트의 기억력 문제를 운영체제의 가상 메모리에서 배운 방식으로 푼 논문이 2023년 UC 버클리에서 나온 MemGPT입니다. 이 논문이 제안한 계층적 메모리 구조는 이후 상용 에이전트 메모리 시스템의 표준 설계 언어가 됐고, 연구는 Letta라는 회사로 이어졌습니다.
문제 배경
언어 모델의 컨텍스트 창은 유한합니다. 창을 늘리는 경쟁이 계속되고 있지만 수개월치 대화 이력이나 대규모 문서 전체를 담을 수는 없고, 창이 커질수록 추론 비용도 함께 늘어납니다. 검색 증강으로 필요한 정보를 그때그때 가져오는 방법도 있으나, 무엇을 저장하고 언제 꺼낼지의 판단이 모델 바깥의 고정된 파이프라인에 묶여 있다는 한계가 있습니다.
방법
운영체제는 빠르지만 작은 물리 메모리와 느리지만 큰 디스크 사이에서 페이지를 교체하며 무한한 메모리가 있는 것 같은 착시를 만듭니다. MemGPT는 이 발상을 그대로 가져와 가상 컨텍스트 관리라 부릅니다. 컨텍스트 창을 주 메모리로, 외부 저장소를 보조 메모리로 두고, 모델이 함수 호출로 정보를 직접 저장하고 검색하고 수정합니다. 중요한 사실은 상시 유지 영역에 적어 두고, 오래된 대화는 외부로 내리고, 필요할 때 검색해 다시 올립니다. 무엇을 기억하고 무엇을 내릴지 모델 자신이 결정한다는 점이 단순 검색 증강과 다릅니다.

결과
논문은 제한된 컨텍스트가 가장 치명적인 두 영역에서 효과를 확인했습니다. 첫째는 문서 분석으로, 기반 모델의 컨텍스트 창을 크게 초과하는 문서에 대한 질의를 처리했습니다. 둘째는 여러 세션에 걸친 대화로, 사용자를 기억하고 회고하며 장기 상호작용을 통해 진화하는 대화 에이전트를 구현했습니다. 두 영역 모두에서 고정 컨텍스트 기반 접근보다 우수한 결과를 보였습니다.
한계와 주의점
메모리 관리 판단을 모델에 맡기는 설계이므로 성능이 모델의 함수 호출 품질에 직접 의존합니다. 판단이 부정확한 모델에서는 중요한 정보를 내리거나 불필요한 정보를 유지하는 오류가 생길 수 있습니다. 또한 메모리 계층 간 이동이 함수 호출로 이루어지는 만큼 호출 횟수와 지연이 늘어나는 비용도 감안해야 합니다.
도입 검토 가이드
여러 세션에 걸쳐 고객이나 프로젝트 맥락을 유지해야 하는 상담·CS 에이전트를 운영하거나, 컨텍스트 창을 초과하는 문서 뭉치에 대한 질의응답이 필요한 조직에 해당합니다. 대화가 한 세션으로 끝나고 참조 문서도 창 안에 들어오는 서비스라면 이 계층 구조는 불필요한 복잡도입니다.
| 구분 | 내용 |
|---|---|
| 검토 주체 | 에이전트 아키텍처를 담당하는 AI 플랫폼팀과 고객 데이터의 저장·보존 정책을 정하는 데이터 담당 |
| 전제 조건 | 함수 호출 품질이 검증된 기반 모델과 검색 가능한 외부 저장소. 논문 설계에서 메모리 이동이 전부 모델의 함수 호출로 이루어지므로, 호출 판단이 부정확한 모델 위에서는 구조 자체가 성립하지 않습니다. 상시 유지할 정보와 검색으로 미룰 정보의 분류 기준도 미리 필요합니다 |
| 첫 적용 지점 | 컨텍스트 창을 초과하는 사내 문서에 대한 질의응답 하나, 또는 세션 간 고객 기본 정보 유지 하나. 논문이 효과를 실증한 두 영역이 바로 이 둘입니다 |
| 판단 기준 | 고정 컨텍스트 방식과 나란히 비교해 창 초과 문서 질의의 정답률과 세션 간 정보 유지 정확도가 실제로 오르는지. 함께 늘어나는 함수 호출 횟수와 응답 지연, 중요 정보를 잘못 내리는 오류의 빈도를 반대편 지표로 둡니다 |
코텍시스는 이 메모리 계층 설계를 에이전트 도입 초기의 데이터 설계 단계에서 함께 다룹니다.
코텍시스 AI사업부는 sLLM 최적화, Advanced RAG, AI Agent 개발을 수행합니다. 이런 기법의 도입을 검토 중이라면 문의를 남겨주세요.
AI 개발 문의기술 블로그 최신 글
AI 네이티브 SDLC 플레이북, 여섯 단계 중 먼저 바꿀 곳
코드 작성이 병목에서 빠지면 계획·리뷰·배포가 새 병목이 됩니다. Anthropic Applied AI 팀의 AI 네이티브 SDLC 플레이북을 여섯 단계 전환표, 통제 계층, 측정 지표로 정리하고 국내 도입 시 확인할 것을 덧붙였습니다.
Anthropic이 AI 교육을 설계한 다섯 원칙과 한국 기업교육의 거리
Anthropic이 Claude Academy를 공개하며 밝힌 AI 교육 설계 원칙 다섯 가지를 정리하고, 국내 기업교육 발주에 옮길 때 제안서에서 확인할 질문과 실패 유형을 덧붙였습니다.
Slack에 상주하는 에이전트, Claude Tag가 실제로 한 일
Anthropic 사내에서 Claude Tag가 처리한 세 가지 업무를 소요 시간과 산출물 기준으로 정리하고, 잘 작동한 지시의 공통 구조와 국내 조직 도입 시 확인할 항목을 덧붙였습니다.
같은 주제의 다른 인사이트
깃허브 이슈로 코드 에이전트를 시험하는 SWE-bench
SWE-bench는 12개 파이썬 오픈소스 저장소의 실제 깃허브 이슈 2,294건을 언어 모델이 해결할 수 있는지 테스트로 검증하는 벤치마크로, 발표 당시 최고 모델의 해결률은 1.96%에 그쳤습니다. 이후 코드 에이전트 경쟁의 표준 척도가 된 이 벤치마크는 개발 업무 자동화의 성숙도를 기업이 수치로 추적할 수 있게 해줍니다.
MCP 생태계의 구조와 보안 위협을 정리한 첫 체계적 분석
이 논문은 AI 모델과 외부 도구를 잇는 표준인 Model Context Protocol의 아키텍처와 생태계를 정리하고, 서버 생명주기 4단계에 걸친 16개 위협 시나리오의 보안 분류체계를 제시한 첫 체계적 연구입니다. MCP로 사내 시스템을 에이전트에 연결하려는 기업에게 표준 도입의 이점과 함께 서버 검증 절차가 왜 필수인지를 알려줍니다.
언어 모델이 스스로 도구 사용을 배우는 방법, Toolformer
Meta AI의 Toolformer는 언어 모델이 사람의 개입 없이 스스로 API 호출 시점과 인자를 학습하는 자기지도 방식을 제시한 논문입니다. 업무 자동화 에이전트를 도입하려는 기업에게는 도구 호출 능력이 별도의 대규모 수작업 라벨링 없이도 학습될 수 있다는 근거가 되어 사내 시스템 연동 에이전트 설계의 출발점이 됩니다.