콤퓨타이슈 AI Agent는 이제 며칠 동안 일한다 — OpenAI·AWS가 만드는 ‘장기 실행 AI’ 인프라
페이지 정보
본문
작성일
AI Agent의 작업 시간이 길어지고 있습니다.
기존의 생성형 AI 서비스는 사용자가 질문하거나 작업을 요청하면 모델이 이를 처리하고 결과를 반환하는 방식이 일반적이었습니다. 하지만 최근에는 하나의 업무를 몇 시간에서 며칠 동안 이어서 수행하는 장기 실행 AI Agent(Long-running AI Agent)를 지원하기 위한 기술과 인프라가 주요 AI·클라우드 플랫폼에서 잇따라 공개되고 있습니다.
OpenAI는 최근 Agents API를 Public Beta로 공개했고, AWS는 Agent Session을 최대 14일까지 유지할 수 있는 실행환경을 제공하고 있습니다. Microsoft와 Google 역시 장시간 Agent 작업을 위한 상태 저장, 복구, 백그라운드 실행과 관련된 기능을 각각 제공하고 있습니다.
■ OpenAI, 장시간 작업을 위한 Agents API 공개
OpenAI는 최근 Agents API를 Public Beta로 공개했습니다.
OpenAI는 유용한 Agent를 구축하기 위해서는 강력한 모델뿐 아니라 문맥(Context)을 관리하고, 도구(Tool)를 사용하고, 여러 하위 Agent(Subagent)를 조율하는 Harness와 장시간 안정적으로 작업을 실행할 수 있는 인프라가 필요하다고 설명합니다.
Agents API는 OpenAI의 코딩 Agent인 Codex에서 사용하는 Harness와 인프라를 개발자가 API 형태로 활용할 수 있도록 제공합니다.
특히 장시간 이어지는 Session을 지원하면서 Agent가 파일을 사용하고 코드를 실행하고 작업 중간 결과를 저장할 수 있도록 구성되어 있습니다. OpenAI가 소개한 물류기업 Nash 사례에서는 이러한 구조를 이용해 수시간 또는 수일 동안 이어지는 업무를 Agent가 수행한다고 설명합니다.
즉 AI에게 하나의 질문을 전달하고 답변을 기다리는 것에서 더 나아가, 하나의 업무를 맡기고 장시간에 걸쳐 수행하도록 하는 실행환경이 API 서비스의 영역으로 들어오고 있습니다.
■ AWS는 AI Agent의 작업 Session을 최대 14일까지 지원한다
AWS에서도 장기 실행 Agent를 위한 인프라가 제공되고 있습니다.
Amazon Bedrock AgentCore의 Runtime Instances는 하나의 Agent Session을 최대 14일까지 실행할 수 있습니다.
기존 AgentCore MicroVM Runtime의 최대 Session 시간이 8시간인 것과 비교하면 장시간 작업을 전제로 실행환경이 확장된 것입니다. AWS는 Runtime Instances를 장시간 자동화, Transformation 작업, 중단 후 재개가 필요한 Agent, 여러 Agent가 협업하는 작업 등에 활용할 수 있다고 설명합니다.
여기서 말하는 최대 14일은 AI 모델이 14일 동안 끊임없이 생각한다는 의미는 아닙니다.
AI Agent의 작업을 수행하는 Runtime Session을 최대 14일까지 유지할 수 있다는 의미입니다.
장기 실행 Agent에서는 단순히 실행시간을 늘리는 것뿐 아니라 작업 중 만들어진 상태를 유지하는 기능도 함께 필요합니다.
AWS는 이를 위해 파일, 설치된 패키지, Build Artifact, Cache 등 Agent가 사용하던 작업환경을 유지할 수 있는 Persistent Filesystem을 지원합니다. 실행환경이 중단된 이후에도 저장된 데이터를 다시 연결해 작업을 이어갈 수 있는 구조입니다.
■ AI Agent가 ‘오래 실행되는 것’과 ‘일을 이어가는 것’은 다르다
장기 실행 Agent에서 중요한 것은 단순히 서버를 오래 켜놓는 것만이 아닙니다.
예를 들어 AI Agent가 프로그램을 개발하면서
프로젝트 생성
↓
라이브러리 설치
↓
코드 작성
↓
테스트
↓
오류 수정
까지 진행했다고 가정해보겠습니다.
작업이 중단된 뒤 지금까지 수정한 파일과 진행 상황이 모두 사라진다면 다시 처음부터 작업해야 합니다.
따라서 장시간 업무를 수행하는 Agent에서는 현재 어디까지 작업했는지 저장하고, 중단된 지점에서 다시 작업을 이어갈 수 있는 구조가 필요합니다.
AWS는 AgentCore Runtime의 Persistent Filesystem과 Session 구조를 통해 이러한 작업환경을 유지할 수 있도록 지원하고 있습니다.
장기 실행 AI Agent를 위한 인프라에서 작업시간뿐 아니라 상태 저장과 복구 기능이 함께 제공되는 이유입니다.
■ Microsoft는 Agent가 중단될 가능성까지 고려하고 있다
Microsoft도 Microsoft Foundry Hosted Agents에서 장기 실행 Agent를 지원하고 있습니다.
Microsoft의 관련 기술문서는 장시간 실행되는 Agent에서 Container Crash, 재배포, 메모리 부족, Scale-in 등으로 실행 중인 Process가 사라질 수 있다는 상황을 전제로 설명합니다.
여기서 Microsoft는 두 가지 개념을 구분합니다.
백그라운드 실행(Background Execution)
사용자가 연결을 종료해도 작업이 계속 실행되는 것
복원 가능한 실행(Resilient Execution)
Agent Process 자체에 문제가 발생해도 저장된 상태를 이용해 작업을 복구하는 것
단순히 사용자가 브라우저를 닫은 뒤에도 AI가 계속 일하는 것과, AI의 실행환경 자체가 중단된 이후에도 이전 작업을 복구하는 것은 서로 다른 문제라는 것입니다.
Microsoft는 이를 위해 별도의 지속 상태 저장소(Durable State Store)도 제공합니다.
여기에는 Agent의 중간 작업물, 대화 기록, 진행 상태, Framework Checkpoint 등의 정보를 저장할 수 있습니다.
■ Google은 AI Agent의 백그라운드 작업을 예약하는 기능도 제공한다
Google Cloud에서도 AI Agent의 실행환경과 관련된 기능이 확대되고 있습니다.
Gemini Enterprise Agent Platform은 최근 자율 Agent의 작업을 즉시 처리하지 않고 Queue에 넣어 이후 실행할 수 있는 Deferred Tier for Autonomous Agent Scheduling을 Preview로 공개했습니다.
즉 모든 Agent 작업을 사용자가 요청한 순간 바로 실행하는 것이 아니라, 즉시 결과가 필요하지 않은 작업은 백그라운드 업무로 분리해 실행할 수 있는 구조입니다.
또한 Google은 격리된 Linux Container 안에서 Agent가 Shell Command를 실행하고 Package를 설치하거나 파일을 조작할 수 있는 Shell Sandbox 등의 실행환경도 제공하고 있습니다.
장시간 Agent 작업을 위해 단순한 모델 호출뿐 아니라 실제 작업을 수행할 실행환경과 Scheduling 기능까지 함께 제공되고 있는 것입니다.
■ AI Agent를 위한 인프라가 별도의 기술 영역이 되고 있다
최근 주요 AI·클라우드 플랫폼에서 나타나는 변화에는 공통적인 요소가 있습니다.
OpenAI는 Agents API를 통해 장시간 Session과 Agent Harness를 제공하고,
AWS는 최대 14일 동안 유지할 수 있는 Runtime과 Persistent Filesystem을 제공하며,
Microsoft는 장기 실행 Agent를 위한 상태 저장과 복구 기능을 제공하고,
Google은 Agent의 백그라운드 작업 Scheduling과 실행환경을 제공하고 있습니다.
각 회사가 제공하는 제품과 구현 방식은 다르지만, 장시간 업무를 수행하는 Agent를 운영하기 위해 필요한 기능들이 실제 개발 인프라의 일부로 제공되고 있다는 점은 공통적입니다.
기존의 생성형 AI 서비스가
사용자 요청
↓
모델 처리
↓
결과 반환
이라는 비교적 짧은 상호작용을 중심으로 구성됐다면, 장기 실행 Agent에서는
업무 요청
↓
Agent 실행
↓
도구와 파일 사용
↓
중간 작업 저장
↓
백그라운드 작업
↓
중단 또는 오류
↓
상태 복구
↓
작업 재개
↓
결과 반환
처럼 하나의 업무를 지속적으로 관리하는 구조가 필요해지고 있습니다.
따라서 최근의 장기 실행 AI Agent 관련 기술은 단순히 AI가 더 오래 작동할 수 있게 만드는 것뿐 아니라, 장시간 진행되는 작업을 저장하고 중단된 작업을 복구하며 실행환경을 유지하기 위한 인프라를 함께 구축하는 방향으로 나타나고 있습니다.
────────────────────
■ 용어 정리
장기 실행 AI Agent(Long-running AI Agent)
몇 시간 또는 며칠처럼 장시간에 걸쳐 하나의 업무나 여러 단계의 작업을 수행하도록 설계된 AI Agent.
런타임(Runtime)
AI Agent나 프로그램이 실제로 실행되는 환경.
세션(Session)
하나의 Agent 작업이나 상호작용이 이어지는 실행 단위.
지속 상태(Durable State)
실행환경이 중단되거나 다시 시작되더라도 이전 작업을 이어갈 수 있도록 별도로 보존하는 상태 정보.
지속 파일 시스템(Persistent Filesystem)
실행환경이 변경되거나 다시 시작되어도 파일과 작업 데이터를 유지할 수 있도록 구성된 저장공간.
백그라운드 실행(Background Execution)
사용자가 계속 연결되어 있지 않아도 작업을 실행하는 방식.
────────────────────
■ 함께 읽으면 좋은 글
다음 콤퓨타지식에서는 「AI Agent는 어떻게 며칠 동안 일을 계속할까? State·Checkpoint·Runtime의 원리」를 통해 장기 실행 Agent가 작업을 기억하고 중단된 업무를 다시 이어가는 기술적 구조를 자세히 살펴봅니다.
────────────────────
■ 참고자료
OpenAI — Introducing the Agents API
https://openai.com/index/introducing-the-agents-api/
AWS — AgentCore runtime instances are now generally available
AWS — Instances - Amazon Bedrock AgentCore
https://docs.aws.amazon.com/bedrock-agentcore/latest/devguide/runtime-instances-how-it-works.html
AWS — Use isolated sessions for agents
https://docs.aws.amazon.com/bedrock-agentcore/latest/devguide/runtime-sessions.html
Microsoft — Resilience for long-running Microsoft Foundry hosted agents
https://learn.microsoft.com/en-us/azure/foundry/agents/concepts/long-running-agent-resilience
Microsoft — Durable state store for Microsoft Foundry hosted agents
https://learn.microsoft.com/en-us/azure/foundry/agents/concepts/agent-state-store
Google Cloud — Gemini Enterprise Agent Platform release notes
https://docs.cloud.google.com/gemini-enterprise-agent-platform/release-notes
