콤퓨타이슈 GPT-6 Astra 공개, 컴퓨터를 사용하는 AI는 어디까지 왔을까?
페이지 정보
본문
작성일
생성형 AI가 질문에 답하거나 코드를 작성하는 것을 넘어 실제 컴퓨터 환경에서 여러 단계의 작업을 수행하는 방향으로 발전하고 있다.
OpenAI는 2026년 9월 3일 새로운 AI 모델 GPT-6 Astra를 공개했다.
이번 발표에서 OpenAI가 주요 개선 영역으로 제시한 것 중 하나는 컴퓨터 사용(Computer Use) 능력이다. Astra는 브라우저와 소프트웨어 환경에서 작업하면서 온라인 양식을 작성하거나 고객 정보를 업데이트하고, 웹사이트를 제작하거나 소프트웨어를 설치·테스트하는 등의 작업을 수행할 수 있도록 설계됐다.
컴퓨터를 사용하는 AI 자체가 이번에 처음 등장한 것은 아니다. OpenAI는 2025년 Operator를 통해 화면을 인식하고 클릭·스크롤·키보드 입력 등을 수행하는 컴퓨터 사용형 에이전트(Computer-Using Agent)를 공개한 바 있다.
이번 Astra 발표에서 확인되는 변화는 컴퓨터 사용형 AI의 작업 범위가 브라우저 조작을 넘어 웹 개발, 테스트, 전문 소프트웨어 활용 등으로 확대되고 있다는 점이다.
이 글에서는 OpenAI가 공개한 공식 자료를 기준으로 GPT-6 Astra의 컴퓨터 사용 능력과 현재 확인되는 활용 범위를 정리한다.
■ GPT-6 Astra는 무엇인가?
GPT-6 Astra는 OpenAI가 2026년 9월 3일 공개한 새로운 AI 모델이다.
OpenAI는 Astra의 주요 활용 영역으로 컴퓨터 사용, 코딩, 연구, 사이버보안, 전문 업무 등을 제시하고 있다.
특히 이번 발표에서는 AI가 단순히 사용자의 질문에 텍스트로 답하는 것뿐 아니라 컴퓨터와 여러 소프트웨어를 사용하면서 복잡한 다단계 작업을 수행하는 능력이 강조됐다.
OpenAI 공식 자료에 따르면 Astra는 온라인 양식 작성, 고객관계관리(CRM) 시스템 업데이트, 캘린더 관리, 온라인 조사, 문서 작성 등의 작업을 수행할 수 있다.
웹사이트 제작이나 프론트엔드 품질보증(QA, Quality Assurance), 소프트웨어 설치와 테스트 같은 개발 관련 작업도 활용 사례에 포함됐다.
■ 컴퓨터를 사용하는 AI는 이전에도 있었다
AI가 화면을 보고 컴퓨터를 조작하는 기술 자체가 Astra에서 처음 등장한 것은 아니다.
OpenAI는 2025년 1월 Operator를 공개하면서 컴퓨터 사용형 에이전트(Computer-Using Agent, CUA)를 소개했다.
Operator는 화면의 스크린샷을 분석해 버튼이나 메뉴, 텍스트 입력 영역 등을 파악하고 마우스 클릭, 스크롤, 키보드 입력 등의 행동을 수행하는 방식이었다.
구조를 단순하게 표현하면 다음과 같다.
화면 확인
↓
현재 상태 판단
↓
클릭·스크롤·입력 등의 행동 수행
↓
변경된 화면 확인
↓
다음 행동 결정
이러한 과정을 반복하면서 웹사이트에서 필요한 작업을 수행하는 방식이다.
Operator의 컴퓨터 사용 기능은 이후 ChatGPT의 에이전트 기능으로 통합됐다.
따라서 Astra에서 나타난 변화는 AI가 컴퓨터를 처음 사용하기 시작했다는 것보다 컴퓨터를 이용해 수행할 수 있는 작업의 종류와 범위가 확대되고 있다는 것에 가깝다.
■ Astra는 웹사이트를 만들고 프론트엔드 QA도 수행한다
이번 발표에서 웹 개발과 직접 연결되는 활용 사례도 공개됐다.
OpenAI는 Astra가 웹사이트를 제작한 뒤 프론트엔드 품질보증(QA) 작업을 수행해 사이트가 제대로 작동하는지 확인할 수 있다고 설명했다.
프론트엔드 QA는 사용자가 실제로 보는 웹사이트 화면에서 기능과 인터페이스가 의도한 대로 동작하는지 확인하는 과정이다.
예를 들어 웹사이트를 제작한 뒤 브라우저에서 실제 화면을 열어 버튼이나 입력 요소가 작동하는지 확인하고, 화면에서 발견된 문제를 다시 수정하는 방식의 작업이 포함될 수 있다.
OpenAI가 공개한 Astra 활용 사례에는 웹사이트 제작뿐 아니라 코드 실행, 브라우저 테스트, 소프트웨어 설치·테스트, 화면에서 발생한 문제 확인과 문제 해결 등이 포함되어 있다.
AI의 개발 작업 범위가 코드 생성 단계에서 실제 실행 환경을 이용한 확인 작업까지 이어지는 사례다.
■ 소프트웨어를 직접 설치하고 테스트하는 작업도 가능하다
Astra의 컴퓨터 사용 사례는 브라우저에만 한정되지 않는다.
OpenAI는 Astra가 소프트웨어를 자동으로 설치하고 테스트하거나 전문 프로그램을 이용해 작업을 수행하는 사례도 제시했다.
문서 편집기와 스프레드시트 같은 업무용 프로그램을 사용하거나 과학 데이터를 분석하고 그래프를 생성하는 등의 작업도 포함된다.
사용자가 하나의 작업을 요청하면 AI가 필요한 프로그램이나 도구를 이용하면서 여러 단계의 작업을 이어가는 방식이다.
OpenAI는 이를 복잡한 다단계 작업(multi-step work)을 수행하는 능력으로 설명하고 있다.
■ OSWorld 2.0에서는 72.6%를 기록했다
OpenAI는 Astra의 컴퓨터 사용 성능을 평가하기 위해 OSWorld 2.0 결과를 공개했다.
OSWorld는 AI 에이전트가 실제 컴퓨터 환경에서 여러 애플리케이션과 운영체제를 사용해 다양한 작업을 수행하는 능력을 평가하기 위한 벤치마크다.
OpenAI가 공개한 OSWorld 2.0 평가에서 GPT-6 Astra는 72.6%를 기록했다.
같은 평가에서 GPT-5.6 Sol은 65.7%를 기록했다.
해당 평가는 2026년 8월 8일 버전의 OSWorld 2.0 오프라인 세트에서 부분 점수(partial score)를 기준으로 측정됐다.
OpenAI는 자체 지연시간 시뮬레이션에서 같은 작업을 완료하는 데 Astra가 약 40분, GPT-5.6 Sol이 약 75분을 사용했다고 밝혔다.
이는 OpenAI가 공개한 특정 평가 환경의 결과이며, 모든 실제 컴퓨터 작업에서 동일한 성능이나 성공률을 의미하는 것은 아니다.
■ 터미널 기반 개발 작업에서도 성능 변화가 나타났다
컴퓨터 사용 능력은 화면을 클릭하는 그래픽 사용자 인터페이스(GUI) 작업에만 해당하지 않는다.
개발자는 명령어를 입력하는 터미널 환경에서도 많은 작업을 수행한다.
OpenAI가 공개한 Terminal-Bench 4.0 평가에서 GPT-6 Astra는 57.9%를 기록했다.
같은 평가에서 GPT-5.6 Sol은 37.3%를 기록했다.
OpenAI가 함께 공개한 다른 모델의 결과에서는 Claude Fable 5.1이 55.8%, Claude Opus 5가 52.6%를 기록했다.
Terminal-Bench는 소프트웨어 엔지니어링, 시스템 설정, 데이터 분석 등 터미널 환경에서 수행되는 복잡한 작업을 AI 에이전트가 해결하는 능력을 평가한다.
OSWorld가 실제 컴퓨터 화면과 애플리케이션을 사용하는 작업을 평가한다면 Terminal-Bench는 명령어 기반의 개발·시스템 작업을 평가한다는 차이가 있다.
■ 웹에서 작업을 수행하는 속도도 평가됐다
OpenAI는 웹 환경에서 AI 에이전트의 작업 능력을 측정하는 Mind2Web 평가 결과도 공개했다.
업데이트된 Codex 컴퓨터 사용 환경과 Astra를 결합한 경우 기존 GPT-5.6 Sol 기반 환경보다 작업 완료 속도가 1.9배 빨라졌다고 OpenAI는 밝혔다.
Mind2Web은 실제 웹사이트 환경에서 여러 단계의 작업을 수행하는 웹 에이전트의 능력을 평가하기 위해 만들어진 벤치마크다.
이 결과 역시 OpenAI가 구성한 특정 평가 환경에서 측정된 수치다.
■ AI의 작업 방식도 질문과 답변에서 다단계 작업으로 확대되고 있다
일반적인 생성형 AI 사용 방식은 사용자가 질문이나 명령을 입력하면 AI가 텍스트, 이미지 또는 코드를 생성하는 형태로 많이 사용돼 왔다.
컴퓨터 사용형 AI에서는 작업 과정이 더 길어질 수 있다.
사용자가 목표를 전달하면 AI가 현재 상황을 확인하고 필요한 도구를 선택한 뒤 작업을 수행한다.
작업 결과를 다시 확인하고 문제가 발견되면 다음 행동을 이어갈 수도 있다.
OpenAI는 Astra가 문서, 스프레드시트, 프레젠테이션 등을 만드는 과정에서도 사용자가 중간에 요구사항을 추가하거나 작업 방향을 변경할 경우 기존 작업 맥락을 유지하면서 계속 작업할 수 있다고 설명하고 있다.
하나의 응답을 생성하는 것뿐 아니라 여러 단계의 행동을 이어가는 형태가 컴퓨터 사용 기능의 주요 특징으로 나타나고 있다.
■ 컴퓨터 사용 능력이 높아지면서 안전 관리도 강화됐다
AI가 실제 컴퓨터에서 수행할 수 있는 작업 범위가 넓어지면서 OpenAI는 관련 안전 기능도 함께 공개했다.
Astra에는 컴퓨터 사용 과정에서 AI가 사용자의 지시를 제대로 이해하지 못했을 가능성을 감지하는 추가 모니터링 기능이 적용됐다.
특정 문제가 감지되면 작업을 일시적으로 중단하거나 사용자에게 검토를 요청할 수 있다.
OpenAI의 안전성 평가에서는 무단 거래, 데이터 손실, 과도한 접근, 통제 우회 등 컴퓨터 사용 과정에서 발생할 수 있는 행동도 평가 대상에 포함됐다.
AI의 컴퓨터 사용 능력과 함께 어떤 작업을 허용하고 언제 사람의 확인을 요구할 것인지도 별도의 관리 영역으로 다뤄지고 있다.
■ Astra는 높은 사이버보안 능력도 함께 평가받았다
OpenAI는 GPT-6 Astra가 자사의 Preparedness Framework에서 사이버보안 능력 기준 Critical 수준에 도달한 첫 모델이라고 밝혔다.
OpenAI가 공개한 평가에서 Astra는 ExploitBench에서 100%, ExploitGym에서 42.4%를 기록했다.
최근 취약점을 대상으로 진행한 별도 평가 과정에서는 기존에 알려지지 않았던 제로데이 취약점 2개를 발견하고 이를 활용하는 데 성공했다고 OpenAI는 설명했다.
이에 따라 OpenAI는 Astra의 배포 과정에 추가적인 사이버보안 안전장치를 적용하고 있다.
이 역시 컴퓨터 사용 기능과 마찬가지로 모델의 작업 능력이 확대되면서 보안과 권한 관리가 함께 다뤄지고 있는 사례다.
■ 발표 직후 모든 사용자에게 제공된 것은 아니다
GPT-6 Astra는 발표와 동시에 모든 ChatGPT 사용자에게 제공된 것은 아니다.
OpenAI는 9월 3일 발표 당시 제한된 조직을 대상으로 우선 배포를 시작했다고 밝혔다.
이후 ChatGPT Plus, Pro, Business, Enterprise 이용자와 OpenAI API로 제공 범위를 확대할 계획이라고 발표했다.
Microsoft Azure와 AWS Bedrock을 통한 제공도 예정되어 있다.
API에서는 gpt-6-astra라는 모델명이 사용된다.
OpenAI가 공개한 Standard API 가격은 입력 100만 토큰당 10달러, 출력 100만 토큰당 50달러다.
따라서 Astra의 실제 이용 가능 여부와 제공 범위는 발표 이후 순차적인 배포 상황에 따라 달라질 수 있다.
■ 2026년 현재 컴퓨터 사용 AI에서 확인되는 변화
OpenAI의 GPT-6 Astra 발표와 기존 컴퓨터 사용형 에이전트의 발전 과정을 함께 보면 몇 가지 변화가 확인된다.
2025년 공개된 Operator에서는 AI가 화면을 인식하고 클릭·스크롤·키보드 입력 등을 수행하는 브라우저 조작 능력이 주요 기능으로 소개됐다.
2026년 Astra에서는 웹사이트 제작, 프론트엔드 QA, 소프트웨어 설치와 테스트, 전문 프로그램 활용 등 더 다양한 컴퓨터 작업이 공식 활용 사례로 제시되고 있다.
컴퓨터 화면을 이용하는 작업뿐 아니라 터미널 기반의 개발·시스템 작업에서도 별도의 성능 평가가 이루어지고 있다.
AI가 하나의 답변이나 코드를 생성하는 방식에서 여러 단계에 걸쳐 도구를 사용하고 결과를 확인하면서 작업을 이어가는 형태도 확대되고 있다.
동시에 실제 컴퓨터와 외부 시스템에 접근하는 능력이 커지면서 사용자 승인, 권한 관리, 행동 모니터링, 사이버보안 등도 함께 관리해야 하는 영역으로 다뤄지고 있다.
현재 공개된 자료에서 확인되는 변화는 컴퓨터를 사용하는 AI가 처음 등장했다는 것이 아니라, AI가 컴퓨터를 이용해 수행할 수 있는 작업의 범위가 웹 개발·테스트·전문 업무 등으로 확대되고 있다는 것이다.
────────────────────
■ 주요 용어 정리
컴퓨터 사용(Computer Use)
AI가 컴퓨터 화면이나 소프트웨어 환경을 인식하고 클릭, 스크롤, 입력, 프로그램 실행 등의 행동을 수행하는 기능을 의미한다.
컴퓨터 사용형 에이전트(Computer-Using Agent, CUA)
화면이나 컴퓨터 환경을 인식하고 필요한 행동을 선택해 여러 단계의 작업을 수행하도록 설계된 AI 에이전트를 의미한다.
AI 에이전트(AI Agent)
사용자의 요청에 답변을 생성하는 것뿐 아니라 외부 도구와 시스템을 이용해 목표를 달성하기 위한 여러 단계의 작업을 수행하는 AI 시스템을 의미한다.
도구 사용(Tool Use)
AI가 검색, 코드 실행, 외부 API, 프로그램 등의 도구를 이용해 작업을 수행하는 것을 의미한다.
프론트엔드 품질보증(Frontend QA, Frontend Quality Assurance)
사용자가 보는 웹사이트나 애플리케이션 화면에서 디자인, 인터페이스, 기능 등이 의도한 대로 동작하는지 확인하는 과정이다.
그래픽 사용자 인터페이스(GUI, Graphical User Interface)
버튼, 메뉴, 창, 아이콘 등 화면의 시각적 요소를 이용해 컴퓨터와 상호작용하는 인터페이스를 의미한다.
다단계 작업(Multi-step Work)
하나의 요청을 처리하기 위해 여러 개의 판단과 행동을 순차적으로 수행하는 작업을 의미한다.
OSWorld
AI 에이전트가 실제 컴퓨터 환경에서 운영체제와 다양한 애플리케이션을 이용해 작업을 수행하는 능력을 평가하기 위한 벤치마크다.
Terminal-Bench
AI 에이전트가 터미널 환경에서 소프트웨어 엔지니어링, 시스템 설정, 데이터 처리 등의 작업을 수행하는 능력을 평가하는 벤치마크다.
제로데이 취약점(Zero-day Vulnerability)
소프트웨어 개발사나 사용자에게 아직 알려지지 않았거나 공식적인 수정 방법이 준비되지 않은 상태의 보안 취약점을 의미한다.
────────────────────
■ 자료 출처
OpenAI
「GPT-6 Astra」
GPT-6 Astra의 컴퓨터 사용, 코딩, 웹 개발, OSWorld 2.0·Terminal-Bench 4.0 등 주요 성능과 활용 사례를 공개한 공식 발표.
OpenAI
「GPT-6 Astra Safety Overview」
컴퓨터 사용 안전성, 사이버보안 능력 및 추가 안전장치와 관련된 공식 자료.
OpenAI
「Computer-Using Agent」
화면을 인식하고 클릭·스크롤·입력 등의 행동을 수행하는 컴퓨터 사용형 에이전트의 구조를 설명한 공식 자료.
OpenAI
「Introducing Operator」
2025년 공개된 Operator와 컴퓨터 사용형 에이전트의 초기 활용 범위를 설명한 공식 발표.
OpenAI
「Product Release Notes」
GPT-6 Astra의 발표 및 초기 제공 범위와 배포 관련 공식 자료.
OSWorld
AI 에이전트가 실제 컴퓨터 환경에서 다양한 작업을 수행하는 능력을 평가하기 위한 OSWorld 공식 프로젝트 자료.
Reuters
GPT-6 Astra의 출시, 컴퓨터 사용 능력 및 AI 에이전트 안전성 문제를 다룬 보도.
TechCrunch
GPT-6 Astra의 컴퓨터·브라우저 사용, 코딩 및 사이버보안 능력을 다룬 보도.
※ 본 콘텐츠는 작성 시점에 공개된 OpenAI 공식 발표, 연구·벤치마크 자료 및 관련 산업 보도를 기준으로 GPT-6 Astra와 컴퓨터 사용형 AI의 현재 상황을 기록한 자료다. 모델의 기능, 성능, 이용 가능 범위와 안전 정책은 이후 변경될 수 있다.
- 이전글컴퓨터 사용 AI는 어떻게 화면을 이해할까? Visual Grounding의 원리 26.09.07
- 다음글GEO 시대, 홈페이지 관리는 어떻게 달라질까? 우리가 유지보수를 하며 생각하게 된 것 26.09.04
