콤퓨타수선집은 문체부지정 공식
저작권대리중개업체 육하원칙과 함께합니다.

콤퓨타지식 컴퓨터 사용 AI는 어떻게 화면을 이해할까? Visual Grounding의 원리

페이지 정보

본문

작성일

컴퓨터 사용 AI가 화면에서 버튼이나 입력창을 찾아 실제 작업을 수행하려면 단순히 화면에 무엇이 있는지 인식하는 것만으로는 부족하다.


사용자가 말한 대상이 화면의 어느 위치에 있는지 연결하고, 그 위치를 실제 행동으로 변환하는 과정이 필요하다.


이때 핵심적으로 사용되는 개념이 비주얼 그라운딩(Visual Grounding)이다.


비주얼 그라운딩은 자연어로 표현된 대상이나 지시를 이미지 속 실제 시각 영역과 연결하는 기술을 의미한다.


GUI 환경에서는 이를 GUI 그라운딩(GUI Grounding)이라고 부르기도 한다.


예를 들어 사용자가 AI에게


“로그인 버튼을 눌러.”


라고 요청했다고 가정해보자.


AI가 로그인이라는 단어를 이해하는 것과 화면에서 실제 로그인 버튼을 찾아 클릭하는 것은 서로 다른 문제다.


컴퓨터 사용 AI는 사용자의 지시를 이해하고, 현재 화면을 분석하고, 지시에 해당하는 UI 요소를 찾은 뒤 그 위치를 좌표나 영역으로 연결해야 한다.


즉 컴퓨터 사용 AI의 화면 조작은 기본적으로 다음 문제를 포함한다.


사용자의 지시 이해


↓


화면 인식


↓


목표 UI 요소 탐색


↓


화면상의 위치 결정


↓


클릭·입력 등의 행동 실행


↓


변경된 화면 다시 확인


비주얼 그라운딩은 이 과정에서 “사용자가 말한 대상이 화면의 어디에 있는가?”를 해결하는 핵심 기술이다.


■ 비주얼 그라운딩(Visual Grounding)이란?


비주얼 그라운딩은 언어로 표현된 개념과 이미지 속 실제 영역을 연결하는 기술이다.


일반적인 이미지에서는


“사진에서 빨간 자동차를 찾아라.”


라는 요청이 들어왔을 때 빨간 자동차라는 언어적 개념을 이미지 속 특정 자동차의 위치와 연결하는 것이 비주얼 그라운딩의 한 예다.


컴퓨터 화면에서는 같은 문제가 UI 요소를 대상으로 발생한다.


“검색 버튼을 눌러.”


“이메일 입력창을 선택해.”


“오른쪽 위에 있는 설정 메뉴를 열어.”


같은 지시가 들어오면 AI는 사용자가 의미하는 대상과 실제 화면의 버튼, 입력창, 아이콘 등을 연결해야 한다.


따라서 GUI 환경의 비주얼 그라운딩은 단순히 무엇이 보이는가를 판단하는 것을 넘어 지시한 대상이 정확히 어디에 있는가를 찾는 문제다.


■ AI에게 컴퓨터 화면은 어떤 데이터일까?


사람에게 컴퓨터 화면은 버튼, 메뉴, 입력창, 이미지, 문서가 배치된 하나의 인터페이스로 보인다.


하지만 AI 시스템이 화면을 인식하는 방법은 여러 가지가 있다.


대표적인 방식 중 하나가 스크린샷(Screenshot)을 사용하는 것이다.


현재 화면을 이미지로 캡처해 멀티모달 AI 모델에 전달하면 모델은 화면을 구성하는 픽셀 정보를 바탕으로 텍스트와 이미지, 버튼, 메뉴 등의 시각적 요소를 분석한다.


이 방식에서는 AI가 반드시 웹페이지의 HTML 구조를 읽어야 하는 것은 아니다.


사람이 모니터를 보듯 렌더링된 결과 자체를 입력으로 사용할 수 있기 때문이다.


컴퓨터 사용형 AI는 현재 화면을 확인하고 행동한 뒤 다시 새로운 화면을 받아 다음 행동을 결정할 수 있다.


화면 입력


↓


화면 분석


↓


행동 결정


↓


클릭·입력·스크롤


↓


새로운 화면


↓


다시 분석


이 과정이 반복되면서 여러 단계의 작업이 이루어진다.


■ OCR과 Visual Grounding은 무엇이 다른가?


컴퓨터 화면에는 많은 글자가 있기 때문에 AI가 화면을 이해하는 기술을 광학 문자 인식(OCR, Optical Character Recognition)과 동일하게 생각하기 쉽다.


하지만 두 기술이 해결하는 문제는 다르다.


OCR의 핵심 질문은 다음과 같다.


“화면에 어떤 글자가 적혀 있는가?”


비주얼 그라운딩의 핵심 질문은 다음과 같다.


“사용자가 말한 대상이 화면의 어디에 있는가?”


예를 들어 화면에


로그인


회원가입


비밀번호 찾기


라는 세 개의 텍스트가 있다고 가정해보자.


OCR은 세 문자를 읽을 수 있다.


하지만 사용자가


“로그인 버튼을 눌러.”


라고 요청하면 AI는 로그인이라는 문자뿐 아니라 그 문자가 버튼인지, 클릭할 수 있는 요소인지, 실제 클릭 위치가 어디인지까지 판단해야 한다.


또 모든 UI 요소에 글자가 있는 것도 아니다.


톱니바퀴 모양의 설정 아이콘이나 돋보기 모양의 검색 버튼처럼 텍스트 없이 의미가 전달되는 요소도 있다.


따라서 컴퓨터 사용 AI의 화면 이해에는 문자 인식뿐 아니라 시각적 형태, 위치, 주변 요소, 화면 문맥과 사용자 지시를 함께 해석하는 능력이 필요하다.


■ 객체 탐지와 Visual Grounding도 같은 기술이 아니다


객체 탐지(Object Detection)는 이미지 안에서 특정 종류의 객체를 찾아 위치를 표시하는 기술이다.


예를 들어 이미지에서


사람


자동차


강아지


같은 객체를 찾아낼 수 있다.


하지만 비주얼 그라운딩에는 언어적 조건이 추가된다.


화면에 버튼이 20개 존재할 때 필요한 것은 모든 버튼을 찾는 것이 아니라 사용자가 말한 특정 버튼 하나를 찾는 것이다.


따라서 차이를 단순화하면 다음과 같다.


객체 탐지


“화면에 버튼이 어디에 있는가?”


비주얼 그라운딩


“사용자가 말한 ‘저장 버튼’은 어디에 있는가?”


즉 비주얼 그라운딩에서는 언어의 의미와 시각적 위치의 연결이 핵심이다.


■ AI는 ‘로그인 버튼’의 위치를 어떻게 찾을까?


이 문제를 단계별로 나누면 비주얼 그라운딩의 구조를 이해하기 쉽다.


사용자가 다음과 같이 요청했다고 가정해보자.


“로그인 버튼을 눌러.”


먼저 AI는 언어 지시에서 목표를 파악해야 한다.


목표 대상


→ 로그인 버튼


필요한 행동


→ 클릭


다음으로 현재 화면을 분석한다.


화면에는 로고, 이메일 입력창, 비밀번호 입력창, 로그인 버튼, 회원가입 링크 등이 존재할 수 있다.


AI는 이 가운데 사용자의 지시와 의미적으로 가장 관련 있는 요소를 찾아야 한다.


그리고 선택한 UI 요소가 화면의 어느 위치를 차지하는지 연결한다.


최종적으로 해당 위치가 클릭 행동의 대상이 된다.


따라서 전체 과정을 단순화하면 다음과 같다.


언어 지시


↓


목표 의미 파악


↓


화면의 시각 요소 분석


↓


언어와 UI 요소 연결


↓


목표 위치 결정


↓


행동 실행


■ 좌표 예측(Coordinate Prediction)이란?


컴퓨터에서 마우스를 클릭하려면 최종적으로 화면상의 위치가 필요하다.


화면의 왼쪽 위를 기준으로 가로 방향을 X축, 세로 방향을 Y축으로 표현하면 특정 위치를 (x, y) 좌표로 나타낼 수 있다.


예를 들어 AI가 로그인 버튼의 중심 위치를


(820, 540)


이라고 판단했다면 해당 위치에 마우스 클릭 행동을 실행할 수 있다.


이처럼 모델이 행동해야 할 화면 위치를 좌표로 결정하는 방식을 좌표 예측(Coordinate Prediction)이라고 설명할 수 있다.


다만 실제 시스템에서는 반드시 하나의 점만 사용하는 것은 아니다.


목표 UI 요소가 차지하는 영역 전체를 찾을 수도 있다.


■ Bounding Box란?


바운딩 박스(Bounding Box)는 이미지 속 특정 객체가 차지하는 영역을 사각형으로 표현하는 방법이다.


예를 들어 로그인 버튼이 화면에서


왼쪽 위 (700, 500)


오른쪽 아래 (900, 560)


영역을 차지한다고 가정해보자.


이 사각형이 로그인 버튼의 바운딩 박스가 될 수 있다.


AI가 목표 요소의 영역을 찾으면 그 영역 내부의 적절한 지점을 클릭하도록 연결할 수 있다.


따라서 GUI Grounding에서는


사용자의 언어 지시


↓


대상 UI 요소


↓


Bounding Box 또는 좌표


↓


실제 마우스 행동


처럼 언어의 의미를 물리적인 화면 위치로 변환하는 과정이 발생한다.


■ 멀티모달 AI는 왜 필요한가?


화면을 조작하려면 언어와 이미지를 동시에 이해해야 한다.


사용자의 요청은 대부분 자연어로 전달된다.


반면 현재 컴퓨터 상태는 화면 이미지로 전달될 수 있다.


따라서 두 종류의 정보를 연결해야 한다.


언어


“검색 버튼을 눌러.”


시각 정보


현재 화면의 버튼·텍스트·아이콘·레이아웃


↓


의미 연결


↓


검색 버튼의 실제 위치


이처럼 서로 다른 형태의 데이터를 함께 처리하는 AI를 멀티모달 모델(Multimodal Model)이라고 한다.


멀티모달 모델은 텍스트뿐 아니라 이미지, 음성 등 여러 종류의 정보를 함께 처리할 수 있도록 설계된다.


GUI 에이전트에서는 특히 언어 지시와 화면의 시각 정보를 연결하는 능력이 중요하다.


■ AI는 화면 이미지를 어떻게 처리할까?


비전 모델은 일반적으로 고해상도 화면 전체를 사람이 보는 것과 완전히 동일한 형태로 처리하는 것은 아니다.


많은 비전 모델에서는 이미지를 작은 영역으로 나누고 각각을 모델이 처리할 수 있는 표현으로 변환한다.


이러한 작은 이미지 영역을 이미지 패치(Image Patch)라고 부를 수 있다.


예를 들어 하나의 화면이 여러 개의 작은 영역으로 분할되고,


각 영역의 시각 정보


↓


모델이 처리할 수 있는 내부 표현


↓


언어 정보와 함께 분석


되는 구조다.


이 방식은 이미지 전체의 의미를 이해하는 데 유용하지만 GUI에서는 새로운 문제가 생긴다.


버튼이나 체크박스처럼 작은 UI 요소는 화면 전체에 비해 매우 작은 영역을 차지할 수 있기 때문이다.


따라서 화면의 의미를 이해하는 능력과 몇 픽셀 단위의 정확한 위치를 찾아내는 능력은 서로 다른 난이도의 문제가 된다.


■ 작은 버튼을 찾는 것이 어려운 이유


일반적인 사진에서는 주요 객체가 이미지에서 비교적 큰 영역을 차지하는 경우가 많다.


반면 컴퓨터 화면에는 작은 요소가 매우 많다.


체크박스


닫기 버튼


작은 아이콘


드롭다운 메뉴


툴바


스크롤바


표 안의 작은 버튼


전문 프로그램의 세부 도구


등이 한 화면에 동시에 존재할 수 있다.


화면 해상도가 높아질수록 각각의 요소가 전체 이미지에서 차지하는 비율은 더 작아질 수 있다.


또 비슷하게 생긴 버튼이 여러 개 존재하면 모델은 시각적 모양뿐 아니라 주변 문맥까지 이용해 목표를 구분해야 한다.


이 때문에 GUI Grounding 연구에서는 고해상도 화면과 작은 UI 요소의 정확한 위치를 찾는 문제가 중요한 과제로 다뤄진다.


■ AI가 화면을 확대해서 다시 볼 수도 있다


복잡한 화면을 한 번에 분석하는 대신 필요한 영역을 다시 자세히 확인하는 방식도 연구되고 있다.


예를 들어 AI가 화면 오른쪽 위에 목표가 있을 가능성이 높다고 판단했다면 해당 영역을 잘라내거나 확대해 다시 분석할 수 있다.


전체 화면 확인


↓


목표가 있을 가능성이 높은 영역 탐색


↓


해당 영역 확대 또는 Crop


↓


세부 UI 다시 분석


↓


목표 위치 결정


이러한 접근은 넓은 범위에서 먼저 목표를 찾고 점차 세부 위치를 좁혀가는 거친 탐색에서 정밀 탐색으로 이어지는 방식(coarse-to-fine)으로 이해할 수 있다.


AI가 입력으로 주어진 화면을 수동적으로 한 번만 보는 것이 아니라 필요한 시각 정보를 추가로 확보하는 방식은 능동적 시각 인식(Active Visual Perception)과도 연결된다.


■ AI가 웹페이지를 이해하는 방법은 스크린샷만 있는 것이 아니다


웹사이트에서는 화면 이미지 외에도 구조화된 정보를 이용할 수 있다.


대표적으로 다음 세 가지 관찰 방식을 구분할 수 있다.


스크린샷(Screenshot)


↓


실제 사용자가 보는 렌더링 화면


DOM(Document Object Model)


↓


HTML 문서의 요소와 계층 구조


접근성 트리(Accessibility Tree)


↓


사용자 인터페이스 요소의 역할과 의미를 접근성 관점에서 정리한 구조


세 방식은 같은 웹페이지를 서로 다른 관점에서 표현한다.


■ Screenshot 방식은 무엇을 보는가?


스크린샷 기반 방식에서는 AI가 실제 화면에 렌더링된 결과를 본다.


따라서


색상


버튼 모양


이미지


실제 배치


폰트


시각적 강조


화면에서 겹쳐진 요소


등을 확인할 수 있다.


사람이 실제로 보는 결과와 가깝다는 장점이 있다.


반면 화면에 존재하는 요소의 역할과 구조를 이미지에서 다시 추론해야 한다.


버튼처럼 보이는 요소가 실제 버튼인지, 단순 이미지인지도 시각 정보만으로 판단해야 할 수 있다.


■ DOM 방식은 무엇을 보는가?


DOM(Document Object Model)은 HTML 문서의 구조를 프로그램이 다룰 수 있는 객체 형태로 표현한 것이다.


예를 들어 웹페이지에 다음과 같은 요소가 있다고 가정해보자.


<button>로그인</button>


브라우저는 이를 단순한 픽셀 이미지가 아니라 button이라는 HTML 요소로도 인식한다.


DOM을 이용하는 에이전트는 화면을 이미지로만 보는 대신 페이지를 구성하는 요소와 계층 구조를 직접 활용할 수 있다.


따라서 특정 웹 환경에서는 화면의 모든 의미를 이미지에서 다시 추론하지 않고 웹페이지가 가지고 있는 구조 정보를 이용할 수 있다.


■ Accessibility Tree란?


접근성 트리(Accessibility Tree)는 브라우저나 운영체제가 사용자 인터페이스의 의미를 접근성 도구에 전달하기 위해 만드는 구조다.


예를 들어 화면에


로그인


이라고 표시된 요소가 있다면 접근성 트리에서는 해당 요소가 단순 문자열이 아니라


역할(Role): Button


이름(Name): 로그인


처럼 표현될 수 있다.


이 정보는 스크린리더 같은 보조 기술이 화면을 이해하는 데 사용된다.


AI 에이전트도 이러한 구조를 이용하면 UI 요소의 의미를 파악하는 데 도움을 받을 수 있다.


즉 스크린샷이 “어떻게 보이는가”에 가까운 정보라면 접근성 트리는 “이 요소가 어떤 역할을 하는가”에 가까운 정보를 제공할 수 있다.


■ Screenshot·DOM·Accessibility Tree는 무엇이 다를까?


세 방식은 서로 완전히 대체되는 관계가 아니다.


스크린샷은 실제 렌더링 결과와 시각적 관계를 제공한다.


DOM은 웹페이지의 HTML 구조를 제공한다.


접근성 트리는 인터페이스 요소의 역할과 의미를 제공한다.


따라서 하나의 버튼도 서로 다르게 표현될 수 있다.


사람이 보는 화면


→ 파란색 로그인 버튼


Screenshot


→ 버튼의 실제 픽셀과 화면 위치


DOM


→ <button>로그인</button>


Accessibility Tree


→ button, name=로그인


AI 에이전트는 시스템 설계에 따라 이 가운데 하나를 사용하거나 여러 정보를 함께 사용할 수 있다.


■ Set-of-Mark란?


화면에서 클릭 가능한 요소를 AI가 쉽게 구분할 수 있도록 시각적인 번호를 붙이는 방식도 있다.


이를 Set-of-Mark(SoM) 방식이라고 부른다.


예를 들어 화면에 세 개의 버튼이 있다면


[1] 로그인


[2] 회원가입


[3] 비밀번호 찾기


처럼 각 요소에 번호가 표시된 화면을 AI에게 제공할 수 있다.


AI는 정확한 픽셀 좌표를 직접 생성하는 대신


“2번 요소를 선택한다.”


처럼 목표를 지정할 수 있다.


이 방식에서는 먼저 어떤 요소가 클릭 가능한지 찾아 표시하는 과정이 필요하며, 시스템에 따라 접근성 정보나 다른 UI 분석 기술이 사용될 수 있다.


■ Visual Grounding과 Action Grounding은 무엇이 다를까?


화면에서 목표를 찾았다고 해서 작업이 끝나는 것은 아니다.


비주얼 그라운딩은 주로 다음 질문을 해결한다.


“사용자가 말한 대상은 어디에 있는가?”


행동 그라운딩(Action Grounding)은 한 단계 더 나아간다.


“그 대상에 어떤 행동을 해야 하는가?”


예를 들어 입력창을 찾았다고 하더라도 사용자의 목적에 따라 행동은 달라질 수 있다.


클릭


텍스트 입력


드래그


스크롤


마우스 오버


더블 클릭


등 서로 다른 행동이 필요할 수 있다.


따라서 컴퓨터 사용 AI의 실제 행동은


목표 요소 탐색


목표 위치 결정


행동 종류 결정


이 결합되어야 한다.


■ Visual Grounding은 왜 실패할까?


GUI Grounding의 실패에는 여러 원인이 있을 수 있다.


첫째, 화면에 비슷한 요소가 여러 개 존재할 수 있다.


둘째, 목표 버튼이나 아이콘이 매우 작을 수 있다.


셋째, 팝업이나 광고가 기존 UI를 가릴 수 있다.


넷째, 화면 해상도와 창 크기에 따라 요소의 위치가 달라질 수 있다.


다섯째, 클릭 이후 페이지가 예상과 다르게 변경될 수 있다.


여섯째, 화면에는 보이지만 DOM이나 접근성 트리에 충분한 정보가 없는 요소가 존재할 수 있다.


반대로 구조 정보에는 존재하지만 실제 화면에서는 가려져 있거나 사용자가 현재 조작하기 어려운 요소도 있을 수 있다.


따라서 화면을 의미적으로 이해하는 능력과 실제 UI를 안정적으로 조작하는 능력은 동일하지 않다.


■ 컴퓨터 사용 AI가 화면을 이해하는 전체 구조


지금까지의 내용을 하나의 흐름으로 정리하면 다음과 같다.


사용자 지시


“로그인 버튼을 눌러.”


↓


언어 이해


무엇을 찾아 어떤 행동을 해야 하는지 파악


↓


현재 환경 관찰


Screenshot / DOM / Accessibility Tree 등


↓


시각·구조 정보 해석


화면에 존재하는 UI 요소 파악


↓


Visual Grounding


로그인 버튼이라는 언어적 개념을 실제 UI 요소와 연결


↓


위치 결정


좌표 / Bounding Box / UI element 등


↓


Action Grounding


클릭·입력·스크롤 등 필요한 행동 결정


↓


행동 실행


마우스·키보드 또는 시스템 도구 사용


↓


새로운 상태 관찰


↓


필요한 경우 다시 Grounding


이 반복 구조를 통해 AI 에이전트는 하나의 화면을 인식하는 것을 넘어 여러 화면을 이동하면서 작업을 수행할 수 있다.


■ 결국 Visual Grounding은 무엇을 해결하는 기술일까?


컴퓨터 사용 AI에서 중요한 것은 화면을 단순히 이미지로 인식하는 것이 아니다.


사용자가 자연어로 표현한 목표와 실제 컴퓨터 화면의 특정 요소를 연결해야 한다.


OCR은 화면의 글자를 읽을 수 있다.


객체 탐지는 화면의 객체를 찾을 수 있다.


멀티모달 모델은 언어와 이미지를 함께 이해할 수 있다.


DOM과 접근성 트리는 웹페이지와 인터페이스의 구조적 정보를 제공할 수 있다.


하지만 컴퓨터에서 실제 행동을 수행하려면 결국


“사용자가 말한 대상이 현재 화면의 어디에 있는가?”


라는 문제를 해결해야 한다.


이것이 GUI 환경에서 비주얼 그라운딩이 담당하는 핵심 역할이다.


그리고 목표 요소를 찾은 뒤 좌표나 UI 요소와 연결하고 적절한 행동을 실행하며 변경된 화면을 다시 관찰하는 과정이 이어진다.


따라서 컴퓨터 사용 AI의 화면 이해는 단순한 이미지 인식 하나로 이루어지는 것이 아니라,


언어 이해 → 시각 인식 → Visual Grounding → 위치 결정 → Action Grounding → 행동 → 재관찰


이라는 여러 기술 요소의 결합으로 이해할 수 있다.


────────────────────


■ 주요 용어 정리


비주얼 그라운딩(Visual Grounding)


자연어로 표현된 대상이나 개념을 이미지 속 실제 시각 영역과 연결하는 기술이다.


GUI 그라운딩(GUI Grounding)


사용자의 자연어 지시를 컴퓨터 화면의 버튼, 입력창, 메뉴 등 실제 UI 요소와 연결하는 문제를 의미한다.


광학 문자 인식(OCR, Optical Character Recognition)


이미지에 포함된 문자나 문장을 인식해 텍스트 정보로 변환하는 기술이다.


객체 탐지(Object Detection)


이미지에서 특정 객체를 찾고 해당 객체의 위치나 영역을 식별하는 기술이다.


좌표 예측(Coordinate Prediction)


AI가 클릭하거나 조작해야 하는 화면상의 위치를 좌표 형태로 결정하는 방식이다.


바운딩 박스(Bounding Box)


이미지 속 특정 객체나 UI 요소가 차지하는 영역을 사각형으로 표현한 것이다.


멀티모달 모델(Multimodal Model)


텍스트와 이미지 등 서로 다른 형태의 정보를 함께 처리할 수 있는 AI 모델이다.


이미지 패치(Image Patch)


이미지를 모델이 처리할 수 있도록 나눈 작은 시각 영역을 의미한다.


DOM(Document Object Model)


HTML 문서의 요소와 계층 관계를 프로그램이 다룰 수 있는 객체 구조로 표현한 것이다.


접근성 트리(Accessibility Tree)


사용자 인터페이스 요소의 이름, 역할, 상태 등의 의미 정보를 접근성 도구가 이용할 수 있도록 표현한 구조다.


Set-of-Mark(SoM)


화면의 조작 가능한 요소 등에 시각적인 표시나 번호를 붙여 AI가 목표 요소를 선택하기 쉽게 만드는 방식이다.


행동 그라운딩(Action Grounding)


현재 목표와 화면 상태를 바탕으로 클릭, 입력, 스크롤 등 실제 수행할 행동과 대상을 연결하는 과정이다.


능동적 시각 인식(Active Visual Perception)


AI가 필요한 정보를 얻기 위해 화면 일부를 확대하거나 잘라 다시 관찰하는 등 추가적인 시각 정보를 능동적으로 확보하는 접근 방식이다.


────────────────────


■ 참고 자료


OpenAI

「Computer-Using Agent」

컴퓨터 사용형 에이전트가 스크린샷 기반의 화면 정보를 이용하고 마우스·키보드 행동을 수행하는 구조를 설명한 공식 자료.


OSWorld

「Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments」

실제 운영체제와 애플리케이션 환경에서 멀티모달 AI 에이전트의 컴퓨터 사용 능력을 평가하고 Screenshot, Accessibility Tree 등 다양한 관찰 방식을 다룬 연구.


WebArena

「A Realistic Web Environment for Building Autonomous Agents」

웹 에이전트를 평가하기 위한 환경으로 Screenshot, HTML DOM, Accessibility Tree 등 다양한 웹 관찰 구조를 제공한다.


GUI-Actor

「Coordinate-Free Visual Grounding for GUI Agents」

GUI 에이전트의 시각적 그라운딩과 기존 좌표 생성 방식의 한계를 다룬 연구.


UGround

「Universal Visual Grounding for GUI Agents」

다양한 GUI 환경에서 순수 시각 정보를 이용해 자연어 지시와 화면상의 UI 요소를 연결하는 방법을 연구한 자료.


ScreenSpot-Pro

전문 소프트웨어와 고해상도 GUI 환경에서 작은 UI 요소와 복잡한 인터페이스를 대상으로 GUI Grounding 능력을 평가한 벤치마크.


GUI-Eyes

GUI 에이전트가 화면 일부를 확대·크롭하면서 목표 요소를 탐색하는 능동적 시각 인식 방식을 연구한 자료.