콤퓨타이슈 AI 봇은 이제 목적에 따라 나뉜다 — 검색·에이전트·학습 봇의 최신 웹 접근 변화
페이지 정보
본문
작성일
생성형 AI가 웹 검색과 브라우저 사용 기능을 확대하면서 웹사이트에 접근하는 AI 자동화 프로그램의 역할도 세분화되고 있다.
과거 검색엔진에서는 Googlebot과 같은 검색 크롤러가 웹페이지를 발견하고 정보를 수집한 뒤 검색 색인에 반영하는 방식이 대표적이었다.
현재 생성형 AI 환경에서는 웹사이트에 접근하는 목적이 더 다양해졌다.
검색이나 AI 답변을 위해 정보를 수집하는 봇이 있는 반면, 사용자의 요청을 받아 특정 웹페이지에 실시간으로 접근하는 AI 에이전트도 있다. AI 모델의 학습이나 개선을 위해 웹 콘텐츠를 수집하는 크롤러도 존재한다.
실제로 OpenAI, Anthropic, Perplexity 등은 서로 다른 목적의 웹 접근에 별도의 봇이나 fetcher를 운영하고 있으며, Google 역시 검색과 생성형 AI 관련 일부 콘텐츠 이용을 구분할 수 있는 제어 방식을 제공하고 있다.
웹 인프라 기업에서도 이러한 구분이 나타나고 있다. Cloudflare는 AI 관련 자동화 트래픽을 검색(Search), 에이전트(Agent), 학습(Training) 행동으로 구분해 웹사이트 운영자가 각각 제어할 수 있도록 하고 있으며, 9월 15일부터 일부 도메인에 새로운 기본 정책을 적용할 예정이다.
현재 AI가 웹사이트에 접근하는 방식이 어떻게 나뉘고 있는지 공개된 공식 자료를 기준으로 살펴본다.
■ AI의 웹 접근은 하나의 목적으로만 이루어지지 않는다
웹사이트에 자동으로 접근하는 프로그램은 생성형 AI 이전부터 존재했다.
대표적인 것이 검색엔진 크롤러다.
검색엔진은 자동화된 프로그램을 이용해 웹페이지를 발견하고 내용을 수집한 뒤 검색 색인에 반영한다.
생성형 AI 서비스가 웹 검색과 실시간 정보 검색, AI 에이전트, 모델 개발 등에 웹 콘텐츠를 활용하면서 자동화된 웹 접근의 목적도 다양해지고 있다.
현재 여러 AI 서비스와 웹 인프라 사업자의 공식 문서에서 확인되는 접근 목적을 단순화하면 다음과 같이 구분할 수 있다.
검색(Search)
↓
검색 또는 정보 탐색을 위한 웹 콘텐츠 발견과 수집
에이전트·사용자 요청(Agent / User Fetch)
↓
사용자의 현재 요청을 처리하기 위한 실시간 웹페이지 접근
학습(Training)
↓
AI 모델의 학습이나 파인튜닝 등을 위한 콘텐츠 수집
각 회사가 사용하는 명칭과 세부적인 작동 방식은 서로 다르지만, 웹 콘텐츠에 접근하는 목적을 구분하는 사례는 여러 서비스에서 확인되고 있다.
■ 검색용 AI 봇은 웹에서 정보를 발견하는 역할을 한다
검색용 봇(Search Bot)은 웹페이지를 발견하고 정보를 수집해 이후 검색이나 정보 탐색 과정에서 활용하기 위한 자동화 프로그램이다.
전통적인 검색엔진 크롤러와 유사한 역할을 하지만 생성형 AI 검색 서비스에서도 별도의 검색용 크롤러가 사용되고 있다.
OpenAI의 OAI-SearchBot이 대표적인 사례다.
OpenAI는 OAI-SearchBot을 ChatGPT의 검색 기능과 관련된 웹 검색용 크롤러로 설명하고 있다.
웹사이트가 ChatGPT 검색의 요약이나 스니펫 등에 포함되려면 OAI-SearchBot의 접근을 허용해야 한다고 공식 문서에서 안내한다.
Perplexity 역시 PerplexityBot이라는 검색용 크롤러를 운영한다.
Perplexity는 PerplexityBot이 검색 결과에서 웹사이트를 발견하고 링크하는 데 사용되며, 생성형 AI 기반 모델의 사전 학습을 위한 콘텐츠 수집에는 사용되지 않는다고 설명하고 있다.
Anthropic도 Claude의 웹 검색 기능을 지원하기 위한 Claude-SearchBot을 별도로 운영한다.
즉 생성형 AI 서비스에서도 검색을 위한 웹 접근이 별도의 기능으로 구분되고 있다.
■ 사용자의 요청을 받아 실시간으로 홈페이지에 접근하는 AI도 있다
검색 크롤러와 다른 형태의 웹 접근도 존재한다.
사용자가 AI에게 특정 정보를 확인해달라고 요청했을 때 AI가 그 요청을 수행하기 위해 웹사이트에 접근하는 방식이다.
예를 들어 사용자가 AI에게
“이 회사 홈페이지에서 서비스 내용을 확인해줘.”
라고 요청했다고 가정해보자.
AI는 해당 요청을 처리하기 위해 그 시점에 웹사이트에 접속하고 필요한 페이지의 정보를 가져올 수 있다.
Anthropic은 이러한 사용자 요청 기반 접근에 Claude-User를 사용하고 있다.
Perplexity도 Perplexity-User라는 별도의 fetcher를 운영한다.
Perplexity는 Perplexity-User를 사용자가 요청한 정보를 가져오기 위해 웹페이지에 접근하는 방식으로 설명하고 있으며, 일반적인 웹 크롤러와는 다른 정책을 적용하고 있다.
이처럼 미리 웹을 돌아다니면서 정보를 수집하는 크롤러와 사용자의 현재 요청을 처리하기 위해 특정 웹페이지에 접근하는 프로그램은 동일한 방식으로 운영되지 않을 수 있다.
■ AI 모델 학습을 목적으로 웹에 접근하는 봇도 있다
웹사이트의 콘텐츠가 AI에 사용되는 또 다른 목적은 모델 학습이다.
OpenAI는 GPTBot이라는 별도의 웹 크롤러를 운영하고 있다.
웹사이트 운영자는 robots.txt를 이용해 GPTBot의 접근 여부를 설정할 수 있다.
Anthropic도 ClaudeBot을 모델 개발과 관련된 웹 콘텐츠 수집에 사용하는 봇으로 별도 안내하고 있다.
따라서 동일한 AI 서비스 안에서도
검색을 위한 접근
과
모델 개발을 위한 접근
이 별도의 크롤러로 운영될 수 있다.
이 구조에서 중요한 사실은 AI 검색에서 웹사이트를 발견하기 위한 접근과 AI 모델 학습을 위한 접근이 항상 같은 것은 아니라는 점이다.
OpenAI의 경우 OAI-SearchBot과 GPTBot이 구분되어 있으며, Anthropic 역시 Claude-SearchBot과 ClaudeBot을 별도로 안내하고 있다.
■ Google도 검색과 생성형 AI 관련 일부 이용을 구분하고 있다
Google은 검색 크롤링과 생성형 AI 관련 일부 콘텐츠 이용을 별도로 제어할 수 있는 방식을 제공하고 있다.
Google Search에서 웹페이지를 수집하는 대표적인 크롤러는 Googlebot이다.
한편 Google은 robots.txt에서 사용할 수 있는 Google-Extended라는 별도의 제어 토큰을 제공한다.
Google-Extended를 이용하면 웹사이트 운영자는 Google이 이미 크롤링한 콘텐츠를 향후 Gemini 모델 학습과 일부 Gemini 관련 grounding에 사용할 수 있는지를 관리할 수 있다.
Google은 Google-Extended 설정이 Google Search에서의 사이트 포함 여부나 검색 순위에는 영향을 주지 않는다고 설명하고 있다.
또 Google Search의 AI 기능은 기존 Googlebot과 Search 관련 제어를 사용한다고 안내한다.
따라서 Google에서도 검색을 위한 웹 접근과 생성형 AI 관련 일부 콘텐츠 이용을 구분하는 제어 구조가 존재한다.
■ 웹 인프라에서도 Search·Agent·Training 구분이 나타나고 있다
AI 서비스 사업자뿐 아니라 웹사이트 트래픽을 관리하는 인프라에서도 이러한 목적 구분이 나타나고 있다.
Cloudflare는 Verified Bots 시스템에서 AI 관련 자동화 트래픽을 행동에 따라 구분한다.
대표적인 세 가지 행동은 다음과 같다.
Search
웹사이트 콘텐츠를 수집하거나 색인해 검색이나 정보 탐색에 활용하는 행동.
Agent
사용자를 대신해 웹사이트에 실시간으로 접근하는 자동화 행동.
Training
생성형 AI 모델의 학습이나 파인튜닝 등에 사용하기 위해 웹 콘텐츠를 수집하는 행동.
Cloudflare에서는 이 세 가지 행동에 대해 각각 허용 또는 차단 설정을 제공하고 있다.
여기서 분류 기준은 단순히 특정 AI 회사의 이름만이 아니다.
하나의 Verified Bot에 하나 이상의 행동이 연결될 수 있기 때문에 같은 봇이 여러 목적을 가진 것으로 분류되는 경우도 존재한다.
■ 9월 15일부터 일부 AI 봇의 기본 접근 설정도 달라질 예정이다
AI 트래픽을 목적별로 구분하는 방식은 실제 웹사이트의 기본 접근 정책에도 반영되고 있다.
Cloudflare는 9월 15일부터 새롭게 Cloudflare에 연결되는 도메인에 새로운 AI 관련 기본 설정을 적용할 예정이라고 발표했다.
광고가 표시되는 페이지에서는 기본적으로
Search
→ 허용
Agent
→ 차단
Training
→ 차단
으로 설정될 예정이다.
Cloudflare는 검색 크롤러가 콘텐츠를 발견하고 사용자를 원래 웹사이트로 연결할 가능성이 있는 반면, AI 에이전트나 학습용 크롤러는 사람이 직접 웹사이트를 방문하지 않고 콘텐츠를 이용할 수 있다는 점을 정책 변경의 배경으로 설명하고 있다.
기존 무료 고객 중 관련 설정을 변경하지 않은 일부 고객에게도 새로운 기본 설정이 적용될 예정이다.
사용자는 Cloudflare 대시보드에서 각 행동에 대한 설정을 변경할 수 있다.
따라서 이번 변화는 AI 봇 전체를 일괄적으로 차단하는 방식이 아니라 접근 목적에 따라 기본 처리 방식을 다르게 적용하는 정책이다.
■ 하나의 AI 봇이 여러 목적을 가진 경우도 있다
Search Bot, Agent, Training Bot이라는 구분이 모든 크롤러에 일대일로 적용되는 것은 아니다.
하나의 크롤러가 여러 목적과 연결되는 경우도 있기 때문이다.
Cloudflare의 Verified Bots 시스템에서도 하나의 봇에 여러 행동을 연결할 수 있다.
Cloudflare는 관련 정책을 설명하면서 Googlebot, Applebot, Bingbot처럼 여러 목적으로 사용되는 크롤러의 사례를 언급하고 있다.
다만 여기서는 각 회사가 자신의 크롤러를 어떻게 설명하는지와 Cloudflare가 해당 트래픽을 어떻게 분류하는지를 구분할 필요가 있다.
예를 들어 Google은 자체 문서에서 Google Search의 크롤링과 Google-Extended를 이용한 생성형 AI 관련 일부 콘텐츠 사용 제어를 별도로 설명한다.
따라서 AI 봇의 목적은 크롤러 운영사의 정책과 웹 인프라 사업자의 트래픽 분류 체계에서 서로 다른 방식으로 표현될 수 있다.
■ AI 봇 접근은 robots.txt로 구분할 수 있다
AI 크롤러의 접근과 관련해 사용되는 대표적인 웹 기술이 robots.txt다.
robots.txt는 로봇 배제 프로토콜(Robots Exclusion Protocol)을 이용해 웹사이트 운영자가 자동화된 크롤러에게 사이트의 어떤 영역을 크롤링할 수 있는지를 전달하는 파일이다.
웹사이트의 최상위 경로에 robots.txt 파일을 두고 크롤러의 사용자 에이전트(User-Agent)에 따라 규칙을 설정할 수 있다.
예를 들어 같은 홈페이지에서도
검색용 크롤러
학습용 크롤러
다른 자동화 프로그램
에 서로 다른 규칙을 전달할 수 있다.
OpenAI와 Anthropic 등도 각 크롤러에 대한 robots.txt 설정 방법을 공식 문서에서 안내하고 있다.
■ robots.txt가 AI 봇의 접속 자체를 막는 것은 아니다
robots.txt는 웹사이트 접근 정책을 전달하는 방식이지만 방화벽과 같은 보안 시스템은 아니다.
로봇 배제 프로토콜은 웹사이트 운영자가 크롤러에게 크롤링 범위를 표현하고, 이를 준수하는 크롤러가 해당 규칙에 따라 행동하는 구조다.
따라서 robots.txt에 특정 크롤러를 차단하는 규칙을 작성하는 것과 해당 프로그램의 HTTP 요청 자체를 서버에서 차단하는 것은 기술적으로 다른 방식이다.
실제 네트워크 요청을 제어하는 데는 웹 애플리케이션 방화벽(WAF, Web Application Firewall), Bot Management, 서버 접근 규칙 등의 기술이 사용될 수 있다.
단순화하면 다음과 같이 구분할 수 있다.
robots.txt
↓
웹 크롤러에게 접근 정책 전달
WAF·Bot Management
↓
들어오는 HTTP 요청을 식별하고 실제 허용 또는 차단
Cloudflare의 AI Crawl Control 역시 WAF 규칙을 이용해 특정 AI 자동화 트래픽을 실제 요청 단계에서 차단할 수 있도록 하고 있다.
■ AI 봇을 식별하는 방법도 다양해지고 있다
웹 크롤러는 HTTP 요청을 보낼 때 사용자 에이전트(User-Agent)를 통해 자신의 정보를 표시할 수 있다.
robots.txt에서도 User-Agent를 기준으로 크롤러별 접근 규칙을 작성한다.
하지만 User-Agent 문자열은 요청을 보내는 프로그램이 표시하는 정보이기 때문에 문자열만으로 실제 요청 주체의 신원을 항상 확인할 수 있는 것은 아니다.
Cloudflare의 Verified Bots 시스템에서는 공개 IP 주소 범위, 역방향 DNS(reverse DNS), Web Bot Auth 등 여러 방법을 이용해 알려진 자동화 프로그램의 신원을 확인할 수 있다고 설명한다.
따라서 현재의 봇 관리에는
어떤 이름으로 접근하는가
↓
실제로 어떤 주체가 요청하는가
↓
어떤 목적으로 분류되는가
↓
어떤 접근 정책을 적용할 것인가
라는 여러 단계가 사용될 수 있다.
■ 웹 콘텐츠의 ‘접근’뿐 아니라 ‘사용 목적’을 표현하려는 방식도 등장하고 있다
AI가 웹 콘텐츠를 사용하는 방식이 다양해지면서 단순한 크롤링 허용과 차단보다 더 세분화된 신호도 등장하고 있다.
Cloudflare의 Managed robots.txt에서는 콘텐츠 신호(Content Signals)라는 방식이 제공되고 있다.
현재 문서에서는 대표적으로 다음과 같은 목적이 구분된다.
search
검색 인덱스와 검색 결과에 콘텐츠를 사용하는 것과 관련된 신호.
ai-input
검색증강생성(RAG), grounding 또는 생성형 AI 답변 생성 과정에서 콘텐츠를 입력으로 사용하는 것과 관련된 신호.
ai-train
생성형 AI 모델의 학습이나 파인튜닝에 콘텐츠를 사용하는 것과 관련된 신호.
Cloudflare는 콘텐츠 이용 범위를 더 세분화하는 추가적인 use 신호도 시험하고 있다고 밝혔다.
이러한 Content Signals와 추가 신호는 현재 Cloudflare가 제공하거나 시험하고 있는 방식이며, 모든 웹사이트와 AI 사업자가 공통으로 사용하는 웹 표준은 아니다.
■ 현재 AI의 웹 접근에서 확인되는 변화
웹사이트에 접근하는 자동화 프로그램 자체는 새로운 기술이 아니다.
검색엔진은 오랫동안 크롤러를 이용해 웹페이지를 발견하고 정보를 수집해왔다.
달라지고 있는 것은 자동화된 웹 접근의 목적이다.
현재 공개된 AI 사업자와 웹 인프라 사업자의 자료에서는 다음과 같은 변화가 확인된다.
검색이나 AI 답변을 위한 웹 접근과 모델 학습을 위한 웹 접근을 별도의 봇으로 운영하는 사례가 존재한다.
사용자의 현재 요청을 처리하기 위해 특정 웹페이지에 실시간으로 접근하는 Agent 또는 User Fetch 방식도 사용되고 있다.
웹사이트 운영자가 Search, Agent, Training 등 목적별로 자동화 트래픽을 구분해 제어할 수 있는 서비스도 등장하고 있다.
robots.txt뿐 아니라 WAF와 Bot Management 등을 이용해 실제 네트워크 요청 단계에서 자동화 트래픽을 관리하는 방식도 사용되고 있다.
또 웹 콘텐츠를 단순히 크롤링할 수 있는지를 넘어 검색, AI 답변 입력, 모델 학습 등 콘텐츠의 이용 목적 자체를 구분하려는 방식도 나타나고 있다.
생성형 AI가 검색과 브라우저 사용 기능을 확대하면서 웹사이트에 접근하는 AI 트래픽도 하나의 종류가 아니라 검색·실시간 사용자 요청·모델 학습 등 서로 다른 목적으로 분화되고 있다.
────────────────────
■ 주요 용어 정리
AI 크롤러(AI Crawler)
생성형 AI의 검색, 정보 수집, 모델 개발 등의 목적으로 웹페이지에 자동 접근하는 프로그램을 통칭할 때 사용되는 표현이다.
검색 봇(Search Bot)
검색이나 정보 탐색을 위해 웹페이지를 발견하고 수집·색인하는 자동화 프로그램이다.
AI 에이전트(AI Agent)
사용자의 목표나 요청을 바탕으로 외부 시스템이나 웹사이트에 접근해 작업을 수행할 수 있는 AI 시스템을 의미한다.
학습 봇(Training Bot)
AI 모델의 학습이나 파인튜닝 등에 활용할 콘텐츠를 수집하기 위해 웹에 접근하는 자동화 프로그램을 의미한다.
Fetcher
특정 요청에 따라 필요한 웹페이지나 데이터를 가져오는 프로그램이다. 지속적으로 웹을 탐색하는 크롤러와 구분해서 사용되기도 한다.
robots.txt
웹사이트 운영자가 자동화된 크롤러에게 사이트의 어떤 영역을 크롤링할 수 있는지를 전달하기 위해 사용하는 파일이다.
사용자 에이전트(User-Agent)
HTTP 요청을 보내는 브라우저, 크롤러 또는 프로그램이 자신을 식별하기 위해 전달할 수 있는 정보다.
웹 애플리케이션 방화벽(WAF, Web Application Firewall)
웹 애플리케이션으로 들어오는 HTTP 요청을 규칙에 따라 검사하고 허용하거나 차단하는 보안 시스템이다.
Verified Bot
알려진 자동화 서비스의 봇인지 별도의 검증 방법을 통해 확인된 트래픽을 의미한다.
검색증강생성(RAG, Retrieval-Augmented Generation)
AI가 답변을 생성할 때 외부 정보원을 검색하고 관련 정보를 가져와 답변 생성에 활용하는 구조다.
────────────────────
■ 자료 출처
Cloudflare Developers
Verified Bots / Bot Categories / AI Crawl Control 공식 문서
AI Search·Agent·Training 행동 분류와 접근 제어 구조.
Cloudflare
Content Independence Day 관련 공식 발표
AI 자동화 트래픽의 새로운 기본 정책과 Content Signals 관련 내용.
OpenAI
Publishers and Developers FAQ
OAI-SearchBot과 GPTBot의 역할 및 웹사이트 접근 정책.
Anthropic
Web crawler 관련 공식 지원 문서
Claude-SearchBot, Claude-User, ClaudeBot의 역할과 robots.txt 정책.
Perplexity
Perplexity Crawlers 공식 문서
PerplexityBot과 Perplexity-User의 역할과 웹 접근 방식.
Google Search Central
Google Crawlers and Fetchers / Google-Extended 공식 문서
Googlebot과 Google-Extended의 역할 및 Search와 생성형 AI 관련 콘텐츠 이용 제어.
IETF / RFC Editor
RFC 9309 — Robots Exclusion Protocol
robots.txt의 표준 규격.
※ 본 글은 공개된 각 사업자의 공식 문서와 발표를 기준으로 현재 확인되는 AI 웹 접근 구조를 정리한 자료입니다. 크롤러 명칭, 분류 방식, 기본 설정과 접근 정책은 각 서비스의 정책 변경에 따라 달라질 수 있습니다.
