Blog · Guide

AI 크롤러 robots.txt 설정 가이드: 검색 봇과 학습 봇 구분하기

GPTBot을 막아도 ChatGPT 검색에는 나올 수 있습니다. 검색 봇과 학습 봇을 구분하는 robots.txt 작성법과 네이버 블로그, 브런치의 설정을 정리했습니다.

애니모프 팀10분 읽기

AI 크롤러는 하는 일에 따라 세 종류로 나뉩니다. AI 검색 답변에 페이지를 보여 주려고 수집하는 검색 봇, 모델 학습용 데이터를 모으는 학습 봇, 사용자가 질문한 순간 페이지를 대신 열어 보는 사용자 요청 봇입니다. AI 검색에 노출되고 싶다면 검색 봇은 열어 두고, 학습 봇은 회사 방침에 따라 고르면 됩니다. 둘은 서로 독립적이어서 GPTBot을 막아도 OAI-SearchBot이 열려 있으면 ChatGPT 검색에 나올 수 있습니다.

이 글은 OpenAI, Anthropic, Perplexity, 구글, 애플이 공개한 크롤러 문서와, 애니모프가 2026년 10월 4일 국내 주요 콘텐츠 채널의 robots.txt를 직접 확인한 결과를 함께 정리합니다.

핵심 요약

  • 검색 봇은 OAI-SearchBot(ChatGPT), PerplexityBot, Claude-SearchBot, Googlebot(AI 개요와 AI 모드 포함), Bingbot(Copilot), Yeti(네이버)입니다. 막으면 해당 AI 검색 답변에서 빠집니다.
  • 학습 봇과 제어 토큰은 GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot 등입니다. 각 회사는 이 봇을 막아도 검색 노출에는 영향이 없다고 밝힙니다. 단, Google-Extended를 막으면 Gemini 앱의 답변 근거로도 쓰이지 않습니다.
  • ChatGPT-User, Claude-User, Perplexity-User 같은 사용자 요청 봇은 사용자가 시킨 요청이라 robots.txt가 적용되지 않을 수 있습니다.
  • 네이버 블로그, 카페, 지식iN은 ChatGPT, Perplexity, Claude의 검색 봇을 막습니다. 브런치는 학습 봇만 막고 검색 봇은 허용합니다.
  • robots.txt보다 CDN과 방화벽의 봇 차단 설정이 먼저 막는 경우가 많습니다. 실제 응답을 확인하세요.

주요 AI 크롤러 한눈에 보기

회사이름종류막으면 생기는 일
OpenAIOAI-SearchBot검색ChatGPT 검색 답변에 나오지 않습니다. 이동용 링크로는 보일 수 있습니다
OpenAIGPTBot학습학습 데이터에서 빠집니다. 검색 노출과는 별개입니다
OpenAIChatGPT-User사용자 요청사용자가 시킨 요청이라 robots.txt가 적용되지 않을 수 있습니다
AnthropicClaude-SearchBot검색Claude 검색용 색인에서 빠져 검색 결과 노출이 줄 수 있습니다
AnthropicClaudeBot학습이후 학습 데이터에서 빠집니다
AnthropicClaude-User사용자 요청사용자가 요청한 페이지 열람이 막힙니다
PerplexityPerplexityBot검색Perplexity 검색 결과에서 빠집니다. 학습에는 쓰지 않는다고 밝힙니다
PerplexityPerplexity-User사용자 요청대체로 robots.txt를 따르지 않습니다
GoogleGooglebot검색구글 검색과 AI 개요, AI 모드에서 모두 빠집니다
GoogleGoogle-Extended제어 토큰Gemini 학습과 Gemini 앱 그라운딩에서 빠집니다. 구글 검색과는 별개입니다
MicrosoftBingbot검색Bing 검색과 Copilot 답변에서 빠집니다
AppleApplebot-Extended제어 토큰Apple 생성형 AI 학습에서 빠집니다. 따로 크롤링하지는 않습니다
Common CrawlCCBot수집여러 AI 학습에 쓰이는 공개 데이터셋에서 빠집니다
네이버Yeti검색네이버 웹문서 검색에서 빠지고, AI 브리핑이 웹문서로 인용할 수도 없습니다

Google-Extended와 Applebot-Extended는 별도로 사이트를 돌아다니는 봇이 아닙니다. 기존 Googlebot과 Applebot이 가져간 데이터를 어디에 쓸지 정하는 이름표라서 제어 토큰이라고 불렀습니다.

ChatGPT 검색은 OAI-SearchBot이 모은 페이지와 함께 외부 검색 제공자의 결과도 씁니다. Bing이 대표적인 제공자로 알려져 있어서, ChatGPT 노출을 생각하면 Bingbot도 열어 두는 편이 안전합니다.

목적별 robots.txt 예시

AI 검색에는 나오고, 학습에는 쓰이지 않게 하고 싶을 때

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

Google-Extended를 여기에 넣을지는 따로 판단해야 합니다. 막으면 Gemini 학습에서 빠지지만, Gemini 앱이 답할 때 구글 검색에서 근거를 찾는 그라운딩에서도 빠집니다. Gemini 앱에서의 노출이 중요하다면 열어 두세요.

모든 AI에 열어 두고 싶을 때

User-agent: *
Allow: /
Disallow: /api/

Sitemap: https://example.com/sitemap.xml

애니모프의 robots.txt도 이 형태입니다. 브랜드 정보가 학습 데이터에 정확하게 들어가는 것도 장기적으로는 AI 답변에 도움이 된다고 보기 때문입니다. 어느 쪽이 맞는지는 콘텐츠가 곧 상품인 언론사와, 많이 알려질수록 좋은 브랜드가 다르게 판단할 일입니다.

일부 경로만 막고 싶을 때

User-agent: *
Disallow: /admin/
Disallow: /cart/
Disallow: /search

Sitemap: https://example.com/sitemap.xml

관리자 화면, 장바구니, 내부 검색 결과처럼 답변의 근거가 될 필요가 없는 경로만 막습니다. robots.txt는 접근 규칙일 뿐 비공개 처리가 아닙니다. 노출되면 안 되는 페이지는 로그인이나 noindex로 막아야 합니다.

국내 채널은 AI 크롤러를 어떻게 다루나요?

브랜드가 외부 채널에 글을 올릴 때도 그 채널의 robots.txt가 AI 노출을 좌우합니다. 애니모프가 2026년 10월 4일 각 채널의 robots.txt를 내려받아 대표 글 주소 기준으로 크롤러별 허용 여부를 판정한 결과입니다.

채널구글 검색BingChatGPT 검색PerplexityClaude 검색학습 봇 (GPTBot, ClaudeBot, Google-Extended)
네이버 블로그허용허용차단차단차단차단
네이버 카페차단차단차단차단차단차단
지식iN허용허용차단차단차단차단
네이버 프리미엄콘텐츠허용허용차단차단차단차단
브런치허용허용허용허용허용차단
티스토리허용허용허용허용허용허용
velog허용허용허용허용허용허용
다음 카페 (공개 게시판)허용허용허용허용허용허용

네이버 서비스의 robots.txt에는 AI 학습과 검색 증강 생성(RAG) 목적의 봇 접근을 금지한다는 문구가 있습니다. 그래서 네이버 블로그 글은 네이버 AI 브리핑과 구글 검색에는 닿지만, ChatGPT, Perplexity, Claude 검색과 Gemini 앱의 답변 근거가 되기 어렵습니다. 브런치는 학습 봇은 막되 AI 검색 봇은 따로 허용해, 검색 노출과 학습 거부를 나눠 놓은 사례입니다. 티스토리는 공식 공지 블로그(notice.tistory.com) 기준이고, 다음 카페는 회원 공개 글이 많아 실제로 읽히는 글은 더 적습니다.

robots.txt는 각 채널이 밝힌 규칙입니다. 실제 수집 여부는 각 AI 회사의 정책에 따라 다를 수 있고, 규칙은 언제든 바뀝니다. 네이버 AI 브리핑을 겨냥한 채널 전략은 네이버 AI 브리핑 노출 방법에 정리했습니다.

robots.txt보다 먼저 확인할 것: CDN과 방화벽

robots.txt는 크롤러에게 부탁하는 규칙이고, CDN과 방화벽은 요청을 실제로 막습니다. robots.txt를 다 열어 둬도 방화벽이 AI 봇을 막으면 소용이 없습니다.

  • Cloudflare는 2025년 7월 1일부터 새 도메인에 AI 크롤러 차단을 기본값으로 두기 시작했습니다. 2026년 7월부터는 모든 요금제에서 AI 트래픽을 검색, 에이전트, 학습 세 가지로 나눠 따로 허용하거나 막을 수 있습니다.
  • Cloudflare의 관리형 robots.txt를 켜 두면 학습 크롤러 차단 규칙과 콘텐츠 사용 신호(search, ai-input, ai-train)가 자동으로 들어갑니다. 내가 쓴 robots.txt와 실제로 나가는 파일이 다를 수 있습니다.
  • 다른 CDN이나 호스팅의 봇 방어 기능도 같은 방식으로 확인합니다.

가장 빠른 점검은 크롤러 이름을 담은 요청을 직접 보내 보는 것입니다.

curl -I -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; OAI-SearchBot/1.3; +https://openai.com/searchbot)" https://example.com/

200이 아니라 403이나 확인 페이지가 돌아오면 어딘가에서 막고 있는 것입니다. 다만 IP까지 검사하는 방화벽은 이름만 흉내 낸 요청과 실제 봇을 다르게 처리하므로, 최종 확인은 서버 로그에서 실제 봇의 요청과 응답 코드를 보는 것입니다. OpenAI와 Perplexity는 봇의 IP 목록을 공개하고, 구글과 네이버의 봇은 역방향 DNS로 진짜인지 확인할 수 있습니다.

llms.txt도 만들어야 하나요?

급하지 않습니다. 구글은 2026년 공식 가이드에서 구글 검색은 llms.txt를 쓰지 않으며, 만들어도 검색 노출에 득도 실도 없다고 밝혔습니다. OpenAI, Anthropic, Perplexity의 크롤러 문서에도 llms.txt를 검색이나 인용에 쓴다는 설명은 없습니다.

애니모프도 llms.txt를 두고 있지만, 이것으로 노출이 늘 거라고 기대하지는 않습니다. 만드는 데 몇 분이면 되니 손해 볼 일은 없지만, 우선순위는 검색 봇 허용, 사이트맵, 본문을 텍스트로 쓰기, 그리고 답이 될 만한 콘텐츠입니다.

자주 묻는 질문

GPTBot만 막으면 ChatGPT에 안 나오나요?

아닙니다. GPTBot은 학습용이고, ChatGPT 검색 노출은 OAI-SearchBot이 정합니다. OpenAI는 두 설정이 서로 독립적이라고 밝힙니다. ChatGPT 검색에서 빠지고 싶다면 OAI-SearchBot을 막아야 합니다.

robots.txt를 바꾸면 언제 반영되나요?

OpenAI는 검색 결과에 반영되기까지 약 24시간이 걸릴 수 있다고 안내합니다. 다른 회사도 robots.txt를 주기적으로 다시 읽으므로 하루 이틀 여유를 두고 확인합니다.

네이버 Yeti를 막으면 어떻게 되나요?

네이버 웹문서 검색에 수집되지 않으므로 통합검색의 웹문서 영역에 나오지 않고, AI 브리핑이 우리 사이트를 웹문서로 인용할 수도 없습니다. 국내 고객이 있다면 Yeti는 열어 두세요.

접속한 봇이 진짜인지 어떻게 확인하나요?

OpenAI는 OAI-SearchBot, GPTBot, ChatGPT-User의 IP 목록을, Perplexity는 PerplexityBot과 Perplexity-User의 IP 목록을 공개합니다. Googlebot과 Yeti는 역방향 DNS 조회로 google.com, naver.com 도메인에서 온 요청인지 확인할 수 있습니다.

참고 자료

AI는 지금 우리 브랜드를 어떻게 말하고 있을까요?

지금 바로 데모 프로덕트와 현재 AI 가시성 진단 레포트를 받아보세요.