
AI 크롤러 차단과 검색 노출 기준: robots.txt를 어떻게 나눠 설정할까
AI 크롤러 차단은 검색 노출을 막는 작업이 아니다. 사이트 운영자는 검색엔진이 글을 찾고 색인하는 길은 열어두면서, AI 학습이나 무단 수집 목적의 봇은 별도로 제한하는 방식으로 접근해야 한다. 핵심은 검색 크롤러, AI 학습 크롤러, 민감한 비공개 페이지를 한꺼번에 묶지 않고 각각 다른 기준으로 판단하는 것이다.
블로그를 운영하다 보면 “AI 봇을 막으면 검색에도 불리한가?”라는 걱정이 생긴다. 실제로는 robots.txt 한 줄을 잘못 넣어서 검색엔진까지 막는 경우가 더 위험하다. 이 글은 개인 블로그와 소규모 사이트 운영자가 AI 크롤러와 검색 노출을 분리해서 관리하는 기준을 정리한 실무 가이드다.
robots.txt는 무엇을 막고 무엇을 못 막을까
robots.txt는 사이트 루트에 두는 공개 규칙 파일이다. 크롤러에게 “이 경로는 요청하지 말라”거나 “이 경로는 접근해도 된다”는 신호를 준다. 예를 들어 워드프레스 사이트에서는 관리자 경로인 /wp-admin/을 막고, 사이트맵 주소를 알려주는 식으로 사용한다.
다만 robots.txt는 비밀번호나 보안 장치가 아니다. Google Search Central 문서도 robots.txt를 검색 결과에서 페이지를 숨기는 장치로 쓰면 안 된다고 설명한다. 이미 다른 페이지에서 링크된 URL은 내용이 크롤링되지 않아도 주소가 검색 결과에 남을 수 있다. 검색 결과에서 확실히 제외해야 하는 페이지라면 noindex, 비밀번호 보호, 페이지 삭제 같은 다른 방법을 써야 한다.
따라서 robots.txt를 만질 때는 “검색 노출 차단”이 아니라 “크롤러 요청 관리”라고 이해하는 편이 안전하다. AI 크롤러 대응도 이 기준에서 출발해야 한다.
검색 크롤러와 AI 학습 크롤러는 같은 기준으로 다루면 안 된다
검색 크롤러는 글을 검색 결과에 노출하기 위해 사이트를 읽는다. 반면 AI 학습 크롤러나 AI 서비스용 크롤러는 검색 색인과 다른 목적으로 콘텐츠를 수집할 수 있다. 두 목적을 구분하지 않고 모든 봇을 막으면 검색 유입까지 줄어들 수 있다.
| 구분 | 주요 목적 | 운영 기준 | 실수하면 생기는 문제 |
|---|---|---|---|
| 검색 크롤러 | 검색 색인, 검색 결과 노출 | 공개 글과 사이트맵은 허용 | 글이 검색에 늦게 잡히거나 누락될 수 있음 |
| AI 학습 크롤러 | 모델 학습 또는 데이터 수집 | 운영 방침에 따라 제한 또는 차단 | 콘텐츠 사용 범위가 운영자 의도와 달라질 수 있음 |
| AI 답변용 크롤러 | 답변 생성, 요약, 인용 | 출처 노출 이익이 있는지 판단 | 무조건 차단하면 추천·인용 기회를 잃을 수 있음 |
| 비공개·관리 경로 | 회원 정보, 관리자 기능, 내부 파일 | robots.txt가 아니라 로그인·권한으로 보호 | 공개 파일에 민감 경로를 드러내는 역효과가 생김 |
블로그 운영자가 바로 적용할 판단 기준
모든 사이트에 같은 정답은 없다. 광고 승인 준비 중인 블로그라면 검색엔진 접근은 유지하고, AI 학습 목적 수집은 보수적으로 제한하는 방식이 현실적이다. 특히 새 글이 많지 않은 사이트는 검색 유입과 색인 안정성이 먼저다.
다음 기준으로 나누면 설정을 크게 망치지 않는다.
- 공개 글: 검색엔진 크롤링은 허용한다. 사이트맵에도 포함한다.
- 관리자·로그인 경로: robots.txt보다 권한 설정으로 막는다.
- AI 학습 수집: 원치 않으면 AI 크롤러별 차단 또는 Content Signal을 검토한다.
- 이미 공개한 글: 무조건 막기보다 검색 유입, 인용 가능성, 콘텐츠 독창성을 함께 본다.
- 민감한 자료: robots.txt에만 의존하지 말고 서버 접근 자체를 제한한다.
robots.txt 설정 예시는 단순하게 시작해야 한다
워드프레스 블로그라면 먼저 검색엔진이 읽어야 하는 기본 구조를 유지한다. 관리자 경로는 막고, 사이트맵은 알려주는 정도면 충분하다.
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap_index.xml
그 다음 AI 크롤러 제한은 한 번에 많이 넣지 말고, 실제로 확인한 크롤러 이름부터 추가한다. 잘 모르는 이름을 복사해서 수십 줄로 붙여넣으면 나중에 어떤 규칙이 어떤 결과를 만들었는지 추적하기 어렵다.
User-agent: ExampleAI-Crawler
Disallow: /
위 예시는 형식을 보여주기 위한 가상의 이름이다. 실제 운영에서는 각 서비스가 공개한 user-agent 문서나 Cloudflare 같은 보안 도구의 크롤러 목록을 확인한 뒤 적용해야 한다. 이름을 틀리게 쓰면 규칙이 작동하지 않는다.
Cloudflare를 쓰는 사이트라면 Content Signal도 확인한다
Cloudflare는 AI Crawl Control에서 AI 크롤러 활동을 확인하고, 크롤러별 허용 또는 차단 같은 조치를 할 수 있게 제공한다. 무료 플랜에서는 주로 user-agent 문자열을 기준으로 알려진 AI 크롤러를 식별한다. 더 강한 탐지는 유료 Bot Management 기능과 연결된다.
또 Cloudflare의 Content Signals Policy는 robots.txt 안에서 검색, AI 입력, AI 학습 같은 사용 목적에 대한 선호를 표현하는 방식이다. 예를 들어 검색 목적은 허용하되 AI 학습은 원하지 않는다는 신호를 줄 수 있다. 다만 이것은 운영자의 선호를 알리는 성격이므로, 실제 차단이 필요한 경우에는 WAF 규칙이나 봇 관리 기능과 함께 봐야 한다.
쉽게 말해 Content Signal은 “내 콘텐츠 사용 의사를 밝히는 표지판”이고, WAF나 봇 차단 규칙은 “실제로 문 앞에서 막는 장치”에 가깝다. 둘을 같은 것으로 보면 안 된다.
설정 후에는 세 가지를 반드시 확인한다
robots.txt는 한 번 저장했다고 끝나는 파일이 아니다. 캐시, CDN, 플러그인, 검색 도구가 서로 다른 버전을 보고 있을 수 있다. 특히 Cloudflare를 쓰는 경우 캐시가 남아 예전 robots.txt가 계속 보일 수 있다.
- 브라우저 확인:
https://내도메인/robots.txt를 열어 실제 공개 파일을 본다. - 캐시 확인: 수정했는데 반영되지 않으면 워드프레스 캐시와 Cloudflare 캐시를 삭제한다.
- 검색도구 확인: Daum, Google Search Console, Bing Webmaster Tools에서 robots.txt 테스트 또는 URL 검사를 진행한다.
여기서 중요한 것은 편집 화면이 아니라 공개 URL이다. 관리자 화면에 내용이 있어도 외부 크롤러가 보는 /robots.txt에 반영되지 않았다면 인증이나 수집 요청은 실패할 수 있다.
AI 크롤러 설정 체크리스트
- 검색엔진 전체를 막는
Disallow: /가 들어가 있지 않은지 확인했다. - 사이트맵 주소가 현재 사용하는 사이트맵과 일치한다.
- AI 크롤러 차단 규칙은 실제 user-agent를 확인한 뒤 넣었다.
- 관리자 경로와 비공개 자료는 robots.txt가 아니라 권한으로 보호한다.
- Cloudflare 사용 시 캐시 삭제 후 공개 robots.txt를 다시 확인했다.
- 검색 노출이 필요한 글 URL은 수집 요청 또는 사이트맵으로 제출했다.
- 변경 전후 파일 내용을 따로 기록해 두었다.
FAQ
AI 크롤러를 막으면 검색 순위가 떨어지나?
AI 크롤러 차단 자체가 곧 검색 순위 하락을 뜻하지는 않는다. 다만 검색엔진 크롤러까지 함께 막으면 색인과 노출에 문제가 생길 수 있다. 그래서 AI 크롤러와 검색 크롤러를 분리해서 설정해야 한다.
robots.txt에 막아 두면 콘텐츠가 완전히 보호되나?
아니다. robots.txt는 공개 규칙 파일이며 모든 수집자를 강제로 막는 보안 장치가 아니다. 민감한 자료는 로그인, 서버 권한, 비공개 저장소로 보호해야 한다.
Cloudflare Content Signal만 켜면 충분한가?
Content Signal은 콘텐츠 사용 선호를 표현하는 신호에 가깝다. 실제 접근 차단까지 원하면 Cloudflare AI Crawl Control, WAF, 서버 접근 제한을 함께 검토해야 한다.
워드프레스에서는 어디서 수정하나?
Rank Math, Yoast 같은 SEO 플러그인의 robots.txt 편집 기능을 사용할 수 있다. 단, 사이트 루트에 실제 robots.txt 파일이 있거나 CDN이 별도 robots.txt를 제공하면 플러그인 편집 내용이 공개 파일에 그대로 반영되지 않을 수 있다.
정리
AI 크롤러 대응의 목표는 검색 노출을 포기하는 것이 아니라 콘텐츠 사용 범위를 분명히 정하는 것이다. 공개 글은 검색엔진이 읽을 수 있게 두고, AI 학습 목적 수집은 사이트 운영 방침에 따라 제한한다. 설정 후에는 관리자 화면이 아니라 실제 /robots.txt 공개 URL, 캐시 상태, 검색도구 테스트까지 확인해야 한다.
처음부터 복잡한 차단 목록을 붙여넣기보다 기본 robots.txt를 안정적으로 유지하고, 확인 가능한 AI 크롤러부터 하나씩 관리하는 방식이 안전하다.