AI 크롤러의 User-Agent에는 어떤 것들이 있나?

최종 수정 2026-09-14 · 지니어스코리아

업체마다 두세 개씩 있고 역할이 다르다. 크게 학습 자료를 모으는 쪽, 검색 색인을 만드는 쪽, 사용자가 물었을 때 그 자리에서 페이지를 가지러 오는 쪽으로 갈린다.

OpenAI는 어떤 이름을 쓰나?

세 가지로 갈라 놓았다. 학습 자료 수집에 쓰는 이름, 검색 기능의 색인에 쓰는 이름, 그리고 사용자가 주소를 주거나 최신 정보가 필요할 때 그 자리에서 페이지를 가지러 오는 이름이 각각 따로 있다. 세 번째가 답변에 직접 영향을 주는 쪽이다.

Anthropic은?

같은 방식으로 갈라져 있다. 수집용 크롤러, 검색용 크롤러, 실시간 페처가 각각 다른 이름을 쓴다. 우리 서버 로그에서 실제로 관측된 것은 수집용과 실시간 페처 두 종류였고, 실시간 페처는 robots.txt를 먼저 확인한 뒤 본문을 가져갔다.

Perplexity는?

두 가지가 공개되어 있다. 색인을 만드는 크롤러와 사용자 요청에 따라 페이지를 가져오는 페처가 있다. 다만 우리 관측에서는 로그아웃 웹 화면에 주소를 직접 주었을 때도 이 두 이름 중 어느 것도 서버에 오지 않았다.

Google은 어떻게 다른가?

검색 크롤러와 제어 토큰이 분리되어 있다. 검색 크롤링은 기존 검색 크롤러가 하고, AI 학습 쪽 사용 여부를 따로 제어하는 토큰이 별도로 있다. 이 토큰을 막아도 검색 크롤링 자체는 계속된다. 이름을 하나로 묶어 막으면 의도하지 않은 결과가 난다.

이름을 확인하는 방법

각 업체가 공개한 크롤러 문서에 이름과 목적이 적혀 있고, 이름은 바뀌거나 추가된다. 그래서 문서를 한 번 보고 끝낼 것이 아니라 자기 서버 로그에서 실제로 들어온 이름을 주기적으로 확인하는 편이 낫다. 우리 로그에서도 문서에는 없던 종류의 봇이 들어오는 것이 관측됐다.

정리하면?

이름을 정확히 알아야 하는 이유는 하나다. "AI에 학습되기는 싫지만 답변에는 나오고 싶다"는 요구가 실제로 많은데, 그 선택은 이름을 갈라서 적어야만 가능하기 때문이다.