
유명 AI 기업의 웹 크롤러인 것처럼 꾸민 자동 스캔 트래픽이 환경설정 파일과 클라우드 자격증명을 집중적으로 찾은 정황이 포착됐다. 이름만 믿고 접근을 허용하는 보안 규칙이 악용될 수 있다는 경고다.
위협 인텔리전스 기업 그레이노이즈는 8월 28일 공개한 분석에서 오픈AI·앤트로픽·딥시크를 비롯한 8개 기업의 AI 크롤러 13종을 사칭한 활동을 관찰했다고 밝혔다. 다만 악성 요청이 전송된 사실과 별개로, 특정 조직에서 실제 파일이 유출됐다는 증거는 확인되지 않았다고 선을 그었다.
공식 주소와 하나도 맞지 않은 824개 IP
브라우저나 크롤러가 보내는 유저에이전트 문자열은 스스로 적어 내는 이름표에 가깝다. 공격자는 정상 크롤러의 문자열을 그대로 복사할 수 있어, 이름만으로는 요청이 실제 기업에서 왔는지 확인하기 어렵다.
그레이노이즈가 7월 28일부터 8월 23일까지 추적한 6개 위조 크롤러 이름은 824개 IP에서 거의 같은 규모로 나타났다. 이 주소들은 795개의 서로 다른 /24 네트워크 대역에 흩어져 있었고, 오픈AI·앤트로픽·구글·퍼플렉시티 등이 공개한 정식 크롤러 주소 목록과 일치한 사례는 없었다.
구글이 AI 학습 통제를 위해 robots.txt에 쓰도록 안내하는 ‘Google-Extended’도 요청 주체의 이름처럼 악용됐다. 구글 문서상 별도 HTTP 유저에이전트가 없는 명칭인데도 분석 기간 26만3849개 세션이 이 이름을 내세웠다.

robots.txt는 건너뛰고 민감 경로부터 확인
정상 크롤러는 사이트가 허용한 수집 범위를 확인하기 위해 robots.txt를 읽는다. 같은 기간 실제 앤트로픽 크롤러에서는 이 파일이 전체 요청의 12%로 가장 많았고, 자격증명 파일을 찾는 요청은 관찰되지 않았다.
반면 위조된 6개 이름의 트래픽은 robots.txt를 한 번도 요청하지 않았다. 대신 /.env, /.aws/credentials, /.git/config처럼 데이터베이스 비밀번호·클라우드 접근 키·저장소 설정이 노출될 수 있는 경로를 두드렸다. 같은 HTTP 클라이언트 지문과 연결된 전체 트래픽에서는 환경파일과 개인 키, 비밀번호 저장소를 겨냥한 요청이 수백만 건에 달했다.
실제 침해 여부와 스캔 정황은 구분해야
이번 분석은 외부에서 민감 파일을 요청한 행위까지 확인한 결과다. 서버가 파일을 반환했는지, 어느 조직이 피해를 봤는지, 누가 활동을 주도했는지는 입증하지 않았다. 탐색 시도 자체와 실제 정보 유출을 같은 사건으로 단정해서는 안 되는 이유다.
그레이노이즈는 웹 개발 도구 Vite의 임의 파일 노출 취약점인 CVE-2025-30208 탐색도 연관 활동에서 확인했다. 공격 기반이 여러 네트워크에 넓게 퍼져 있어 특정 호스팅 업체나 소수 대역만 차단하는 대응으로는 한계가 있다고 분석했다.
크롤러 이름보다 주소와 행동을 함께 봐야
보안팀은 유저에이전트 문자열만으로 접근을 허용하거나 경고를 끄지 말고, 연결 IP를 각 기업이 공개한 주소 목록과 대조해야 한다. 민감 경로 요청과 robots.txt를 지속적으로 건너뛰는 패턴도 함께 살피는 편이 안전하다.
웹 운영자는 환경파일과 Git 설정, 클라우드 인증 파일을 웹 루트 밖에 두고 외부 URL로 읽힐 가능성이 있었던 키는 교체해야 한다. Vite를 사용한다면 공식 보고서가 권고한 수정 버전인 6.2.3·6.1.2·6.0.12·5.4.15·4.5.10 이상 적용 여부도 점검할 필요가 있다.