소름 끼치는 크롤러들

5 hours ago 2

AI 학습용 크롤러가 Git 커밋을 하나씩 HTML로 렌더링하면서, git.kernel.org에서 Git 복제를 포함한 모든 정상 접근보다 더 많은 CPU 자원을 소비하고 있음 AI 생성물이 섞이지 않은 Linux 개발 이력을 얻으면서도 저장소를 한 번 복제하지 않고, 922개 포크와 148만 커밋에서 파생된 URL을 반복해서 요청함 IP·ASN 차단을 피하려고 주거용·모바일 프록시로 분산하며, IP마다 4~5회만 요청하고 사라져 기존 차단 방식이 효과를 잃음 작업증명 도구 Anubis가 처음에는 크롤러를 막았지만, 이들이 난이도 4와 5의 SHA-256 문제까지 풀면서 정상 모바일 사용자만 수초의 지연과 발열을 감수하게 됨 하루 약 600만 건의 무작위 커밋 요청 중 정상 트래픽은 넉넉히 추산해도 약 2%이며, 운영 측은 비싼 기능과 익명 접근을 제한하는 대신 전체 데이터 다운로드는 계속 제공할 계획임 Linux 개발 데이터가 크롤러를 끌어들이는 이유 Linux 개발은 복제 가능한 Git 저장소와 실시간으로 추적할 수 있는 토론 아카이브를 통해 공개적으로 진행됨 전체 커널 커밋 이력은 AI 생성물이 섞이지 않은 데이터임을 보장할 수 있어 대규모 언어 모델의 학습 자료로 가치가 높음 LLM 생성 콘텐츠로 다시 LLM을 학습시키면 디지털 프리온 질환에 해당하는 문제가 생길 수 있어 AI 이전 데이터가 특히 선호됨 저장소 복제 대신 HTML을 긁는 비효율 저장소와 아카이브는 보존과 재사용을 위해 대부분 git clone으로 내려받을 수 있음 LKML 전체도 Git 저장소로 복제한 뒤 원하는 방식으로 처리할 수 있음 학습 데이터를 얻으려면 저장소를 한 번 복제하고 각 커밋을 순회하면 충분함 크롤러는 이 효율적인 방식 대신 커밋마다 HTML을 렌더링한 뒤 다시 파싱함 linux.git에는 약 148만 개 커밋이 있고, git.kernel.org에는 약 922개 포크가 존재함 서버에서는 대부분 같은 객체를 공유하므로 포크를 효율적으로 저장함 크롤러에는 수십억 개의 유효 URL이 노출되며, 같은 148만 커밋을 최대 922번 중복해서 가져갈 수 있음 cgit은 커밋뿐 아니라 패치, 일반 텍스트 렌더링, 임의 커밋 간 차이도 제공함 사람과 robots.txt를 따르는 크롤러를 전제로 할 때는 유용했지만, 이제는 포크 하나에서도 사실상 헤아리기 어려울 만큼 많은 유효 URL이 생성될 수 있음 IP와 ASN 차단이 무력화된 과...

Read Entire Article