구글 검색 결과 링크, 스크래핑 방지 위해 'goto' 방식으로 변경 — AI 생성 일러스트AI 일러스트
인프라 뉴스

구글 검색 결과 링크, 스크래핑 방지 위해 'goto' 방식으로 변경

google.com/goto: Google's anti-scraping update

Hacker News9월 12일 발표 · 3분

구글 검색 결과 링크가 `google.com/goto`로 변경되어, 목적지 URL이 HTML에 직접 노출되지 않고 새로운 형태로 대체되었습니다.

세 줄 요약Hacker News 원문 기반
  1. 기존과 달리 실제 목적지 URL은 응답 헤더의 'Location' 값에서만 얻을 수 있어, 단순히 HTML 파싱으로는 데이터 추출이 불가능합니다.
  2. 이는 대규모 SERP 데이터 수집 및 검색 인덱스 구축을 어렵게 하여, 자동화된 스크래핑 시스템의 난이도와 비용을 높이는 조치입니다.
  3. 따라서 정확한 데이터를 확보하려면 단순 HTML 파싱을 넘어 HTTP 요청 헤더 분석 등 복잡하고 정교한 기술적 접근이 필수적으로 요구됩니다.

구글 검색 엔진이 일반적인 유기적 검색 결과 링크를 더 이상 목적지 URL을 HTML에 직접 노출하지 않고 `google.com/goto`와 같은 새로운 형식으로 재작성하고 있습니다. 이 방식은 사용자가 결과를 클릭할 때 실제 페이지로 리디렉션시키며, 이때 사용되는 `url` 는 일반적인 Base64 인코딩이 아닌 구글 고유의 암호화 방식을 따릅니다.

새로운 `goto` 형식은 기존의 `google.com/url?q=[URL-encoded destination]`과 근본적으로 다릅니다. 결과 링크의 `href`는 목적지가 아니라 `/goto` 자체를 가리키며, 실제 URL 정보는 응답 헤더의 `Location` 값에 담겨 있습니다. 따라서 단순히 HTML을 파싱하는 것만으로는 최종 목적지 URL을 얻을 수 없고, 해당 URL을 읽기 위해 요청(Request)이 필요합니다.

구글은 이러한 변화를 자동화된 SERP 데이터 수집 및 대규모 검색 인덱스 구축 시도를 막기 위한 광범위한 정책적 움직임의 일환으로 보고 있습니다. 기존에는 평문 링크가 많아 스크래퍼가 HTML에서 수천 개의 URL을 파싱할 수 있었으나, `goto` 방식을 도입하면서 각 결과마다 구글에 다시 요청하여 목적지를 확인해야 하므로 과정이 더 느리고 복잡해졌습니다.

이러한 변화는 SERP 데이터로 검색 인덱스를 구축하는 모든 시스템에 영향을 미치며, 데이터를 확보하기 위해서는 단순 HTML 파싱을 넘어 HTTP 응답 헤더 분석과 같은 정교하고 기술적인 접근 방식이 필수적으로 요구됩니다. 일부 서비스 제공업체들은 이미 이러한 `google.com/goto` 링크를 처리할 수 있도록 검색 파이프라인을 업데이트했다고 밝히고 있습니다.

용어 풀이

파라미터
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
원문Hacker News · google.com/goto: Google's anti-scraping update

평일 아침 메일로 받아 보기 ›틀린 곳 알리기