Dev Blog

스크립트 & 소스코드 공유

실무에서 유용하게 쓰는 스크립트와 코드 조각을 블로그 게시판으로 저장하고 공유합니다.

HTML5 검색엔진 노출 방지 방법 - robots.txt와 meta robots

페이지 정보

조회 106회 작성일 22-12-01 14:18
검색엔진에 사이트가 노출되지 않도록 제어하는 방법을 정리한 글이다. robots.txt 파일의 User-agent, Disallow, Allow 규칙과 특정 디렉터리·페이지·구글봇만 차단하는 예시, URL 패턴 일치, 그리고 각 페이지에 넣는 meta robots 태그(noindex, nofollow) 사용법과 함께 구글 웹마스터 도움말 기준으로 설명한다.

제공해주신 검색엔진 크롤링 제어 방법에 관한 내용을 마크다운 형식으로 가독성 있게 정리해 드립니다.

검색엔진 노출 제어 가이드: robots.txt 및 Meta 태그 활용법

검색엔진 로봇의 접근을 제어하여 원치 않는 페이지가 검색 결과에 노출되지 않도록 하는 방법은 크게 두 가지가 있습니다. 이 가이드는 구글 웹마스터 도움말 센터의 표준 규약을 바탕으로 작성되었습니다.


1. robots.txt 파일을 이용하는 방법

robots.txt 파일은 웹사이트의 루트 디렉토리에 위치해야 하며, 검색 로봇이 사이트 정보를 수집하기 전 가장 먼저 확인하는 규약 파일입니다.

기본 작성 규칙

  • User-Agent: 규칙을 적용할 로봇의 종류 (전체는 *)
  • Disallow: 수집을 차단할 페이지 경로
  • Allow: 차단된 경로 내에서 예외적으로 허용할 경로

주요 설정 예시

설정 목적 코드 예시
모든 봇의 사이트 전체 차단 User-Agent: *<br>Disallow: /
특정 디렉토리 및 하위 항목 차단 User-Agent: *<br>Disallow: /abcd/
특정 페이지 차단 User-Agent: *<br>Disallow: /index.html
특정 로봇(구글봇)만 차단 User-Agent: Googlebot<br>Disallow: /
특정 확장자(.gif) 파일 차단 User-Agent: Googlebot<br>Disallow: /*.gif$

주의사항

  • 대소문자 구분: URL 경로 작성 시 대소문자를 정확히 구분해야 합니다.
  • 슬래시(/) 활용: Disallow: /abcd라고 적으면 abcd 디렉토리뿐만 아니라 파일명이 abcd로 시작하는 모든 파일도 차단됩니다.
  • 표준 준수: 이 설정은 검색 로봇이 표준 규약을 따를 때만 유효합니다.

2. Meta 태그를 이용하는 방법

사이트 루트 권한이 없어 robots.txt 파일을 수정할 수 없을 때, 개별 HTML 페이지의 <head> 섹션에 태그를 삽입하여 제어하는 방식입니다.

주요 설정 예시

  • 모든 로봇의 색인 생성 및 링크 수집 차단
    <meta name="robots" content="noindex, nofollow">
  • 구글 로봇만 특정하여 차단
    <meta name="googlebot" content="noindex, nofollow">
  • 페이지 색인은 허용하되, 외부 링크 추적만 차단
    <meta name="robots" content="nofollow">
  • 페이지 내 이미지 색인 생성 차단
    <meta name="robots" content="noimageindex">

관련 참고 링크



Let's create something great together.

프로젝트 문의 및 견적 요청은 언제든 환영합니다.