HTML5 검색엔진 노출 방지 방법 - robots.txt와 meta robots
페이지 정보
조회 104회
작성일 22-12-01 14:18
검색엔진에 사이트가 노출되지 않도록 제어하는 방법을 정리한 글이다. robots.txt 파일의 User-agent, Disallow, Allow 규칙과 특정 디렉터리·페이지·구글봇만 차단하는 예시, URL 패턴 일치, 그리고 각 페이지에 넣는 meta robots 태그(noindex, nofollow) 사용법과 함께 구글 웹마스터 도움말 기준으로 설명한다.
제공해주신 검색엔진 크롤링 제어 방법에 관한 내용을 마크다운 형식으로 가독성 있게 정리해 드립니다.
검색엔진 노출 제어 가이드: robots.txt 및 Meta 태그 활용법
검색엔진 로봇의 접근을 제어하여 원치 않는 페이지가 검색 결과에 노출되지 않도록 하는 방법은 크게 두 가지가 있습니다. 이 가이드는 구글 웹마스터 도움말 센터의 표준 규약을 바탕으로 작성되었습니다.
1. robots.txt 파일을 이용하는 방법
robots.txt 파일은 웹사이트의 루트 디렉토리에 위치해야 하며, 검색 로봇이 사이트 정보를 수집하기 전 가장 먼저 확인하는 규약 파일입니다.
기본 작성 규칙
- User-Agent: 규칙을 적용할 로봇의 종류 (전체는
*) - Disallow: 수집을 차단할 페이지 경로
- Allow: 차단된 경로 내에서 예외적으로 허용할 경로
주요 설정 예시
| 설정 목적 | 코드 예시 |
|---|---|
| 모든 봇의 사이트 전체 차단 | User-Agent: *<br>Disallow: / |
| 특정 디렉토리 및 하위 항목 차단 | User-Agent: *<br>Disallow: /abcd/ |
| 특정 페이지 차단 | User-Agent: *<br>Disallow: /index.html |
| 특정 로봇(구글봇)만 차단 | User-Agent: Googlebot<br>Disallow: / |
| 특정 확장자(.gif) 파일 차단 | User-Agent: Googlebot<br>Disallow: /*.gif$ |
주의사항
- 대소문자 구분: URL 경로 작성 시 대소문자를 정확히 구분해야 합니다.
- 슬래시(/) 활용:
Disallow: /abcd라고 적으면abcd디렉토리뿐만 아니라 파일명이abcd로 시작하는 모든 파일도 차단됩니다. - 표준 준수: 이 설정은 검색 로봇이 표준 규약을 따를 때만 유효합니다.
2. Meta 태그를 이용하는 방법
사이트 루트 권한이 없어 robots.txt 파일을 수정할 수 없을 때, 개별 HTML 페이지의 <head> 섹션에 태그를 삽입하여 제어하는 방식입니다.
주요 설정 예시
- 모든 로봇의 색인 생성 및 링크 수집 차단
<meta name="robots" content="noindex, nofollow"> - 구글 로봇만 특정하여 차단
<meta name="googlebot" content="noindex, nofollow"> - 페이지 색인은 허용하되, 외부 링크 추적만 차단
<meta name="robots" content="nofollow"> - 페이지 내 이미지 색인 생성 차단
<meta name="robots" content="noimageindex">