网站爬虫控制策略介绍(robots.txt、sitemap.xml、x-robots-tag、noindex、nofollow)网站索引

text 复制代码
  │ robots.txt          │ ✅  允许 /,屏蔽应用路由,指向 sitemap                       │
  ├─────────────────────┼───────────────────────────────────────────────────────────┤
  │ sitemap.xml         │ ✅  列出落地页                                             │
  ├─────────────────────┼───────────────────────────────────────────────────────────┤
  │ auth 子域名 noindex │ ✅  x-robots-tag: noindex, nofollow 已生效



这几个概念是什么意思?

文章目录

  • 概念介绍
    • [这三个概念都与 SEO(搜索引擎优化) 和 网站爬虫控制 相关。下面逐一通俗解释:](#这三个概念都与 SEO(搜索引擎优化) 和 网站爬虫控制 相关。下面逐一通俗解释:)
      • [1️⃣ robots.txt](#1️⃣ robots.txt)
      • [2️⃣ sitemap.xml](#2️⃣ sitemap.xml)
      • [3️⃣ auth 子域名 noindex](#3️⃣ auth 子域名 noindex)
      • [📊 三者协作关系](#📊 三者协作关系)

概念介绍

这三个概念都与 SEO(搜索引擎优化) 和 网站爬虫控制 相关。下面逐一通俗解释:


1️⃣ robots.txt

是什么: 放在网站根目录(如 example.com/robots.txt)下的一个纯文本文件,相当于给搜索引擎爬虫(如 Googlebot、百度蜘蛛)的"门禁指令"。

表格中描述的含义:

描述 含义
允许 / 允许爬虫访问网站首页(根路径)
屏蔽应用路由 禁止爬虫访问一些内部路径,比如 /admin/api/dashboard 等后台或功能性页面
指向 sitemap 文件中写了类似 Sitemap: https://example.com/sitemap.xml 的一行,告诉爬虫"完整地图在这里"

通俗比喻: 就像在小区门口立了个牌子------"访客可以进大门(/),但别去物业办公室(/admin),想看完整楼栋分布图请看这边(sitemap)"。


2️⃣ sitemap.xml

是什么: 一个 XML 格式的"站点地图"文件,列出了你希望被搜索引擎收录的所有页面 URL。

表格中描述的含义:

描述 含义
列出落地页 sitemap 里包含了所有"落地页"(Landing Page)的链接。落地页就是用户从搜索引擎/广告点进来后看到的页面

通俗比喻: 相当于给搜索引擎一份"我希望你收录的页面清单",确保重要页面不被遗漏。


3️⃣ auth 子域名 noindex

是什么: 网站的登录/注册功能通常放在一个子域名下(如 auth.example.com)。"noindex" 是告诉搜索引擎不要收录这个子域名。

表格中描述的含义:

描述 含义
x-robots-tag 这是一种通过 HTTP 响应头(而不是 HTML meta 标签)来控制爬虫的方式
noindex 告诉搜索引擎:不要把登录页、注册页放进搜索结果
nofollow 告诉搜索引擎:不要跟踪这个页面上的链接(不传递权重)
已生效 表示这个配置已经正确部署并在工作

通俗比喻: 登录页面是给用户用的,不是给搜索用户看的。你肯定不希望搜"XX平台"时出现一个登录框页面,所以把这类页面"隐藏"起来。


📊 三者协作关系

复制代码
搜索引擎爬虫来到网站
       │
       ▼
  先看 robots.txt ──→ 知道哪些能爬、哪些不能爬
       │                  以及 sitemap 在哪里
       ▼
  再看 sitemap.xml ──→ 知道有哪些重要页面需要收录
       │
       ▼
  爬取各页面 ──→ 遇到 auth 子域名
                    │
                    ▼
              读到 x-robots-tag: noindex
                    │
                    ▼
              跳过,不收录登录/注册页面 ✅

简单说,这是一套完整的网站爬虫控制策略:开放该开放的,索引该索引的,隐藏该隐藏的。

相关推荐
IT毕设实战小研13 小时前
电影数据可视化推荐系统
大数据·后端·爬虫·python·算法·信息可视化·课程设计
笔触狂放16 小时前
第3章 抓取静态网页数据
爬虫·python
笔触狂放17 小时前
第1章 认识网络爬虫
爬虫
马优晨18 小时前
pom.xml 中 jquery webjars 依赖解释
xml·前端·jquery·jquery webjars·webjars依赖
深蓝电商API1 天前
Referer 校验原理
爬虫·referer
天空1101 天前
你的网站在 AI 眼里是什么样:三类「人能看见、AI 看不见」的内容
爬虫·seo
zx_741484812 天前
【Python入门】爬虫实战:Requests + XPath 从基础到实战
开发语言·爬虫·python
互联网中的一颗神经元2 天前
09. mheap:全局堆管理器
java·spring·dubbo
for_ever_love__2 天前
python爬虫: GET请求与POST请求
开发语言·爬虫·python·网络编程
楚识科技2 天前
定制 OCR 服务:非标证件与表格的 XML 字段映射实践
xml·ocr