网站爬虫控制策略介绍(robots.txt、sitemap.xml、x-robots-tag、noindex、nofollow)网站索引

text 复制代码
  │ robots.txt          │ ✅  允许 /,屏蔽应用路由,指向 sitemap                       │
  ├─────────────────────┼───────────────────────────────────────────────────────────┤
  │ sitemap.xml         │ ✅  列出落地页                                             │
  ├─────────────────────┼───────────────────────────────────────────────────────────┤
  │ auth 子域名 noindex │ ✅  x-robots-tag: noindex, nofollow 已生效



这几个概念是什么意思?

文章目录

  • 概念介绍
    • [这三个概念都与 SEO(搜索引擎优化) 和 网站爬虫控制 相关。下面逐一通俗解释:](#这三个概念都与 SEO(搜索引擎优化) 和 网站爬虫控制 相关。下面逐一通俗解释:)
      • [1️⃣ robots.txt](#1️⃣ robots.txt)
      • [2️⃣ sitemap.xml](#2️⃣ sitemap.xml)
      • [3️⃣ auth 子域名 noindex](#3️⃣ auth 子域名 noindex)
      • [📊 三者协作关系](#📊 三者协作关系)

概念介绍

这三个概念都与 SEO(搜索引擎优化) 和 网站爬虫控制 相关。下面逐一通俗解释:


1️⃣ robots.txt

是什么: 放在网站根目录(如 example.com/robots.txt)下的一个纯文本文件,相当于给搜索引擎爬虫(如 Googlebot、百度蜘蛛)的"门禁指令"。

表格中描述的含义:

描述 含义
允许 / 允许爬虫访问网站首页(根路径)
屏蔽应用路由 禁止爬虫访问一些内部路径,比如 /admin/api/dashboard 等后台或功能性页面
指向 sitemap 文件中写了类似 Sitemap: https://example.com/sitemap.xml 的一行,告诉爬虫"完整地图在这里"

通俗比喻: 就像在小区门口立了个牌子------"访客可以进大门(/),但别去物业办公室(/admin),想看完整楼栋分布图请看这边(sitemap)"。


2️⃣ sitemap.xml

是什么: 一个 XML 格式的"站点地图"文件,列出了你希望被搜索引擎收录的所有页面 URL。

表格中描述的含义:

描述 含义
列出落地页 sitemap 里包含了所有"落地页"(Landing Page)的链接。落地页就是用户从搜索引擎/广告点进来后看到的页面

通俗比喻: 相当于给搜索引擎一份"我希望你收录的页面清单",确保重要页面不被遗漏。


3️⃣ auth 子域名 noindex

是什么: 网站的登录/注册功能通常放在一个子域名下(如 auth.example.com)。"noindex" 是告诉搜索引擎不要收录这个子域名。

表格中描述的含义:

描述 含义
x-robots-tag 这是一种通过 HTTP 响应头(而不是 HTML meta 标签)来控制爬虫的方式
noindex 告诉搜索引擎:不要把登录页、注册页放进搜索结果
nofollow 告诉搜索引擎:不要跟踪这个页面上的链接(不传递权重)
已生效 表示这个配置已经正确部署并在工作

通俗比喻: 登录页面是给用户用的,不是给搜索用户看的。你肯定不希望搜"XX平台"时出现一个登录框页面,所以把这类页面"隐藏"起来。


📊 三者协作关系

复制代码
搜索引擎爬虫来到网站
       │
       ▼
  先看 robots.txt ──→ 知道哪些能爬、哪些不能爬
       │                  以及 sitemap 在哪里
       ▼
  再看 sitemap.xml ──→ 知道有哪些重要页面需要收录
       │
       ▼
  爬取各页面 ──→ 遇到 auth 子域名
                    │
                    ▼
              读到 x-robots-tag: noindex
                    │
                    ▼
              跳过,不收录登录/注册页面 ✅

简单说,这是一套完整的网站爬虫控制策略:开放该开放的,索引该索引的,隐藏该隐藏的。

相关推荐
Ai拆代码的曹操14 小时前
Dubbo 2.7.5 的线程上下文陷阱:从版本演进看 AllChannelHandler 的设计之痛
前端·dubbo·safari
user-猴子19 小时前
2026国产AI智能体七强横评:WorkBuddy、AiPy、悟空、Kimi Work、TRAE Work、QoderWork、百度搭子怎么选?
人工智能·百度·dubbo
天启HTTP2 天前
爬虫频繁弹验证码?解析网站反爬检测机制
网络·爬虫·tcp/ip
深蓝电商API2 天前
如何快速定位加密函数?
爬虫·加密函数
oh,huoyuyan2 天前
网页公开数据采集工具推荐
人工智能·爬虫·火车采集器
崔子末2 天前
某影视库剧集列表以及查询接口逆向
爬虫·python
雪山青木3 天前
全国微博签到数据201912-202004
大数据·爬虫·python·数据挖掘·数据分析·新浪微博
TlSfoward3 天前
DLL 指纹库 采集、检索 TLSFOWARD tls指纹库
爬虫·网络协议·https·自动化
有味道的男人3 天前
基于 Codex 爬虫构建亚马逊无人上架系统|竞品详情采集到商品发布完整实现
爬虫·亚马逊
微微1笑抽了筋4 天前
xml中设置透明度
xml