网站爬虫控制策略介绍(robots.txt、sitemap.xml、x-robots-tag、noindex、nofollow)网站索引

text 复制代码
  │ robots.txt          │ ✅  允许 /,屏蔽应用路由,指向 sitemap                       │
  ├─────────────────────┼───────────────────────────────────────────────────────────┤
  │ sitemap.xml         │ ✅  列出落地页                                             │
  ├─────────────────────┼───────────────────────────────────────────────────────────┤
  │ auth 子域名 noindex │ ✅  x-robots-tag: noindex, nofollow 已生效



这几个概念是什么意思?

文章目录

  • 概念介绍
    • [这三个概念都与 SEO(搜索引擎优化) 和 网站爬虫控制 相关。下面逐一通俗解释:](#这三个概念都与 SEO(搜索引擎优化) 和 网站爬虫控制 相关。下面逐一通俗解释:)
      • [1️⃣ robots.txt](#1️⃣ robots.txt)
      • [2️⃣ sitemap.xml](#2️⃣ sitemap.xml)
      • [3️⃣ auth 子域名 noindex](#3️⃣ auth 子域名 noindex)
      • [📊 三者协作关系](#📊 三者协作关系)

概念介绍

这三个概念都与 SEO(搜索引擎优化) 和 网站爬虫控制 相关。下面逐一通俗解释:


1️⃣ robots.txt

是什么: 放在网站根目录(如 example.com/robots.txt)下的一个纯文本文件,相当于给搜索引擎爬虫(如 Googlebot、百度蜘蛛)的"门禁指令"。

表格中描述的含义:

描述 含义
允许 / 允许爬虫访问网站首页(根路径)
屏蔽应用路由 禁止爬虫访问一些内部路径,比如 /admin/api/dashboard 等后台或功能性页面
指向 sitemap 文件中写了类似 Sitemap: https://example.com/sitemap.xml 的一行,告诉爬虫"完整地图在这里"

通俗比喻: 就像在小区门口立了个牌子------"访客可以进大门(/),但别去物业办公室(/admin),想看完整楼栋分布图请看这边(sitemap)"。


2️⃣ sitemap.xml

是什么: 一个 XML 格式的"站点地图"文件,列出了你希望被搜索引擎收录的所有页面 URL。

表格中描述的含义:

描述 含义
列出落地页 sitemap 里包含了所有"落地页"(Landing Page)的链接。落地页就是用户从搜索引擎/广告点进来后看到的页面

通俗比喻: 相当于给搜索引擎一份"我希望你收录的页面清单",确保重要页面不被遗漏。


3️⃣ auth 子域名 noindex

是什么: 网站的登录/注册功能通常放在一个子域名下(如 auth.example.com)。"noindex" 是告诉搜索引擎不要收录这个子域名。

表格中描述的含义:

描述 含义
x-robots-tag 这是一种通过 HTTP 响应头(而不是 HTML meta 标签)来控制爬虫的方式
noindex 告诉搜索引擎:不要把登录页、注册页放进搜索结果
nofollow 告诉搜索引擎:不要跟踪这个页面上的链接(不传递权重)
已生效 表示这个配置已经正确部署并在工作

通俗比喻: 登录页面是给用户用的,不是给搜索用户看的。你肯定不希望搜"XX平台"时出现一个登录框页面,所以把这类页面"隐藏"起来。


📊 三者协作关系

复制代码
搜索引擎爬虫来到网站
       │
       ▼
  先看 robots.txt ──→ 知道哪些能爬、哪些不能爬
       │                  以及 sitemap 在哪里
       ▼
  再看 sitemap.xml ──→ 知道有哪些重要页面需要收录
       │
       ▼
  爬取各页面 ──→ 遇到 auth 子域名
                    │
                    ▼
              读到 x-robots-tag: noindex
                    │
                    ▼
              跳过,不收录登录/注册页面 ✅

简单说,这是一套完整的网站爬虫控制策略:开放该开放的,索引该索引的,隐藏该隐藏的。

相关推荐
小静AI工程实验室13 小时前
Python 爬虫中文乱码排查:严格解码、UTF-8 BOM 与 JSON 转义的 12 项实验
字符编码·爬虫·python
咖啡星人k20 小时前
从自建爬虫到托管工具:数据采集选型对照表
爬虫·数据采集·mcp
电商API_180079052471 天前
拍照找同款是怎么实现的?淘宝以图搜图接口 item_search_img 对接实战
大数据·爬虫·数据挖掘·数据分析·代采api
Patrick在香港2 天前
Python 抓 0.91 GB 香港法例:Agent 的进度该写进磁盘,不是写进上下文
爬虫·python·api·claude·香港
Experience-摆渡2 天前
开源RAG知识库WeKnora深度调研:让知识自己长成体系
爬虫·docker·开源·rag
孙启超3 天前
【AI开发之Rust】第 7 课:错误处理 —— panic、Result 与 `?`
人工智能·分布式·后端·爬虫·spring cloud·架构·rust
执明wa3 天前
Android RecyclerView 多类型, 多种 Item
android·xml·开发语言·设计模式·android studio
wl85113 天前
SAP CPI 教程004 如何通过groovy修改XML节点属性值
xml
该逃避避3 天前
IP代理类型介绍:住宅IP、机房IP、移动IP等区别与选择
爬虫
科技苑3 天前
Python简单网络爬虫教程
爬虫·python