text
│ robots.txt │ ✅ 允许 /,屏蔽应用路由,指向 sitemap │
├─────────────────────┼───────────────────────────────────────────────────────────┤
│ sitemap.xml │ ✅ 列出落地页 │
├─────────────────────┼───────────────────────────────────────────────────────────┤
│ auth 子域名 noindex │ ✅ x-robots-tag: noindex, nofollow 已生效
这几个概念是什么意思?
文章目录
- 概念介绍
-
- [这三个概念都与 SEO(搜索引擎优化) 和 网站爬虫控制 相关。下面逐一通俗解释:](#这三个概念都与 SEO(搜索引擎优化) 和 网站爬虫控制 相关。下面逐一通俗解释:)
-
- [1️⃣ robots.txt](#1️⃣ robots.txt)
- [2️⃣ sitemap.xml](#2️⃣ sitemap.xml)
- [3️⃣ auth 子域名 noindex](#3️⃣ auth 子域名 noindex)
- [📊 三者协作关系](#📊 三者协作关系)
概念介绍
这三个概念都与 SEO(搜索引擎优化) 和 网站爬虫控制 相关。下面逐一通俗解释:
1️⃣ robots.txt
是什么: 放在网站根目录(如 example.com/robots.txt)下的一个纯文本文件,相当于给搜索引擎爬虫(如 Googlebot、百度蜘蛛)的"门禁指令"。
表格中描述的含义:
| 描述 | 含义 |
|---|---|
| 允许 / | 允许爬虫访问网站首页(根路径) |
| 屏蔽应用路由 | 禁止爬虫访问一些内部路径,比如 /admin、/api、/dashboard 等后台或功能性页面 |
| 指向 sitemap | 文件中写了类似 Sitemap: https://example.com/sitemap.xml 的一行,告诉爬虫"完整地图在这里" |
通俗比喻: 就像在小区门口立了个牌子------"访客可以进大门(/),但别去物业办公室(/admin),想看完整楼栋分布图请看这边(sitemap)"。
2️⃣ sitemap.xml
是什么: 一个 XML 格式的"站点地图"文件,列出了你希望被搜索引擎收录的所有页面 URL。
表格中描述的含义:
| 描述 | 含义 |
|---|---|
| 列出落地页 | sitemap 里包含了所有"落地页"(Landing Page)的链接。落地页就是用户从搜索引擎/广告点进来后看到的页面 |
通俗比喻: 相当于给搜索引擎一份"我希望你收录的页面清单",确保重要页面不被遗漏。
3️⃣ auth 子域名 noindex
是什么: 网站的登录/注册功能通常放在一个子域名下(如 auth.example.com)。"noindex" 是告诉搜索引擎不要收录这个子域名。
表格中描述的含义:
| 描述 | 含义 |
|---|---|
| x-robots-tag | 这是一种通过 HTTP 响应头(而不是 HTML meta 标签)来控制爬虫的方式 |
| noindex | 告诉搜索引擎:不要把登录页、注册页放进搜索结果 |
| nofollow | 告诉搜索引擎:不要跟踪这个页面上的链接(不传递权重) |
| 已生效 | 表示这个配置已经正确部署并在工作 |
通俗比喻: 登录页面是给用户用的,不是给搜索用户看的。你肯定不希望搜"XX平台"时出现一个登录框页面,所以把这类页面"隐藏"起来。
📊 三者协作关系
搜索引擎爬虫来到网站
│
▼
先看 robots.txt ──→ 知道哪些能爬、哪些不能爬
│ 以及 sitemap 在哪里
▼
再看 sitemap.xml ──→ 知道有哪些重要页面需要收录
│
▼
爬取各页面 ──→ 遇到 auth 子域名
│
▼
读到 x-robots-tag: noindex
│
▼
跳过,不收录登录/注册页面 ✅
简单说,这是一套完整的网站爬虫控制策略:开放该开放的,索引该索引的,隐藏该隐藏的。