Google 爬虫管理:抓取预算、404 与重定向
-
- [一、抓取预算:Google 每天只爬你这么多页](#一、抓取预算:Google 每天只爬你这么多页)
- [二、日志分析:上帝视角看 Google 怎么爬你](#二、日志分析:上帝视角看 Google 怎么爬你)
- [三、404 页面:软 404 vs 硬 404](#三、404 页面:软 404 vs 硬 404)
-
- [硬 404](#硬 404)
- [软 404](#软 404)
- [四、自定义 404 页面与重定向](#四、自定义 404 页面与重定向)
- 五、爬虫管理的核心逻辑
独立站做了几十个产品页、写了几十篇文章,满心期待 Google 来爬。结果 GSC 一看------Google 每天只爬了 20 个页面,而你新发的 10 篇文章排着队等在抓取队列里。
这不是 Google 的问题,是你没有管理好爬虫。
爬虫管理不是"让 Google 多来几次"这么简单。它是一套从预算分配、日志分析到错误处理的系统工程。你的核心产品页和新内容能不能被及时发现,取决于你有没有把爬虫资源引导到该去的地方。
一、抓取预算:Google 每天只爬你这么多页
抓取预算(Crawl Budget)是 Google 每天愿意爬的页面数量。Google 不会一口气爬完你全站------它会根据两个因素分配每天的爬取配额:
- 抓取速度限制(Crawl Rate Limit):Google 不想把你服务器爬崩。如果你的服务器响应慢,Google 会主动放慢爬取速度。你可以在 GSC 的"设置 > 抓取速度"中查看当前的速度限制,也可以手动调高------但前提是你的服务器扛得住
- 抓取需求(Crawl Demand):你的页面值不值得频繁重爬。新页面、频繁更新的页面、高流量页面------Google 会更积极地爬。老而稳定的页面,Google 可能几周才来一次
影响预算的四个因素:
| 因素 | 说明 |
|---|---|
| 站点大小 | 越大的站预算越多,但页均配额越少。1000 页的站可能每天爬 200 次,10000 页的站可能每天爬 4000 次------但后者每页平均被爬的频率更低 |
| 页面速度 | 加载越快,Google 在单位时间内爬得越多。TTFB(首字节时间)低于 200ms 是理想状态,超过 600ms 就会影响爬取效率 |
| 域名权威 | 越被信任的站,Google 越愿意多爬。新站可能每天只有几十次爬取,运营两年以上的成熟站每天可以到几百甚至上千 |
| 更新频率 | 经常更新的站会被更频繁地爬。如果你首页每周更新一次,Google 可能每天来查看;如果三个月没变化,它可能一周才来一次 |
对于大多数独立站(页面数在 1000 以内),抓取预算通常不是瓶颈------Google 每天几百次爬取足够覆盖全站。但有几个场景会让你的预算被白花:
- 大量带参数的重复 URL 被爬(比如
?sort=price、?color=red产生几十个变体页) - 低质量页面占用了配额(标签聚合页、空分类页、内部搜索结果页)
- 页面加载太慢导致 Google 在单位时间内爬不完
这些场景下,你的核心产品页和新内容在排队------因为垃圾在挤占通道。
优化抓取预算的核心思路不是"让 Google 多爬"------是让 Google 只爬你希望它爬的页面。
实操建议:
用 robots.txt 拦掉不需要被爬的页面类型。常见的拦截规则包括:筛选结果页(/filter/)、搜索内页(/search/)、购物车页(/cart/)、带跟踪参数的 URL(?utm_source=、?sessionid=)。在 GSC 中查看索引覆盖率报告,重点关注"已抓取但未索引"和"发现的但未抓取"两个分类------这些就是你把预算花在刀柄上的证据。如果某个 URL 目录下大量页面被判为重复或被排除,考虑在 robots.txt 中直接 Disallow 整个目录。
二、日志分析:上帝视角看 Google 怎么爬你
服务器日志记录了每一次 Googlebot 的访问------精确到秒。把日志导入 Screaming Frog Log File Analyzer,你可以看到四个关键问题的答案:
- Google 每天爬了什么类型的页面
- 各爬了多少次
- 哪些重要页面从来没被爬过
- 抓取频率是否突然下降
日志的关键字段解读:
每次 Googlebot 访问都会在日志中留下一条记录,你需要关注的核心字段包括:
| 字段 | 含义 |
|---|---|
| 请求时间 | Google 什么时候来访------可以发现爬取集中在哪个时间段 |
| 请求路径 | Google 爬了哪个页面------按目录分组能看到它偏好哪类内容 |
| 状态码 | 200 正常、301 重定向、404 不存在------状态码分布反映你的站有多少"浪费" |
| 响应时间 | 花了多少毫秒------响应慢的页面会影响整体爬取效率 |
日志分析比 GSC 精确得多。GSC 告诉你"哪些页面被索引了",日志告诉你"Google 来了多少次、在什么时间、爬了哪些页、返回了什么状态码、花了多少毫秒"。
如果你发现 Google 大量时间在爬标签页、搜索结果内页,而核心产品页每周只被访问一次------这是一个明确的信号:你的抓取预算分配出了问题。
中小站(页面数少于 1000)不一定需要日志分析。GSC 的索引覆盖率报告已经覆盖了 80% 的场景。但当你的站超过 5000 个页面,日志分析就变成了必需品------它让你看到 GSC 看不到的东西。特别是当你的 GSC 报告显示"抓取速度正常"但实际索引速度远低于预期时,日志能告诉你到底哪里出了问题。
三、404 页面:软 404 vs 硬 404
404 有两种,很多人搞混了------后果完全不同。
硬 404
硬 404:页面返回 404 或 410 状态码。
搜索引擎会从索引中移除这个页面。如果这个页面有外链指向它,外链权重会丢失------这是硬 404 最大的代价。一个有 20 条外链的旧产品页被删了,这些权重就全部流失,相当于你之前花了几个月积累的链接资产归零。
对于确实已经不存在的页面,返回 410 Gone 比 404 更好------Google 会更快速地处理 410,因为它明确告诉爬虫"这个页面永久消失了,别再来了"。404 只是说"暂时找不到",Google 可能还会反复回来确认,浪费你的抓取预算。
软 404
软 404:页面返回 200 状态码但内容是空的。
这是独立站最常见也最隐蔽的问题。页面表面上存在、服务器返回正常的 200 状态码,但页面内容只有一行"抱歉,该产品已下架"或者"暂无内容"。
常见场景:
- 电商站下架产品页,页面还在但只剩一行提示文字
- 分类页下没有商品,显示空白或"暂无产品"
- 博客标签页只有一条内容,主体区域几乎为空
Google 会把这些页面标记为软 404,从索引中移除,但它们仍然在消耗你的抓取预算。更糟糕的是------你在 GSC 中看不到它们报错(因为返回的是 200),只有在索引覆盖率报告的"已抓取但未索引"分类中才能发现蛛丝马迹。
排查软 404 的方法: 在 GSC 索引覆盖率报告中查看"已抓取但未索引"列表,逐页检查是否有薄内容页面。也可以用 Screaming Frog 爬全站,过滤出内容极少(比如正文少于 100 字)但返回 200 的页面------这些大概率是软 404。
四、自定义 404 页面与重定向
自定义 404 页面不是给 Google 看的------是给用户看的。当用户不小心访问了一个不存在的 URL,你的自定义 404 页面应该有:
- 导航回到首页的按钮
- 搜索框,让用户可以自己找想要的内容
- 热门产品推荐或最近文章列表,引导用户继续浏览
不要让用户困在一个死胡同里。一个好的 404 页面能把"迷路"变成"重新找到方向",降低跳出率。
从 SEO 角度看,自定义 404 页面本身不会影响排名。但如果你把一个有外链指向的旧页面直接返回 404,外链权重就流失了。正确做法是:
| 页面情况 | 处理方式 | 原因 |
|---|---|---|
| 有外链的旧页面 | 301 重定向到最相关的新页面 |
保留外链权重,传递到新页面 |
| 没有外链的旧页面 | 返回 410 Gone |
告诉 Google "永久消失",释放抓取预算 |
注意:301 重定向的目标页面必须与旧页面主题相关。把一个"蓝牙耳机评测"的旧页面重定向到"蓝牙音箱"的新页面------相关性不够,Google 可能不传递权重。尽量重定向到同类或同系列的产品页。
重定向链
重定向链是另一个容易被忽视的问题。如果你先 301 到 A 页面,A 页面又 301 到 B 页面------这就是重定向链。
每多跳一次,加载就慢一点,Google 也少爬一点。Googlebot 在每次重定向跳转时都会消耗额外的请求和时间,链式重定向会导致爬取效率下降。更严重的是,如果链超过 3-5 跳,Google 可能直接放弃跟踪这个重定向。合并成一条 301 规则直接到最终目标页面。
另外不要把 404 全部 301 到首页------Google 会把这种行为视为 Soft 404,等同于没处理。404 应该 301 到最相关的替代页面,而不是一刀切地全部指向首页。
自查三步走
- 用 Screaming Frog 爬全站------设置爬取模式为"列出所有 URL",确保覆盖全站
- 过滤出
4xx错误和有外链的页面------在 Screaming Frog 中用"Response Codes"过滤器找到 404 页面,再用"Inlinks"列查看哪些 404 页面有内链或外链指向 - 分类处理 ------有外链的
301到相关页、无外链的返回410、创建自定义 404 页面作为兜底
半天能搞定。但这是一项需要持续维护的工作------每季度复查一次,特别是电商站的产品上下架频繁,404 会不断产生。
五、爬虫管理的核心逻辑
以上所有内容------抓取预算、日志分析、404 处理、重定向管理------指向同一个核心逻辑:
Google 对你的网站有有限的耐心和资源,你的任务是把这些资源引导到最重要的页面上。
| # | 动作 | 优先级 |
|---|---|---|
| 1 | robots.txt 拦掉低价值页面,把预算留给核心页 |
★★★ |
| 2 | 有外链的旧页面 301 到相关新页面,无外链的返回 410 |
★★★ |
| 3 | 合并重定向链为一跳,不 301 到首页 |
★★☆ |
| 4 | 用日志分析找出抓取预算被浪费的页面类型 | ★★☆ |
| 5 | 排查软 404------返回 200 但内容为空的页面 |
★★★ |
前三项是立刻能做的事,半天搞定。后两项是持续优化------大站每月做一次日志分析,小站每季度复查一次索引覆盖率。爬虫管理不是一次性项目,是长期维护。