前面两篇,我对刚上线的网站做了基础排查。
网站是:
聆机智能制造业AI工具箱
地址:
https://ai.linkede.cn
第一轮检查确认,百度蜘蛛能够正常访问首页,服务器返回 HTTP 200,原始 HTML 中也能直接读取网站名称、8D报告、SOP和设备点检表等正文内容。

随后,我又检查了:
https://ai.linkede.cn/robots.txt
https://ai.linkede.cn/sitemap.xml
两个地址最初都返回 404,因此在 Next.js 项目中补充了对应配置。
完成网站内部的基础配置后,接下来要解决的是:
网站虽然可以被抓取,但百度还不知道这个子域名属于谁,也没有收到主动提交的公开页面。
这篇继续记录如何在百度搜索资源平台添加子域名、完成站点验证、进行抓取诊断,并提交公开链接。
一、提交之前,先做一次生产环境检查
不要刚写完 robots.ts 和 sitemap.ts,就马上进入百度后台提交。
本地代码存在,不代表生产环境已经生效。
先执行:
bash
curl -I https://ai.linkede.cn/
首页最终应返回:
bash
HTTP/1.1 200 OK
检查 robots.txt:
bash
curl -i https://ai.linkede.cn/robots.txt
检查 sitemap.xml:
bash
curl -i https://ai.linkede.cn/sitemap.xml
至少要确认:
首页返回 200
robots.txt 返回 200
sitemap.xml 返回 200
同时还要查看实际正文,避免 Next.js 或 Nginx 将不存在的地址错误回退到首页。
bash
curl -s https://ai.linkede.cn/robots.txt
正常应看到类似内容:
bash
User-Agent: *
Allow: /
Sitemap: https://ai.linkede.cn/sitemap.xml
再检查网站地图:
bash
curl -s https://ai.linkede.cn/sitemap.xml | head -n 30
正常应看到:
XML
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
如果仍然返回404,或者正文是网站首页HTML,应先继续修复,暂时不要进入百度平台提交。
二、在百度搜索资源平台添加子域名
登录百度搜索资源平台后,如果还没实名认证,需要先实名认证。这里不赘述。

进入站点管理,添加:
https://ai.linkede.cn
这里需要注意,ai.linkede.cn 虽然属于 linkede.cn,但它有自己独立的网站内容和部署服务,建议将它作为单独站点添加和验证。
协议选择正式生产环境使用的:
https
不要因为网站同时支持HTTP访问,就把下面两个地址分别当成两个站点:
http://ai.linkede.cn
https://ai.linkede.cn
正式网站应统一跳转到HTTPS版本,提交时也使用最终地址。

根据你的站点选择站点属性:

三、选择站点验证方式
添加站点后,需要证明自己拥有该网站的管理权限。
常见做法包括:
-
文件验证;
-
HTML标签验证;
-
根据平台当前页面提供的其他验证方式。
对于 Next.js 项目,我更倾向于使用文件验证。
原因很简单:验证文件和 robots.txt 一样,都可以通过 public 目录直接发布,不需要改首页代码。

四、使用文件验证
百度会提供一个验证文件,名称类似:
baidu_verify_xxxxxxxxxx.html
实际文件名和内容以平台提供的为准。
为了脱敏,本文不展示真实文件名和验证码。
1. 下载验证文件
从百度搜索资源平台下载验证文件。
不要修改:
-
文件名称;
-
文件扩展名;
-
文件内容;
-
文件编码。
2. 放入 Next.js 的 public 目录
项目结构通常类似:
public/
├── baidu_verify_xxxxxxxxxx.html
├── favicon.ico
└── 其他公开静态文件
如果项目使用 src/app,验证文件仍然放在项目根目录的:
public/
而不是:
src/app/
3. 重新构建和部署
按照项目原有部署方式重新发布。
例如:
npm run build
具体部署命令以项目实际环境为准。
4. 检查生产环境
部署后执行:
bash
curl -i https://ai.linkede.cn/baidu_verify_xxxxxxxxxx.html
正常应返回:
bash
HTTP/1.1 200 OK
并且正文与百度提供的验证文件内容一致。
如果返回404,说明文件没有进入生产环境。
如果返回200,但正文是首页HTML,说明路由回退接管了请求,验证文件并未真正生效。
5. 回到平台点击验证
确认验证文件能够公开访问后,再回到百度搜索资源平台点击"完成验证"或相应按钮。

五、验证文件不要立即删除
验证完成后,不建议马上删除文件。
百度后续可能会重新确认站点所有权。如果验证文件被删除,可能影响站点的验证状态。
六、先使用 Robots 工具检查抓取规则
站点验证完成后,进入百度搜索资源平台的 Robots 工具。
检查当前百度读取到的 robots.txt 是否与生产环境一致。
百度官方说明,Robots工具可以用于查看、校验和更新站点的 robots.txt,并检查哪些页面允许或禁止百度蜘蛛抓取。
当前网站的公开规则保持简单:
User-Agent: *
Allow: /
Sitemap: https://ai.linkede.cn/sitemap.xml
检查时重点确认:
-
没有出现
Disallow: /; -
Sitemap地址正确;
-
百度读取到的是最新内容;
-
返回的不是404;
-
返回的不是首页HTML。

七、使用抓取诊断查看百度蜘蛛真正看到的内容
下一步进入:
数据统计 → 抓取诊断
平台菜单名称可能随版本调整,以实际后台显示为准。
先提交首页:
https://ai.linkede.cn/
也可以再选择一个公开内容页进行检查,例如:
https://ai.linkede.cn/examples

不要使用:
-
登录后页面;
-
用户个人页面;
-
内部管理页面;
-
带用户数据的地址;
-
不希望公开的接口或业务路径。
百度的抓取诊断工具可以从百度蜘蛛的视角查看页面内容。官方说明中提到,每个站点每周有一定诊断次数,当前页面说明为每周70次,并展示百度蜘蛛可见内容的前200KB。
八、抓取诊断重点看什么?
抓取完成后,不要只看"抓取成功"四个字。
至少检查以下内容。
1. HTTP状态码
应当返回:
200
如果返回:
403
说明百度蜘蛛可能被安全策略拦截。
如果返回:
404
说明提交的页面地址不存在,或者路由配置有问题。
如果返回:
5xx
则需要检查Next.js服务、Nginx反向代理和服务器稳定性。
2. 页面标题
抓取内容中应能看到:
聆机智能制造业AI工具箱 - 8D报告、SOP、点检表在线生成
3. 页面正文
应能够读取:
聆机智能制造业AI工具箱
8D报告
SOP
设备点检表
生产日报
4. 是否抓到了错误页面
需要确认百度蜘蛛看到的不是:
-
登录页面;
-
安全验证页面;
-
系统错误页;
-
空白页面;
-
"请启用JavaScript"页面;
-
只有
div#__next的空HTML。
5. 是否出现禁止收录设置
检查抓取内容中是否存在:
noindex
如果公开首页出现 noindex,应先修复,不要继续重复提交。

九、向百度提交公开链接
确认抓取诊断正常后,进入:
资源提交 → 普通收录
百度目前的普通收录工具用于主动向百度提交链接,可以缩短百度蜘蛛发现网址的时间,但不能保证提交后一定收录。
第一批不要提交太多页面,先提交已经确认公开并正常返回200的地址。
例如:
https://ai.linkede.cn/
https://ai.linkede.cn/examples
https://ai.linkede.cn/pricing
实际提交时,应以当前 Sitemap 中的公开URL为准。
十、Sitemap怎么提交?
如果当前百度搜索资源平台账号和站点后台提供Sitemap提交入口,可以提交:
https://ai.linkede.cn/sitemap.xml
百度将Sitemap定义为网站页面列表,用于向蜘蛛提供站点中可供抓取的页面。
不同账号或平台页面显示的提交方式可能有所不同。
如果后台暂时没有显示Sitemap入口,可以先使用普通收录的手动提交方式,将第一批公开页面逐条提交。
百度官方资料中列出的普通收录方式包括手动提交、API提交及Sitemap等方式,但实际可用入口以当前站点后台为准。

十一、提交完成后不要反复提交同一个首页
很多新站长看到网站还没收录,会每天重复提交首页。
这种做法意义不大。
提交后,更值得观察的是:
-
百度蜘蛛是否访问网站;
-
抓取状态是否正常;
-
Sitemap中的页面是否都返回200;
-
网站是否有公开正文;
-
是否有外部页面链接到新站;
-
百度索引量是否开始变化。
普通收录只负责帮助百度更快发现链接,并不保证最终收录。
十二、在服务器日志中检查百度蜘蛛
提交后,可以在服务器上查看是否出现百度蜘蛛访问记录。
示例命令:
bash
grep -i "Baiduspider" /var/log/nginx/access.log | tail -n 50
具体日志位置以实际服务器配置为准,公开文章中不需要展示真实服务器目录结构以外的更多部署信息。
正常情况下,可能看到类似记录:
Baiduspider GET / HTTP/1.1 200
Baiduspider GET /robots.txt HTTP/1.1 200
Baiduspider GET /sitemap.xml HTTP/1.1 200
重点关注最后的状态码。
如果出现:
403
说明蜘蛛被拒绝。
如果出现:
404
说明请求地址不存在。
如果持续出现:
5xx
说明服务器或应用稳定性存在问题。
十三、提交后怎么判断有没有开始收录?
可以定期在百度搜索:
site:ai.linkede.cn
也可以搜索完整品牌词:
"聆机智能制造业AI工具箱"
不过,site: 查询结果只能作为外部观察方式,平台中的索引量、抓取诊断和抓取异常数据更适合用来判断网站是否进入百度的处理流程。
刚提交后,不要马上得出"没有效果"的结论。
网站需要经历:
发现链接
→ 蜘蛛抓取
→ 页面分析
→ 建立索引
→ 搜索结果展现
链接被抓取,也不代表一定会进入最终搜索结果。

总结
完成网站内部的title、robots.txt和sitemap.xml配置后,下一步就是让百度正式认识这个子域名。
这次操作的核心步骤是:
-
将
https://ai.linkede.cn添加到百度搜索资源平台; -
通过验证文件确认站点归属;
-
使用Robots工具检查抓取规则;
-
使用抓取诊断确认百度蜘蛛能够读取首页;
-
通过普通收录提交公开链接;
-
在平台提供入口时提交Sitemap;
-
通过服务器日志和索引量继续观察结果。
需要特别注意:
提交链接只能帮助百度更快发现页面,不能保证页面一定被收录。
网站最终能否进入搜索结果,还取决于页面是否稳定、内容是否公开、正文是否有实际价值,以及站点是否持续提供可被搜索的内容。
下一篇准备继续记录:
百度之外,360搜索和搜狗搜索是否还需要单独提交,以及同一份Sitemap能不能直接复用。