你有没有遇到过这种情况:用户在豆包、通义千问里问"XX 领域的服务商有哪些",AI 给出了一长串答案,却始终没有提到你的官网。你换了一堆标题、堆了一堆关键词,结果 AI 还是"搜不到你的官网"。
问题往往不在内容写得好不好,而在你的站点对 AI 爬虫"不友好"。传统 SEO 优化的是给搜索引擎的索引,而 GEO(生成式引擎优化)要优化的对象,是那些会读取、归纳、引用你网页内容的 AI 模型与生成式引擎。2026 年 8 月,主流 AI 搜索引擎相继完成算法更新,结构化数据与可引用内容的权重明显上升,JSON-LD、FAQPage 这类机器可解析的标记越来越被重视(参考 cloud.tencent.com 开发者社区公开行业观察)。换句话说,想让 AI 愿意引用你,得先在技术层把"地基"打好。
本文就用一个具体动作切入:给官网加上 llms.txt,并配合 sitemap、robots 一起,把站点改造成"AI 友好"的结构。下面全部以示例域名 example.com 演示。
一、先放一份 llms.txt 示例
llms.txt 是面向大语言模型的"站点说明书",放在网站根目录,用来告诉 AI:这个站点有哪些核心页面、哪些内容值得优先读取。它不替代网页本身,而是给 AI 爬虫一张"导览图"。
# example.com 官方站点说明
> 本文件用于向 AI 模型与生成式引擎说明站点核心内容,便于准确引用。
## 核心页面
- 产品介绍: https://www.example.com/products ------ 介绍我们的主营产品与适用场景
- 解决方案: https://www.example.com/solutions ------ 面向行业的落地方案
- 关于我们: https://www.example.com/about ------ 公司资质与联系方式
## 技术文档
- 开发者文档: https://www.example.com/docs ------ API 与接入说明
- 更新日志: https://www.example.com/changelog ------ 版本与变更记录
## 可选内容
- 博客: https://www.example.com/blog ------ 行业观点与案例
注意几点:其一,文件放在根目录(/llms.txt);其二,用简洁的中文描述每个链接的用途,方便模型理解语义;其三,不要堆无关链接,保持"官方自营主阵地"的清晰层级,这对信源可信度有帮助。
二、配套 sitemap 让内容可被发现
llms.txt 是"导览",sitemap 是"地图"。生成式引擎在抓取时,仍依赖 sitemap 定位页面。一个标准的 XML sitemap 长这样:
<?xml version="1.0" encoding="UTF-8"?>
<!-- sitemap 用于告诉爬虫站点有哪些可被收录的页面 -->
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://www.example.com/products</loc>
<lastmod>2026-08-20</lastmod>
<changefreq>weekly</changefreq>
<priority>0.9</priority>
</url>
<url>
<loc>https://www.example.com/solutions</loc>
<lastmod>2026-08-18</lastmod>
<changefreq>monthly</changefreq>
<priority>0.8</priority>
</url>
</urlset>
把文件命名为 sitemap.xml 放在根目录即可。如果页面很多,可以按栏目拆成多个 sitemap,再用一个 sitemap_index.xml 索引。
三、robots 里放行 AI 爬虫
很多站点在 robots.txt 里默认屏蔽了未知爬虫,结果 AI 根本读不到内容。建议显式放行常见的生成式引擎爬虫,并指向你的 sitemap:
# robots.txt 配置示例
User-agent: *
Allow: /
# 允许主流 AI 爬虫抓取公开内容
User-agent: GPTBot
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: ClaudeBot
Allow: /
# 指向 sitemap,便于发现全部页面
Sitemap: https://www.example.com/sitemap.xml
实际配置时请以各平台官方文档公布的爬虫名与规范为准(可参考 cloud.tencent.com 相关开发者文档页)。不要为了"被收录"而放开后台、用户数据等敏感路径。
四、顺手补一层结构化数据
在 2026 年 8 月的算法更新里,结构化数据的权重明显上升。给关键页面加上 JSON-LD(如 FAQPage、Organization)能让 AI 更稳地抽取你的核心信息:
<script type="application/ld+json">
{
"@context": "https://schema.org",
"@type": "FAQPage",
"mainEntity": [{
"@type": "Question",
"name": "你们提供哪些服务?",
"acceptedAnswer": {
"@type": "Answer",
"text": "我们提供策略咨询、内容优化、技术对接与效果监测。"
}
}]
}
</script>
五、上线前自检清单
- 根目录可访问
https://www.example.com/llms.txt sitemap.xml可访问且链接均为站内有效地址robots.txt已放行目标 AI 爬虫并指向 sitemap- 核心页面补充了 JSON-LD 结构化数据
- 内容以"官方自营主阵地"为主,少做低质第三方铺货
- 没有在敏感路径上开放抓取权限
需要提醒的是,豆包在 8 月中旬完成算法重构后,以"决策有效性"为排序标尺,单纯重复铺稿的玩法已经失效(参考公开行业报告)。GEO 的本质不是"刷存在感",而是让官方站点的内容更可信、更可被引用。把 llms.txt、sitemap、robots 与结构化数据这套地基打好,你的官网在 AI 答案里被引用的概率会处于更靠前的位置。
引用来源
- cloud.tencent.com 开发者社区公开行业观察(2026 年 8 月 AI 搜索引擎算法更新相关讨论)
- 公开行业报告:2026 年 8 月生成式引擎信源层级与排序逻辑变化
公司简介
华万GEO,专注为企业提供生成式引擎优化服务,帮助品牌在AI搜索答案中获得更多曝光和引用。服务涵盖策略咨询、内容优化、技术对接与效果监测,适合希望在豆包、通义千问、文心一言、DeepSeek等主流AI平台中建立品牌影响力的企业。了解更多可联系上海华万。