先讲一个场景,你大概不陌生:网站的关键词排名没掉,甚至还在前三位,Google Search Console 的展示量也是涨的,但点击量在跌,询盘跟着跌。团队查了一圈,技术没问题,内容在更新,外链也在加。唯一变了的是搜索结果页——你的蓝色链接上面,多了一块 AI 生成的答案。 如果你的产品还未进入 AI 搜索结果,这份 GEO优化落地指南 和对应的 GEO外包服务值得参考。
这不是个别现象。Ahrefs 用 30 万个关键词做过前后对比,AI Overviews 上线一年后,排名第一的页面桌面端点击率下降 34.5%;2025 年 12 月他们用同样方法复测,降幅扩大到 58%。Pew Research Center 追踪 900 名美国成年人、68,879 次真实搜索后给出另一组数字:搜索结果页出现 AI 摘要时,用户点击传统结果链接的比例是 8%,没有 AI 摘要的对照组是 15%。
这就是 Generative Engine Optimization(生成式引擎优化,下文简称 GEO)要解决的问题。这篇不解释概念,只回答一件事:怎么从一堆自称能做 GEO 优化服务的公司里,挑出真会做的那家。
我先把三个结论放在前面,因为后面所有判断都建立在这三条上:
第一,GEO 优化服务的有效性和它能不能被测量,是同一件事。测不了的,等于没做。 第二,llms.txt 目前是行业提案,不是标准。拿它当核心卖点收费的,多半没别的东西可卖。 第三,多数企业缺的不是 GEO 策略,是技术底座。底座没打好,GEO 一层都贴不上去。
先把概念钉死:GEO 是被引用,不是被排名
从十条蓝链到一个答案
2024 年 5 月,Google 在 I/O 大会上推出 AI Overviews;同年 10 月 31 日,ChatGPT 上线搜索功能,直接给出带来源链接的答案。这两件事改变了搜索的分配机制:过去是十家分流量,现在是先由模型生成一段答案,被选中的少数来源才拿得到点击。
覆盖面已经不小。Ahrefs 分析 1.46 亿个搜索结果页后得出,AI Overviews 在 21% 的关键词上触发;而在问题类查询上,触发率高达 57.9%,7 个词以上的查询是 46.4%,单个词的查询只有 9.5%。还有一条最关键的:99.9% 会触发 AI Overviews 的关键词属于信息类意图。B2B 采购流程的前半段——选型、对比、参数确认——恰好全是信息类查询。
不同机构报出的触发率差异很大(Semrush 的面板在 2025 年 1 月是 6.49%,峰值接近 25%,2025 年 11 月回落到 15.69%),分歧主要来自关键词样本构成。但方向没有争议。
传统 SEO 和 GEO 的差别,用一张表说清楚:
| 对比项 | 传统 SEO | GEO / AI 搜索优化 |
| 核心机制 | 索引 + 排序 | 检索 + 抽取 + 生成引用 |
| 竞争单位 | 关键词 | 问题(prompt)与实体 |
| 目标位置 | 前十名 | 答案正文内被点名 |
| 获胜标志 | 排名与点击 | 引用频次与引用语境 |
| 内容形态偏好 | 覆盖全面的长文 | 40–60 词可独立成立的答案块 |
| 效果可测量性 | 排名工具成熟 | 依赖 prompt 集抽样,仍是行业难题 |
最后一行是重点。Generative Engine Optimization 至今没有一个公认的”引用率”标准算法,谁在跟你谈 GEO 优化服务,你就问他那一行。
三个反直觉的事实
你的排名没掉,流量也会掉。 上面两组数据已经说明。所以判断 AI 搜索优化有没有起效,不能只看排名工具,要看品牌在 AI 答案里的出现率。这也是为什么 GEO 服务商必须能拿出监测工具,而不是 Excel 手工统计。
llms.txt 目前不是任何一家 AI 公司的官方标准。 它于 2024 年 9 月由 Jeremy Howard 等人提出(提案站 llmstxt.org),定位是给大模型看的站点说明文件。截至目前,OpenAI 和 Google 都没有公开确认会读取它。这不代表它没用——写了不亏,成本极低,如果未来成为事实标准你能占先手。但它被当成核心交付物卖给你,就是把一个 30 分钟的工作量包装成服务包。
被 AI 引用的页面,往往不是排名第一的页面。 模型抽取内容时偏好结构清晰、数据具体、能独立成段的表述。Ahrefs 分析了 190 万条 AI Overviews 引用,发现 76% 来自自然搜索前十名,中位排名是第 2 位——但仍有 31% 的引用来自前 100 名之外的页面。同一份研究还测出,字数与 AI 引用的相关性约等于零(Spearman 系数 0.04)。通篇形容词的长文,排第一也可能不被引用;通篇参数表和带单位数字的短文,排第五反而常被摘走。
挑 GEO 服务商,问这 7 个问题
这 7 个问题按重要性排序。能让对方当场答上来的,进入下一轮;答不上来的,不用浪费第二次会议。
1. 引用率怎么测?用哪个工具,抽多少条 prompt,多久跑一次? 合格的答案会点名具体工具,比如 Profound、Otterly.ai、Peec AI、Scrunch AI、AthenaHQ、Ahrefs Brand Radar、Semrush AI Toolkit(按字母序,非推荐排序)。并且会说清楚 prompt 集怎么构建——通常按购买阶段分层,每层 30 到 80 条,每周或每两周跑一轮,覆盖 ChatGPT、Google AI Overviews、Perplexity、Gemini 至少三个引擎。只说”我们会持续监测”而没有工具名和抽样量的,是在糊弄。
2. 技术层交付物清单是什么? 至少应该包含:全站 JSON-LD Schema 部署、Organization 的 sameAs 实体关联、作者 Person 实体建设、AI 爬虫放行检查、llms.txt 编写、答案块(speakable)标记。拿不出清单的服务商,交付的多半是内容。
3. 内容层怎么做 E-E-A-T? 问这一句:”你们怎么写一篇没有一手信息的产品文章?” 正确答案是承认没法写,或者坚持要求企业提供一手数据——实测参数、产线照片、客户验收记录、失败案例。回答”我们有专业写手团队”的,直接排除。AI 搜索引擎对”看起来专业但换个人也能写”的内容识别得很准。
4. 外部权威源怎么做? GEO 里确实有一部分是让品牌出现在 AI 倾向抓取的语料里——行业媒体、垂直论坛、Reddit 相关 subreddit、Quora、行业报告。但只允许白帽手段:真实投稿、真实专家引述、真实数据被引用。凡是提出批量注册账号发回答的,看第 6 节第 2 条。
5. 和现有 SEO 团队怎么协同? GEO 和 SEO 在内容层高度重叠,两套人马各做各的必然打架——一个要删旧内容做瘦身而改 URL,另一个正靠这些页面拿流量。问清楚协作机制和冲突时的决策权。
6. 报告长什么样? 要求看样张。合格的报告应该能看到 prompt 级别:具体问了什么、AI 回答了什么、你的品牌有没有被提到、引用的是哪个 URL、竞品被引用了几次、引用语境是正面还是中性。只能给你一个”品牌提及量 +32%”这种汇总数字的,无法验证。
7. 你们不承诺什么? 这一条最能看出底色。敢把”不保证 ChatGPT 100% 推荐””不承诺具体引用量增幅””不通过买 Reddit 回答做优化”写进合同的服务商,反而更可信。因为 AI 答案的生成是非确定性的,同一条 prompt 在不同时间、不同会话里的结果都可能不同,任何精确承诺都是不可能兑现的。
四类服务商,各适合谁
| 类型 | 强项 | 短板 | 适合的企业 |
| 技术工具型 | 监测能力强,数据颗粒度细 | 策略与内容生产偏弱 | 已有内容团队,缺测量与方向 |
| 数字 PR 型 | 外部权威源覆盖强,能拿媒体引用 | 站内技术基本不碰 | 品牌已有声量,要放大 AI 可见度 |
| SEO 代理转型型 | 技术底座扎实,内容可执行 | 引用监测多为工具外采 | 中小企业,需要一站式落地 |
| 内容工厂型 | 便宜,产量高 | 无一手信息,通篇正确的废话 | 不建议,AI 搜索最先淘汰这类 |
市面上做 GEO 服务商推荐的榜单很多,但榜单解决不了匹配问题,四类里没有最优只有适配。选型时有个更直接的验证方法:让对方挑你行业里的一条真实 prompt 现场演示,看他在 ChatGPT 和 Google AI Overviews 里跑出来的结果,以及他能从结果里读出什么。真正做过的人,两分钟就能指出你品牌在实体关联上缺哪一环。
FUNION 的落地框架(四层,从下往上做)
架构层:让 AI 爬虫进得来
上线前必查的 user-agent 放行清单:GPTBot(OpenAI 训练)、OAI-SearchBot(ChatGPT 搜索)、ClaudeBot 与 anthropic-ai、PerplexityBot、Google-Extended(控制 Gemini 与 AI Overviews 的训练使用)、Applebot-Extended。
这里有个高频事故:Cloudflare 把”阻止 AI 爬虫”做成了部分套餐的默认选项,很多站在毫不知情的情况下把所有 AI 爬虫挡在门外,然后花钱做 GEO 却始终没效果。检查方法两步:看 robots.txt 全文,再登录 Cloudflare 后台进 Bots → AI Scrapers and Crawlers 看开关状态。这一步不用钱,但能省掉后面几个月的无效投入。
llms.txt 的正确写法(放在站点根目录 /llms.txt,Markdown 格式):
# 公司名 > 一句话定位,包含核心实体与主营范围
## 核心服务- [服务A](https://example.com/service-a/): 一句话说明,含关键参数- [服务B](https://example.com/service-b/): 一句话说明
## 关键事实- 成立于 2017 年,服务 B2B 制造业客户- 已交付项目数、覆盖国家数等可核验数字
## 内容许可允许 AI 搜索引擎与大模型在注明来源链接的前提下引用本站内容作答。
## 不建议抓取- /wp-admin/- /cart/ 与结账流程相关路径要点是”关键事实”这一节。写可核验的数字,不写形容词。这一段最容易被模型摘走。
内容层:按答案块组织,不是按段落组织
每一节开头给一个 40 到 60 词的结论块,能脱离上下文独立成立,往下再展开论证。表格优先于长句,具体数字优先于程度副词,一手数据优先于行业共识。
有两个趋势支持这种写法。一是查询长度在变长:Semrush 的分析显示,Google 平均查询约 4 个词,Google AI Mode 约 7 个词,而 ChatGPT 的平均 prompt 约 23 个词。问题变长,意味着模型要抽取的是”带约束条件的答案”,不是”关键词匹配”。二是字数与引用无关(前面提到的 Spearman 0.04),堆长度不如堆信息密度。
一个反直觉的操作:把”我们的优势”这类没有信息量的章节删掉。它既不会被 AI 引用,也不会被人类读完,只占用爬虫预算。
实体与引用层
Organization 的 sameAs 至少指向 LinkedIn 公司页、Crunchbase 或企业征信平台的档案、行业协会会员页。作者 Person 要有真实姓名、职务、knowsAbout 字段和 worksFor 关联。品牌名、产品名、人名在全站的写法必须完全一致——”FUNION””Funion””福能”混用会稀释实体识别。
监测层
建 prompt 集时按购买阶段分层:认知层(”什么是 X”)、对比层(”X 和 Y 哪个适合…”)、选型层(”X 供应商推荐”)。每层 30 到 80 条,两周跑一轮,记录引用率、引用 URL、引用语境、竞品对比。基线数据必须在合作开始前采集,否则无法归因。
效果预期:行业基准与一个填好的参照案例
先给一组公开基准。这些是你判断任何一份 GEO 提案是否合理时的参照系:
| 指标 | 数值 | 来源 |
| AI Overviews 触发率(全关键词) | 21% | Ahrefs,1.46 亿 SERP |
| 问题类查询触发率 | 57.9% | Ahrefs |
| 7 词以上查询触发率 | 46.4% | Ahrefs |
| AIO 引用来自自然搜索 Top 10 的比例 | 76%,中位排名第 2 位 | Ahrefs,190 万条 AIO 引用 |
| AIO 引用来自 Top 100 之外的比例 | 31% | Ahrefs |
| 字数与 AI 引用的相关性 | Spearman ≈ 0.04 | Ahrefs |
| 有 AI 摘要时点击传统结果的比例 | 8%(无摘要时 15%) | Pew,900 人 / 68,879 次搜索 |
| 点击 AI 摘要内引用链接的比例 | 1% | Pew |
| AIO 导致 Top 1 桌面 CTR 降幅 | 34.5%(2025-03)→ 58%(2025-12) | Ahrefs,30 万关键词 |
| ChatGPT 引用页面中零自然搜索可见度的占比 | 28.3% | Ahrefs |
| 美国 Google 搜索零点击占比 | 68%(2024 年为 60%) | SparkToro,2026 年初 |
| ChatGPT 触发联网搜索的 prompt 占比 | 31%,平均每次 >2 次检索 | Nectiv,8,500+ prompts |
基于这组基准,一个典型的 B2B 项目在 180 天内可以合理期待什么?下面这份案例,数值按上文公开基准推导,用于说明各指标的合理量级。
基线(第 0 天):prompt 集 120 条,覆盖 ChatGPT、Google AI Overviews、Perplexity、Gemini 四个引擎。品牌引用率 11%,主要竞品 A 为 34%。品牌在自然搜索 Top 10 的相关页面上只有 23 个,这直接限制了引用上限——按 Ahrefs 的 76% 基准,Top 10 页面太少,GEO 天花板就低。
干预动作(第 1–60 天):补齐 Organization、Person、Product、BreadcrumbList 四类 Schema,共 42 个实体;放行 6 类 AI 爬虫;llms.txt 上线;把 28 篇核心页面改写为答案块结构,每篇开头加 40–60 词结论段;新增 9 处行业媒体与垂直论坛的真实引用。
第 90 天:引用率从 11% 升到 19%。增量集中在改写过的对比类 prompt,认知类 prompt 变化不明显——这符合预期,认知类查询的答案高度依赖 Wikipedia 与大型媒体,短期内很难挤进去。
第 180 天:引用率 24%。AI 渠道引荐会话从每月 40 次升到 310 次,其中 96 次进入产品页,产生询盘 14 条,成交 2 单。
复盘:最有效的动作是把 28 篇页面改成答案块结构(贡献约六成增量),最无效的是外部投稿(两个月只拿到 3 处引用,且对引用率影响微弱)。最该提前做的事是建基线——第一个月没有基线数据,导致前 30 天的改动无法归因。
六个坑,见到就走
1. 承诺”保证 ChatGPT 100% 推荐”。 AI 答案是非确定性的,同一 prompt 在不同会话结果都可能不同。能做这种承诺的,要么不懂,要么打算造假。
2. 通过买 Reddit、Quora 回答来做 GEO。 这违反平台政策,也踩 Google 的垃圾内容政策。Reddit 对 AI 搜索引用的权重确实高——Google 在 2024 年 2 月与 Reddit 签下内容授权协议,据报道年金额约 6,000 万美元,此后 Reddit 在搜索结果中的可见度显著提升,Profound 的追踪显示 2024 年 8 月至 2025 年 6 月间,Reddit 是 Google AI Overviews 与 Perplexity 引用最多的域名。这让很多人动了歪脑筋。正确做法是让真实员工去真实回答,慢,但不会反噬。AI 搜索优化里凡是”快”的方案,基本都在赌博。
3. 只做 `llms.txt`,不碰技术底座。 一个文件的边际效果接近于零,除非站点的 Schema、爬虫可访问性、实体一致性已经做完。
4. 用 AI 批量生产”GEO 内容”。 没有一手信息的 AI 内容,正是 AI 搜索最不引用的那一类。前面那组数据可以佐证:字数与引用几乎无关,说明模型要的是信息,不是篇幅。
5. 不区分品牌词与非品牌词。 “XX 公司怎么样”被 AI 答对,说明不了任何事。只有非品牌词的引用增长才代表真实的可见度提升。报告里必须分列。
6. 忽视 AI 爬虫可访问性。 重复一次,因为它是最常见也最便宜的失败原因。做 GEO 之前先确认站点没有被自己挡住。
常见问题
问:GEO 优化服务一般多少钱? 市场区间波动很大,按月服务费从几千到数万元不等,取决于是否含内容生产。判断标准不是价格,是第 2 节那 7 个问题。一份只做监测不含内容的合同,和一个含内容生产的合同,价差三倍是正常的。
问:有没有必要单独买 GEO 监测工具? 如果你的 GEO 优化服务报告已经细到 prompt 级别,不需要自己买。如果你想同时对比两家服务商,或者内部要独立验证效果,那自己买一份(Profound、Otterly.ai 这类,月费几十到几百美元不等)是值得的。AI 搜索优化的效果验证,本质是数据独立性问题。
问:做了 GEO 还需不需要做 SEO? 需要,而且 SEO 是前置条件。AI 搜索的检索层大量复用传统搜索的索引与排序信号——Ahrefs 的数据是 76% 的 AI Overviews 引用来自自然搜索前十名。一个技术 SEO 一塌糊涂的站,GEO 无从谈起。
问:哪里能看到靠谱的 GEO 服务商推荐名单? 我的建议是别看名单,看交付物。名单可以买,prompt 级的基线报告买不来。让候选方各交一份你行业的基线测量(30 条非品牌 prompt,4 个引擎),谁的颗粒度细、谁敢写”不承诺什么”,差距一目了然。
问:怎么自己验证服务商的效果? 自己建 30 条非品牌 prompt,每月固定时间、固定账号、固定地区手动跑一遍,截图存档。这是最笨但最难造假的方法,也是最省钱的 AI 搜索优化自检。
问:多久能看到效果? 实体建设和 Schema 部署这类技术改动,4 到 8 周内可能被模型检索到;内容层的引用率变化通常需要 3 到 6 个月。任何短于 8 周的承诺都不成立。
问:Generative Engine Optimization 和 AEO(Answer Engine Optimization)是一回事吗? 高度重叠,AEO 更侧重答案引擎(语音助手、精选摘要),GEO 侧重生成式引擎(AI Overviews、ChatGPT、Perplexity)。落地动作八成以上是重合的,不必纠结名词。
现在可以做的三件事
第一,打开 robots.txt,确认 GPTBot、OAI-SearchBot、PerplexityBot、ClaudeBot 没有被 Disallow。再登录 Cloudflare 后台确认 AI 爬虫开关。这一步十分钟,零成本。
第二,手动跑 30 条你行业里的真实问题,记下你的品牌被提到几次、竞品被提到几次。这就是基线,没有基线就没有归因。
第三,把第 2 节的 7 个问题发给正在谈的 GEO 优化服务商,看回复质量。
FUNION 的 GEO 优化服务诊断:提交域名后 5 个工作日内交付,包含 AI 爬虫放行检查报告、llms.txt 草稿、Schema 缺口清单(精确到字段)、120 条 prompt 的基线引用率测量,以及竞品对比。诊断不绑定后续合作,你可以拿报告去任何一家执行。

