
AI搜索月报最容易制造一种虚假的确定感:品牌提及率上涨了、引用数量增加了、某个工具的可见性分数变绿了,于是团队宣布“FAQ有效”“Schema有效”或“GEO项目产生了增长”。
问题是,同期可能发生了模型更新、搜索需求变化、竞品退出、第三方工具采样调整,甚至只是同一组Prompt随机生成了不同答案。只看改动前后的两条曲线,无法证明变化来自你的页面优化。
2026年7月,Search Engine Journal与seoClarity分享了一套AI搜索拆分测试方法:固定Prompt与目标页、建立相关对照组、先保存基线、一次只改一个变量,并在必要时撤回改动。如果测试组在上线后相对对照组上升,撤回后又回落,因果证据会比普通“前后对比”强得多。
这套方法最重要的价值,不是证明FAQ永远有效,而是把GEO从“行业观点”推进到“可证伪的实验”。团队需要回答三个不同的问题:
- 发生了什么? 页面是否获得提及、引用、展现或访问;
- 为什么发生? 变化是否由本次改动造成,而不是外部噪声;
- 值不值得扩大? 引用变化是否进一步影响点击、询盘、订单和收入。
如果只回答第一个问题,AI可见性评分再精确,也不能替代因果判断和商业复盘。
为什么传统A/B测试不能直接搬到AI搜索?
传统转化率测试可以把实时访问者随机分到A、B两个版本,在同一时期比较点击或购买。AI搜索通常做不到这种流量级随机分配:
- ChatGPT、Claude、Gemini、Perplexity与AI Mode不会配合站点把同一Prompt的用户50/50分流;
- 模型版本、检索索引、回答结构和引用策略可能在测试期间变化;
- 相同Prompt在不同时间、地区、语言和登录状态下可能产生不同答案;
- 各AI引擎的抓取、JavaScript渲染和页面读取能力并不一致;
- 第三方工具只能抽样固定Prompt,无法覆盖所有真实用户问题;
- 引用出现与网站收到点击之间还有一段不可见路径。
因此,AI搜索实验更接近SEO拆分测试:选择一组被修改的页面,再用结构、主题、历史表现和需求趋势相近的未修改页面作为控制组。控制组不是完美随机样本,而是用于过滤模型与市场共同噪声的参照物。
先把“有效”拆成可观察、可归因和可变现
| 证据层 | 主要指标 | 可以说明 | 不能单独说明 |
|---|---|---|---|
| AI答案可见性 | 提及率、引用率、引用份额、跨引擎一致性 | 品牌或页面是否进入AI答案 | 哪项改动造成变化 |
| 页面级增量 | 测试组相对控制组的净变化 | 本次改动是否比共同噪声表现更好 | 是否产生商业回报 |
| 访问与互动 | AI推荐流量、CTR、参与时间、关键页面行为 | 被引用后是否带来有效访问 | 访问是否转化为收入 |
| 业务结果 | 有效询盘、订单、收入、毛利、客户质量 | 项目是否值得扩大投入 | 哪个页面元素单独起作用 |
| 答案控制 | USP是否准确、比较对象是否合理、错误信息是否减少 | 品牌叙事和零点击影响 | 直接财务价值 |
这五层不能压缩成一个总分。尤其是“提及”与“引用”必须分开:品牌可能出现在答案中,却没有指向网站的链接;页面也可能被引用,但链接没有带来点击。
第一步:建立覆盖购买旅程的黄金Prompt集
原演示方法先把Prompt覆盖到认知、发现、评估、决策与留存阶段,再按品牌当前表现确定测试优先级。对独立站来说,可以使用下面的结构。
| 阶段 | B2B示例 | B2C示例 | 适合的目标页 |
|---|---|---|---|
| 认知 | 食品设备为什么需要IP69K连接器? | 敏感肌为什么容易泛红? | 教育指南、问题页 |
| 发现 | 有哪些适合小批量采购的连接器供应商? | 适合油皮的矿物防晒有哪些? | 品类页、解决方案页 |
| 评估 | M12与M8连接器如何选择? | 矿物防晒和化学防晒有什么区别? | 对比页、选型页 |
| 决策 | 某供应商MOQ、交期和认证如何? | 某产品价格、成分和退货政策如何? | 产品页、服务页、报价页 |
| 留存 | 如何安装和维护该连接器? | 防晒如何与维A醇搭配使用? | 帮助文档、FAQ、教程 |
不要把团队临时想出的50个问题直接当成市场样本。Prompt应优先来自Search Console查询、销售通话、客服工单、站内搜索、产品评价、社区讨论和真实AI对话。需要长期保存样本时,可以先建立AI搜索Prompt Tracking基线。
Prompt按机会分层,而不是按“看起来重要”排序
演示文稿把Prompt大致分为三类:
- 优先测试:品牌已被提及但没有目标页引用。 相关性已经存在,缺的是一个值得引用的页面;
- 较难测试:品牌在答案中完全缺席。 可能需要补页面、主题权威或站外证据,不能只改一个标题;
- 暂不测试:目标页已经稳定被引用。 没有明显增量空间,适合继续监测而不是消耗实验资源。
这个分层的意义是先选择“接近成功但尚未被引用”的Prompt。早期实验更容易产生可解释结果,也能避免把资源投入到品牌完全不相关的答案空间。

第二步:把“Prompt + 目标页”设为最小测量单位
只记录“这个月被引用100次”无法定位改动。每个测试单元至少应包含:
- Prompt原文和版本;
- 购买阶段与搜索意图;
- 目标国家、语言和用户角色;
- AI引擎、模型或搜索形态;
- 希望被引用的目标URL;
- 测试页或控制页所属模板;
- 提及、引用、答案语境和实际引用URL;
- 测试日期、页面版本和改动记录。
例如,Prompt是“适合德国食品设备的小批量防水连接器供应商”,目标页就应固定为对应的德语解决方案页或供应商能力页。AI引用了首页、旧博客或经销商页面时,不能简单记作目标页成功。
固定配对还能暴露页面定位问题:同一个Prompt同时对应五个“目标页”,说明站内信息架构可能没有明确主页面;多个页面互相竞争,也会让实验结果难以解释。
第三步:用相关页面建立控制组
一个合格控制组不是“随便挑几篇没改的文章”。测试页与控制页应尽量匹配:
- 页面模板和内容类型;
- 主题与购买阶段;
- 上线时间和历史SEO表现;
- 当前提及或引用基线;
- 国家、语言与目标市场;
- 页面数量和Prompt数量;
- 抓取频率、内部链接和外链水平;
- 季节性、促销与产品生命周期。
演示文稿建议把改动前3—4周作为起始基线,改动后至少观察6—8周,再比较两组变化。这只是企业级案例给出的测试起点,不是Google规则。低抓取频率、低Prompt命中率或季节波动明显的网站,需要更长窗口。
净效应可以用一个简单公式表达:
净效应 = 测试组上线后变化 − 控制组同期变化
如果测试组和控制组一起上涨,可能是模型、需求或全站因素造成;如果只有测试组上涨,因果证据更强;如果两组都没有变化,假设可能无效,也可能是样本、抓取和观察窗口不足。

第四步:一次只测试一个可撤回变量
最常见的失败方式,是同时增加FAQ、改标题、重写首屏、添加Schema、更新内链和更换发布日期。即使引用上涨,也无法知道应该扩大哪项改动。
适合独立站优先测试的变量包括:
| 测试假设 | 测试页改动 | 控制页保持 | 主要观察 |
|---|---|---|---|
| FAQ提高引用机会 | 增加基于真实用户问题的可见FAQ | 保持原正文结构 | Prompt对应引用率、引用URL |
| 摘要提高信息提取 | 增加简短结论或TL;DR | 不加摘要 | 提及、引用与答案准确性 |
| 问题式标题更易匹配 | 把部分小标题改为真实问题 | 保持陈述式标题 | 指定Prompt的目标页出现率 |
| 对比表提高评估引用 | 增加规格、条件和限制对比表 | 保持段落说明 | 比较型Prompt引用率 |
| 简洁表达改善理解 | 降低术语密度,拆短句并补定义 | 保持原有文风 | 事实准确性、引用与互动 |
| 结构化数据帮助理解 | 添加与可见内容一致的Schema | 不添加Schema | 抓取、富结果与AI引用分别记录 |
Google官方明确表示,进入AI Overviews和AI Mode不需要特殊Schema或新的AI文本文件;结构化数据必须与页面可见内容一致。因此,“增加FAQ内容”和“添加FAQPage Schema”应作为两个不同假设测试,不能把结果混在一起。
FAQ案例说明了什么,又不能说明什么?

图源:seoClarity与Search Engine Journal演示文稿。原图没有披露纵轴数值。
演示案例覆盖约1,000个Prompt。FAQ上线后,测试组的提及与引用相对控制组上升;FAQ被撤回后,测试组曲线回落到接近原水平。这种“上线增加—撤回减少”的反转,比只看到上线后上涨更能支持因果判断。
但公开摘要和演示页没有披露客户行业、测试页面数量、AI平台拆分、绝对提升幅度、统计显著性和纵轴数值。因此,合理结论是:
该客户、该页面集合、该Prompt样本中的FAQ改动产生了可重复的正向信号。
不能据此推出“所有网站增加FAQ都会提高AI引用”。演示中的Meta Description测试没有产生明显影响,列表式结构测试则结果不确定,正说明GEO策略必须在自己的网站上验证。
另外,FAQ内容有效不等于FAQ富结果仍然存在。Google已说明,自2026年5月7日起FAQ富结果不再出现在Google Search中;页面仍然可以保留对用户有帮助的FAQ,只是不应把获得FAQ富结果作为测试成功标准。
折叠FAQ能否被AI读取,取决于实现方式
“默认折叠”本身不是关键,关键是答案是否已经存在于服务器返回的HTML或初始DOM中。
- 如果答案随页面HTML一起返回,只是通过CSS或原生
details元素折叠,抓取系统通常仍有机会读取; - 如果必须点击按钮后再调用接口加载内容,Google和AI爬虫未必会执行这一步;
- 如果内容被robots、登录、CDN、防火墙或客户端渲染阻挡,折叠样式再合理也没有意义。
测试时应先抓取页面源码和渲染结果,确认答案真实可见,再观察引用变化。不要只在浏览器里“点得开”,就认为所有AI引擎都能读取。
第五步:撤回测试,让因果链更完整
当测试组相对控制组明显上升后,不要马上把改动复制到全站。先选择一部分页面撤回改动并继续观察:
- 上线前保存测试组与控制组基线;
- 只在测试组部署一个变化;
- 观察测试组是否相对控制组上升;
- 撤回该变化,其他条件保持不变;
- 检查净效应是否回落;
- 再决定扩大、修改或放弃。
撤回后没有回落,不一定说明测试失败。模型可能已经重新抓取并保留旧信息,其他页面也可能提供了相同事实,或者引用变化来自同期外部事件。此时结论应标为“不确定”,而不是强行宣布成功。
三种结果都能指导下一步
| 结果 | 表现 | 合理判断 |
|---|---|---|
| 有效 | 测试组上升、控制组稳定,撤回后回落 | 可以扩大到相似页面并继续复测 |
| 不明确 | 两组一起变化,或撤回后没有变化 | 外部噪声较大,延长窗口或重建控制组 |
| 需要迭代 | 两组都不变化 | 假设、页面、Prompt样本或抓取条件需要调整 |
没有提升不是“白做”。它能阻止团队把开发和内容资源继续投入到没有证据的做法上。
Search Console新报告能解决什么?
Google于2026年6月3日开始向部分网站推出生成式AI表现报告,提供AI Overviews、AI Mode及Discover生成式AI功能中的:
- URL展现次数;
- 出现的页面;
- 国家;
- 设备;
- 日期与时间趋势。
Google Search Console AI报告属于Google一方数据,适合验证页面在Google AI功能中的展现变化。但它仍不能覆盖ChatGPT、Claude和Perplexity,也没有替代固定Prompt、目标页配对和控制组。
更重要的是,这份报告解决的是“页面在哪里出现”,不是自动回答“哪项改动造成出现”或“出现带来多少收入”。后两个问题仍需要实验日志、分析工具和业务系统。
从引用到收入:建立五层实验看板
第一层:AI答案指标
- Prompt命中率;
- 品牌提及率;
- 目标页引用率;
- 引用份额;
- 跨引擎一致性;
- 答案中的品牌语境与事实准确性。
第二层:抓取与页面指标
- 各AI爬虫是否可访问;
- 页面是否被索引并符合摘要展示资格;
- 服务器日志中的抓取频率;
- 目标内容是否出现在初始HTML;
- 实际被引用的是测试页还是其他URL。
第三层:访问质量
- AI平台推荐流量;
- 着陆页、停留与关键互动;
- 下载、订阅、加购、表单启动;
- 新访客与回访用户差异。
第四层:业务结果
- 有效询盘和销售合格线索;
- 订单、收入、毛利和客单价;
- 品牌搜索、直接流量与辅助转化;
- 销售周期和成交率。
第五层:投入与增量
- 内容、开发、工具和监测成本;
- 每个有效Prompt或新增引用的成本;
- 测试组相对控制组的净业务结果;
- 扩大到更多模板后的边际回报。
如果需要把自然搜索、AI可见性和询盘放进同一套复盘,可结合SEO ROI模型区分基线、增量、辅助影响和不能确认的相关性。
独立站可直接执行的12周测试计划
第1周:定义假设
选择一个具体、可撤回的页面变化,并写清成功指标、失败条件、业务目标和风险。
第2—4周:保存基线
固定Prompt、目标页、国家、语言、AI引擎与测试频率;选择匹配的控制页;同步记录Search Console、分析工具和业务结果。
第5周:部署一个变量
只修改测试组,保留页面版本、上线时间、抓取状态和审批记录。不要同时调整标题、模板、内链和Schema。
第6—11周:观察净效应
按周比较测试组与控制组的提及、引用、目标页出现和业务指标。模型波动明显时不要因单日变化提前结束。
第12周:撤回或扩大
强信号先做撤回验证;无变化检查Prompt样本、页面抓取和假设;两组同步变化则延长窗口或重建控制组。
常见的八个实验失真原因
- 测试期间同时修改多个页面元素;
- 控制页与测试页的主题、模板或历史表现不相似;
- Prompt全部来自团队想象,没有真实用户需求证据;
- 中途更换Prompt、国家、语言或AI平台;
- 只测一次答案,忽略模型输出波动;
- 页面尚未重新抓取就宣布测试失败;
- 把品牌提及、页面引用、点击与收入混为同一指标;
- 看到正向曲线后直接全站复制,没有做撤回验证。
结论:GEO不缺做法,缺的是可撤回的证据
FAQ、摘要、对比表、问题式标题、Schema和Markdown都可以成为实验假设,但不能提前成为“最佳实践”。真正可复制的不是某一个页面模块,而是测试流程:
固定Prompt与目标页 → 建立相关对照组 → 保存基线 → 只改一个变量 → 计算净效应 → 撤回验证 → 连接询盘与收入。
对中国出海B2B和B2C独立站,Iwish可以把Google SEO/GEO优化从月度可见性报告升级为可审计的实验系统:明确Prompt来源、控制组选择、页面版本、抓取条件、引用变化与商业结果,让管理层知道哪些改动应扩大、哪些应停止、哪些仍然没有足够证据。
FAQ
AI搜索实验是真正的随机A/B测试吗?
通常不是。网站无法让AI平台把同一Prompt的真实用户随机分流到两个页面版本。更准确的说法是基于相关测试页与控制页的SEO拆分测试,用控制组过滤共同噪声。
测试需要多少Prompt?
没有统一数量。样本应覆盖关键购买阶段、国家、语言和高价值主题,并保持稳定。约1,000个Prompt是seoClarity公开案例的规模,不是所有网站的最低要求。
AI搜索测试要运行多久?
演示方法建议改动前观察3—4周、上线后观察6—8周。实际周期取决于抓取频率、Prompt命中率、样本量、季节性和业务转化延迟。
FAQ一定能提高AI引用吗?
不能保证。公开案例显示FAQ在某个客户样本中产生正向并可撤回的信号,但Meta Description没有明显效果,列表式结构结果不确定。每个网站都应单独验证。
只添加FAQPage Schema可以吗?
Schema应与页面可见内容一致,而且Google不要求特殊Schema才能进入AI功能。建议把“增加可见FAQ内容”和“添加FAQPage Schema”拆成两个实验。
Search Console能看见所有AI搜索流量吗?
不能。Google的新报告只覆盖Google的生成式AI功能,并且正在向部分网站推出。ChatGPT、Claude和Perplexity仍需要第三方跟踪、推荐流量分析或日志数据。
没有AI点击,引用还有价值吗?
可能有。引用可以影响品牌在比较、推荐和决策答案中的表达,但这属于零点击品牌影响,不能直接按访问收入计算。应同时监测答案准确性、品牌搜索、辅助转化和销售反馈。
参考来源
- Search Engine Journal:AI Search is Working. How to Prove It With Real Tests ,2026年7月23日。
- seoClarity:AI Search Is Working. How To Prove It With Real Tests ,2026年7月16日。
- seoClarity与Search Engine Journal演示文稿 ,访问于2026年7月27日。
- Google Search Central:Introducing Search Generative AI performance reports in Search Console ,2026年6月3日。
- Google Search Central:Optimizing your website for generative AI features on Google Search ,访问于2026年7月27日。
- Google Search Console API:Search Analytics Query ,访问于2026年7月27日。