如何测量 GEO 效果:Prompt Set 与指标体系

GEO 知识体系 · 第 06 / 8 篇
本系列共 8 篇,从认知、机制、内容、技术、分发、测量、落地到研究,构成一套完整的生成式引擎优化框架。可顺序阅读,也可按当前要解决的问题跳读。
GEO 监测的基本单位是问题,先建立固定的 Prompt Set,再谈指标。评价体系以 AI 提及率、声量份额、引用来源分布为主,可追踪的引荐流量为辅——多数用户读完答案不会点击链接,流量指标会严重低估实际影响。
一、为什么监测要围绕问题而非关键词
用户向 AI 提问时用的是完整句子与场景描述,关键词数据库覆盖不到这些问法。有行业测算显示,大部分 AI 提问在传统关键词库里找不到对应词条(Semrush 2026 口径)。以关键词为单位的监测体系,在 AI 场景下会漏掉大部分真实提问。
二、Prompt Set 设计四步
- 按决策阶段收意图。认知类(这个品类是什么)、品类类(有哪些品牌)、对比类(A 和 B 哪个好)、决策类(多少钱、怎么买)、售后类(出问题怎么办)。五个阶段的权重按业务阶段分配。
- 为每类生成 8 到 15 条自然语言问句。覆盖口语表达与专业表达两种方式,贴近真实用户的问法。总题量控制在 50 到 80 条,便于固定频率执行。
- 跑一轮基线。记录品牌是否出现、出现位置、情感倾向、引用了哪些来源。基线数据是后续所有对比的参照。
- 固定监测节奏。同问句、同引擎、每周或双周固定执行,观察频率上的趋势。引擎算法更新频繁,单次快照没有判断价值。
三、指标体系
| 层级 | 指标 | 含义与用法 |
|---|---|---|
| 可见度 | AI 提及率 | 问题集中品牌被提及的比例,最基础的健康度指标 |
| 竞争位 | 声量份额 SOV | 品牌提及数除以品类总提及数,用于横向比较竞品 |
| 推荐位 | TOP1 首推率、TOP3 推荐率 | 在对比与决策类问题中的排位表现,商业价值最高 |
| 引用 | 引用次数与来源分布 | 反推哪类信源真正有效,直接指导分发投放的调整 |
| 质量 | 情感倾向与信息准确度 | 是否出现错误信息、过时信息或负面描述 |
| 流量 | AI 来源访问量 | 通过 referrer 与埋点识别来自 AI 引擎的会话 |
| 品牌 | 品牌词搜索量变化 | 间接指标,AI 曝光会带动品牌词搜索 |
| 业务 | AI 来源转化率 | 可追踪时使用,用于判断商业价值 |
四、归因的三个陷阱
陷阱一:把 AI 引荐流量当作全部效果。多数用户阅读答案后不发生点击,这部分曝光无法被统计。只看流量会严重低估价值。
陷阱二:用单次采样下结论。同一问句在不同时间、不同会话中的答案存在波动。需要看固定问题集上的频率趋势。
陷阱三:忽略引擎版本变化。各引擎的模型与检索策略更新频繁,指标波动可能来自版本变化。解读数据时需要结合已知的更新时点。
五、工具选型
| 类别 | 代表工具 | 说明 |
|---|---|---|
| 国内监测平台 | 新榜智汇、ImpetaAI 等 | 覆盖豆包、DeepSeek、元宝、Kimi、千问、文心等。此类榜单多来自行业媒体稿件与厂商自述,选型时要求提供原始对话溯源与抽样方法 |
| 海外专业工具 | Profound、Peec AI、Otterly.AI、Ahrefs Brand Radar、Semrush AI Toolkit、SE Ranking | 支持 ChatGPT、Perplexity、Google AI 等入口的引用与声量追踪,多按提示词数量与引擎数计费 |
| 免费起点 | 手工 Prompt Set、免费 AEO 体检工具 | 零成本建立基线,适合团队先用起来再决定是否采购 |
选型四问
- 能否溯源到原始 AI 对话全文?无法溯源的估算值需要打折看待。
- 覆盖哪些引擎?国内主流模型与海外入口是否齐全。
- 数据是实测还是推算?推算口径需要明确告知抽样方法。
- 是否只做监测?带诊断与优化建议的闭环工具长期价值更高。
六、最小可用监测流程
- 建立 50 条问句的 Prompt Set,覆盖五个决策阶段
- 覆盖 6 个中文引擎,每个问句每个引擎记录一次结果
- 记录四项字段:品牌是否出现、出现第几位、情感倾向、引用了哪些来源
- 每两周执行一次,存入表格形成时间序列
- 每月输出一次变化摘要,标出被引用来源的变化
- 每季度复核 Prompt Set 问句,替换已失效的问法
数据要落到动作上
监测结果主要服务于两个决策:投哪类信源,以及改哪类内容。信源侧的判断依据见第 05 篇,内容侧的改造标准见第 03 篇。需要定制的 Prompt Set 与月度监测报告,属于GEO 智能营销服务的常规模块。
GEO 知识体系 · 第 06 / 8 篇
相关阅读
吾一

