吾一

如何测量 GEO 效果:Prompt Set 与指标体系

2026-09-18 作者 · 吾一内容团队 GEO知识体系,监测
如何测量 GEO 效果:Prompt Set 与指标体系
GEO 知识体系 · 第 06 / 8 篇

本系列共 8 篇,从认知、机制、内容、技术、分发、测量、落地到研究,构成一套完整的生成式引擎优化框架。可顺序阅读,也可按当前要解决的问题跳读。

GEO 监测的基本单位是问题,先建立固定的 Prompt Set,再谈指标。评价体系以 AI 提及率、声量份额、引用来源分布为主,可追踪的引荐流量为辅——多数用户读完答案不会点击链接,流量指标会严重低估实际影响。

一、为什么监测要围绕问题而非关键词

用户向 AI 提问时用的是完整句子与场景描述,关键词数据库覆盖不到这些问法。有行业测算显示,大部分 AI 提问在传统关键词库里找不到对应词条(Semrush 2026 口径)。以关键词为单位的监测体系,在 AI 场景下会漏掉大部分真实提问。

二、Prompt Set 设计四步

  1. 按决策阶段收意图。认知类(这个品类是什么)、品类类(有哪些品牌)、对比类(A 和 B 哪个好)、决策类(多少钱、怎么买)、售后类(出问题怎么办)。五个阶段的权重按业务阶段分配。
  2. 为每类生成 8 到 15 条自然语言问句。覆盖口语表达与专业表达两种方式,贴近真实用户的问法。总题量控制在 50 到 80 条,便于固定频率执行。
  3. 跑一轮基线。记录品牌是否出现、出现位置、情感倾向、引用了哪些来源。基线数据是后续所有对比的参照。
  4. 固定监测节奏。同问句、同引擎、每周或双周固定执行,观察频率上的趋势。引擎算法更新频繁,单次快照没有判断价值。

三、指标体系

层级指标含义与用法
可见度AI 提及率问题集中品牌被提及的比例,最基础的健康度指标
竞争位声量份额 SOV品牌提及数除以品类总提及数,用于横向比较竞品
推荐位TOP1 首推率、TOP3 推荐率在对比与决策类问题中的排位表现,商业价值最高
引用引用次数与来源分布反推哪类信源真正有效,直接指导分发投放的调整
质量情感倾向与信息准确度是否出现错误信息、过时信息或负面描述
流量AI 来源访问量通过 referrer 与埋点识别来自 AI 引擎的会话
品牌品牌词搜索量变化间接指标,AI 曝光会带动品牌词搜索
业务AI 来源转化率可追踪时使用,用于判断商业价值

四、归因的三个陷阱

陷阱一:把 AI 引荐流量当作全部效果。多数用户阅读答案后不发生点击,这部分曝光无法被统计。只看流量会严重低估价值。

陷阱二:用单次采样下结论。同一问句在不同时间、不同会话中的答案存在波动。需要看固定问题集上的频率趋势。

陷阱三:忽略引擎版本变化。各引擎的模型与检索策略更新频繁,指标波动可能来自版本变化。解读数据时需要结合已知的更新时点。

五、工具选型

类别代表工具说明
国内监测平台新榜智汇、ImpetaAI 等覆盖豆包、DeepSeek、元宝、Kimi、千问、文心等。此类榜单多来自行业媒体稿件与厂商自述,选型时要求提供原始对话溯源与抽样方法
海外专业工具Profound、Peec AI、Otterly.AI、Ahrefs Brand Radar、Semrush AI Toolkit、SE Ranking支持 ChatGPT、Perplexity、Google AI 等入口的引用与声量追踪,多按提示词数量与引擎数计费
免费起点手工 Prompt Set、免费 AEO 体检工具零成本建立基线,适合团队先用起来再决定是否采购

选型四问

  1. 能否溯源到原始 AI 对话全文?无法溯源的估算值需要打折看待。
  2. 覆盖哪些引擎?国内主流模型与海外入口是否齐全。
  3. 数据是实测还是推算?推算口径需要明确告知抽样方法。
  4. 是否只做监测?带诊断与优化建议的闭环工具长期价值更高。

六、最小可用监测流程

  1. 建立 50 条问句的 Prompt Set,覆盖五个决策阶段
  2. 覆盖 6 个中文引擎,每个问句每个引擎记录一次结果
  3. 记录四项字段:品牌是否出现、出现第几位、情感倾向、引用了哪些来源
  4. 每两周执行一次,存入表格形成时间序列
  5. 每月输出一次变化摘要,标出被引用来源的变化
  6. 每季度复核 Prompt Set 问句,替换已失效的问法

数据要落到动作上

监测结果主要服务于两个决策:投哪类信源,以及改哪类内容。信源侧的判断依据见第 05 篇,内容侧的改造标准见第 03 篇。需要定制的 Prompt Set 与月度监测报告,属于GEO 智能营销服务的常规模块。

GEO 知识体系 · 第 06 / 8 篇