吾一

AI 引擎如何挑选信源:生成链路五步与信源权重

2026-09-18 作者 · 吾一内容团队 GEO知识体系,机制
AI 引擎如何挑选信源:生成链路五步与信源权重
GEO 知识体系 · 第 02 / 8 篇

本系列共 8 篇,从认知、机制、内容、技术、分发、测量、落地到研究,构成一套完整的生成式引擎优化框架。可顺序阅读,也可按当前要解决的问题跳读。

生成式引擎给出一段答案的过程分五步:查询改写、检索召回、重排择优、答案生成、引用归因。理解这五步的分工,就能明白为什么"内容写得好"和"被引用"是两件需要分别解决的事——结构性因素决定能否被召回,正文证据决定能否被采用。

一、五步链路与各环节的决定因素

环节决定因素你能控制的部分
查询改写意图识别、场景扩展、子问题拆解覆盖场景化与口语化的问法
检索召回索引覆盖度、爬虫可达性、语义相似度robots 与 WAF 放行、站点结构、标题与摘要
重排择优权威度、时效性、结构完整度、实体清晰度证据密度、发布时间、实体一致性
答案生成片段可摘取性、段落自包含程度结论前置、表格化、问答化
引用归因溯源清晰度、来源可验证性出处标注、作者署名、数据口径说明

二、结构驱动检索,证据驱动引用

这是 GEO 实践中最需要记住的一条机制判断。延世大学 2026 年发布的 SAGEO Arena 研究首次把完整的"检索—重排—生成"链路纳入测试,得到两组方向相反的数据:

优化方式检索命中重排位置被引用
只优化正文内容约 -9%约 -16%约 -6%
优化标题、meta、结构化数据约 +22%

数据来源:SAGEO Arena(延世大学,2026,arXiv:2602.12187)。该研究的另一项发现是电商产品页在各类优化方法下引用反而下降,说明不同页面类型需要区别对待。

实操含义很清楚:只改正文不动结构,页面可能连候选池都进不去;只堆结构化数据不动正文,进了候选池也拿不到引用。两件事需要同步做。

三、三类爬虫,三种控制方式

把爬虫当成一类来处理,是技术配置最常见的错误来源。

类型代表 UA目的控制方式
训练爬虫GPTBot、ClaudeBot、Google-Extended、CCBot、Bytespider进入模型语料库可 Disallow 退出训练,与是否被引用无直接关系
检索爬虫OAI-SearchBot、Claude-SearchBot、PerplexityBot、Bingbot建立答案索引必须 Allow,否则无法被引用
实时抓取ChatGPT-User 等用户当场要求读取某页行为接近真人访问,难以用 robots 精确区分

一个额外前提:Bing 索引是 Microsoft Copilot 与 ChatGPT Search 的底层数据来源。Bing 收录异常会连带影响两个入口的可见性,这个环节经常被漏掉。具体配置方法见第 04 篇技术底座

四、信源权重:第三方内容占主导

多伦多大学 2025 年的研究(arXiv:2509.08919)分析了多个 AI 引擎的引用来源构成,发现引用高度偏向第三方内容(earned media),品牌自营内容的占比明显偏低。

引擎第三方内容在引用中的占比
ChatGPT约 90%–95%
Claude约 82%–93%
Gemini约 63%–67%
Perplexity约 53%–74%

口径说明:数据来自 2025 年 9 月 arXiv 预印本,测试环境以英文生态为主。中文引擎是否呈现同等偏向,需要用本地 Prompt Set 自行验证,方法见第 06 篇

同一项研究还发现,社交平台内容在 AI 搜索中的被引比例远低于传统搜索中的表现。这解释了为什么一个在社交平台上声量很大的品牌,可能在 AI 答案里毫无存在感——两套系统的信源池不同。

五、AI 偏爱的引用信号

  • 年份与口径的具体数字,例如"同比提升 34%"优于"显著提升"
  • 署名机构或专家的直接引语
  • 可溯源的出处,包含报告名称、发布方、时间
  • 规范的定义句,便于直接摘取成答案
  • 对比表格与步骤清单,结构清晰便于切块
  • 明确的更新日期,时效可判断
  • 实体清晰、无同名歧义的主体名称

六、机制层面推出的三条结论

  1. 技术可达性是天花板。爬虫进不来的站点,内容质量带来的差异归零。
  2. 自有阵地单独做不够。信源池以第三方为主,内容需要进入媒体、垂类平台与社区,具体布局见第 05 篇
  3. 写法影响的是最后一公里。证据与结构的价值,体现在进入候选池之后的采用环节。
GEO 知识体系 · 第 02 / 8 篇