吾一

GEO 的技术底座:抓取、解析与实体一致性

2026-09-18 作者 · 吾一内容团队 GEO知识体系,技术
GEO 的技术底座:抓取、解析与实体一致性
GEO 知识体系 · 第 04 / 8 篇

本系列共 8 篇,从认知、机制、内容、技术、分发、测量、落地到研究,构成一套完整的生成式引擎优化框架。可顺序阅读,也可按当前要解决的问题跳读。

内容写得再好,爬虫进不来就无从被引用。技术层按优先级处理四件事:放行检索类爬虫、确保站内可达、部署结构化数据、放置 llms.txt。这四件事里,最常见也最隐蔽的失败是防护层静默拦截了 AI 爬虫——robots.txt 明明写着 Allow,实际抓取从未发生。

一、P0:放行检索类爬虫

第一步是 robots.txt 的配置。检索类爬虫需要明确放行,训练类爬虫可以按需限制。

User-agent: OAI-SearchBot  Allow: /
User-agent: Claude-SearchBot  Allow: /
User-agent: PerplexityBot  Allow: /
User-agent: Googlebot  Allow: /
User-agent: Bingbot  Allow: /
User-agent: GPTBot  Disallow: /

第二步比第一步更容易被忽略:检查 WAF、CDN、云防护是否按 User-Agent 规则拦截了这些爬虫。很多站点在 robots 里全部放行,防护策略却把非浏览器 UA 一律拦掉,结果是零引用,而排查方向一直停在内容上。

验证方法只有一种:从爬虫官方公布的 IP 段发起一次真实抓取,确认请求能完整拿到页面内容。静态检查不解决问题。

二、P1:确保站内可达

  • 核心内容不依赖客户端 JS 渲染后才出现,服务端直出 HTML
  • 保证 Bing 与 Google 的收录正常,Bing 索引是 Copilot 与 ChatGPT Search 的前提
  • 避免强制 IP 跳转或地域拦截,防止爬虫抓到空页或跳转页
  • 单页内容量控制在合理范围,超长页面在切块时容易丢失段落

三、P2:结构化数据

按页面实际内容部署对应的 Schema 类型,让机器明确内容的角色。

页面类型建议类型作用
首页、关于页Organization、WebSite确立主体身份与站点信息
服务页、产品页Service、Product让服务与产品作为实体被识别
问答类内容FAQPage问答结构在答案生成环节更容易被直接引用
操作指南HowTo步骤类问题的匹配度提升
新闻、文章Article提供发布时间、作者、主体信息
导航层级BreadcrumbList帮助理解站点结构

标注与实际内容不符会带来风险,宁可少标也不要错标。

四、P3:llms.txt 的真实状态

这个文件在过去两年被讨论得很多,实际作用需要按事实判断。

维度现状
采用率约 9% 至 14%,不同扫描口径差异较大(Cloudflare Radar 2026 年 6 月报告约 14%)
厂商承诺主要模型厂商尚未公开承诺在生产检索中消费该文件
Google 立场明确表示不作为排名或抓取信号
优先级robots.txt 优先级高于 llms.txt,两者冲突时以 robots 为准
实际价值对开发者工具类客户端(Claude Code、Cursor 等)有实际索引价值;对主流检索链路属于低成本期权

结论:值得放,成本接近零;不要把它当核心手段,也不必纳入 KPI 考核。

五、实体一致性:让机器确认你是谁

实体解析失败会导致引擎不敢引用。同名公司、同名产品、品牌名称在不同渠道写法不一,都会造成这类问题。

  • 品牌名称、简介、logo、联系方式在各平台保持完全一致
  • 结构化数据中的 sameAs 指向百科词条、工商信息、行业平台主页与官方社交账号
  • 存在同名主体时,在官网做出明确区分说明
  • 母品牌、子品牌、产品线之间的从属关系写清楚,避免被拆成互不相关的实体
  • 第三方渠道的简介、地址、电话口径与官网一致

有关研究显示,实体图谱建设与 AI 概览可见度之间存在正向关联(OrganiKPI 2026 口径)。不同来源的具体数值差异较大,把方向作为参考即可。

六、技术自检清单

  1. robots.txt 中检索类爬虫已明确放行
  2. 已用爬虫官方 IP 段实测抓取,确认防护层未拦截
  3. Bing 与 Google 收录正常,核心页面无索引异常
  4. 核心页面在禁用 JS 的情况下仍可读到正文
  5. 结构化数据通过校验工具检测,且与页面内容一致
  6. 品牌名称与简介在各平台口径统一
  7. 结构化数据中已配置 sameAs 指向
  8. llms.txt 已放置,内容与实际站点结构同步

技术是门槛,不是答案

这四件事做完,站点具备被引用的资格,接下去比的是内容里的证据强度与第三方信源位置。前者见第 03 篇,后者见第 05 篇。需要逐项排查现有站点时,GEO 智能营销服务提供抓取层与结构化数据的完整诊断。