GEO 的技术底座:抓取、解析与实体一致性

本系列共 8 篇,从认知、机制、内容、技术、分发、测量、落地到研究,构成一套完整的生成式引擎优化框架。可顺序阅读,也可按当前要解决的问题跳读。
内容写得再好,爬虫进不来就无从被引用。技术层按优先级处理四件事:放行检索类爬虫、确保站内可达、部署结构化数据、放置 llms.txt。这四件事里,最常见也最隐蔽的失败是防护层静默拦截了 AI 爬虫——robots.txt 明明写着 Allow,实际抓取从未发生。
一、P0:放行检索类爬虫
第一步是 robots.txt 的配置。检索类爬虫需要明确放行,训练类爬虫可以按需限制。
User-agent: OAI-SearchBot Allow: /
User-agent: Claude-SearchBot Allow: /
User-agent: PerplexityBot Allow: /
User-agent: Googlebot Allow: /
User-agent: Bingbot Allow: /
User-agent: GPTBot Disallow: /
第二步比第一步更容易被忽略:检查 WAF、CDN、云防护是否按 User-Agent 规则拦截了这些爬虫。很多站点在 robots 里全部放行,防护策略却把非浏览器 UA 一律拦掉,结果是零引用,而排查方向一直停在内容上。
验证方法只有一种:从爬虫官方公布的 IP 段发起一次真实抓取,确认请求能完整拿到页面内容。静态检查不解决问题。
二、P1:确保站内可达
- 核心内容不依赖客户端 JS 渲染后才出现,服务端直出 HTML
- 保证 Bing 与 Google 的收录正常,Bing 索引是 Copilot 与 ChatGPT Search 的前提
- 避免强制 IP 跳转或地域拦截,防止爬虫抓到空页或跳转页
- 单页内容量控制在合理范围,超长页面在切块时容易丢失段落
三、P2:结构化数据
按页面实际内容部署对应的 Schema 类型,让机器明确内容的角色。
| 页面类型 | 建议类型 | 作用 |
|---|---|---|
| 首页、关于页 | Organization、WebSite | 确立主体身份与站点信息 |
| 服务页、产品页 | Service、Product | 让服务与产品作为实体被识别 |
| 问答类内容 | FAQPage | 问答结构在答案生成环节更容易被直接引用 |
| 操作指南 | HowTo | 步骤类问题的匹配度提升 |
| 新闻、文章 | Article | 提供发布时间、作者、主体信息 |
| 导航层级 | BreadcrumbList | 帮助理解站点结构 |
标注与实际内容不符会带来风险,宁可少标也不要错标。
四、P3:llms.txt 的真实状态
这个文件在过去两年被讨论得很多,实际作用需要按事实判断。
| 维度 | 现状 |
|---|---|
| 采用率 | 约 9% 至 14%,不同扫描口径差异较大(Cloudflare Radar 2026 年 6 月报告约 14%) |
| 厂商承诺 | 主要模型厂商尚未公开承诺在生产检索中消费该文件 |
| Google 立场 | 明确表示不作为排名或抓取信号 |
| 优先级 | robots.txt 优先级高于 llms.txt,两者冲突时以 robots 为准 |
| 实际价值 | 对开发者工具类客户端(Claude Code、Cursor 等)有实际索引价值;对主流检索链路属于低成本期权 |
结论:值得放,成本接近零;不要把它当核心手段,也不必纳入 KPI 考核。
五、实体一致性:让机器确认你是谁
实体解析失败会导致引擎不敢引用。同名公司、同名产品、品牌名称在不同渠道写法不一,都会造成这类问题。
- 品牌名称、简介、logo、联系方式在各平台保持完全一致
- 结构化数据中的 sameAs 指向百科词条、工商信息、行业平台主页与官方社交账号
- 存在同名主体时,在官网做出明确区分说明
- 母品牌、子品牌、产品线之间的从属关系写清楚,避免被拆成互不相关的实体
- 第三方渠道的简介、地址、电话口径与官网一致
有关研究显示,实体图谱建设与 AI 概览可见度之间存在正向关联(OrganiKPI 2026 口径)。不同来源的具体数值差异较大,把方向作为参考即可。
六、技术自检清单
- robots.txt 中检索类爬虫已明确放行
- 已用爬虫官方 IP 段实测抓取,确认防护层未拦截
- Bing 与 Google 收录正常,核心页面无索引异常
- 核心页面在禁用 JS 的情况下仍可读到正文
- 结构化数据通过校验工具检测,且与页面内容一致
- 品牌名称与简介在各平台口径统一
- 结构化数据中已配置 sameAs 指向
- llms.txt 已放置,内容与实际站点结构同步
技术是门槛,不是答案
这四件事做完,站点具备被引用的资格,接下去比的是内容里的证据强度与第三方信源位置。前者见第 03 篇,后者见第 05 篇。需要逐项排查现有站点时,GEO 智能营销服务提供抓取层与结构化数据的完整诊断。
吾一

