分类: AI平台规则

  • 2026 主流 AI 搜索引擎抓取与引用机制全解析:ChatGPT、Perplexity、Google、Claude 的爬虫与信源规则

    做 GEO(生成式引擎优化),第一个要搞清楚的问题是:AI 到底”怎么看”你的网站。它派哪些爬虫来抓页?robots.txt 里哪一行决定你能不能被引用?它回答买家问题时偏爱引用谁?这篇文章把 ChatGPT 搜索、Perplexity、Google AI 概览(AI Overviews/AI Mode)和 Claude 四套机制拆开讲透,并落到外贸企业的部署优先级上。

    一、四家平台,四种抓取机制

    1. ChatGPT 搜索(OpenAI):四个爬虫各司其职

    据 OpenAI 官方文档,OpenAI 目前运营四个与网页相关的爬虫/用户代理,用途完全独立,robots.txt 也分别控制(OpenAI 官方爬虫文档):

    • OAI-SearchBot(搜索索引爬虫):负责抓取网页、建立 ChatGPT 搜索的索引。官方明确:屏蔽 OAI-SearchBot 的网站不会出现在 ChatGPT 搜索答案中(仍可能以导航链接形式出现)。robots.txt 规则更新后约 24 小时生效。
    • GPTBot(训练爬虫):抓取内容用于训练生成式基础模型。屏蔽它仅表示”别拿我的内容训练”,不影响你在搜索结果里的出现。
    • ChatGPT-User(用户触发访问):当用户在对话中让 ChatGPT 实时打开某个网页时触发,不是自动爬取。官方说明这类由用户发起的访问”robots.txt 规则可能不适用“。
    • OAI-AdsBot(广告验证):仅访问在 ChatGPT 投放广告时提交的落地页,不用于训练。

    值得注意的是,ChatGPT 搜索的实时结果并非全部来自自有索引:除 OAI-SearchBot 抓取外,OpenAI 帮助中心承认还会使用”第三方搜索提供商”的结果,行业普遍确认 Bing 是其主要外部检索来源之一(OpenAI 帮助中心)。引用显示上,ChatGPT 答案内带上标编号,链接到来源页,并自动给引荐链接加 utm_source=chatgpt.com 参数,方便在 GA 里追踪流量。2025 年 10 月 OpenAI 还推出了自带浏览器 ChatGPT Atlas,让”在 ChatGPT 里点开网站”成为常规动作。

    2. Perplexity:PerplexityBot 建索引,Perplexity-User 实时取页

    Perplexity 官方支持文档写明:PerplexityBot 是自动抓取、建立答案索引的爬虫,遵守 robots.txt;被禁页面不会被索引正文,但仍可能被索引域名、标题和一句简短事实摘要。官方强调”Perplexity 不训练基础模型,你的内容不会用于模型预训练”。此外,早期版本允许用户让它摘要某个被 robots 屏蔽的 URL,该功能现已禁用;第三方合作爬虫也被要求遵守 robots(Perplexity 官方支持文档)。Perplexity-User 则是用户提问时实时抓取页面的代理,按其机制设计一般不遵循 robots.txt——它本质上是”替一个真人去看网页”。

    需要如实提示争议:2024 年 WIRED 等发现 Perplexity 用未声明身份访问已屏蔽站点;2025 年 8 月 Cloudflare 报告观察到伪装成普通 Chrome 的隐形爬虫抓取被禁内容,Perplexity 归因于第三方服务商 BrowserBase,并被 Cloudflare 移出”验证机器人”名单;《纽约时报》、道琼斯的诉讼仍在进行(行业综述,2026-06)。Perplexity 的答案默认逐句挂角标引用,来源卡片可一键点开。

    3. Google AI 概览 / AI Mode:没有独立”AI 爬虫”

    Google 的机制与前三家根本不同。据 Google Search Central 官方说明,AI Overviews 和 AI Mode 使用与普通搜索完全相同的索引和 Googlebot 抓取,没有单独的 AI 爬虫、无需额外标记;”页面只要被 Google 索引、能显示摘要,就有资格成为 AI 概览的支撑链接,没有任何额外技术要求”;系统还会用 query fan-out(把一个问题拆成多个子查询同时检索)来扩大候选来源(Google 抓取工具官方文档)。

    这意味着两件事:其一,传统 Google SEO(收录、排名、E-E-A-T)依然是 AI 概览可见度的地基;其二,你无法只退出 AI 概览而保留 Google 搜索——想不被 AI 答案引用,只能 noindex 退出整个搜索。Google-Extended 是 2023 年 9 月推出的 robots.txt 令牌(不是独立爬虫,抓取仍由 Googlebot 完成),只控制内容能否用于 Gemini/Vertex AI 的训练与 grounding;Google 2025 年 4 月文档明确它”不影响搜索收录,也不是排名信号”。另外,Google 的用户触发类抓取工具(如朗读功能)按官方分类设计上一般忽略 robots.txt。

    4. Claude(Anthropic):三个机器人,训练与搜索分开

    据 Anthropic 官方隐私文档,其爬虫分三类(Anthropic 官方说明):ClaudeBot 收集可能用于模型训练的网页内容;Claude-SearchBot 抓取网页以提升 Claude 搜索结果质量,官方提示屏蔽它”可能降低你在用户搜索结果中的可见度与准确性”;Claude-User 在用户提问时代理访问网站。三者均声明遵守 robots.txt、不绕过 CAPTCHA,并支持非标准的 Crawl-delay 指令;Anthropic 不公布 IP 段,建议用 robots.txt 而非封 IP 来管理。

    5. 其他平台在外贸场景的位置

    Microsoft Copilot 的联网回答由系统生成查询发给 Bing、基于 Bing 结果作答,回答下方有 Sources 按钮,并可调用 LinkedIn 数据(Microsoft 官方文档)——所以 Bing 站长工具提交和 LinkedIn 布局对 Copilot 可见度有直接价值。中文平台方面,字节跳动的 Bytespider 关联豆包等模型训练,字节未发布官方爬虫文档,多份安全厂商报告称其频繁忽略 robots.txt、抓取量大(Temso 机器人档案);对面向欧美买家的外贸站,中文平台优先级靠后,知晓即可。

    二、一张表看懂:爬虫、robots 与引用特点

    平台 搜索/引用爬虫 训练爬虫 robots.txt 现状(官方口径) 引用显示
    ChatGPT 搜索 OAI-SearchBot(+Bing 等第三方) GPTBot 均遵守;ChatGPT-User 为用户触发,”robots 可能不适用” 句内编号角标 + 来源链接,带 utm 参数
    Perplexity PerplexityBot 官方称不训练基础模型 PerplexityBot 遵守(被禁仍可能留标题摘要);Perplexity-User 用户触发、设计上忽略 robots;2025 年有隐形抓取争议 逐句角标 + 来源卡片
    Google AI 概览/AI Mode 无独立爬虫,用 Googlebot 与搜索索引 Google-Extended 令牌控制(不影响排名/收录) Googlebot 遵守;用户触发类工具设计上可忽略 robots 内联链接 + 网站卡片轮播
    Claude Claude-SearchBot ClaudeBot 三个机器人官方均称遵守 robots,支持 Crawl-delay,不公布 IP 引用链接(搜索功能内)
    Microsoft Copilot 基于 Bing 索引(Bingbot) 遵循 Bing 既有规则 Sources 按钮列出来源

    三、AI 引用来源的五条共性规律

    第一,引用高度集中在少数权威域名。汇总 Semrush、Ahrefs、Goodie、First Page Sage 四项共覆盖上千万条引用的研究:前 5 个域名拿走约 38% 的引用,前 20 个域名占 66%(Decoding 汇总,2026-03)。各平台口味不同:ChatGPT 头部来源是 Wikipedia(其前十大来源内占约 47.9%);Perplexity 最偏爱 Reddit(前十大来源内占约 46.7%,总引用中 Reddit 占 6.6%、YouTube 2.0%、Gartner 1.0%、Yelp/LinkedIn/Forbes/G2 等紧随其后);Google AI 概览则是 Reddit 约 21%、YouTube 约 18.8%(Profound,6.8 亿条引用分析,2025-06)。

    第二,Reddit、论坛、问答、评测站高频被引,因为 AI 在”找真人经验”。Semrush 对 24.8 万条被引 Reddit 帖子的分析显示,SearchGPT 有 12.6% 的回答包含 Reddit 链接,Google AI Mode 为 9%;Perplexity 中 Reddit 链接出现位置更靠前(平均第 3 位)(Semrush,2025-11)。背后逻辑是:买家问的”best supplier””how to choose””X vs Y”类问题,需要第一手使用体验和对比讨论——这正是论坛和评论区的内容形态。

    第三,YouTube 正成为最大黑马。Adweek 2026 年 1 月汇总四家机构 610 万条引用的调查发现:YouTube 已出现在约 16% 的 AI 回答中,超过 Reddit(约 10%);社交类引用里 YouTube 份额从 2025 年 8 月的 18.9% 升至 12 月的 39.2%,Reddit 同期从 44.2% 跌到 20.3%。AI 不看视频画面,读的是字幕转录文本;94% 被引视频是长视频,且订阅数与被引频率几乎不相关(r=-0.03),40% 被引视频播放量不足 1000(Zeover 引 Adweek 调查,2026-04)——小团队的优质实操视频一样有机会。

    第四,品牌官网被引有明确”内容形态门槛”。多项实测一致指向同一模式:AI 引用的不是”页面”而是”段落”——开头 100 词内直接回答问题、含列表/表格/FAQ/定义句等结构化元素的页面被引概率显著更高;长而散的营销文案几乎不被提取(SystemsArchitect 综合研究,2026-05)。同时新鲜内容权重上升:AI 概览会把一个查询拆成多个子问题,被引页面中只有 38% 同时位列传统自然前十(一年前为 76%),意味着引用池正在向更”对题”的页面扩散,而不全是老权威站。

    第五,被引是”新的排名第一”,但点击逻辑变了。Ahrefs 2025 年 12 月研究显示 AI 概览出现时首位自然结果平均 CTR 下降约 58%;但 Seer Interactive 追踪 24.3 亿次曝光发现,被 AI 概览引用的品牌自然点击多 35%、付费点击多 91%QuickSEO 汇总 Seer/Ahrefs/Pew,2026-05)。答案里”被提到”本身就是曝光与信任投票。

    四、2025–2026 年改变引用生态的三件事

    一是 OpenAI 用版权合作锁定优质信源。截至 2025 年初 OpenAI 已与 20 余家新闻出版商签约(美联社、Axel Springer、《金融时报》、新闻集团、Condé Nast、赫斯特、Vox、The Atlantic、Axios、《卫报》、《华盛顿邮报》、路透社等),覆盖 160 多家媒体、20 多种语言;合作媒体的摘要与摘录在 ChatGPT 搜索中带明确引用和原文链接,新闻集团交易据报道 5 年超 2.5 亿美元(OpenAI 官方公告,2025-01)。Reddit、Stack Overflow 也在 2024 年把数据 API 授权给了 OpenAI。这意味着时事、行业资讯类问题的答案,权威媒体的权重被制度性抬高。

    二是 Google AI Mode 全面铺开并开始商业化。AI Mode 2025 年 5 月在美国上线,10 月扩至 40 多个国家,2026 年 5 月 Google I/O 宣布覆盖近 200 个国家、月活超 10 亿;2026 年 2 月正式推出 AI Mode 购物广告(Keywords Everywhere 追踪,2026-08)。AI 概览月触达约 20 亿用户。对 B2B 买家而言,”在 Google 里直接问供应商怎么选”正成为默认动作。

    三是 Perplexity 商务化与基础设施层的”默认拦截”。Perplexity 2025 年 7 月推出 AI 浏览器 Comet(10 月转免费),8 月推出 Comet Plus 订阅,将 80% 收入分给参与出版商、设 4250 万美元资金池,合作方包括 CNN、Condé Nast、《华盛顿邮报》等。更关键的是基础设施变化:Cloudflare 自 2025 年 7 月 1 日起对新接入域名默认拦截 AI 爬虫,站长需主动放行,并推出”按抓取付费”机制;2026 年 7 月进一步细分为搜索/代理/训练三类管理(Cloudflare 官方新闻稿,2025-07)。外贸站如果用 Cloudflare 且没主动放行,可能在 robots.txt 没问题的情况下依然对 AI 爬虫返回 403——这是最容易被忽略的”隐形脱榜”。

    五、外贸企业的 GEO 落地优先级

    理解机制差异后,部署顺序就清楚了,建议按以下四步推进:

    1. 先修”门票”(第 1 周)。检查 robots.txt 与 CDN/WAF 设置:允许 OAI-SearchBot、PerplexityBot、Claude-SearchBot、Googlebot(Google-Extended 可按内容策略决定),训练类 GPTBot/ClaudeBot 可按需屏蔽;登录 Cloudflare 等 CDN 后台确认 AI 爬虫未被默认拦截;提交 sitemap 到 Google 与 Bing 站长工具。这一步不做好,后面所有内容工作 AI 都”看不见”。
    2. 再做 Google 地基(第 1–2 月)。AI 概览与 AI Mode 吃的是 Google 索引,外贸买家的信息检索仍以 Google 为绝对入口(第三方测算 Google 仍占美国桌面搜索约 73.7%,SparkToro/Datos,2026-03)。把核心产品页、行业问答页做到可收录、结构清晰,是 ROI 最高的一步。
    3. 然后按平台口味布内容(第 2–4 月)。官网内容改成”定义句 + 表格对比 + FAQ + 应用场景清单”的可提取形态,开头百词内直接给答案;同步在 YouTube 铺带完整英文字幕的产品实操/验厂/选型视频(吃 AI 视频引用红利);在 Reddit、Quora、行业论坛、LinkedIn、G2 类平台布局真实讨论与第三方提及(喂 Perplexity 和 ChatGPT 的”经验类信源”);Bing/Copilot 场景则同步经营 LinkedIn 公司页。
    4. 持续监测与迭代(长期)。用买家真实提问在各平台做季度可见度抽检,追踪品牌被引率、引用位置与引荐流量(ChatGPT 流量看 utm_source=chatgpt.com),按引用数据反哺内容更新。

    需要提醒的是,各平台机制差异大、策略需要针对性设计,企业自行试错成本高,可交给专业团队一对一部署整套体系。

    参考来源

    ——

    关于工厂外贸GEO

    工厂外贸GEO 隶属于外贸圈集团,专注为外贸企业提供一对一 GEO 体系部署服务:从 AI 可见度诊断、技术 GEO 部署、内容体系搭建到 AI 平台引用布局与效果监测,整套体系打包交付(收费 20 万元,不承接零敲碎打的零散需求)。

    如果你希望团队直接帮你把整套 GEO 体系落地,查看服务详情联系我们(微信:Linlaoshizhuli,邮箱:4441859@qq.com)。