AI 爬虫清单

AI 爬虫清单与校验(2026)

国内外 AI 爬虫的完整对照:谁能放行、谁是检索、谁是用户触发;以及怎么用官方 IP 段与反查验证真伪(UA 可伪造,不能只看名字)。

为什么先分清三类(放行策略的基础)

同一个厂商常按用途跑多个爬虫 —— 封了训练爬虫不会影响它的检索与用户触发爬虫。混淆三者是最常见的误封来源:

训练类

抓内容进模型训练语料

GPTBot · ClaudeBot · Google-Extended · CCBot · Applebot-Extended · Bytespider · meta-externalagent

按你的内容策略决定(我们放行:内容公开,被认识才能被推荐)

检索类

为 AI 检索建索引 → 回答时引用你的页面

OAI-SearchBot · PerplexityBot · Claude-SearchBot · MistralAI-Index

建议放行 —— 这是 AI 引用你的直接入口

用户触发类

用户当场提问 → 实时抓你的页面作答

ChatGPT-User · Perplexity-User · Claude-User · MistralAI-User

建议放行 —— 用户在问,抓不到就丢机会

清单(含官方来源,可点开核对)

下表每个 token 都标注了官方来源;没有官方来源的会如实说明(只观测、未获官方确认),不猜测、不编造。

GPTBot
OpenAI · 训练
openai.com/gptbot.json(IP 段 JSON)
OAI-SearchBot
OpenAI · 检索
openai.com/searchbot.json
ChatGPT-User
OpenAI · 用户触发
openai.com/chatgpt-user.json
ClaudeBot
Anthropic · 训练
claude.com/crawling/bots.json(IP 段)
Claude-SearchBot
Anthropic · 检索
同上(官方 2026-02 明确三爬虫框架)
Claude-User
Anthropic · 用户触发
同上
PerplexityBot
Perplexity · 检索
perplexity.ai/perplexitybot.json
Perplexity-User
Perplexity · 用户触发
perplexity.ai/perplexity-user.json
Googlebot
Google · 搜索
developers.google.com/static/crawling/ipranges/common-crawlers.json
Google-Extended
Google · 训练(token)
同上 —— 只影响训练,不影响搜索排名
Google-Agent
Google · 用户触发
同上(2026-03 新增)
Bingbot
Microsoft · 搜索(Copilot 也用它)
bing.com/toolbox/bingbot.json
Applebot / Applebot-Extended
Apple · 搜索 / 训练 token
search.developer.apple.com/applebot.json
Amazonbot / Amzn-SearchBot / Amzn-User
Amazon · 训练 / 检索 / 用户触发
developer.amazon.com/amazonbot(官方推荐 rDNS 验证)
CCBot
Common Crawl · 训练(公开语料)
官方约定:rDNS 反查到 *.commoncrawl.org
meta-externalagent / Meta-ExternalFetcher
Meta · 训练 / 用户触发
developers.facebook.com/docs/sharing/webmasters/crawler
Bytespider
字节(豆包 / 抖音搜索) · 训练
zhanzhang.toutiao.com/docs/intro/26899(《关于Bytespider》· 官方 rDNS 后缀 .byted.org)
DoubaoBot
字节(豆包) · AI Agent
行业目录有记录;官网未见独立说明(与 Bytespider 是两个爬虫)

国内 AI 爬虫

国内厂商的公开资料整体少于国际(多无 IP 段 JSON):有官方页的已标注;没有的如实说明。

Baiduspider / Baiduspider-render
百度 · 搜索 / 渲染
www.baidu.com/robots.txt(官方声明)
Sogou web spider / Sogou inst spider
搜狗(腾讯) · 搜索
www.sogou.com/robots.txt(官方声明)
360Spider
360 · 搜索
www.so.com/help/spider_ip.html —— 官方给出 6 个 IP 段,并提示"不要误拦截";官方说明其不支持 nslookup 查询(只能用 IP 段判定)
Kimi-SearchBot
月之暗面(Kimi) · 检索
kimi.ai/policies/kimi-crawlers(《Kimi Crawlers》· 官方政策页)
DeepSeekBot
深度求索 · 训练
官方未见爬虫说明页;行业目录记为"不遵守 robots.txt"
ChatGLM-Spider
智谱 · 训练 / 抓取
官方未见说明页(行业目录中该条亦标注信息不完整)
QwenBot / TongyiBot / Qwen-User
阿里(通义千问) · 训练 / 检索 / 用户触发
官方英文资料较少;行业目录有时间记录
PetalBot
华为(花瓣搜索) · 搜索
行业目录记为"遵守 robots.txt";官网未见独立说明页
YisouSpider
阿里(神马搜索) · 搜索
官方站存在(zhanzhang.sm.cn),但未见 token 声明

最常见的误封错误

下面第一条是每年都在发生的损失:

为"防 AI 训练"直接 `Disallow: /`(或禁掉一批 AI UA)

会把检索类与用户触发类一起禁掉 —— 结果是从 AI 搜索里彻底消失,AI 回答里不再引用你,而训练照旧(别人家的语料里可能还有你)。正确做法是按类别分别决定:训练随你、检索与用户触发建议放行。

只看 User-Agent 就判定真伪

UA 可伪造:伪装成 ChatGPT/Claude 的扫描器很常见(真实案例里它们会去打 `/.env`、`/wp-config`、`/actuator` 这类管理路径)。判定必须看行为(是否抓 robots/sitemap/正常页面)。

把路径名当成爬虫声明

在 `robots.txt` 里看到 `/xxxai/*` 这类路径,是目录名,不是爬虫 token。

以为"封了训练爬虫"能省流量

流量最大的往往是搜索与用户触发类;训练类封了既省不了多少,还可能丢掉"被模型认识"的机会。

怎么验证真假(三层,从硬到软)

① 官方 IP 段(最硬)

Google / OpenAI / Perplexity / Apple / Bing 都发布机器可读的 IP 段 JSON;360 在帮助页给出 6 个网段。命中即确认。

② 反查域名(rDNS)

反解 IP → 域名应属于厂商(如 Googlebot 落 *.googlebot.com;字节落 *.byted.org;Common Crawl 落 *.commoncrawl.org)。⚠️ 360 官方说明其不支持 nslookup,只能用 IP 段。

③ 行为判定

真爬虫通常在读 `robots.txt`、`sitemap.xml` 与正常页面;扫描器则会去问 `.env`、`wp-config`、`actuator` 之类的敏感路径。这一层最适合快速判断可疑来源。

常见问题

封了 GPTBot,ChatGPT 就看不到我的站了吗?

不一定。ChatGPT 的实时浏览走的是 ChatGPT-User,检索索引走 OAI-SearchBot —— 二者与 GPTBot 相互独立。只封 GPTBot 通常不影响 ChatGPT 的实时引用与检索,但会退出"训练语料"。

国内 AI 爬虫值得放行吗?

值得。中文用户的主入口之一就是国内 AI 搜索与助手;这些爬虫多数没有公开 IP 段,难以做精细控制,从内容侧欢迎(robots 放行 + 内容结构化)是最省事的做法。

为什么清单里有些爬虫"没有官方来源"?

国内部分厂商(如深度求索、智谱)目前没有发布爬虫说明页或 IP 段。我们只观测、不猜测:这类条目会明确标注"未获官方确认",并以行业目录交叉验证作为参考。

我能用这份清单做什么?

配置 robots.txt 放行策略、在日志中识别 AI 爬虫/扫描器、判断"某个自称某爬虫"的请求是否可信。不要仅凭 UA 去封禁来源 —— 误封爬虫会直接影响收录与 AI 引用。

闲鱼下单
闲鱼下单
微信扫码
微信扫码
购买与咨询

批量采购 · 接入协助 · 使用问题

仅结算与技术支持,不提供投资建议。

相关

如果你要把数据接给 AI Agent(而不是只被爬取):