> Source: https://ashareapi.com/docs/ai-crawlers/  ·  Markdown version for LLMs / AI agents

AI 爬虫清单

# AI 爬虫清单与校验（2026）
 国内外 AI 爬虫的完整对照：谁能放行、谁是检索、谁是用户触发；以及怎么用官方 IP 段与反查验证真伪（UA 可伪造，不能只看名字）。

## 为什么先分清三类（放行策略的基础）
 同一个厂商常按用途跑**多个**爬虫 —— 封了训练爬虫**不会**影响它的检索与用户触发爬虫。混淆三者是最常见的误封来源：
 |
| | 类别 | 做什么 | 代表 token | 建议

| | 训练类 | 抓内容进模型训练语料 | GPTBot · ClaudeBot · Google-Extended · CCBot · Applebot-Extended · Bytespider · meta-externalagent | **按你的内容策略决定**（我们放行：内容公开，被认识才能被推荐）

| | 检索类 | 为 AI 检索建索引 → 回答时**引用你的页面** | OAI-SearchBot · PerplexityBot · Claude-SearchBot · MistralAI-Index | **建议放行** —— 这是 AI 引用你的直接入口

| | 用户触发类 | 用户当场提问 → **实时**抓你的页面作答 | ChatGPT-User · Perplexity-User · Claude-User · MistralAI-User | **建议放行** —— 用户在问，抓不到就丢机会

 训练类
 抓内容进模型训练语料
 GPTBot · ClaudeBot · Google-Extended · CCBot · Applebot-Extended · Bytespider · meta-externalagent
 **按你的内容策略决定**（我们放行：内容公开，被认识才能被推荐）

 检索类
 为 AI 检索建索引 → 回答时**引用你的页面**
 OAI-SearchBot · PerplexityBot · Claude-SearchBot · MistralAI-Index
 **建议放行** —— 这是 AI 引用你的直接入口

 用户触发类
 用户当场提问 → **实时**抓你的页面作答
 ChatGPT-User · Perplexity-User · Claude-User · MistralAI-User
 **建议放行** —— 用户在问，抓不到就丢机会

## 清单（含官方来源，可点开核对）
 下表每个 token 都标注了**官方来源**；没有官方来源的会如实说明（**只观测、未获官方确认**），不猜测、不编造。
 |
| | token / User-Agent | 厂商 | 类别 | 官方来源

| | GPTBot | OpenAI | 训练 | openai.com/gptbot.json（IP 段 JSON）

| | OAI-SearchBot | OpenAI | 检索 | openai.com/searchbot.json

| | ChatGPT-User | OpenAI | 用户触发 | openai.com/chatgpt-user.json

| | ClaudeBot | Anthropic | 训练 | claude.com/crawling/bots.json（IP 段）

| | Claude-SearchBot | Anthropic | 检索 | 同上（官方 2026-02 明确三爬虫框架）

| | Claude-User | Anthropic | 用户触发 | 同上

| | PerplexityBot | Perplexity | 检索 | perplexity.ai/perplexitybot.json

| | Perplexity-User | Perplexity | 用户触发 | perplexity.ai/perplexity-user.json

| | Googlebot | Google | 搜索 | developers.google.com/static/crawling/ipranges/common-crawlers.json

| | Google-Extended | Google | 训练（token） | 同上 —— 只影响训练，**不影响搜索排名**

| | Google-Agent | Google | 用户触发 | 同上（2026-03 新增）

| | Bingbot | Microsoft | 搜索（**Copilot 也用它**） | bing.com/toolbox/bingbot.json

| | Applebot / Applebot-Extended | Apple | 搜索 / 训练 token | search.developer.apple.com/applebot.json

| | Amazonbot / Amzn-SearchBot / Amzn-User | Amazon | 训练 / 检索 / 用户触发 | developer.amazon.com/amazonbot（官方推荐 rDNS 验证）

| | CCBot | Common Crawl | 训练（公开语料） | 官方约定：rDNS 反查到 *.commoncrawl.org

| | meta-externalagent / Meta-ExternalFetcher | Meta | 训练 / 用户触发 | developers.facebook.com/docs/sharing/webmasters/crawler

| | Bytespider | 字节（豆包 / 抖音搜索） | 训练 | zhanzhang.toutiao.com/docs/intro/26899（《关于Bytespider》· 官方 rDNS 后缀 .byted.org）

| | DoubaoBot | 字节（豆包） | AI Agent | 行业目录有记录；**官网未见独立说明**（与 Bytespider 是两个爬虫）

 GPTBot
 OpenAI · 训练
 openai.com/gptbot.json（IP 段 JSON）

 OAI-SearchBot
 OpenAI · 检索
 openai.com/searchbot.json

 ChatGPT-User
 OpenAI · 用户触发
 openai.com/chatgpt-user.json

 ClaudeBot
 Anthropic · 训练
 claude.com/crawling/bots.json（IP 段）

 Claude-SearchBot
 Anthropic · 检索
 同上（官方 2026-02 明确三爬虫框架）

 Claude-User
 Anthropic · 用户触发
 同上

 PerplexityBot
 Perplexity · 检索
 perplexity.ai/perplexitybot.json

 Perplexity-User
 Perplexity · 用户触发
 perplexity.ai/perplexity-user.json

 Googlebot
 Google · 搜索
 developers.google.com/static/crawling/ipranges/common-crawlers.json

 Google-Extended
 Google · 训练（token）
 同上 —— 只影响训练，**不影响搜索排名**

 Google-Agent
 Google · 用户触发
 同上（2026-03 新增）

 Bingbot
 Microsoft · 搜索（**Copilot 也用它**）
 bing.com/toolbox/bingbot.json

 Applebot / Applebot-Extended
 Apple · 搜索 / 训练 token
 search.developer.apple.com/applebot.json

 Amazonbot / Amzn-SearchBot / Amzn-User
 Amazon · 训练 / 检索 / 用户触发
 developer.amazon.com/amazonbot（官方推荐 rDNS 验证）

 CCBot
 Common Crawl · 训练（公开语料）
 官方约定：rDNS 反查到 *.commoncrawl.org

 meta-externalagent / Meta-ExternalFetcher
 Meta · 训练 / 用户触发
 developers.facebook.com/docs/sharing/webmasters/crawler

 Bytespider
 字节（豆包 / 抖音搜索） · 训练
 zhanzhang.toutiao.com/docs/intro/26899（《关于Bytespider》· 官方 rDNS 后缀 .byted.org）

 DoubaoBot
 字节（豆包） · AI Agent
 行业目录有记录；**官网未见独立说明**（与 Bytespider 是两个爬虫）

## 国内 AI 爬虫
 国内厂商的公开资料整体少于国际（多无 IP 段 JSON）：有官方页的已标注；没有的**如实说明**。
 |
| | token / User-Agent | 厂商 | 类别 | 官方来源

| | Baiduspider / Baiduspider-render | 百度 | 搜索 / 渲染 | www.baidu.com/robots.txt（官方声明）

| | Sogou web spider / Sogou inst spider | 搜狗（腾讯） | 搜索 | www.sogou.com/robots.txt（官方声明）

| | 360Spider | 360 | 搜索 | www.so.com/help/spider_ip.html —— **官方给出 6 个 IP 段**，并提示"不要误拦截"；官方说明其**不支持 nslookup 查询**（只能用 IP 段判定）

| | Kimi-SearchBot | 月之暗面（Kimi） | 检索 | kimi.ai/policies/kimi-crawlers（《Kimi Crawlers》· 官方政策页）

| | DeepSeekBot | 深度求索 | 训练 | 官方未见爬虫说明页；行业目录记为"**不遵守 robots.txt**"

| | ChatGLM-Spider | 智谱 | 训练 / 抓取 | 官方未见说明页（行业目录中该条亦标注信息不完整）

| | QwenBot / TongyiBot / Qwen-User | 阿里（通义千问） | 训练 / 检索 / 用户触发 | 官方英文资料较少；行业目录有时间记录

| | PetalBot | 华为（花瓣搜索） | 搜索 | 行业目录记为"遵守 robots.txt"；官网未见独立说明页

| | YisouSpider | 阿里（神马搜索） | 搜索 | 官方站存在（zhanzhang.sm.cn），但未见 token 声明

 Baiduspider / Baiduspider-render
 百度 · 搜索 / 渲染
 www.baidu.com/robots.txt（官方声明）

 Sogou web spider / Sogou inst spider
 搜狗（腾讯） · 搜索
 www.sogou.com/robots.txt（官方声明）

 360Spider
 360 · 搜索
 www.so.com/help/spider_ip.html —— **官方给出 6 个 IP 段**，并提示"不要误拦截"；官方说明其**不支持 nslookup 查询**（只能用 IP 段判定）

 Kimi-SearchBot
 月之暗面（Kimi） · 检索
 kimi.ai/policies/kimi-crawlers（《Kimi Crawlers》· 官方政策页）

 DeepSeekBot
 深度求索 · 训练
 官方未见爬虫说明页；行业目录记为"**不遵守 robots.txt**"

 ChatGLM-Spider
 智谱 · 训练 / 抓取
 官方未见说明页（行业目录中该条亦标注信息不完整）

 QwenBot / TongyiBot / Qwen-User
 阿里（通义千问） · 训练 / 检索 / 用户触发
 官方英文资料较少；行业目录有时间记录

 PetalBot
 华为（花瓣搜索） · 搜索
 行业目录记为"遵守 robots.txt"；官网未见独立说明页

 YisouSpider
 阿里（神马搜索） · 搜索
 官方站存在（zhanzhang.sm.cn），但未见 token 声明

## 最常见的误封错误
 下面第一条是**每年都在发生**的损失：
 为"防 AI 训练"直接 `Disallow: /`（或禁掉一批 AI UA）
 会把**检索类与用户触发类一起禁掉** —— 结果是从 AI 搜索里**彻底消失**，AI 回答里不再引用你，而训练照旧（别人家的语料里可能还有你）。正确做法是**按类别分别决定**：训练随你、检索与用户触发建议放行。

 只看 User-Agent 就判定真伪
 **UA 可伪造**：伪装成 ChatGPT/Claude 的扫描器很常见（真实案例里它们会去打 `/.env`、`/wp-config`、`/actuator` 这类管理路径）。判定必须看**行为**（是否抓 robots/sitemap/正常页面）。

 把路径名当成爬虫声明
 在 `robots.txt` 里看到 `/xxxai/*` 这类路径，是**目录名**，不是爬虫 token。

 以为"封了训练爬虫"能省流量
 流量最大的往往是搜索与用户触发类；训练类封了既省不了多少，还可能丢掉"被模型认识"的机会。

## 怎么验证真假（三层，从硬到软）
 ① 官方 IP 段（最硬）
 Google / OpenAI / Perplexity / Apple / Bing 都发布**机器可读的 IP 段 JSON**；360 在帮助页给出 6 个网段。命中即确认。

 ② 反查域名（rDNS）
 反解 IP → 域名应属于厂商（如 Googlebot 落 *.googlebot.com；字节落 *.byted.org；Common Crawl 落 *.commoncrawl.org）。⚠️ 360 官方说明其不支持 nslookup，只能用 IP 段。

 ③ 行为判定
 真爬虫通常在读 `robots.txt`、`sitemap.xml` 与正常页面；扫描器则会去问 `.env`、`wp-config`、`actuator` 之类的敏感路径。**这一层最适合快速判断可疑来源。**

## 常见问题
 封了 GPTBot，ChatGPT 就看不到我的站了吗？
 不一定。ChatGPT 的**实时浏览**走的是 ChatGPT-User，**检索索引**走 OAI-SearchBot —— 二者与 GPTBot 相互独立。只封 GPTBot 通常不影响 ChatGPT 的实时引用与检索，但会退出"训练语料"。

 国内 AI 爬虫值得放行吗？
 值得。中文用户的主入口之一就是国内 AI 搜索与助手；这些爬虫多数没有公开 IP 段，难以做精细控制，**从内容侧欢迎**（robots 放行 + 内容结构化）是最省事的做法。

 为什么清单里有些爬虫"没有官方来源"？
 国内部分厂商（如深度求索、智谱）目前没有发布爬虫说明页或 IP 段。我们**只观测、不猜测**：这类条目会明确标注"未获官方确认"，并以行业目录交叉验证作为参考。

 我能用这份清单做什么？
 配置 robots.txt 放行策略、在日志中识别 AI 爬虫/扫描器、判断"某个自称某爬虫"的请求是否可信。**不要**仅凭 UA 去封禁来源 —— 误封爬虫会直接影响收录与 AI 引用。

 ![闲鱼下单]() 闲鱼下单

 ![微信扫码]() 微信扫码

 购买与咨询
 批量采购 · 接入协助 · 使用问题
 仅结算与技术支持，**不提供投资建议**。

 相关
 如果你要把数据接给 AI Agent（而不是只被爬取）：

 [MCP 接入指南](/mcp)[国内平台接入教程](/docs/mcp-china)
