AI 爬虫清单与校验(2026)
国内外 AI 爬虫的完整对照:谁能放行、谁是检索、谁是用户触发;以及怎么用官方 IP 段与反查验证真伪(UA 可伪造,不能只看名字)。
为什么先分清三类(放行策略的基础)
同一个厂商常按用途跑多个爬虫 —— 封了训练爬虫不会影响它的检索与用户触发爬虫。混淆三者是最常见的误封来源:
| 类别 | 做什么 | 代表 token | 建议 |
|---|---|---|---|
| 训练类 | 抓内容进模型训练语料 | GPTBot · ClaudeBot · Google-Extended · CCBot · Applebot-Extended · Bytespider · meta-externalagent | 按你的内容策略决定(我们放行:内容公开,被认识才能被推荐) |
| 检索类 | 为 AI 检索建索引 → 回答时引用你的页面 | OAI-SearchBot · PerplexityBot · Claude-SearchBot · MistralAI-Index | 建议放行 —— 这是 AI 引用你的直接入口 |
| 用户触发类 | 用户当场提问 → 实时抓你的页面作答 | ChatGPT-User · Perplexity-User · Claude-User · MistralAI-User | 建议放行 —— 用户在问,抓不到就丢机会 |
抓内容进模型训练语料
按你的内容策略决定(我们放行:内容公开,被认识才能被推荐)
为 AI 检索建索引 → 回答时引用你的页面
建议放行 —— 这是 AI 引用你的直接入口
用户当场提问 → 实时抓你的页面作答
建议放行 —— 用户在问,抓不到就丢机会
清单(含官方来源,可点开核对)
下表每个 token 都标注了官方来源;没有官方来源的会如实说明(只观测、未获官方确认),不猜测、不编造。
| token / User-Agent | 厂商 | 类别 | 官方来源 |
|---|---|---|---|
| GPTBot | OpenAI | 训练 | openai.com/gptbot.json(IP 段 JSON) |
| OAI-SearchBot | OpenAI | 检索 | openai.com/searchbot.json |
| ChatGPT-User | OpenAI | 用户触发 | openai.com/chatgpt-user.json |
| ClaudeBot | Anthropic | 训练 | claude.com/crawling/bots.json(IP 段) |
| Claude-SearchBot | Anthropic | 检索 | 同上(官方 2026-02 明确三爬虫框架) |
| Claude-User | Anthropic | 用户触发 | 同上 |
| PerplexityBot | Perplexity | 检索 | perplexity.ai/perplexitybot.json |
| Perplexity-User | Perplexity | 用户触发 | perplexity.ai/perplexity-user.json |
| Googlebot | 搜索 | developers.google.com/static/crawling/ipranges/common-crawlers.json | |
| Google-Extended | 训练(token) | 同上 —— 只影响训练,不影响搜索排名 | |
| Google-Agent | 用户触发 | 同上(2026-03 新增) | |
| Bingbot | Microsoft | 搜索(Copilot 也用它) | bing.com/toolbox/bingbot.json |
| Applebot / Applebot-Extended | Apple | 搜索 / 训练 token | search.developer.apple.com/applebot.json |
| Amazonbot / Amzn-SearchBot / Amzn-User | Amazon | 训练 / 检索 / 用户触发 | developer.amazon.com/amazonbot(官方推荐 rDNS 验证) |
| CCBot | Common Crawl | 训练(公开语料) | 官方约定:rDNS 反查到 *.commoncrawl.org |
| meta-externalagent / Meta-ExternalFetcher | Meta | 训练 / 用户触发 | developers.facebook.com/docs/sharing/webmasters/crawler |
| Bytespider | 字节(豆包 / 抖音搜索) | 训练 | zhanzhang.toutiao.com/docs/intro/26899(《关于Bytespider》· 官方 rDNS 后缀 .byted.org) |
| DoubaoBot | 字节(豆包) | AI Agent | 行业目录有记录;官网未见独立说明(与 Bytespider 是两个爬虫) |
国内 AI 爬虫
国内厂商的公开资料整体少于国际(多无 IP 段 JSON):有官方页的已标注;没有的如实说明。
| token / User-Agent | 厂商 | 类别 | 官方来源 |
|---|---|---|---|
| Baiduspider / Baiduspider-render | 百度 | 搜索 / 渲染 | www.baidu.com/robots.txt(官方声明) |
| Sogou web spider / Sogou inst spider | 搜狗(腾讯) | 搜索 | www.sogou.com/robots.txt(官方声明) |
| 360Spider | 360 | 搜索 | www.so.com/help/spider_ip.html —— 官方给出 6 个 IP 段,并提示"不要误拦截";官方说明其不支持 nslookup 查询(只能用 IP 段判定) |
| Kimi-SearchBot | 月之暗面(Kimi) | 检索 | kimi.ai/policies/kimi-crawlers(《Kimi Crawlers》· 官方政策页) |
| DeepSeekBot | 深度求索 | 训练 | 官方未见爬虫说明页;行业目录记为"不遵守 robots.txt" |
| ChatGLM-Spider | 智谱 | 训练 / 抓取 | 官方未见说明页(行业目录中该条亦标注信息不完整) |
| QwenBot / TongyiBot / Qwen-User | 阿里(通义千问) | 训练 / 检索 / 用户触发 | 官方英文资料较少;行业目录有时间记录 |
| PetalBot | 华为(花瓣搜索) | 搜索 | 行业目录记为"遵守 robots.txt";官网未见独立说明页 |
| YisouSpider | 阿里(神马搜索) | 搜索 | 官方站存在(zhanzhang.sm.cn),但未见 token 声明 |
最常见的误封错误
下面第一条是每年都在发生的损失:
会把检索类与用户触发类一起禁掉 —— 结果是从 AI 搜索里彻底消失,AI 回答里不再引用你,而训练照旧(别人家的语料里可能还有你)。正确做法是按类别分别决定:训练随你、检索与用户触发建议放行。
UA 可伪造:伪装成 ChatGPT/Claude 的扫描器很常见(真实案例里它们会去打 `/.env`、`/wp-config`、`/actuator` 这类管理路径)。判定必须看行为(是否抓 robots/sitemap/正常页面)。
在 `robots.txt` 里看到 `/xxxai/*` 这类路径,是目录名,不是爬虫 token。
流量最大的往往是搜索与用户触发类;训练类封了既省不了多少,还可能丢掉"被模型认识"的机会。
怎么验证真假(三层,从硬到软)
Google / OpenAI / Perplexity / Apple / Bing 都发布机器可读的 IP 段 JSON;360 在帮助页给出 6 个网段。命中即确认。
反解 IP → 域名应属于厂商(如 Googlebot 落 *.googlebot.com;字节落 *.byted.org;Common Crawl 落 *.commoncrawl.org)。⚠️ 360 官方说明其不支持 nslookup,只能用 IP 段。
真爬虫通常在读 `robots.txt`、`sitemap.xml` 与正常页面;扫描器则会去问 `.env`、`wp-config`、`actuator` 之类的敏感路径。这一层最适合快速判断可疑来源。
常见问题
不一定。ChatGPT 的实时浏览走的是 ChatGPT-User,检索索引走 OAI-SearchBot —— 二者与 GPTBot 相互独立。只封 GPTBot 通常不影响 ChatGPT 的实时引用与检索,但会退出"训练语料"。
值得。中文用户的主入口之一就是国内 AI 搜索与助手;这些爬虫多数没有公开 IP 段,难以做精细控制,从内容侧欢迎(robots 放行 + 内容结构化)是最省事的做法。
国内部分厂商(如深度求索、智谱)目前没有发布爬虫说明页或 IP 段。我们只观测、不猜测:这类条目会明确标注"未获官方确认",并以行业目录交叉验证作为参考。
配置 robots.txt 放行策略、在日志中识别 AI 爬虫/扫描器、判断"某个自称某爬虫"的请求是否可信。不要仅凭 UA 去封禁来源 —— 误封爬虫会直接影响收录与 AI 引用。


批量采购 · 接入协助 · 使用问题
仅结算与技术支持,不提供投资建议。