知识库 / 阶段 7 · 站点配置 · 风险与合规 / 搜索引擎优化(SEO) ↗ / 第 092 节

网站CDF机器人爬取规则机器人爬取规则

网站CDF机器人爬取规则#

一、放行搜索引擎(最重要,确保 SEO 不受影响)

这些 bot 必须放行:

  • Googlebot

  • Googlebot-Image / AdsBot-Google 等所有 Google bot

  • Bingbot

  • YandexBot

Cloudflare 自带“Verified Bots”识别,最好直接启用。

✔ 启用 Cloudflare Verified Bots#

位置:
Security → Bots → Allow Verified Bots

这样 Cloudflare 会自动放行:

  • Googlebot

  • Bingbot

  • Yandex

  • Applebot

  • Linkedinbot

  • Pinterestbot

  • 等所有正规 bot

你无需写额外规则。

🟧 二、限速:所有 AI 机器人(每秒 5 次)#

以下 AI bot 都应限制:

名称 User-Agent 包含
GPTBot GPTBot
ChatGPT-user ChatGPT
ClaudeBot ClaudeBot / anthropic-ai
PerplexityBot Perplexity
Facebook LLaMA crawler facebookexternalhit
Baidu AI bot Baiduspider-render/AI

📌 Cloudflare WAF 限速规则(可直接复制)#

进入:
Security → WAF → Rate Limiting → Create Rule

条件:#

(

http.user_agent contains "GPTBot" or

http.user_agent contains "ChatGPT" or

http.user_agent contains "ClaudeBot" or

http.user_agent contains "anthropic" or

http.user_agent contains "Perplexity" or

http.user_agent contains "facebookexternalhit"

)

限速设置:#

  • Threshold: 5

  • Period: 1 second

  • Action: Block 或 Challenge

  • Timeout: 10 seconds

✔ 你要的 AI 爬虫限速(每秒 5 次)就实现了
✔ 不会影响 SEO
✔ 不会误伤正常用户

🟫 三、限速 “一般爬虫” 每秒 5 次#

一般爬虫:

  • bot

  • crawler

  • spider

  • python-requests

  • Scrapy

  • curl / wget

  • 某些 SEO 工具机器人

📌 Cloudflare WAF 限速规则(可直接复制)#

条件:#

(

lower(http.user_agent) contains "bot" or

lower(http.user_agent) contains "crawler" or

lower(http.user_agent) contains "spider" or

lower(http.user_agent) contains "scrapy" or

lower(http.user_agent) contains "python" or

lower(http.user_agent) contains "curl" or

lower(http.user_agent) contains "wget"

)

and not cf.client.bot

⚠ and not cf.client.bot → 确保不会误伤 Google / Bing / Yandex

限速设置:#

  • Threshold: 5 requests

  • Period: 1 second

  • Action: Challenge(推荐)

  • Timeout: 10 seconds

🟪 四、伪装机器人(隐藏 User-Agent / 无 Accept-Language)#

许多爬虫会伪装成浏览器 UA,但会暴露这些特征:

  • UA 为空

  • Accept-Language 为空

  • 请求频率异常高

  • 来自数据中心(CF 能识别)

📌 Cloudflare Firewall Rule(非限速,直接 Challenge)#

条件:#

(

http.user_agent eq "" or

http.accept_language eq "" or

ip.geoip.asnum in { 例如 AS12389, AS14061, AS45102 等数据中心 ASN }

)

and not cf.client.bot

Action:Challenge

🟩 五、最终整合策略(完整方案)#

以下是你的最终策略逻辑,超级清晰易用:

🎯 1. 放行合法搜索引擎(自动)#

开启:

  • Allow Verified Bots ✔

🎯 2. 限速所有 AI BOT(5 次/秒)#

Example WAF Rule:

(http.user_agent contains "GPTBot" or

http.user_agent contains "ChatGPT" or

http.user_agent contains "ClaudeBot" or

http.user_agent contains "anthropic" or

http.user_agent contains "Perplexity")

→ Rate limit 5 rps

🎯 3. 限速所有一般爬虫(5 次/秒)#

(

lower(http.user_agent) matches "(bot|crawler|spider|scrapy|python|curl|wget)"

)

and not cf.client.bot

→ Rate limit 5 rps

🎯 4. 阻挡伪装机器人#

(http.user_agent eq "" or http.accept_language eq "")

and not cf.client.bot

Action: Challenge

🟦 六、效果总结(非常清晰)#

类型 结果
Google / Bing / Yandex 完全放行(SEO 100% 安全)
GPTBot / ClaudeBot 等 AI 爬虫 每秒最多 5 次(超速封禁)
一般爬虫 每秒最多 5 次
伪装机器人 自动挑战或阻止
正常用户 完全不受影响

这是目前最“SEO 友好 + 最强防 AI 抓取 + 最稳定”的策略组合。