知识库 / 阶段 7 · 站点配置 · 风险与合规 / 搜索引擎优化(SEO) ↗ / 第 092 节
网站CDF机器人爬取规则机器人爬取规则
网站CDF机器人爬取规则#
一、放行搜索引擎(最重要,确保 SEO 不受影响)
这些 bot 必须放行:
-
Googlebot
-
Googlebot-Image / AdsBot-Google 等所有 Google bot
-
Bingbot
-
YandexBot
Cloudflare 自带“Verified Bots”识别,最好直接启用。
✔ 启用 Cloudflare Verified Bots#
位置:
Security → Bots → Allow Verified Bots
这样 Cloudflare 会自动放行:
-
Googlebot
-
Bingbot
-
Yandex
-
Applebot
-
Linkedinbot
-
Pinterestbot
-
等所有正规 bot
你无需写额外规则。
🟧 二、限速:所有 AI 机器人(每秒 5 次)#
以下 AI bot 都应限制:
| 名称 | User-Agent 包含 |
| GPTBot | GPTBot |
| ChatGPT-user | ChatGPT |
| ClaudeBot | ClaudeBot / anthropic-ai |
| PerplexityBot | Perplexity |
| Facebook LLaMA crawler | facebookexternalhit |
| Baidu AI bot | Baiduspider-render/AI |
📌 Cloudflare WAF 限速规则(可直接复制)#
进入:
Security → WAF → Rate Limiting → Create Rule
条件:#
(
http.user_agent contains "GPTBot" or
http.user_agent contains "ChatGPT" or
http.user_agent contains "ClaudeBot" or
http.user_agent contains "anthropic" or
http.user_agent contains "Perplexity" or
http.user_agent contains "facebookexternalhit"
)
限速设置:#
-
Threshold: 5
-
Period: 1 second
-
Action: Block 或 Challenge
-
Timeout: 10 seconds
✔ 你要的 AI 爬虫限速(每秒 5 次)就实现了
✔ 不会影响 SEO
✔ 不会误伤正常用户
🟫 三、限速 “一般爬虫” 每秒 5 次#
一般爬虫:
-
bot
-
crawler
-
spider
-
python-requests
-
Scrapy
-
curl / wget
-
某些 SEO 工具机器人
📌 Cloudflare WAF 限速规则(可直接复制)#
条件:#
(
lower(http.user_agent) contains "bot" or
lower(http.user_agent) contains "crawler" or
lower(http.user_agent) contains "spider" or
lower(http.user_agent) contains "scrapy" or
lower(http.user_agent) contains "python" or
lower(http.user_agent) contains "curl" or
lower(http.user_agent) contains "wget"
)
and not cf.client.bot
⚠ and not cf.client.bot → 确保不会误伤 Google / Bing / Yandex
限速设置:#
-
Threshold: 5 requests
-
Period: 1 second
-
Action: Challenge(推荐)
-
Timeout: 10 seconds
🟪 四、伪装机器人(隐藏 User-Agent / 无 Accept-Language)#
许多爬虫会伪装成浏览器 UA,但会暴露这些特征:
-
UA 为空
-
Accept-Language 为空
-
请求频率异常高
-
来自数据中心(CF 能识别)
📌 Cloudflare Firewall Rule(非限速,直接 Challenge)#
条件:#
(
http.user_agent eq "" or
http.accept_language eq "" or
ip.geoip.asnum in { 例如 AS12389, AS14061, AS45102 等数据中心 ASN }
)
and not cf.client.bot
Action:Challenge
🟩 五、最终整合策略(完整方案)#
以下是你的最终策略逻辑,超级清晰易用:
🎯 1. 放行合法搜索引擎(自动)#
开启:
- Allow Verified Bots ✔
🎯 2. 限速所有 AI BOT(5 次/秒)#
Example WAF Rule:
(http.user_agent contains "GPTBot" or
http.user_agent contains "ChatGPT" or
http.user_agent contains "ClaudeBot" or
http.user_agent contains "anthropic" or
http.user_agent contains "Perplexity")
→ Rate limit 5 rps
🎯 3. 限速所有一般爬虫(5 次/秒)#
(
lower(http.user_agent) matches "(bot|crawler|spider|scrapy|python|curl|wget)"
)
and not cf.client.bot
→ Rate limit 5 rps
🎯 4. 阻挡伪装机器人#
(http.user_agent eq "" or http.accept_language eq "")
and not cf.client.bot
Action: Challenge
🟦 六、效果总结(非常清晰)#
| 类型 | 结果 |
| Google / Bing / Yandex | 完全放行(SEO 100% 安全) |
| GPTBot / ClaudeBot 等 AI 爬虫 | 每秒最多 5 次(超速封禁) |
| 一般爬虫 | 每秒最多 5 次 |
| 伪装机器人 | 自动挑战或阻止 |
| 正常用户 | 完全不受影响 |
这是目前最“SEO 友好 + 最强防 AI 抓取 + 最稳定”的策略组合。