最近服务器负载一直下不来,经常到 100%,结果发现是各大 AI 厂商的机器人爬虫,疯狂请求我的网站

qxmqh 2026-08-22 14:02 1

从上周开始,我上线了一个小网站,需要一个关键字来搜索内容,结果被 chagptbot,claudebot,谷歌,还有 meta facebook 的这些机器人 疯狂提交参数,然后读取返回结果,我一直以为是中病毒了,结果今天一看网站日志,我去。

全是
" Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; [email protected])"
Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/151.0.7922.137 Mobile Safari/537.36 (compatible; GoogleOther)"

几乎达到了 攻击级别的访问。

把我小站的流量 和 负载 干满了。

在 nginx 里面加了一个

if ($http_user_agent ~* "(GPTBot|ChatGPT-User|ClaudeBot|anthropic-ai|PerplexityBot|Bytespider|GoogleOther|meta-externalagent|MJ12bot)") {
return 403;
}


整个负载 瞬间就下来了。

没人管这帮机器人吗。
最新回复 (8)
  • SkywalkerJi 08-22 14:03
    1
    cf 有个 bot 过滤还行
  • loading 08-22 14:13
    2
    还算良心,带 bot 标签请求。
  • opengps 08-22 14:32
    3
    但是这样做,别人问 ai 问题的时候,也就不会出现来源与你网站的答案了
  • opengps 08-22 14:33
    4
    如果你确实不希望机器人访问全部内容,那还是得做成半封闭的,要注册帐号才能访问内部数据的结构
  • Dragonish3600 08-22 14:36
    5
    很多不是 AI 机器人,而是伪装成机器人的爬虫。
    直接封所有云厂商 IDC 的 ip 最有用
  • jasonjie2015 08-22 23:41
    6
    这么多学问啊
  • moooooooo 08-22 23:56
    7
    cf 自带过滤,还可以加个限速
  • zz177060 08-23 12:21
    8
    所以我不做开放网站的平台。只做内部或者内部开号才行的那种
* 帖子来源V2EX
返回