ai爬虫遇到robots限制

jppp 2026-10-05 16:17 1

佬们,想要ai爬一些官方网站的新闻报告,总是遇到robots限制,ai绕不开无法爬取,有什么解决办法吗

最新回复 (17)
  • Hughpig 10-05 16:18
    1楼

    呃?指的是AI自身道德标准高不愿意帮你爬 还是被反爬卡了

  • zhongcheng1024 10-05 16:18
    2楼

    让AI写个脚本,通过脚本抓取网页然后汇报给AI处理就行了。

  • 墨尘 10-05 16:19
    3楼

    虽然…但是……robots就是用来限制爬虫的吧

  • 挨个搞 10-05 16:20
    4楼

    爬网站不都是agent干的活吗?

    插件啊,mcp啊好多的

    实在不行,直接curl 也可以啊

  • jppp 楼主 10-05 16:21
    5楼

    ai自身道德不愿意爬。。。。。。

  • Hughpig 10-05 16:23
    6楼

    换个甲薄的,或者sys prompt里破限一下 站内佬有现成方案去搜搜看

  • jppp 楼主 10-05 16:30
    7楼

    因为不是只爬一个网站,我在做全球新闻搜集,总共接近1000个新闻网站和官网,每天定时爬最新的新闻报道。用ai帮我抓固定栏目定时采集。其中有一部分是有robtos协议限制的,ai读取后就退出爬取了。

  • jppp 楼主 10-05 16:31
    8楼

    让ai写爬虫脚本好像也不行吧,网站有robots协议的过不去

  • zhongcheng1024 10-05 16:36
    9楼

    GlM可以,实测这个模型不会拒绝这个要求。

  • zhongcheng1024 10-05 16:37
    10楼

    我也是做这个的。 已经上线很久了。 不过没有用AI去爬,太费钱了。

  • 旋律 10-05 16:37
    11楼

    新闻站点一般都有RSS聚合订阅地址,直接采集就行吧,这样就无需处理rebots。

  • jppp 楼主 10-05 16:40
    12楼

    目前大部分是通过RSS采集的,但还有一部分没有的ai爬不到

  • jppp 楼主 10-05 16:42
    13楼

    我也没用ai爬,只是让ai搜集了所有的网站栏目,然后让ai写的脚本每天定时抓更新内容。爬取过程不调用ai。但是robots限制的网站ai不愿意给我写脚本爬 ^-^

  • jppp 楼主 10-05 16:42
    14楼

    佬的项目有链接吗,想注册登录学习一下

  • lanvent 10-05 16:57
    15楼

    简单方法就是hook下,让robots.txt从相关结果里消失

  • zhongcheng1024 10-05 22:15
    16楼

    (帖子已被作者删除)

  • zhongcheng1024 10-05 22:16
    17楼
* 帖子来源Linux.do
返回