AI抓取瑟瑟网站的方法

Ein 2026-08-12 18:54 1

在VPS部署了云盘,想走VPS的上行下行上传文件,这样就不用跑本地的流量还能美美看了。

其它的步骤已经跑通,目前就卡在资源检索这一步上,因为很多网站其实有一定的防护措施,比如强制打开cloudflare盾,比如年龄认证之类的,直接让codex去做容易起码有两个问题



  1. codex自动化水平不行,搜两下直接给anti-bot了,甚至挂着动态家宽触发Google的人机验证。

  2. codex奇妙的道德水平,在破限提示词下愿意逆向渗透,但是不愿意替你点击cf和年龄认证(尤其是这个),以及版权威胁。

  3. 其它工具的局限。Grok-search整合了grok以及firecrwal和ta那个啥,但是给出的结果不够具体到URL以及其中的描述和神秘链接,更不要说最后一程的GPT还会审查。


所以不太懂有什么好办法。我只是希望能够自动筛选一些资源 + 字幕,然后让AI搬运到云盘喵。

是不是爬虫之类的更合适?

最新回复 (12)
  • Neptune 08-12 19:10
    2

    什么涩涩网站,链接发我看看,我帮你研究一下(可能

  • Ein 楼主 08-12 19:13
    3

    javdb/javbus/javlibrary/某花堂之类的 ^-^总是抓不全

  • 水星 08-12 19:19
    4

    大毛的搜索引擎自动pass掉jav的,但是可以通过车牌的方式到miss的资源站中,基本上都是几个大站的搬运吧,还能有漏网之鱼? ^-^,可以通过关键词筛选,比如mosaic或者是english,现在没有标注的一般都只有fc了,不过也是默认有♞

  • leoshi 08-12 19:26
    5

    年轻真好,需求量这么大呢哈哈哈(注意身体,手动狗头

  • Ein 楼主 08-12 19:37
    6

    纯粹仓鼠癖犯了hh。之前硬盘瓶颈给我卡住了,忽然学会部署了个好用的云盘服务,继续折腾…

  • anxiaoze 08-12 19:38
    7

    sis001这个下载链接能不能转链呀

  • 亚斯娜 08-12 19:39
    8

    98堂是付费的网站你怎么抓的,看不到内容

  • peter4lee 08-12 19:49
    9

    sukebei好抓一点吧, 基本没有门禁, 就是下载速度不稳定. 搭配一个刷流盒子+RSS+刮削器, 简直多的看不过来

  • superNic 08-13 00:06
    10

    我不太明白,你到VPS的流量是免费的吗?

    没用过AI浏览器当爬虫,之前弄过传统爬虫,过反爬的方法十分朴素,浏览器上去点一次,然后把cookie复制一份交给程序,之后自动化执行。

    我的想法是监控自己喜欢的标签、演员页面,每天爬一次新增作品,看预览图判断喜不喜欢。喜欢之后再下载,本质还是一个人在回路的流程。毕竟萝卜青菜各有喜爱,自己的口味要自己判断。

  • Ein 楼主 08-13 00:08
    11

    甲骨文10T出站,下载上传都在机器上完成的话就是10TB的上传量。不过我肯定不会这么狂野,因为我觉得机器有挺大概率被ban吧。

    我也提出了给AIcookie的意见,但是它坚持要我每次手动点,可能写个程序爬会好一点?

    我的想法是我刷到喜欢的去全网搜资源,然后看骑兵步兵、大小、字幕、做种人数之类的决定下载哪个~

  • nichang 08-13 00:08
    12

    有什么画质高一些的站吗。肉视频和小黄书好像都只有720p,看的不爽

  • chapiom 08-13 00:31
    13

    javbus



    有个叫javbus-api的项目,可以搭建镜像站点或者部署到vercel,这样没什么限制挺好用。

* 帖子来源Linux.do
返回