AI 采集网页资料保存方案

Lyumbreit 2026-08-28 10:44 1

个人最近的一个任务,目的是在收集各类实体的官方网站。这类网站通常限制较少,可直接公开访问。


由于项目需要采集粒度较细的个人信息,需要留存导出的网页原始数据,后续再调用其他的AI Agent进行网页的AI的处理和阅读。


为此,我调研并比较了下各个AI采集工具,形成了最终的方案,在此分享出来。也欢迎更有经验的大佬提供一些优化思路。




工具能力对比
































































工具 动态页面 认证页面 图片保存 适用场景 复杂度
wget ^-^ (自动下载所有资源) 静态/简单页面
curl ^-^ (需额外处理) 下载单个文件
webfetch 快速提取文本
defuddle 清理后 Markdown
playwright CLI ^-^ (–load-state) 需脚本支持 动态/认证页面
Playwright + 自定义脚本 统一方案 中高

最终方案
































情境 特征 工具 说明
情境一 静态 HTML,无需 JS,无验证 wget GET 返回完整 HTML,无重定向到验证页。最快,首选
情境二 需 JS 动态渲染(SPA/React/Vue),无验证门槛 node + Playwright API (headless: true) 返回空壳页时用 headless 渲染;支持 -Channel 选择浏览器
情境三 需要验证/登录/CAPTCHA node + Playwright API (headless: false) + storageState 有头浏览器 + 复用已保存的认证态;支持 msedge / chrome

最新回复 (1)
  • slk 09-12 17:45
    1

    是网页下载嘛,有一个插件不知道帮不帮得上忙




    之前在crx搜搜上看到的

* 帖子来源Linux.do
返回