个人最近的一个任务,目的是在收集各类实体的官方网站。这类网站通常限制较少,可直接公开访问。
由于项目需要采集粒度较细的个人信息,需要留存导出的网页原始数据,后续再调用其他的AI Agent进行网页的AI的处理和阅读。
为此,我调研并比较了下各个AI采集工具,形成了最终的方案,在此分享出来。也欢迎更有经验的大佬提供一些优化思路。
工具能力对比
最终方案
wget
GET
node
headless: true
-Channel
headless: false
storageState
msedge
chrome
是网页下载嘛,有一个插件不知道帮不帮得上忙
之前在crx搜搜上看到的