预期设想是给定目标站,给定目标然后llm分析目标站,获取关键标签的相关规则组合。 然后生成一个代码或者json组件交给爬虫程序触发执行。
但是有几个问题, dom感觉动不动就超llm上下文上限,导致工作异常 另一个是网页经常刷新,频繁触发更新规则,导致token消耗偏高 再者是网页部分元素和js结合的行为,js又是混淆代码,llm经常直接触发设定的超时条件卡死了。
现在这个路径有成熟方案吗?还是说我走错方向了。