【工具调研】影刀这个工具,目前看起来只能支持前台,且会抢占鼠标?有那种支持后台操作、且不抢占鼠标的工具吗?

huzz 2026-09-29 13:02 1

我自己在做一个支持后台、不抢占鼠标的工具(通过任务编排来自动操作Windows应用)。

目前已经有基础的功能了,但不知道现在是不是已经有相关的工具了。


因为之前做私有化AI网关浪费了很多时间精力

(自己做了个私有化部署的AI网关,目前免费闭源,本来想靠这个赚点外快,结果发现越来越搞不下去了),

所以想在深入做这个工具之前做个调研。


有佬知道的吗?

最新回复 (11)
  • chinajojo 09-29 13:15
    1楼

    影刀我觉得不太行了吧,现在这年头RPA直接转SKILL好了,微软有一个SKILL录制工具,录制你的操作转换为SKILL,GitHub - microsoft/skill-recorder: Desktop app that records your on-screen work session and uses the GitHub Copilot CLI to reconstruct it as an intent + ordered steps, then builds a reusable Skill or Automation for Microsoft Scout, Microsoft Copilot Cowork, or Copilot Studio. · GitHub,然后SKILL扔给AI执行不就行了

  • 我妻善逸u 09-29 13:17
    2楼

    用影刀自带的浏览器就不会抢了 ^-^

  • huzz 楼主 09-29 13:18
    3楼

    这种每次运行都要用AI啊,这成本太大了。


    我考虑做的是,可以利用AI来自动录制生成脚本,后续执行的时候不让AI介入。

  • huzz 楼主 09-29 13:19
    4楼

    它也只能是操作浏览器吧,我说的是Windows应用。

  • TimelessPeak 09-29 13:21
    5楼

    之前我自己的RPA也想做成这种方式,但是感觉太难了,网站交互性技术栈太多样化了

  • 我妻善逸u 09-29 13:22
    6楼

    sry 没注意审题,影刀对windows不太友好,浏览器支持的还行。

  • huzz 楼主 09-29 13:23
    7楼

    我其实不太了解的是,为啥这种自动化工具全部依赖于html元素识别。


    为啥不采用“人眼看”的这种方式?


    人的操作都是先看到某个地方有某个按钮,就去点击它。那为何不采用截图去定位呢?这种方式理论上可以使用在任何的窗口上,包含非浏览器的窗口。

  • TimelessPeak 09-29 13:28
    8楼

    元素识别准确率交出错概率要比屏幕识图强太多了,截图定位屏幕尺寸,滚动条,字体,不同操作系统任何一项都会影响识别成功率.除非运行时融合ai还好一些.

  • 长的高高兽 09-29 13:28
    9楼

    而且影刀在操作紫鸟这种指纹浏览器的时候,只能一个个浏览器操作,没法打开多个浏览器运行同一套流程

  • huzz 楼主 09-29 13:31
    10楼

    弊端也是有的,采用元素识别只能用在标准的Windows程序或者web上,如果是使用一些非标Windows控件做的程序,就没办法识别。


    你说的精度和滚动条的这种,其实不算是问题:图片识别的算法可以解决精度的问题(不一定要像素的精准对比),滚动条是通过编排解决的,比如:


    while 出现滚动条
    拖动滚动条;
    识别可视化区域是否存在某个截图;
    if 存在
    点击截图的位置
  • huzz 楼主 09-29 13:32
    11楼

    那我可以理解,目前没有很好的工具可以解决后台操作、不抢占键鼠的工具么?


    咱不说影刀,我个人也是认为它有局限性的。

* 帖子来源Linux.do
返回