个人业余项目,做了一个可以物理操作 iPhone 的 agent,不知道有商业前景吗?

fzuccq 2026-07-27 14:24 1

淘宝美团常用的 app ,都没有 API ,agent 没法直接调用。走 ADB 容易被风控,豆包手机那条路似乎也很坎坷不好走。


我想,如果能用硬件直接托管 iPhone ,用摄像头观察屏幕,用机械臂点击,或许能绕过大部分风控检测。搞了几个月,agent 跑通了,使用起来还可以。


目前,最大的问题不是可行性的问题,是 token 太贵,点击一次 token 花费 0.2 元。


大家觉得这种 agent 有商业前景吗?


项目地址: https://github.com/physiclaw/PhysiClaw


硬件组装手册和代码都开源,硬件 DIY 成本 1000 元左右。

最新回复 (100)
  • sillydaddy 07-27 14:27
    1
    有没有钱景不知道,不过我一直在找呢: /t/1004095
    另外问下,耗费贵是因为图片太耗 token 吗?
  • network127001 07-27 14:29
    2
    你这种大规模应用后不就是主板机,恶意刷单
  • bwnjnOEI 07-27 14:29
    3
    我刚在 x 上刷到这个东西叫 lumi 吧
  • flyqie 07-27 14:31
    4
    这种感觉得考虑法律风险。
  • fzuccq 楼主 07-27 14:31
    5
    @sillydaddy 每一次点击动作,agent 都需要观察屏幕才能决策,prompt 需要把图片放到 context 里面,当然 context 做了很多优化,但 token 还是很贵。
  • fzuccq 楼主 07-27 14:33
    6
    @flyqie 法律风险肯定要考虑,不过这是开源软件,我只做 harness ,不运营。
  • bwnjnOEI 07-27 14:35
    7
    @bwnjnOEI https://x.com/saameeey/status/2081422451418743066?s=61
  • fzuccq 楼主 07-27 14:36
    8
    @network127001 只是觉得日常点外卖、买火车票、挂号,这些事,应该 AI 来做,人们只需要交代一声就行了。
  • sillydaddy 07-27 14:37
    9
    我记得看到过 Google 有 Gemini Live API ,也就是流式处理图片和声音,延迟很低。价格不知道怎么样。
  • timethinker 07-27 14:37
    10
    黑灰产自动化可能会有用,可以将一些常规且重复的操作流程,利用 AI 烘培为基于 OCR 的程序化操作,类似于生成一次性的中间脚本,这样就不用经过 AI ,也不用消耗 Token ,只在某些意外情况无法解决的时候,再由 AI 介入进行修复,然后更新 Case 。
  • jayeli 07-27 14:38
    11
    本地部署的大模型可以跑吗?
  • fzuccq 楼主 07-27 14:38
    12
    @bwnjnOEI 不知道他这多少钱一套?
  • fzuccq 楼主 07-27 14:39
    13
    @jayeli 本地模型,一是太慢,二是能力不行,容易在陌生界面卡住。
  • fzuccq 楼主 07-27 14:41
    14
    @timethinker 你这烘培称 OCR 的程序化操作思路非常不错,我看看能不能加进来,减少 token 消耗,速度还快。
  • DeadLion 07-27 14:45
    15
    感觉没有前景,中间产物。
    未来“豆包手机”这种更可能是主流。
    或者再进一步没有 app 了,都是 xx-cli ,自己部署一个 xxclaw 就能用了。
  • fzuccq 楼主 07-27 14:48
    16
    @DeadLion 豆包也是命途多舛,agent 是大厂必争之地,能让豆包这没有硬件基础的公司垄断吗?
  • network127001 07-27 14:49
    17
    系统自带的 ai agent 才是趋势,有厂家兜底,这玩意最大的问题就是安全隐私了吧,豆包手机不就被下架了。万一模型投毒 给你钱包刷爆就完了 :(
    @fzuccq
  • fzuccq 楼主 07-27 14:52
    18
    @network127001 安全性是很大的问题,给 agent 权限越大,越方便,出了问题越严重,咱们的许多身家可都在手机上呢。
  • nilaoda 07-27 14:52
    19
    极客湾测续航似乎也是这种
  • kulove 07-27 14:52
    20
    没有前景 自己做也做不到完美 而且手机厂商会自己做的
  • fzuccq 楼主 07-27 14:54
    21
    @kulove 确实,我也不知道,咱们搞技术的人,喜欢拿着锤子找钉子。
  • Nasdaq 07-27 14:55
    22
    请教 OP,能过滑块吗?
  • fzuccq 楼主 07-27 14:57
    23
    @Nasdaq 没遇到滑块验证。iPhone 环境信任度高,操作微信、淘宝没有任何异常需要验证。能不能过,我没试过。
  • Nasdaq 07-27 14:59
    24
    @fzuccq #23 TB 查看卖家店铺营业执照试一下。
  • fzuccq 楼主 07-27 15:04
    25
    @Nasdaq 我刚才手工试验了一下,agent 通不过验证。agent 无法边滑动边观察屏幕,agent 做一个动作,移开触控笔,不遮挡摄像头,才能观察屏幕。
  • Nasdaq 07-27 15:04
    26
    @fzuccq #25 感谢,已 Star 支持。
  • airqj 07-27 15:09
    27
    很多人做这个了
    靠在社交软件里钓男人挣钱
  • qaq13037 07-27 15:10
    28
    看了 B 站视频评论区和当前评论区,为什么非得要求拟人化呢,好像不拟人这个项目就要被处死一样,就比如 op 说的几个场景,买票之类的,根本没有被检测的可能。有些人啊,屁股就是歪的,拿来就想去做灰产。这个项目我觉得挺有意思的,可能很多人都想过这个思路,但是 op 做出来了,也有继续进化的可能,很佩服,已 star
  • fzuccq 楼主 07-27 15:13
    29
    @qaq13037 感谢认可,当前一是硬件 1000 元确实不小门槛,二是 token 贵,也只有黑灰产才会感兴趣。我自己用它在京东七鲜买菜,也挺心疼的。买次生鲜 token 花费 6-7 元。
  • iixy 07-27 15:13
    30
    @timethinker 啊?怎么现在又是蒸馏又是烘焙的,下一步是不是该红烧 ai 了。
  • lumia1020 07-27 15:15
    31
    貌似极客湾做手机续航测试就是这么干的,和楼主想法差不多,只是听说是本地模型来做的。
  • fzuccq 楼主 07-27 15:19
    32
    @iixy 烘培的意思是,把 agent 操作 app 的经常性动作,固定下来,下次 agent 要执行某个操作时,直接触发一连贯动作,就像打游戏出个连招,不用每一步都经过大模型。
  • fzuccq 楼主 07-27 15:21
    33
    @lumia1020 我看过极客湾测试视频,导航相对比较单一,本地模型应该可以跑得动。
  • NeverMore11 07-27 15:22
    34
    对于 Android 来说,adb + uiautomator 方案没有问题,成本还低,基本上视图树、坐标点完成主流程,截图做关键步骤确认。我天天用这个自动化发小红书,没遇到检测。
  • Sunyin 07-27 15:23
    35
    [极客湾手机续航大横评:电池锁容?电量缩水?谁在浑水摸鱼?] https://www.bilibili.com/video/BV1LR336sEFX

    确实,今天刚刷到
  • HeyWeGo 07-27 15:25
    36
    那些上来就说啥完美不完美的听上去就是正确的废话
  • fzuccq 楼主 07-27 15:26
    37
    @NeverMore11 不同技术方案适合不同场景,到没有说哪种最优。但如果你想让 agent 能帮你购物、挂号、缴费、打卡,可能需要更 robust 的技术栈。
  • xue777hua 07-27 15:28
    38
    简单的不需要这个 难得你也过不去(刷脸)
  • fzuccq 楼主 07-27 15:31
    39
    @xue777hua 个人使用的话,拿起手机刷完脸放回去,让 agent 继续做,问题倒也不大。
  • grzhan 07-27 15:31
    40
    有,国内灰产需求很大。尤其是抖音和微信。
  • fzuccq 楼主 07-27 15:32
    41
    @grzhan 我还是希望自己项目能用在正当合法的地方的~
  • ota 07-27 15:33
    42
    软件不行,硬件来凑,手段暴力,但思路的确可以。
    后面优化硬件,小型化,包装成产品,用途太多了,小型外科机器人?哈哈。
    专门一台手机交给硬件,随便点,自己的主力机负责远控,哇靠。以后国产软件都能不装了。
    从 camera - ocr - text - 终端,直接可以分离。

    https://imgur.com/a/d9zEruN
  • xue777hua 07-27 15:37
    43
    @fzuccq 既然让你刷脸 那就是标记你了 多刷几次 就封号了。

    总的来说 成本还是搞 似乎没啥场景是 必须要在手机完成的(感觉只有灰产需要?或 灰产类似?
  • fzuccq 楼主 07-27 15:38
    44
    @ota 目前设计架构确实是这样的,主力手机通过微信远程遥控,发指令任务,专门一个手机交给 agent ,查看微信,用硬件操作 iPhone app ,然后回复。
  • grzhan 07-27 15:38
    45
    @fzuccq 如果平台愿意开放的话它就会直接开放 API 来拥抱 AI Native ,也就不需要这个东西。一些 App 他们风控这么变态就是不希望你自动化。所以这也是这块变成灰产的原因。

    现在一些咸鱼卖滑轨机械臂+摄像头的也会带上 SDK 和自动化脚本软件,应该是有一定产业的。
  • skyemin 07-27 15:38
    46
    所以我的手机得一直放在那吗
  • fzuccq 楼主 07-27 15:39
    47
    @xue777hua 价格高就是原罪。
  • fzuccq 楼主 07-27 15:40
    48
    @skyemin 你需要两台手机,一台主力机你用,一台手机 agent 用来物理操作。
  • fzuccq 楼主 07-27 15:43
    49
    @grzhan 希望远离黑灰产,我做这个,初衷是希望 agent 能成为人们的生活助手,减少日常繁琐事务带来的心智负担。
  • grzhan 07-27 15:52
    50
    @fzuccq 只能说真正在商业上有需求的,也就是商业上能带来利润的主要还是灰产。
  • grzhan 07-27 15:53
    51
    剩下就是作为极客玩具的市场了,但这块由于其实门槛没那么高,不好说哇。先考虑在开源占个生态位?
  • ZhaokunZhang 07-27 15:55
    52
    我前同事也做了一个,AI 自动化测试,路子跟你差不多,https://github.com/dongxinsuperman/ai-phone 已经有公司开始用了,
  • ota 07-27 15:55
    53
    @fzuccq 截图 + OCR + LLM 推理,但这样的问题是延迟+token 。
    问题的核心是“持续视觉理解”,我想到了 yolo 这个,让本地 gpu 跑。
    第二个是,这些 app 虽然不开放 api ,但页面加载的监控是否能做呢?比如加载完成了,就立刻让 agent 去截图。我看你的视频貌似卡了一下,是不是在等页面平稳?
    软+硬?
    纯过程探讨,不涉及可行性和逻辑性,抱歉。
  • ZhaokunZhang 07-27 15:56
    54
    @ZhaokunZhang #52 等等,但好像又不太一样,但是确实用视觉识别+ LLM 推理了。
  • fzuccq 楼主 07-27 15:56
    55
    @grzhan 可能 token 成本降下来,才能进入个人消费者市场吧。
  • dreamdragon 07-27 15:58
    56
    不限制在手机上,直接炒菜
  • fzuccq 楼主 07-27 16:00
    57
    @ota 有个摄像头在手机正上方,视频中没录进去。agent 通过摄像头观察屏幕,不是通过截屏。在执行完一个动作后,把机械臂移开,摄像头拍照,在本地进行 OCR 和图标识别,把识别结果、bbox 列表和原图一起发给大模型,决策下一个动作。
  • spike0100 07-27 16:03
    58
    我看成本更低的方式是用 mac 的 iphone 镜像+本地多模态模型,在镜像模拟点击。就是忘了项目名称叫什么了
  • fzuccq 楼主 07-27 16:05
    59
    @spike0100 这个 mac iphone 镜像就是可扩展性太差,生态锁死在 Apple 上了。
  • ybz 07-27 16:05
    60
    有 API 可以持续录制手机屏幕的啊,就是直播软件用的那个,不需要专门整个摄像头来看着。而且你都这样做了,整越狱 iPhone 啊,越狱后都不用物理操作了,直接软件操作。
  • we1w3i 07-27 16:06
    61
    如果是按你的愿景,那 iOS27 很可能可以实现
  • fzuccq 楼主 07-27 16:10
    62
    @ybz 我初衷是想做个人助理 agent ,总不能指望用户把自己 iPhone 越狱才能用 agent 吧?需要考虑用户易用性,尽量减少配置和设置。
  • fzuccq 楼主 07-27 16:11
    63
    @we1w3i 苹果是有强大号召力的,就看各大厂愿不愿配合了。
  • yuruizhe 07-27 16:15
    64
    让大模型直接操作实体手机,如果指令混入了恢复出厂设置步骤,那岂不是很危险。。。
  • fzuccq 楼主 07-27 16:18
    65
    @yuruizhe 这个 guardrail 需要用户自己来控制,比如,不要把自己的主力机给 agent 操作,账户余额少充点,退出 apple id ,只装必要的 app 。
  • evilHa 07-27 16:20
    66
    你得把一些场景包装好,收费降下来了,比如什么样的动作,调用大模型的次数减少,费用降低,然后包装起来,这样商业化就成功多了。

    一旦某个场景这样跑通,你就可以定制另外一些动作,而且像有些信息采集的,就超级简单了,只需要往下拉,收集信息,不需要 AI 操作。提取信息直接用 OCR 技术就行了,也能省掉 token 钱。

    综合来看,适合做,但是要往深了做,使用成本先降下来。

    当作业余做个小东西吧,先把想挣钱的事情,做好了,自然商业化场景就来了。就跟那个 rapiddns 一样,每年一大笔支出好多年,然后开始卖数据了,也挣了一笔钱。
  • MasterCai 07-27 16:22
    67
    https://www.bilibili.com/video/BV1LR336sEFX/?vd_source=d608e8f69a8f0aec740e78c355e9226f

    手机自动化测试
  • fzuccq 楼主 07-27 16:26
    68
    @evilHa 硬件 DIY 1000 元虽然贵了些,但毕竟是一次性支出。token 要持续花费的。大模型调用确实需要大力优化的方向,一个是一次调用触发连续动作,中间就不需要调用大模型了,第二个是,优先用便宜的模型,卡住了再切换能力更强的大模型。 这些工程难度不小,增加许多项目复杂度。
  • printdarling 07-27 16:27
    69
    @fzuccq 智谱之前不是开源了一个 AutoGLM-Phone-9B 的模型嘛?感觉可以瞅瞅
  • zhangshaohan 07-27 16:27
    70
    我前些日子正在寻找这种,目的是给我京东的订单评价赚京豆,几十个订单自己评价又太麻烦了,还需要传图片
  • fzuccq 楼主 07-27 16:28
    71
    @MasterCai 自动化测试用的最多是本地化视觉模型,对于简单的导航够用。对于能零 skill 配置就导航各种常用 app ,还需要调用最先进的大语言视觉模型。
  • evilHa 07-27 16:29
    72
    @fzuccq #68
    越复杂的项目,越有护城河。

    而且你真的商业化了,就可以自己部署模型了,边界成本低。
  • loveumozart 07-27 16:29
    73
    你的视频演示用的是什么模型啊?
    我自己之前用 qwen3.7 这个多模态来做过 windows 上面的模拟 computer use ,让它下国际象棋,识别然后输出点击操作、拖动棋的操作挺快的,有两个很大的问题:
    1. 靠 llm 多模态识别出来的 x,y 不精准,很多次无法正确拖动棋子。
    2. 靠 llm 本身的聪明程度,后面复杂了会乱下棋,实际上并不懂国际象棋规则,为了让上下文利用起来,最好的方式是每次都新开上下文下棋。
  • fzuccq 楼主 07-27 16:30
    74
    @printdarling 我最近也在寻找能本地部署的开源模型,感谢分享,我回去测试一下 AutoGLM 性能,看能不能集成到本地。如果本地开源模型能驱动 agent ,那 token 成本一下子就可以忽略了。
  • DiamondYuan 07-27 16:30
    75
    我感兴趣。 有成品卖吗?

    我的想法是接入 https://midscenejs.com/ , 做自动化测试
  • Vipcw95 07-27 16:30
    76
    这个感觉和 agent 关系不大啊,识图的方案不需要 agent 吧
  • silencil 07-27 16:34
    77
    之前已经找到一个 也接入了我的 harness 工具,在我的本地安装一个 runner app ,通过拿节点树和截图辅助一起定位操作我的本机 ipone ,实现帮我使用购物 app 来获取 BOM 信息(做些小玩具的时候),不过体感是太慢了也不稳定,也还没优化,晚点再看看你这个
  • fzuccq 楼主 07-27 16:35
    78
    @loveumozart 我演示视频用的是 sonnet-5 ,但 kimi-k2.6, k3 性能也都不错。不能让多模态模型直接看图像输出 x,y bbox ,那样会漂移。我的做法是,在本地先对图片进行 OCR 和 ICON 检测,获取都 bbox 列表,和原图一起,发给大模型。让大模型从 bbox 列表选择,这样输出坐标就很稳定了。
  • xiaomushen 07-27 16:35
    79
    太慢,token 太贵

    建议重点优化高价值场景:崩老头

    我说真的
  • fzuccq 楼主 07-27 16:36
    80
    @DiamondYuan 需要购买零件,DIY ,文档里有组装手册。
  • yohjisakamoto 07-27 16:38
    81
    默认坐标放在右下角是不是好一点,大部分交互设计都是放在屏幕下侧的。另外不是很懂机器人,但是感觉 xy 的复位不需要每次操作都复位一次吧,计算新 x 和 y 就当前点击位置的偏差,然后每 5 次复位一下会有影响吗。感觉可以快很多。另外我觉得你图片压缩上有很大搞头,只要能压缩到不丢失交互信息,费用能减少很多。
  • xiaomushen 07-27 16:38
    82
    @timethinker 可以用来抓淘宝京东,APP 端价格数据。这种方式,不违法
  • fzuccq 楼主 07-27 16:38
    83
    @xiaomushen 只针对特定场景,有固定操作流程,确实能做到低成本和快速响应。我想做的是,无需配置能操作大部分常用 app ,能应付各种 app 导航,这个场景要求确实 token 很贵。
  • DiamondYuan 07-27 16:38
    84
    @fzuccq

    midscenejs 是基于纯视觉做自动化测试的,和你的场景几乎一样。

    你可以参考他的模型选择

    https://midscenejs.com/zh/model-strategy.html


    千问和豆包的视觉模型应该不错。 然后成本应该是不高的。
  • jjtang11 07-27 16:39
    85
    我之前刷过不知道是不是你的,同一台机子操作十几台手机,如果不是的话说明市场早有跟成熟的方案了,你这个一机一控效率太低了
  • zhangli2946 07-27 16:45
    86
    通过物理手段构造的以信息终端为目标的输入, 本质上都是吃政策红利和做政策对抗。
    信息终端必须由人类进行物理操作这一限定而产生。
    限定被打破便是对这个行当颠覆性的外部条件变化。
  • fzuccq 楼主 07-27 16:45
    87
    @yohjisakamoto 手机正上方比较高的地方有摄像头,拍摄手机屏幕。把机械臂停靠在左上角,是为了不挡住摄像头观察操作结果。context 图片压缩,我已经做了极致优化,只保留最新的图片,历史图片都被 OCR 文本取代了。其实速度瓶颈不是机械运动,而是大模型 api 延迟太高,需要至少 20s 才能返回结果。
  • fzuccq 楼主 07-27 16:46
    88
    @jjtang11 这个 agent 的定位是个人助理,帮你操作需要在手机上做的事情,并不是要做手机自动化农场。
  • fzuccq 楼主 07-27 16:49
    89
    @zhangli2946 你这个论断太宏大了,我只不过想让 agent 能帮我做些琐事,好让我不必每天都操心这些必要而又无足轻重的事情。
  • Clannad0708 07-27 16:49
    90
    目前来看这个需求是真实的,未来我觉得一定是豆包手机那种形式,从底层具备了 agent 操作能力。

    现在最大的主力是这些 agent 想要真正完成落地需要依赖很多其他 sass 系统比如淘宝,高德。但是这些操作能力,数据内容又是他们大公司的核心价值。不可能免费或者很轻易的给你(在他们找到自己生态位之前)

    我觉得未来所有的 sass 都会 cli 化比如飞书 lark 那种。
  • cezhang 07-27 16:54
    91
    我之前也有这个这个想法 我是用途是拿来打卡 狗头
  • fzuccq 楼主 07-27 16:54
    92
    @Clannad0708 技术路线和商业利益冲突的时候,历史不会自动选择最优的技术路线,或者最优路线需要很多年,走过很多弯路才会实现。
  • zhangli2946 07-27 16:55
    93
    当然可以,头伸出去探索一下,除了崩老头及同模式的变现方式,还有没有其他的变现方式。
    另外探索新技术来在成本端做优化。
  • chouyee 07-27 16:55
    94
    如果只是模拟点击,完全不用大模型介入,可以换成安卓,用无障碍模式,可以实现大部分点击功能,而且更精确
  • zhangli2946 07-27 16:57
    95
    @fzuccq 个人发展要和时代浪潮结合,才有的潮头永立 XP
  • fzuccq 楼主 07-27 16:58
    96
    @chouyee 让 agent 能稳定可靠运行,还是要减少对手机系统的侵入,这样风控触发会少很多。
  • xiaomushen 07-27 17:02
    97
    @fzuccq 合法合规前提虾,大企业对于终端渠道价格的监控,是强烈需求。人工方案不算,目前只有灰产才能做到,而你这个方案,完全合法合规,所有有商业价值
  • fzuccq 楼主 07-27 17:05
    98
    @xiaomushen 也只有大企业才能付得起 token 费用,目前能稳定驱动 agent 的模型,单次点击操作成本 0.2 元,确实有很多优化空间。
  • loveumozart 07-27 17:05
    99
    @fzuccq #78 很棒啊,确实应该多识别一些精准元数据出来!不过好像下国际象棋的场景很特殊,棋子都太像了,没法像你这样做得很泛化,支持楼主
  • loveumozart 07-27 17:07
    100
    @chouyee 大模型是提供泛化能力的,具体用什么点,这个不是大模型的工作
* 帖子来源V2EX
返回