大哥们,多模态大模型,能给个对比吗?

AutumnVerse 2026-09-07 10:37 1

让 ai 监控画面,然后自动执行处理,7*24 运行,哪家比较合适?另外不能太慢,那 chatgpt5.6 sol 跑了一天,效果挺不错的,但是太慢了,一次请求要 10s 左右,延长太高经常出问题。

以前在 v 站看到一个模型对比表格,列出了各个模型的参数量、价格、跑分,但是现在搜不出来了,哪个大哥能再给一个吗
最新回复 (24)
  • clemente 09-07 12:52
    1
    哥们 NASA 都不敢这么用
  • AutumnVerse 楼主 09-07 14:41
    2
    @clemente ?有啥问题吗?成本太高?

    sol 跑了一天,几千块钱成本而已,也可能是 sol 太慢了,10 秒左右才返回一次。
  • ruanimal 09-07 15:12
    3
    一天几千块而已。。
  • clemente 09-07 15:12
    4
    @AutumnVerse 首先多模态的模型不是干监控的。99%的多模态就是 画面描述器的胶水模型 和 LLM 投影沾到一起的

    我不知道你实际的工作需求,如果能走 cli 还是尽可能走 cli 或者 headless
  • wizChen 09-07 16:22
    5
    这种本地部署比较好吧
  • Nasdaq 09-07 16:24
    6
    这,OP 拿一张监控画面跑一下看看成本,要是 24 小时非常夸张的。。。
  • AutumnVerse 楼主 09-07 16:32
    7
    就是拿来跑监控的,把图片压缩到 480p ,token 消耗还行,唯一问题是 sol 太慢了,处理一帧要 10s ,取下一帧的时候已经过了 10 多秒了,这期间如果出现异常又消失了,ai 就监控不到了。

    成本那是老板考虑的,我知道 yolo ,也知道传统的 opencv 里面的算法,但是你用那些算法做出来,老板怎么给投资人吹牛逼,你连大模型都没用上,谁给你投资。
    @Nasdaq
    @ruanimal
  • AutumnVerse 楼主 09-07 16:37
    8
    @clemente 现在是写了一个程序,把相关画面抽帧给 ai ,让 ai 发现某些事件,调用对应的 function 处理。

    主要问题是 sol 太慢了,导致抽帧非常少,两帧中间的内容就丢掉了。尝试了 gemini flash 3.8 ,看统计也要 4s 左右一次,也没快多少。
  • Nasdaq 09-07 16:39
    9
    @AutumnVerse #7 这是我一个类似项目用 gemini-3.7-flash 做图片理解(仅供参考),图片分辨率大概 1080p 左右

    Routing 197ms
    Google 2.6s
    Generation 8.5s
    Total 11.3s

    Cost $0.00632
    Throughput 179.0tok/s
  • xujinkai 09-07 16:43
    10
    并发呗,真有钱🤣
  • AutumnVerse 楼主 09-07 16:45
    11
    @Nasdaq 那跟我测试差不多,我用的 480p 会快一点。但是总耗时也要 4s 左右。
  • tim9527 09-07 16:45
    12
    想想就好贵,家底富裕啊
  • clemente 09-07 16:46
    13
    @AutumnVerse 我 6 年前做过类似的,我做的是检测+跟踪。我的方法是帧不变走缓存,帧变了走识别那一套逻辑,但是有一点因为设备计算能力达不到实时,所以我加了异步队列和跳帧方法,这样能保证所有事件捕捉+某个场景能同步到实时
  • cvooc 09-07 16:47
    14
    误闯天家系列, 没这么用过...
  • wysnxzm 09-07 16:50
    15
    做异步,延迟 10s 而已不会漏数据
  • winterx 09-07 16:54
    16
    你需要的是视频算法而不是 AI ,当然 AI 也能干这事就是太烧钱了
    如果成本受限可以考虑海康、商汤或者旷视
  • AutumnVerse 楼主 09-07 16:59
    17
    @cvooc
    @tim9527 做 cv 算法的工程师,一个月也得三四万,这一套下来,两三个人也得十来万了,这钱拿来买 token ,我觉得是帮公司省钱了。而且招人也要时间,开发也要时间,改 bug 也要时间。

    几天时间能跑通业务,完成商业验证,简直赚麻了。
  • la9998372 09-07 17:05
    18
    你是啥场景啊?非要用大模型来做?
    现在的 qwen3.8flash 和 glm5.3flash 都支持多模态了,应该性价比和性能都挺不错吧
  • cvooc 09-07 17:05
    19
    @AutumnVerse #17 哪怕让 ai 写算法呢...花点钱...上肥波,上 astra... 也比直接让 ai 识别强啊...
  • gpt5 09-07 17:09
    20
    我知道几家公司的主营业务就是这个。
    上百个监控全接进来,实时 ai 分析。
  • AutumnVerse 楼主 09-07 17:12
    21
    @gpt5 直接上大模型还是传统的 yolo 类的小模型?
  • gpt5 09-07 18:07
    22
    @AutumnVerse 本地大模型+精巧的系统设计+极限优化
  • Sezxy 09-07 19:58
    23
    本地部署 Qwen3.8-27B 是不是好点
  • cyningxu 09-07 20:04
    24
    看楼主的描述是不考虑成本的,那直接异步,每秒固定往里丢个图,只是 10 秒后出判定结果而已,但这样做就不会丢数据
* 帖子来源V2EX
返回