有没有这种 yolo 自动标注工具

simo 2026-09-22 09:27 1

我现在做了一个千牛的聊天留存工具,方案是 yolo + ocr + 简单算法来实现的。


标注的事,第一次干,也搜了一圈,最后手动的,一共 10 张图,眼都要标注瞎了。 现在设计的是 标注按照一组聊天区域 [用户名+时间+内容] ,这是四个标注区域。


因为素材太少,模型效果不太好,有时候时间或者发送人会识别不到,有时候是 yolo 识别的时间或者发送人区域有偏差,ocr 最后只能识别到一部分。


现在准备搞 50 张图,训练一次试试,想问问有没有可以自动标注的工具,实现如图这种标注逻辑?

最新回复 (16)
  • simo 楼主 09-22 09:28
    1
  • afirefish 09-22 09:34
    2
    先训练一个小模型,然后用这个小模型去标注
  • afirefish 09-22 09:35
    3
    但是这个应该用不着 yolo 吧,直接 OCR 就能全搞了
  • jonty 09-22 09:39
    4
    直接写一个吧,这种程度的活就是一个 goal 的事
  • street000 09-22 09:44
    5
    感觉三楼说的有道理,直接定位头像然后 OCR 就能完成了
  • NikoXu 09-22 09:56
    6
    LocateAnything
  • simo 楼主 09-22 10:03
    7
    @afirefish
    @street000
    这个方案主要是为了省点 token ,用视觉模型来做肯定没问题。我当时想的是,需要知道一条消息(发送人、时间、内容),ocr 的话,识别内容没问题,但是识别出来发送人、时间不一定是一组,担心发送人识别成多个坐标多个内容,时间也是一样的担心。所以用 yolo 先分组,如果一组消息被截断(上下滚动条位置),那就滚动或者有新消息的时候,下一轮也能捕获到(不考虑在一个轮询内海量消息有一部分丢失的问题)。

    你们说的纯 ocr 方案也考虑过,但不确定 ocr 识别内容的拆分逻辑在应对不同机器不同账号不同聊天对象是不是一致。

    比如图片这个,不知道用户名是识别成 想念你 + 64644133 还是一个完整的,还是想 + 念你 64 + 644133
    时间那个也是一样的担心。内容区域的文本更容易出现这个情况
  • Muniesa 09-22 10:06
    8
    找个视觉能力强的大模型直接输出各个框的坐标和标签,50 张也花不了多少 token
  • simo 楼主 09-22 10:14
    9
    @Muniesa 对啊,茅塞顿开,我先试试标注的准确度
  • moooooooo 09-22 10:22
    10
    @Muniesa 我用 ds 干过这事,确实可以
  • simo 楼主 09-22 10:29
    11
    @moooooooo 标注的话大模型效果不知道效果如何,你之前场景大概是哪种的标注?方便截图+马赛克看下么?
    如果是实现方案,用 ocr ,然后大模型总结,可以;视觉模型也可以。我这就是为了省点钱,才定的 yolo + ocr
  • barantt01 09-22 10:33
    12
    没太理解 直接获取网页元素不可以吗? 还是说你拿到的就是只有图片?
  • simo 楼主 09-22 10:50
    13
    @barantt01 千牛客户端
    有网页版吗?有的话,搞个插件就 ok 了啊
  • barantt01 09-22 10:55
    14
    @simo #11 pc 端的也能自动化获取元素的。
  • simo 楼主 09-22 13:51
    15
    @barantt01 用 inspect 试过了不行,UIA 做不到
  • rockycc 09-22 17:11
    16
    可以试试 grounding dino
* 帖子来源V2EX
返回