【请教】如何实现自动化数据标注?

胖死了的阿猫 2026-07-27 21:16 1

背景:最近在做一个YOLO目标检测项目。训练集用的是公开数据集,训练好的yolo模型不理想,检测结果受到摄像头角度、检测目标特征不在训练集内等问题导致目标检测不到。

想到的解决方案:目前想到的方向是,通过图片分割模型来获取物体坐标框,然后通过的多模态模型给所有坐标框生成标签。




  1. 第一步:用图像分割模型生成“候选轮廓”



    • 虽然YOLO不认识我的目标,但有之前看到号称“分割一切”的开源分割模型可以所有物体分割开来




  2. 第二步:用多模态大模型给轮廓“命名”



    • 这里想引入多模态大模型,比如Qwen-VL。把第一步切出来的每个小图块喂给VLLM,用Prompt让它从我的目标类别列表里做选择。




  3. 第三步:用CLIP做本地预筛,降低API成本




    • 如果每张裁切图都调VLLM,API费用感觉扛不住。




    • 可以本地部署一个CLIP模型做初筛分类,只有CLIP拿不准的“难例”才交给VLLM处理。这样能省不少钱,不知道实际效果怎么样。






  4. 第四步:转换成YOLO训练格式




    • 最后把第一步生成的轮廓坐标,和第二步确定的类别标签合并,转成YOLO的 .txt 标注文件。




    • 这样就得到了一份可以拿去微调专属YOLO模型的数据集。






请佬友们帮忙看看方案是否可行,有没有更好的方案或者开源可用的方案。

最新回复 (16)
  • 空气动力学 07-27 21:21
    1

    关注一下。虽然我不懂,但与所在行业有很密切关系。

    (我知道传统的画框识别正确率只有50,很难上去了。可能要找更到质量的数据集,而非未筛选过的公开集?)

  • Nba12 07-27 21:22
    2

    本地部署qwen vl 去标注 3-5s一张图片,不如人工来,还放心。我做省级的项目,都累计十几万图了,人肯定比机器便宜,而且打工,你非得要机器替代人工干嘛

  • yuuyjiang 07-27 21:25
    3

    先人工标个几千张图,微调下yolo,然后对所有图片推理生成标签,自己再调整框,推荐roboflow这个标注平台,新用户注册7天会员,可以用临时邮箱无限续

  • Ximybf 07-27 21:28
    4

    基本上,我覺得這東西是沒有捷徑的,如果能用捷徑標好標籤,那你還拿大模型跑幹麻,直接把那捷徑拿來用就好

  • Para 07-27 21:29
    5

    1. 你先试下不切给VLLM处理 结果怎样

    2. 切的话没必要 第二步了,直接第三步 本地+不确定的联网VLLM 就好了

    3. 不一定 CLIP模型, 你对比下看那个本地模型更好,特别是 yolo 有别人标注好的训练出来的,比如你想识别汽车,别人的训练的 yolo模型,已经可以识别出汽车

    4. 找一下标注好的 yolo 数据集,看有没有你想要训练的类型

    5. yolo 需要的数据量如果类别少的话可以不是很大, 你可以用老数据微调生成新数据 扩散训练一下

  • ytbglht55 07-27 21:30
    6

    你这个只能作为初标参考选项,最后还是要人确认标注和专家抽样审核,要不然感觉够呛

  • 填情☂️ 07-27 21:33
    7

    别试了 基本没戏 因为我公司跑的百度的标注,没几个过的 如果有就当我没说把 。。。

  • yzhkail 07-27 22:02
    8

    先得人工标注,标注好了才有几率可以用模型,而且就算用模型最后还得自己来审查,人工还便宜

  • mhyyyyy 07-27 22:07
    9

    毕竟佬友自己动脑子不花token^-^

  • tpu01yzx 07-27 22:09
    10

    楼上说得对,别折腾了,性价比最高的还是人工标注。需要的吱声,我有个朋友做这个的,便宜。

  • 填情☂️ 07-27 23:36
    11

    ai能代替人工 而且价格便宜的情况下肯定是首选ai

    等ai能替代的时候数据标注这个行业也就彻底没了

  • songtao2627 07-30 20:33
    12

    佬,你朋友有数据标注这方面的一手资源吗

  • lll9p 07-30 20:41
    13

    替代不了,有的领域数据集都没有。


    先少量标一批,然后human in the loop可以很省力气地获得高质量数据。

    像下面这种数据集,只能老老实实人工标注再搞主动学习+HITL


  • 沢尻エリカ 07-30 20:44
    14

    最近我也在做合成数据集,虽然方向不同,但也是跟视觉相关吧,个人感觉 sam2 在其中发挥了重要作用

  • 男子汉 08-02 16:21
    15

    roboflow



    佬 如果是图像分割呢 是不是就是千问会快一点呢

  • 男子汉 08-02 16:22
    16

    解决了吗 ?佬 我蹲一个解决方案

* 帖子来源Linux.do
返回