大模型图片识别能力求助

bobo1314 2026-06-25 09:54 1

请教一下各位大佬,我在做电商自动上款,里面有一个功能,同一个商品有多个款式,但是一个商品的图片都存在一个文件夹,我希望ai能识别区分款式的图片,识别出有多少种款式以及每种款式的图片分别用来上架,目前使用gpt5.5识别准确率太差,还有什么方案?

最新回复 (19)
  • bigkele 06-25 10:02
    1

    感觉gemini的图片识别能力更强,可以试试

  • 喵帕丝 06-25 10:02
    2

    不太好做,感觉,现在大模型识别图片幻觉率还挺高的。

  • ww472934 06-25 10:05
    3

    GPT-5.5低吗?我觉得挺好的啊。

    如果你觉得识别正确率低,那你要弄个好的提示词。


    AI识别会有“自动纠错”机制,上次我拿去识别PPT截图,5.5自动把别人的笔误纠正了。

  • bobo1314 楼主 06-25 10:05
    4

    是的,做了几次尝试了,卡住,没什么进展

  • bobo1314 楼主 06-25 10:05
    5

    3.1Pro还是3.5flash强一点?

  • bobo1314 楼主 06-25 10:06
    6

    文字肯定识别得好呀,现在是商品的摆放,构图,颜色,材质来区分

  • bigkele 06-25 10:07
    7

    我用的gemini-2.5-pro就感觉不错,3.1Pro应该会更强吧

  • ww472934 06-25 10:08
    8

    哦,这样的话,那肯定gemini了。上次我让gemini识别枪械上的配件,他竟然能找到同款 ^-^

  • ww472934 06-25 10:13
    9

    我之前用3.1pro识别复杂排版的PPT,pro的正确率比flash强得多。

    flash经常搞不清排版顺序。

  • chenhahaimi 06-25 10:14
    10

    识图正确率太低,那可能是训练集在这个方面不够好,可以自己用训练集补强。整理出一个yolo的训练集,然后用标签工具给图片打上标签,让gpt多对照这个库来判断,或者后台运行yolo识别图片。但是yolo可能需要的空间比较大,而且跑训练集时间比较久

  • bobo1314 楼主 06-25 10:17
    11

    大佬,我没有做yolo识别训练集,现在只是丢给模型,然后提示词,让他识别后返回结果,程序根据识别结果拆分

  • chenhahaimi 06-25 10:29
    12

    富裕的话,就用gpt和gemini交叉验证图片是否识别正确,然后用一个文件夹做验证集,放二三十张明显的图片,十张容易错的图片,比较一下召回率和精确率,后面慢慢把模型搞错的重命名之后放进去。其他的没接触这么深,不清楚有没有用

  • egden 06-25 10:51
    13

    用dino2/3 做特征提取,然后用于余弦做聚类,如果知道款式数量就用knn,不知道数量就用社区算法做自动聚类,阈值不好弄,得调。

  • bobo1314 楼主 06-25 11:05
    14

    大佬是懂行的,我这个功能预算是几K,每组商品识别不超过1块钱,能实现吗 ^-^

  • xiaopenggggggg 06-30 18:03
    15

    体感 gpt 和gemini各有千秋

  • egden 07-02 16:27
    16

    dino做特征提取相对简单,AI写个python脚本就可以搞定,自动聚类参考我的仓库 openmynet/fces-rs: fces rust 用AI把rust翻译成你需要的语言就行。

  • bobo1314 楼主 07-17 17:52
    17

    做好了做好了,gemini-3.1-pro实现了,用提示词+图片转base64

  • aoi 08-01 15:25
    18

    佬,请问你做的工具,是支持tb和pdd的商品自动上架吗

  • bobo1314 楼主 08-01 22:02
    19

    不是的,我做境外的,tb和pdd不是大把吗

* 帖子来源Linux.do
返回