AI 无法识别出的图片

45dino 2026-08-10 19:26 1



识别图片中的文字,禁止访问互联网



我试了手头的几个 AI,全都全军覆没,表现比较优秀的是 glm5v,识别出来的是:生活本就沉闷, 但用耳朵听, 就会有声音。Opus5 认为这是小篆。


我想起了前段时间看到的 baby-vision,感觉多模态还是任重而道远的。

最新回复 (18)
  • 灰質心 08-10 19:28
    1

    识别图片中的文字,禁止访问互联网





    我来试试5.6 Sol Pro能不能看出来 ^-^

  • Evaleanosrey 08-10 19:29
    2

    别说AI,我自己都看不出“沉闷”,怎么看都看不出来

  • coco 08-10 19:31
    3



    还是可以的

  • 45dino 楼主 08-10 19:32
    4

    我前段时间还跟朋友聊了一个想法,能不能训练一个模型,使得能够根据用户的需求去寻找比较符合用户喜好的影视作品本子


    常规肯定是只能用 tag 筛选,但是假如这个人给出的是一段具体的情节,那么是不是就很难做到去向量化?


    以及我们看漫画的时候会对画风或者任务有自己的喜好,俗称戳(到)我(的xp)。这个又是怎么实现检索的?

  • 45dino 楼主 08-10 19:35
    5

    其实在看到 baby vision 之前,我就感觉 AI 能够把图片的信息吃下来,只是算力的结果,人类对图片往往有一个宏观的理解,这是 AI 没有的。


    写到这里的时候,我又想起了这个:




    what does the image say?


  • 45dino 楼主 08-10 19:35
    6

    关键是需要把上面和下面的边框连起来

  • corinc 08-10 19:37
    7



    gpt失败了

  • 114yiyis 08-10 19:37
    8


    神秘gemini

  • lulinkjason 08-10 19:46
    9

    识别图片中的文字,禁止访问互联网



    图片中的文字应为:



    上班无聊就玩手机

    但请勿

    影响工作效率^-^



    这张图用了高度变形、故意降低可读性的字体,但结合各字结构,以上识别置信度较高。


    来自 5.6 sol max,应该是除了fable最权威的了吧



    哈哈哈哈哈哈哈哈哈哈

  • lulinkjason 08-10 19:47
    10

    这个其实好办,因为作品本身也想被受众搜索到,所以很多作品上架之前会写tag,按tag搜索呗

  • 灰質心 08-10 19:48
    11



    神秘Pro模型

  • alizoed 08-10 19:52
    12

    识别图片中的文字,禁止访问互联网




    傻福gpt pro()


  • Mabel 08-10 19:52
    13

    这看起来有点难度,

    像是会被辨识错误之类的。

  • 45dino 楼主 08-10 19:53
    14

    比如如果想要找一个特定的情节呢,过于具体以至于不会有一个专门的tag?

  • 翠花上酸菜 08-10 19:54
    15

    看来大模型的缺陷还是一如既往,没训练过的就是不知道

  • yyjeqhc 08-10 19:56
    16



    ^-^ sol不行,luna提示了几次,也没有好的效果,就第一个字是对的

  • lulinkjason 08-10 19:56
    17

    那太难了,AI就只能搜索全网信息,看看有没有推荐文章,或者网友讨论。他没办法挨个翻看每本作品然后告诉你哪个是,就算能,那token爆炸了

  • 黄豆豆 08-10 19:57
    18

    你不说我都认不出来,确实有点抽象了

* 帖子来源Linux.do
返回