大家有没有发现最近新出的多模态模型识图能力越来越差了。比如 qwen3.8 max, kimi-k3

lynn1su 2026-08-24 10:02 1

我发现最近的大模型空间理解能力越来越差了,大家有没有这种感觉?
比如根据照片推断地址,目前这两个都说的不对,就 gpt-5.6 sol 说对了
最新回复 (11)
  • keshawnvan 08-24 11:27
    1
    现在重心在 Coding
  • yulon 08-24 11:35
    2
    现在多模态基本没有空间想象能力,多模态还会分走智商,我做 AI 视频的,如果要 LLM 帮忙自动生成构图,不如给瞎子模型配个识图 tool
  • lynn1su 楼主 08-24 11:40
    3
    @yulon #2 识图 tool 也是用了大模型识别图片吧?
  • longaiwp 08-24 11:51
    4
    我感觉是因为如果混入太多这类数据,它整个参数会变大,训练难度会增加,并且这类数据还会影响整体的智能水平,所以都没有往多模态去做。
  • oky 08-24 11:57
    5
    以前他们的多模态也是远不如 gpt 的,感觉识别能力差很多
  • yulon 08-24 12:57
    6
    @lynn1su #3 那肯定啊,只是描述一下,用小参数模型就行
  • lynn1su 楼主 08-24 14:05
    7
    @longaiwp #4 那为啥 gpt 5.6 这类能成啊
  • longaiwp 08-24 14:08
    8
    @lynn1su 我觉得是因为人家有足够的算力
  • mingtdlb 08-24 14:12
    9
    我感觉只有 chatgpt 的靠谱,其他的糊一点就识别不到
  • clemente 08-24 15:06
    10
    多模态都是胶水 vision 层模型 做的

    现在的模型都是胶合板 没有原生的多模态
  • clemente 08-24 15:15
    11
    @yulon 配不了的 token 不在一个维度
* 帖子来源V2EX
返回