【演示】deepseek-v4-flash-vision 开发的无向量数据库-直接视觉理解-简单高效RAG效果

liangdabiao 2026-08-26 23:06 1

最近在社区发布了3个基于deepseek-v4-flash-vision 视觉deepseek理解 的开源skill项目:


本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:

我的帖子已经打上 开源推广 标签: 是
我的开源项目完整开源,无未开源部分: 是
我的开源项目已链接认可 LINUX DO 社区: 是
我帖子内的项目介绍,AI生成、润色内容部分已截图发出: 是
以上选择我承诺是永久有效的,接受社区和佬友监督: 是

以下为项目介绍正文内容,AI生成、润色内容已使用截图方式发出
上次在lin…


本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:

我的帖子已经打上 开源推广 标签: 是
我的开源项目完整开源,无未开源部分: 是
我的开源项目已链接认可 LINUX DO 社区: 是
我帖子内的项目介绍,AI生成、润色内容部分已截图发出: 是
以上选择我承诺是永久有效的,接受社区和佬友监督: 是

以下为项目介绍正文内容,AI生成、润色内容已使用截图方式发出
上次在lin…


本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:

我的帖子已经打上 开源推广 标签: 是
我的开源项目完整开源,无未开源部分: 是
我的开源项目已链接认可 LINUX DO 社区: 是
我帖子内的项目介绍,AI生成、润色内容部分已截图发出: 是
以上选择我承诺是永久有效的,接受社区和佬友监督: 是

以下为项目介绍正文内容,AI生成、润色内容已使用截图方式发出

deeps…


佬友评论说,怀疑和有问题。所以我完整测试一次看看行不行:


1 我先找一本扫描版的lego图书,这种其实一般都很难用常规方法进行rag,最难搞的进行测试:


几百页的图文图书,让deepseek先理解,然后索引好知识和数据:



以上就是形成了 索引数据的目录树, rag以后直接查询这个目录索引就能够大概粗查,然后视觉细看页面,最后深度思考和反复验证,给你答案!

关键就是deepseek视觉理解 又快又便宜又有深度!


2, RAG 的全称是 「Retrieval-Augmented Generation」,翻译过来就是:检索增强生成。


第一步已经完成了 理解和索引,现在测试 RAG:



deepseek-v4-flash-vision-rag skill 已经对 test2 进行了索引,请你检查 有没有看到,情况怎样 ?





请你整理一个 这本书的 目录索引给我, 让我方便的知道 内容和页码地点,方便查询




rag 二轮车的拼搭




跑车的搭建方法



各种各样问题,随便问! 关键就是,这里完全不需要过去那些rag复杂流程和工具,不需要向量数据库,什么都不需要,你只需要一个deepseek key就可以了,而且效果比以前那些好的多。


开源不容易,感谢佬提意见

最新回复 (5)
  • Mozi 08-26 23:18
    1

    DeepSeek这个模型目前价格本身不便宜,视觉方面也不算强,感觉不出性价比

    Gemini 的模型自身就支持输入 PDF 文件,几百页的 PDF 图片完全不是问题,而且是全量的视觉理解

    这个项目如果要用国产模型的话,也是千问更加合适

  • 鸡公煲不要辣 08-30 22:46
    2

    一般如果要做视觉处理任务的话,该怎么用啊。比如我有几百张图片需要识别处理整理出图片内容,用来做ai生图的方向锚定。那么Gemini该怎么购买以及完成?买个pro通过反重力去完成吗还是有什么其他更方便的用法?请佬指教一下qwq

  • Mozi 08-30 22:55
    3

    几百张图片这种体量,Gemini 完全可以全部放到上下文中分析

    我说的是满血的原生的 API,不是网页版的,网页版的Gemini导入大文件,其实它底层是用RAG来实现检索的,antigravity 转出来的API限制也很大

    直接调用Gemini原生API的PDF功能,可以直接在PDF里面放几百张图片,它可以精准找到图片的位置,还有每个图片里面的内容它都是可以看得到的

    我觉得只有几千张、几万张那种体量,我才会使用RAG,或者将图片转成文本再存储的方法,但是这种失真太严重了

    下面这个例子就展示了 gemini 的多模态能力,所有 PDF 页面中的内容它都是有用视觉能力来查看的,而且它可以通过坐标给出精确的位置。如果你要批量分析几百张图片的视觉风格,完全可以全部放到上下文中分析





    PDF 定位功能,问一句话就可以分析 PDF 的内容,并找出对应的页码标注位置


  • liangdabiao 楼主 08-31 00:21
    4

    我的方案索引后,以后每一次rag成本几乎忽略不计,可以大规模进行 例如客服啊,知识库啊,各种。 而google的应该不便宜吧

  • Pakho 08-31 00:35
    5

    佬,这个是哪个软件,好像没见过,cherry studio?

    另外你用的是原生的api吗?我挺好奇和antigravity反代出来的主要区别有哪些

* 帖子来源Linux.do
返回