【pi-media】通过转发非文本输入使得文本模型具备多模态

GreenNa 2026-08-01 22:26 1

本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:



  • 我的帖子已经打上 开源推广 标签:

  • 我的开源项目完整开源,无未开源部分:

  • 我的开源项目已链接认可 LINUX DO 社区:

  • 我帖子内的项目介绍,AI生成、润色内容部分已截图发出:

  • 以上选择我承诺是永久有效的,接受社区和佬友监督:


以下为项目介绍正文内容,AI生成、润色内容已使用截图方式发出




前段时间deepseekv4flash刚出的时候品鉴了一下,感觉这个价格除了没有多模态没什么缺点了 所以写了一个基于pi的另类实现文本模型多模态的插件


逻辑很简单:



  1. 检测输入文件后缀,特定后缀发给特定模型

  2. 让文本模型整理提示词和上下文发给多模态模型

  3. 多模态模型整理之后再发给文本模型


推荐主会话使用DeepSeekV4Flash,多模态用GPT5.6LunaMax


GreenNa717/pi-media: 为 Pi 文本模型补充多模态能力,自动处理图片、音频、视频和 PDF,并将多模态分析结果注入当前会话。

最新回复 (2)
  • 阿达姆 08-01 22:48
    1

    让AI分析了一下,按照AI分析的结果,图片只会在第一次发送的时候送到多模态模型解析,然后用解析结果替换图片进入上下文记录对吧;但是这样有个问题,如果第一次解析的目的性不够强,可能解析出来的结果不满足任务要求,后续无法对该图片进行进一步精细化解析;感觉佬可以扩展一下,让插件给模型提供一个tool,让模型可以在后续通过tool call对这个图片做进一步提问,然后将这个提问和图片代理给多模态模型

  • caoayu 08-02 01:08
    2

    可以支持更多模型吗,比如mimov2.5,谷歌的那些

* 帖子来源Linux.do
返回