【开源】【BiliSum】支持多模态理解视频(低成本)并总结图文笔记的桌面应用

lycohana 2026-05-17 15:51 1

本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:



  • 我的帖子已经打上 开源推广 标签:

  • 我的开源项目完整开源,无未开源部分:

  • 我的开源项目已链接认可 LINUX DO 社区:

  • 我帖子内的项目介绍,AI生成、润色内容部分已截图发出:

  • 以上选择我承诺是永久有效的,接受社区和佬友监督:


以下为项目介绍正文内容,AI生成、润色内容已使用截图方式发出






新增:图文笔记(VLM理解)


由llm识别视频重点内容/关键画面->截取画面交由多模态模型理解,并入图文笔记



(使用多模态理解图片成本会增加些许,日常使用纯文本笔记也足够强大!)


优势亮点


界面美观


类b站主页页面的视频流列表,清晰明了



视频总结摘要,一键导出一图省流



文字笔记,图文笔记,思维导图一应俱全




高度自定义


语音转写可用ASR在线服务(硅基流动,注册了免费能用),本地部署语音转写服务,OpenAI协议的语音转写

提示词可完全自定义,打造适合自己的总结风格,也可以优化总结的质量(如果更加优的提示词可以提交贡献!)


更多功能不一一列举


环境友好,支持一键安装cuda转写环境

rag知识库以及llm问答(可选模块,可以一键安装

更多小细节有待发掘^-^


后续目标


接入更多视频平台,视频收藏夹功能,提示词自定义模板等等

感谢佬友们的使用反馈!

最新回复 (14)
  • ᴇɴᴄ 05-17 18:58
    1

    最近在B站看沈枯燥的历史课,打算下周试试 ^-^

  • dtemiemie 05-17 22:11
    2

    看起来很不错诶!^-^

    视频笔记真的强需求

    时间戳啥的


    截取关键帧的截图也是强需求~

  • lycohana 楼主 05-17 22:23
    3

    欢迎使用找找bug提提需求,最近创意枯竭了

  • 鹤九先生丶 05-19 16:05
    4

    佬,本地的视频导入可以增加一个整个文件夹一起导入的功能,类似omniget

  • dtemiemie 05-28 16:26
    6

    如果能支持一下qwenasr、elevenlabs scribe、soniox之类的,然后还有热词替换来纠错(elevenlabs 和soniox好像API自带支持)就好了(

  • lycohana 楼主 05-28 16:37
    7

    qwenasr在线版试过了不大行,我过会试试本地版的)

  • 墨子龙 05-30 23:19
    8

    nice!感谢佬友,我之前一直再用bilinote,但是bilinote好像不维护了,项目已点Star,感谢佬友

  • denvey 05-30 23:22
    9

    不错,正好想要这方面的功能,研究试试

  • ProudBenzene 05-30 23:23
    10

    之前看到过一个叫BiliGPT的闭源收费项目可以实现多模态视频笔记,当时觉得很厉害但是订阅费太贵了……终于看到社区也出现了多模态视频笔记的开源项目,献上我的star!

  • summer221 05-30 23:26
    11

    看起来不错哎,是不是有AI字幕就分析AI字幕,没有字幕的就下载视频然后提取音频,音频再转ASR?

  • lycohana 楼主 05-30 23:33
    12

    没尝试直接读取视频的字幕了,全部都直接下载音频识别字幕 ^-^

  • sabbbber 06-02 23:13
    14

    发现了问题,在从别的应用切换打bilisum的时候(窗口全屏的情况下),界面会出现全白色->正常界面 的切换过程,在暗色模式下非常影响体验,像是玩cs被丢了个闪在脸上,希望解决。

  • lycohana 楼主 06-02 23:26
    15

    收到,我刷新试了一下确实被闪了()等一下去修一修

  • heglin 06-11 00:05
    16

    唔,知识库不能使用硅基流动的向量模型吗?主要是我I卡搞不来cuda,也不想费力折腾了,谁让硅基流动便宜、好用、稳定呢。而且本地跑向量模型对主机也是一个负担,我是放到主机当一个桌面的学习程序用的。最重要的是依赖太恶心了,不好解决。

* 帖子来源Linux.do
返回