基于Gemini的多模态做了两个有意思的功能

Mozi 2026-08-29 12:38 1




视频导航功能,直接将视频拖入聊天框中,就能AI大模型读视频给出定位




PDF定位功能,问一句话就可以分析PDF的内容,并找出对应的页码标注位置

这个功能其实很久以前就做了,但是我现在把它合并到我的聊天工具中


最新回复 (10)
  • lueluelue 08-29 12:39
    1

    视频最长支持多长呀?Gemini还是支持2小时视频吗

  • buzz 08-29 12:40
    2

    我还以为是OSINT定位确定图片拍摄所在的IP地址,吓死了 ^-^

  • Mozi 楼主 08-29 12:45
    3

    单个文件限制2GB,时间没有具体限制,主要是限制Token数量,Token数量和帧率的参数有关系

  • vextuber 08-29 12:45
    4

    佬用的聊天工具是什么项目?开源了吗?

  • Mozi 楼主 08-29 12:47
    5

    本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:

    我的帖子已经打上 开源推广 标签: 是
    我的开源项目完整开源,无未开源部分: 是
    我的开源项目已链接认可 LINUX DO 社区: 是
    我帖子内的项目介绍,AI生成、润色内容部分已截图发出: 是
    以上选择我承诺是永久有效的,接受社区和佬友监督: 是

    以下为项目介绍正文内容,AI生成、润色内容已使用截图方式发出



    https://linux.do/t/topic/1371269

  • Z 08-29 12:47
    6

    好久没用美国豆包了,听说现在改的很强了不知真假

  • Mozi 楼主 08-29 12:59
    7

    很久以前我就想做基于 Gemini 的剪辑工具,只是工作量大,所以一直懒得开动

  • Mozi 楼主 08-29 13:10
    8




    不能定位IP地址,但根据图片定位地图坐标,这个功能是有的

  • hui 08-29 13:21
    9

    拖长视频进去它往往只啃前两分钟就截断

  • Mozi 楼主 08-29 13:25
    10

    我拖了一个长视频,十多分钟的视频进去,可以精准读出画面内容

* 帖子来源Linux.do
返回