Kivio:我把自己天天用的 AI 操作全塞进了一个桌面应用「开源推广」

枳萌 2026-06-20 19:55 1

本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:



  • 我的帖子已经打上 开源推广 标签:

  • 我的开源项目完整开源,无未开源部分:

  • 我的开源项目已链接认可 LINUX DO 社区:

  • 我帖子内的项目介绍,AI生成、润色内容部分已截图发出:

  • 以上选择我承诺是永久有效的,接受社区和佬友监督:


以下为项目介绍正文内容,AI生成、润色内容已使用截图方式发出




之前一直有不懂的,还不可以复制那种,用ai总是这个流程,截图 复制 给ai。之后使用claude desktop有截图分析的功能,但是用了几个月发现这玩意占用太大了,沙盒13g,我还试了其他的,豆包、kimi什么的,但是最后都没有用下去,只好自己做了一个。



本来就想做个翻译框,用着用着就收不住了。今天加截图翻译,明天想着干脆能问答吧,后天接自己的 key ,再再后来它都能调工具、读文档、跑代码了。写到现在,它早不是当初那个翻译框,名字也从 KeyLingo 改成了 Kivio


我现在电脑已经把所有AI客户端都删掉了,只留了一个kivio和claudecode。我做这玩意儿其实没什么宏大目标,就是把自己天天用的那些 AI 操作,全做进一个应用里,缺啥补啥,结果越做越大。下面几个是我自己离不开的。用 Tauri + Rust 搓的,装起来不大、开起来速度还可以,平时缩在托盘里,要用才出来。Mac 和 Windows 都能运行。


主要功能:


边打边译 / 截图翻译:一个热键,当场出结果




  • 边打边译:在任何地方打字,按下热键直接把刚打的翻译并替换掉。写英文邮件、回消息很顺。

  • 截图翻译:框选屏幕任意区域,译文卡片直接「飞」到鼠标位置,原文对照在下方。看 PDF 特别好用。

  • 划词:选中的文字直接翻,文字能选时比截图还快一步。


对于截图翻译,可以使用多模态模型直接使用,同时也可以支持系统OCR 然后再用文本模型翻译。


Lens:核心功能,对着屏幕,直接问,直接出答案




这个优化最久,也是我后来最离不开的。按热键框住屏幕上任意一块,直接开多轮对话



  • 看不懂的公式 → 框住,给你 LaTeX 还讲原理

  • 弹出来的报错 → 框住,问咋回事、怎么修

  • 图表、表格、大段代码、英文界面 → 框住就能聊

  • 框一段文字 → 当场翻译、改写、总结、润色


支持直接跳转到 AI客户端里持续聊天,你截一次图,你聊几次可以生成一个有规范文件


Kivio AI 客户端



有codex的模样,但也参考了别的一些项目和自己的一些想法,做成我的形状的kivio AI 客户端

做这个主要是替代我经常使用的 cherry studio这些ai应用,我现在所有杂七杂八的都在这里。

对比cherry来讲,不只是聊天了:对话按项目分组、能建助手、有本地记忆、能塞图片和文件进去问。

关键是它真能干活——读写文件、跑命令、抓网页、搜索,还内置 Python 沙箱(Pyodide),丢 PDF / Excel / Word 让它分析是真能算的。上图就是随手让它对比几种 OCR 方案,直接拉了张表还附了代码。

OpenAI、Anthropic 接口支持,支持多供应商管理,多KEY支持轮训



每个模型可以单独设置上下文,单独设置支持的功能,是否支持图片输入等等。




即使没有配置kivio,可以直接使用本地的CLI工具进行使用,目前正在逐步适配。


混音器,让不支持视觉的模型也能图片输入。




同时也可以通过工具调用的方式生图。


还有很多AI客户端的功能等待佬友们使用探索。


Kivio code 超级离谱跑题功能


天天使用claudecode,我想这个能不能也代替一下,模仿的做了一下。

一个在终端跑的编码 agent,命令行 kivio code 直接用


越来越感觉做的逐渐跑题,这个应用基本就是围绕着我日常使用来进行构建的,把自己天天用的那些 AI 操作,全做进一个应用里

最新回复 (3)
  • 星灵技术 06-20 20:10
    1

    推荐使用paddleocr本地化接入OCR模型

  • 枳萌 楼主 06-20 20:15
    2

    离线OCR我用的是rapidOCR

  • XXF 06-20 20:49
    3



    很轻量,目前已经离不开了,要是有webdav同步就好了

* 帖子来源Linux.do
返回