飞升在即,开源一个给无机器视觉的模型增加基础视觉能力的CLI工具

故笙 2026-08-11 10:40 1

本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:



  • 我的帖子已经打上 开源推广 标签:

  • 我的开源项目完整开源,无未开源部分:

  • 我的开源项目已链接认可 LINUX DO 社区:

  • 我帖子内的项目介绍,AI生成、润色内容部分已截图发出:

  • 以上选择我承诺是永久有效的,接受社区和佬友监督:


以下为项目介绍正文内容,AI生成、润色内容已使用截图方式发出


开源地址:GitHub链接

项目介绍:GitHub托管页


项目背景


梁先生的ds是真的很便宜啊,可惜没有视觉能力,本项目精选了一些好用的OCR和VLM小模型集成到CLI中实现一键下载和配置,电脑性能好的可以OCR+VLM,性能不太好的可以使用OCR模式,针对于Web场景还有特调,最后会输出带结构化的Json,启用视觉模型的会带一些提炼好的关键信息


功能特点



  • 操作简单,已集成三到四个官方下载点支持断点续传

  • AI操作友好,CLI强命令格式校验

  • 支持 iOS、Linux、Windows

  • 界面简洁

  • 已支持纯OCR识别、VLM通用识别、OCR+VLM降低幻觉率的混合识别


写在最后


本项目经过gpt5.6-sol和deepseek-v4-flash双盲测,效果还行。

欢迎大家提issue或PR

最新回复 (5)
  • Ianxp 08-11 10:43
    1

    感谢大佬推荐。mark一下,备用…

  • ppf 08-11 10:44
    2

    感谢佬的分享,留作备用了。。。。

  • 太想进步啦 08-11 10:45
    3

    感谢佬友分享,已收藏备用。。。。

  • nick_glod 08-11 10:46
    4

    感谢佬的作品分析,祝佬起飞快乐,(bushi

  • 08-13 01:50
    5

    qwen-mm-plugin不错 今天下载试了下

* 帖子来源Linux.do
返回