做了一条新的纯视觉解析路线用来识别图像类资料,有做金融或工程的老哥要试试吗?

cs1707 2026-08-30 15:28 1

在 agent 开发和实际落地的时候,经常会遇到一类问题:像金融、工程等行业,他们有很多资料是以图像的形式呈现的,比如设计规范、图纸、施工图集和报表,如果纯纯把它当成纯文字解析,那效果是不好的,有很多信息和关联都会丢失,影响后面模型的回复质量。但是要把它们丢掉,那更不现实,因为这些资料十分重要,很多是要当做原始证据保存的。

所以,我就在我们的解析工具 Knowhere 里加了一条纯视觉理解路线——VISION-MAP ,专门用来处理这方面的问题。

VISION-MAP 是这样工作的:

第一步,保留源文件和页面标注。

文档进入 Knowhere 后,原始文件不会因为解析而被一份 Markdown 取代。每一页还会按原始样子存储,但其核心内容和图表资产已被理解和标准,页面里的文字、表格线、图片、印章和相对位置都在,为后面的回溯和审计留下了完整入口。注意,我们保留的是页面注释,不是把文件页面作为图片再存一次。

第二步,建立地图。

只有一堆页面还不够。一本几百页的文件,如果没有结构,Agent 还是只能从头翻到尾。

VISION-MAP 会按照文档的章节关系组织页面,形成“章—节—页面”的层级地图,并给页面配上必要的轻量说明。这些说明负责告诉 Agent“这页大概讲什么、属于哪里”,但不会取代原始页面。

第三步,先找路,再看页。

用户提出问题后,Agent 不需要把整份文件重新读一遍。它会先根据问题在章节地图里判断方向:哪些章节相关,是否还要往下钻,哪些页面值得收下。

找到候选页面后,再由视觉模型直接阅读原页,核对金额、条款、图表或版式关系,并把答案引用回具体页面。



这也延续了 Knowhere 一直以来的三步思路:先发现可能相关的内容,再沿着章节结构导航,最后交付可以追溯的证据。

VISION-MAP 很适合我前面提到的工程类和金融类场景。当然了,文档干净、答案就在一段话里的时候,直接读文字反而更快。但是处理高价值、强合规、高要求的文档时,或者答案在图里没那么好找,还要留着让人复核的时候,VISION-MAP 就最能发挥作用了。

比方说,当金融分析师想知道“某公司本季度经营现金流下降的主要原因是什么?”。你只靠关键词搜的话,一般只能搜出带着“经营现金流”的段落文字、摘要或者表格,有的还混了上一年的对比数据,最后还是要自己一个个核查。

VISION-MAP 的做法是先翻到现金流量表,再去管理层讨论( MD&A )里找对应的说明,把数字、单位、口径、范围和解释依据都对上了再回答。给出的答案后面还跟着行项目、章节和页码,你想验证,随时可以点回去看。

在投研、审计、风控这些任务里,这就很有用了。

还有就是工程、建筑和制造行业,那些设计文件和图集往往都很大份,一套几百上千页的都有。而且还分得很散,想查一个材料的防火等级、一个构件的安装要求,往往等级在一张表里,要求写在另一章,具体位置还得看图纸。如果简单切成文本块,相互的关系就断了很难接上。

VISION-MAP 则会把相关的条款、表格和图纸页面一起找出来,让视觉模型对着页面核对。工程师和审查人员也能直接打开原页,看清楚表格里的数字、图纸上的标注,以及是不是最新版本。

所以,VISION-MAP 做的就是“像人一样读懂文档,并拿出可核验依据的答案”,这也更符合专业人员当前逐页阅读、定位、复核和决策的真实工作习惯,这比简单给出一个概括性结论,要靠谱多了。

当然,以上只是我浅浅举的两个小例子,真实场景中,我觉得有类似困惑的行业都能用上,尤其是“能回到源页”这一点,我觉得是最管用的。因为合同审查、财务分析、工程核验这些事,出了错是要担责任的,不能一句“模型说的”就交差。

在这一点上,VISION-MAP 更像是给 Agent 配了一位懂行的文档审查员。它不会将文件简单切分为彼此割裂的文本 chunk ,而是以接近人类阅读的方式,逐页理解文档中的标题层级、段落语义、表格、图像、图纸与版面结构,并建立“问题—证据—页面位置”的可追溯关联。

在用户提问后,系统不仅生成答案,还能基于对问题和文档结构的理解,准确定位答案来自哪一页、哪一个章节、哪张表格甚至哪一处字段;用户可以一键跳转回原始证据进行核验。

这种能力不只是提升了检索准确率,还显著增强了 Agent 检索与回答过程的透明度、可解释性和可审计性。

结果怎么样可以讨论,但证据你得有嘛,对吧。

现在,这个功能我们已经做好了,感兴趣的可以体验一下:
Knowhere Brain: https://notebook.knowhereto.ai/?utm_source=v2ex

你上传一份文档时,可以根据文件特点选择合适的理解方式。

如果是排版清晰、以正文为主的电子文档,可以使用文本解析,让 Agent 快速搜索和引用段落。

如果是扫描文件、复杂报告、图纸、图文混排资料,或者你特别在意原始版式与数字细节,可以使用 VISION-MAP ,让 Agent 沿着章节地图找到相关页面,再直接阅读原页。

你也不需要操心底层到底调用了多少次模型,你只需要像平常一样提问就行了,比如:

- “帮我核对这一年的合同金额和付款条件。”

- “这张图纸里设备 A 和管线 B 是什么关系?”

- “这份报告的结论,和前面的图表是否一致?”

Knowhere 会根据文档和问题选择路径,把相关文字或页面交给 Agent 。需要核验的时候,你可以从回答回到章节、具体页图,并追溯到最初上传的源文件。



如果你正在处理扫描合同、复杂报告、工程图纸或任何“解析成文字以后总觉得少了点什么”的文件,欢迎体验。有问题随时交流~
最新回复 (0)
    没有回复
* 帖子来源V2EX
返回