文档接入AI根据模版规则进行格式化标准化遇到点麻烦,菜狗求思路

BinaryChia 2026-06-14 17:55 1

事情是这样,客户呢要求做一个文档格式智能化的处理:



  1. 能识别各种模版规则

  2. 根据模版规则校验用户上传的文档

  3. 能够修复不规范的文档内容


我这系统呢用的vue+java+python,AI相关的服务都在python,调的阿里的api,其他处理都在java。


我实现这个是思路是:



  1. 多模态模型识别模版规则

  2. 用户上传文档之后java先利用poi获取节点坐标,格式和数据,但是问题呢是用户肯定会上传一些奇奇怪怪的文档格式,比如正文加粗当标题,空格代替缩进这种。因此这里我一次prompt识别文本角色,到底应该是标题还是啥角色

  3. 识别之后拿着java传的格式对照规则看看符不符合要求

  4. 让用户看看检测出来的对不对,勾选一下想修复的,生成修复方案之后开始java-poi修复(修复规则是AI生成的)


整体是这样,问题就在于,检测角色总是不够准,导致有的问题检测不出来,或者检测出来了但是AI对照规则给不出方案,或者一段文字能给多个方案。搞了好久了,gpt+glm+deepseek都费老大劲了。实在没招了,来问问大佬们有什么好想法啊,是不是我这个思路太麻烦了,还是有什么新招,跪求思路或者指出我这个思路的问题。


(很明显人已经熬夜熬傻了,脑子不行了 ^-^

最新回复 (7)
  • Bensong 06-14 17:58
    2

    你这个不就是数据清洗的范畴了吗?现在数据清洗还都是人工来清洗的,怎么可能全部让AI来清呢?这玩意儿确实难搞呀,你文档。啥样的都有,对吧?你在文档里边画一张图。或者是加一个什么乱七八糟的。你加一个法文。你加一个西伯来文,你加一个英语,你加一个中文,你再加一个拉丁文,你怎么搞啊?

    要不你就加多agent。对吧。一个agent清洗,一个agent来复核,然后一个agent来查资料。

  • BinaryChia 楼主 06-14 18:00
    3

    是啊,所以我暂时第一版限定的就是一些文本啊,页面规格,表格文字,shape样式之类poi能支持的格式上的修复,多余的图片内容理解啥的都暂时不打算做

  • Bensong 06-14 18:01
    4

    没啥意义,你搞不完的。真的。我现在数据清洗都是直接交给codex来去清洗。而且。文档每个文档都有差别,你怎么搞?我也没办法,我现在全部都是用codex来清,自己写脚本,自己处理,自己复核

  • BinaryChia 楼主 06-14 18:01
    5

    多几个agent会不会太慢了啊,效率上。其实现在也差不多是这么做的了,为了精准度,分了三步走:检测内容角色+看看合不合规+审查

  • 识宝 06-14 18:02
    6

    没有特别的理解,就是说用户的模板全部都是各类图片?然后自己用多模态识别再画一遍?

  • BinaryChia 楼主 06-15 19:12
    7

    是不是我想做的太多了太细了导致的,现在很烦恼,有点精益求精困住自己了,但是这东西是大客户要的,又不能敷衍做,嗨呀 ^-^

  • BinaryChia 楼主 06-15 19:14
    8

    模版什么都有吧,可能是标准的文档来识别,也可能是文字+图片指导型的。

    不过我也想通了,用户不可控,AI不可控,那必然不会精准到100%,所以今天的开发方向改了一下。

    (顺便说昨天不回是因为新人限制回不了 ^-^

* 帖子来源Linux.do
返回