求助:JAVA读取PDF获取PDF内容以及坐标(消耗内存低)

Gabong 2026-08-27 13:37 1

求助:JAVA读取PDF获取PDF内容以及坐标(消耗内存低),现在上级要求调研这个,当不能获取时候再通过模型来做。大佬们有什么好的方案吗? 不限制java,python也行

最新回复 (17)
  • 灰名单用户 08-27 13:41
    1

    你咋不问AI呢?这块AI很擅长呀

  • Gabong 楼主 08-27 13:42
    2

    AI能解决的,就不在这问了。我们公司用的miniu这种的,但是一直出问题

  • Zven 08-27 13:42
    3

    去看看codex的pdf阅读解决方法。

  • xzc0502 08-27 13:43
    4

    走OCR啊,PaddleOCR-Vl,我们目前用的是这个,可以给出MD格式的结果。

  • Gabong 楼主 08-27 13:45
    5

    PaddleOCR现在就有就是压力太大。现在想做的是能否本地解决,解决不了再走这套

  • christina 08-27 13:47
    6

    楼主你说的应该是MinerU吧,我们公司之前是本地部署的 PaddleOCR-VL,效果挺不错的,可以试试

  • Gabong 楼主 08-27 13:49
    7

    是MinerU,本地部署的 PaddleOCR-VL这个也有就是并发上来后还有其它业务就很容易扛不住

  • Lan0 08-27 13:51
    8

    用古法编程呀。我几年前弄过,好像是官网提供的库

  • xxx 08-27 13:58
    9

    我之前做过这个,我的方案是,你为什么要获取所有的pdf的内容?如果都是有价值的信息 那应该直接全部使用类似mineru这种模型, 如果大部分是没价值的内容,那你应该确定什么是有价值的内容或者没价值的内容的图像特征是什么?如果说采用小模型初筛 大模型精筛 你又怎么保证小模型识别的内容 比如数字是正确的呢?

  • lzd2 08-27 13:59
    10

    这不是 PaddleOCR 的工作咩,虽然我觉得这个可用,但是效果并不算很理想


    阅读顺序会乱、丢失内容。。。

  • 今天学点啥 08-27 14:00
    11

    付费工具可以用 比如 阿里的 文档智能


    开源工具,你要不试试 什么MinerU Docling Marker Markitdown ?看看 这些工具是不是适合你?

  • xzc0502 08-27 14:04
    12

    他有一个高性能方案,不知道你们部署了没?如果那个也不行的话,可能就难了

  • Nba12 08-27 14:06
    13

    从上线的角度,64页,得不超过10s,应该是多节点,多线程即说是:多GPU并行+服务常驻+页面级并发+跳过不必要OCR+只处理复杂页,一般会这么做,写路由逻辑,可编辑,不可编辑分开处理。真实场景8成是可编辑。这块的时间会很快,只需要配合layout,然后把表格这种丢vlm做,layout本身耗时很少,ms级,pagelevel,blocks都弄成消费池,8卡,可以做到26页/s且是L20。 6卡4090 就更快了。

  • Nba12 08-27 14:08
    14

    参考skygazer42/DocPrism 以及 skygazer42/DocPilot 或者 skygazer42/deepdoc

  • Gabong 楼主 08-27 14:10
    15

    什么高性能方案,可以细说吗。这个还真不知道

  • bytemaster 08-27 14:11
    16
    PDFBox + Tabula

    这个挺好用的,目前已完美走通

  • 没有道德 没有底线 没有思想 没有品德 没有素质 08-27 14:12
    17

    用 fitz 啊 每一行都是一个 block

* 帖子来源Linux.do
返回