我要结构化入库一本书《内科学 十四五 第十版.pdf》

EasonIndie 2026-09-24 08:23 1

现在的做法是按照目录切分成块,后面想根据不同疾病来抽取书本知识,这一步计划工程做,然后组装 prompt 给大模型出针对某个疾病的专业的学习资料+考核题目+模拟接诊。


目前在结构化入库阶段


但是其中的图标怎么解析与什么样数据结构存比较好呢? V 友有没有经验的,望不吝赐教(抱拳)


以下是几个典型的图,我让 ai 给 coding 出解析脚本一直不理想。






最新回复 (6)
  • maocat 09-24 08:47
    1
    `根据不同疾病来抽取书本知识`

    那只能用 GrapRAG 了

    图和表的处理,一般就是提取文字,再加上 vlm 对图表的描述,建议提取的表格要保持结构(markdown/html table)
  • mx2dream 09-24 10:11
    2
    我参与过类似的项目,如果你要求精准度,就不是一个人能完成的,很麻烦,费时费力。需要换个思路,不要被这个 PDF 限制了,关注目标而不是一定通过某种方式实现,可识别文本+专业题库 API+人工校对。不要想着一键提取。这种教材原版一般也是 Word 转 PDF 制成的,然后由排版设计完成最后一步
  • wroyal 09-24 10:18
    3
    关注这个实现方式,最近也有这个需求,需要结构化一个知识库
  • zhangli2946 09-24 10:38
    4
    1. 先试试 IMA (tencent)
    2. 如有本地化要求,试试 IMA 的开源版本,自托管一下。
  • qazzhouwei123 09-24 11:18
    5
    你这些图表都算好处理的,提取文字是核心,确保 AI 能够用传统的文字方式检索到。那些没有文字的如风景图、人物图、抽象图才是真的麻烦,只能用 AI 模型单独跑图像识别
  • dododada 09-24 16:13
    6
    我记得站上看到一个兄弟做了个关于论文结构化的东西的,你找找
* 帖子来源V2EX
返回