RAG知识库如何构建,求助

X 2026-09-15 13:39 1

最近想针对专业的大量文件规范(一般都是pdf文件)构建一个RAG知识库,最好是表格也可以完整记录索引的,实现完全针对知识库内容进行输出。RAG的原理大概明白,只是想问问有没有佬们推荐解决方案,例如软件和方法之类的

最新回复 (16)
  • Piz.liu 09-15 13:41
    1

    好像要用向量数据库,没有实操过,有答案了踢我一下

  • 憨憨和Nike 09-15 13:44
    2

    最近可能也会用到,搜了一下论坛里没有什么具体方案,有了也踢我一下

  • r3drum 09-15 13:47
    3

    感觉得结合接入的模型能力来综合取舍,LLM wiki的形式我觉得比向量召回会更合适

  • eversleeping 09-15 13:51
    4

    可以尝试一下WeKnora,我觉得一般用用够了。

  • Ninth 09-15 13:53
    5

    佬可以看下扣子开源版,基本功能都有

  • wc81 09-15 13:54
    6

    RAG里面最坑的就是向量,这东西基本就是负收益的代名词

  • X 楼主 09-15 13:54
    7

    我好像有印象,好像是腾讯新出的是不是,话说这个可以完全保留pdf中的表格信息,同时AI能完全识别吗

  • X 楼主 09-15 13:55
    8

    好滴好滴,我去看看,github上的项目吗

  • eversleeping 09-15 13:56
    9

    我解析过pdf,效果不是很完美,我也是测试,数量不多,就把pdf用mineru转md了,这个效果很好。

  • 佩克兰德 09-15 13:57
    10

    我之前看的两个佬的,站内还有很多呢,佬搜搜应该就挺多的,方式也有很多,看你的需求,可以从简单的向量数据库开始。


    <1> 背景
    自动化测试代码维护这行干了挺久,以往基本是在和内部框架打交道,以往工作实属不难,只能说测试以及Debug比较耗时间精力
    后来上面也想与时俱进一下,就想着结合AI搞点辅助我们工作的东西,想法是美好的
    团队里有一套长期演进的内部工程体系,配置、脚本、规则和经验散在不同地方不同人。
    新人要改一个东西,有时要问老同事;老同事也不一定每次都记得准,只能继续翻文件、搜历史、看代码。
    于…


    引言
    实在不好意思这么晚才更新新的文章……这几天忙的事情比较多所以就耽搁了,而且其实昨天就开始写了但是写了一半不小心退出了没保存还得重写(因为我一般在自己的博客平台写,没设置自动保存之类的功能)(悲)。今天给大家带来的是对于RAG全链路,从chunking、embedding、存储……到最终的输出给LLM充当证据生成答案,都会有所涉及。
    此外,在这篇文章种我必须要反驳一个观点:所谓的RAG已死。…
  • Vince 09-15 13:57
    11

    fastgpt + 文本、向量、排序模型

  • X 楼主 09-15 13:57
    12

    然后放到RAG里再进行切片吗,明白了

  • Glen 09-15 13:59
    13

    可以用dify嘛

    原生应该支持pdf类型的文件上传

    或者可以自己写个拆分文件的py程序,调用dify的api接口,上传至dify的知识库

    自己拆分的话,也可以根据文件/数据的类型,选择合适的拆分方式和chunksize

  • X 楼主 09-15 13:59
    14

    okok,佬们的方法我都去试试,试完后再回到帖子下发结果 ^-^

  • Nba12 09-15 14:00
    15

    【开源推广】 企业级知识库:中文优先的企业 RAG 知识库(市级智能客服验证) - #43,来自 Nba12 可以看看我的帖子 ^-^

  • yuchuanmu0506 09-15 14:26
    16

    留个脚印,后面有需要再来看看,感觉要学的东西太多了,根本学不完

* 帖子来源Linux.do
返回