RAG是否有研究的意义?有没有其他技术?

yxs 2026-07-30 10:33 1

RAG我用过一些,去年尝试过dify的知识库和旧版的ragflow,今年用过anythingllm和新版的ragflow,感觉效果都还一般。


核心不在于如何向量化、如何召回,而是切分,甚至是PDF解析,这也是新版ragflow我感觉主要提升的地方。现实情况大部分资料知识可能都是有点脏的,没有那么好的文字数据供你去建库,一旦切分不好、PDF解析不好,效果还不如人工去找之后当作提示词输入上下文。


至于graphRAG,流程又慢,自动化效果很差,想要好的效果还是得人工治理。刚刚在其他帖子看到pageindex这种vectorless rag,准备研究一下看看。还有什么其他技术吗?佬们在生产中真正使用rag体验如何?有什么经验分享吗?

最新回复 (11)
  • baima 07-30 10:35
    1

    我刚安装了ragflow,不知道实际效果如何,感觉pdf解析慢且不准

  • levizheng 07-30 10:37
    2

    去年了解了一下ragflow,这玩意太吃垂直行业了。各种不同形式的文件解析才是大头,用mineru感觉效果也不是很理想。

  • shuibuxin 07-30 10:38
    3

    重要的还是如何合理的切分。不同类型的内容切分不一样。这个很难适配出统一的规则。如果暴力按照篇幅数量切分,又不太好。 文章类的 如果按照段落切分,不同段落的内容大小又不一致。 太难了 ^-^ 现在慢慢的方法应该改变了。如果不考虑速度效率。不如把文本都做成md。放在一个文件夹让 agent 直接在里面用命令工具搜。同样是知识库可以了解下obsidian 这类的。它并没有实现向量化呢。

  • onlyxx 07-30 10:39
    4

    我之前也做了一个ragflow,从html做切分,确实不太理想。但是我发现他可以手工改通过admin控制台改切分。我想说有没有可能将内容交给AI来切分?

  • hoa 07-30 10:40
    5

    ragflow,用生产,需要调整很多东西,解析慢不是ragflow的问题,解析pdf 基本都是mineru 的速度。还有emb 模型相应速度了

  • leo_00 07-30 10:43
    6

    哈哈,去年我们公司也搞了个小组搞RAG,研究部署了了各种开源框架,各种切分方案。好不容易上线了,公司内部测试,发现数据总是更新不及时,例如AI拿到的数据总是慢半拍(数据不是最新的),复盘发现公司没有一个专门维护知识库的部门。今年项目降级了。

  • hoa 07-30 10:46
    7

    真实,基本要靠人肉运维,客户场景五花八门,满足这个,又出新的那个。感觉不做垂直领域真的难

  • Kassdin 07-30 10:47
    8

    pageindex 这种只有时延不敏感的任务用吧,和传统rag还是区别比较大的

  • Toluv 07-30 10:56
    9

    (帖子已被作者删除)

  • Yansuu1 07-30 11:56
    10

    将每一次对话的数据(不只是对话消息,还有调用,查找到,rag等)也保存到rag里面

  • 嗯djs. 07-30 12:05
    11

    普通开发者还能研究下的也就是切分环节如何自动化和自适应了吧,后面检索阶段成熟方案已经非常成熟了

* 帖子来源Linux.do
返回