gpt-6 pro 和 Fable 5.1 max 感觉做科研还是不行啊

galaxy 2026-09-17 14:28 1

可能适合设计或者绘图这些方面,但是我我用来做科研还是不行,上下文一长(一个窗口十个对话左右,就要换新窗口) 就开始丢三落四,一会说忘记看之前发的文件了,又说文件没读完,逻辑也跳来跳去,想让它帮我设计一个实验任务,总是设计不好,我的想法也丢给它来回优化好几次,提示词都是让 AI 优化后给它的,但是最后交出的版本感觉还是根据 概率 token 预测出来的一样,毫无灵魂,甚至都能猜到它会给什么,这两个都是最高的订阅,也没有降智,每次提问都思考十几分钟甚至更久,但是还是达不到期望,是不是我不太会用?我先让 AI 整理完的需求,包括我提示词没有覆盖到的隐形需求,然后让我确认,即使这样反复讨论下来感觉还是收获不大,甚至有些点是我顾虑到了,它没考虑到。这两个目前已经算是最强的了吧?但是做科研,写论文,可是适合写代码,优化项目工程啥的,但是像人文社科类的,需要好的 idea 的感觉还是不太行。人文社科需要大量的文献积累,丢给他几篇论文让它读,能读懂,但是几轮交互上下文就又没了。

我现在用下来感觉最容易被 AI 取代的反而是理工科,而不是人文社科 …

有没有好的意见?

最新回复 (19)
  • Davi 09-17 14:29
    1

    给配个RAG知识库,加个记忆模块。

  • galaxy 楼主 09-17 14:31
    2

    我将每次交互的重要文件上传到谷歌云,然后 gpt 每次对话都可以连接阅读这些文件,是不是同样的道理?

  • Davi 09-17 14:34
    3

    不是吧,RAG是知识图谱。

    上传谷歌云应该配置谷歌的notebookLM用吧。

  • Abruzz1 09-17 14:35
    4

    我不太建议科研场景用rag。甚至不如本地在/docs 里面记md。原因是rag的召回一旦某一次不准,造成的后果反而会更耗token,更耗上下文。

  • 湛琉 09-17 14:36
    5

    有点想当然了,维护一个RAG比搞科研还累

  • galaxy 楼主 09-17 14:36
    6

    我也觉得,每次检索太浪费 token ,而且科研每次做出的决定可能让上下文记忆更加混乱。每次有好的 idea 我都会新开上下文,不敢在一个上下文交互太多内容

  • 莉莉安 09-17 14:38
    7

    用claude桌面版自带的project试试?主要还是聊天记录要落到硬盘上的问题,通过claude.md让他在你的项目里面,维护一套记忆md。而且claude project在文档数超过多少多少的时候会启用rag模式

  • galaxy 楼主 09-17 14:38
    8

    现在给我的感觉是,我的理解速度跟不上 AI 的回复速度,每次哗一下输出一堆,一方面还得辨别输出的内容哪些有价值,哪些没有价值,另一方面还得继续维持上下文,还得处理每次输出的文件,真的太累了,每次都是在 gpt ,claude ,grok 不同 AI 之间来回切换,我自己都搞懵了,到底该用哪个版本的意见了。

  • Abruzz1 09-17 14:38
    9

    (帖子已被作者删除)

  • Abruzz1 09-17 14:40
    10

    我觉得你不应该频繁开新会话,试试在一个上下文里面loop。现在的harness都把compaction做的比较好,在一个上下文里面工作不会丢太多注意力。

  • galaxy 楼主 09-17 14:40
    11

    能不能具体指点一下,大佬,现在信息像洪水一样扑面而来,我的理解速度跟不上 AI 的回复速度,每次哗一下输出一堆,一方面还得辨别输出的内容哪些有价值,哪些没有价值,另一方面还得继续维持上下文,还得处理每次输出的文件,真的太累了,每次都是在 gpt ,claude ,grok 不同 AI 之间来回切换,让它们互相辩论,但是到最后输出的文件越来越多,像草稿纸一样,堆积如山,不知道咋处理了

  • 栖迟 09-17 14:40
    12

    我感觉还是检索和上下文的问题,每次跟它讨论一个创新点,总是检索不到好的论文;上下文一长就回答的牛头不对马嘴。

  • Abruzz1 09-17 14:43
    13

    保持一个主agent在同一个上下文里一直工作,让他记个/wiki ,把一些决策记下来,1m模型的auto compaction设置在500k差不多。 其他agent的信息你应该尽量告诉主agent,比如“grok反馈信息:xxx”

  • apparition 09-17 14:51
    14

    科研不行

    大概是设备不行 (钱 ^-^)

  • galaxy 楼主 09-17 14:53
    15

    跟设备没关系吧?不需要算力,订阅就够了,但是输出还是不太满意

  • galaxy 楼主 09-17 14:54
    16

    好的,试一下,谢谢啦

  • Bunny🐰🐰 09-18 10:54
    17

    上下文应该是agent方案的问题吧,站内最近热门里有一个北大的方案或许能用到?我感觉claude science用起来还行不过不是人文社科

  • Da_Da_Zi 09-18 11:30
    18

    我使用这些顶级模型搞科研的经验就是:上下文管理一定一定很重要。


    举个具体例子。给定一个研究主题,让 AI 帮你找可能的创新点,第一步不是让它直接输出创新点,而是让它先帮你找符合研究主题的相关文献。根据我的经验,我平常用 IEEE 和 Elsevier 的文献比较多。一般来说,下载最相关的文献 20~30 篇就足够了。然后用 Zotero 管理这些文献。我记得 Codex 是有 Zotero 插件的,可以很方便地读取。读取完相关文献以后,其实就已经构建了一个比较好的上下文。当然,读取这一步可以用子代理去完成,这样可以减少主线程的上下文占用。


    第二步是筛选相关文献。这个时候就体现出 human in the loop 的作用了。因为写论文,你必须得有自己的主见,完全交给 AI 是不行的。正如很多人感受到的那样,AI 很多时候分不清创新点及其重要性,也就是说,你得有自己的 taste。它经常会把一些普通的执行步骤,或者一些很简单的训练技巧当成创新点,这是不行的。所以这个时候,你必须严格限制它的输出。否则,你就会经常看到 AI 输出一些长难句,并且把它当作创新点。原因是,当前的 AI 基本不具备判断创新点的能力,所以很多东西说起来既抽象难懂,又让人觉得是简单的拼凑缝合。


    在科研创新点探讨这个阶段,具体限制 AI 输出的内容如下:


    假设我当前安装了 GitHub 上 star 数很高的那个学术技能插件,它是一套面向科研流程全生命周期的管理流程。在探讨科研创新点时,往往会被动触发该插件的相关技能,导致 AI 输出大量信息。但很多时候,你并不需要这么多内容。例如,它在提供可行思路的同时,往往会附带后续的实验步骤,以及针对创新点特有的“防御式声明”。


    当你不需要这些额外信息时,就需要限制它的输出。你可以在提示词中明确说明:



    当前是创新点探讨阶段,严禁跟我讨论任何其他阶段的内容。



    此外,还有一个很重要的思路就是“渐进式披露原则”。也就是说,你不要期望跟 AI 一探讨,它就给你输出一套完整的、可以直接放入论文正文的方法。这部分内容一定是经过多轮迭代修改的,所以可以采用这个原则。


    具体来说,你可以先给它一个研究主题,然后让它去读取相关论文。因为科研的本质很多时候就是拼凑缝合,无非是看谁讲故事的能力更高而已。基于这个思路,你可以一开始就跟 AI 按以下步骤探讨:




    1. 明确研究主题与条件

      告诉 AI:“我当前有一个想研究的‘XX’主题,目前主要是基于什么样的假设,或者什么样的条件去进行实现。”这一块需要你自己把握。




    2. 检索文献并寻找思路

      让 AI 检索本机 Zotero 软件库中下载的文献,找出与本文研究场景最为类似、可以最大程度方便迁移的文献,并帮你看看有哪些可行的思路。一般选个3~5篇就够了。




    3. 严格限制探讨阶段

      一定要在给模型的提示词中加入这一段内容:“注意,当前是科研创新点的探讨阶段,严禁跟我讨论后续内容。”不然的话,模型就会考虑很多,但不一定会把注意力放在“创新点探讨”这件事上。而这件事通常占据了整个面向 Agent的科研中非常重要、占用时间长的过程。这样一来,模型的输出受到限制,回答质量就会好一些,幻觉现象也会少很多,因为它的注意力集中了。




    在此之后,如果这一步做得好,那么 AI 通常会给你输出几段简短的大概思路,不会提前展开公式,也不会说出特别难懂的句子。接下来,你就可以根据自己的 taste 去挑选 1~2 个你感兴趣或者认为初步可行的方案,让 AI 帮你继续完善、铺展开。到最后,就慢慢迭代发展成一个可行的思路,至少是有清晰逻辑的,不像之前一股脑输出的那种拼凑式、毫无美感的创新点。


    当然,每次迭代都必须要有人工把关,这个时候其实就比较考验人的能力了。所以当前各个期刊的投稿数量激增,但真正有质量的好文章总比例还是比较少的。很多人本身学术 taste 没有上来,借助 AI 放大以后,就产生了很多这种垃圾文章。


    这是我当前的一个经验和技巧,也是“渐进式披露”原则的应用。核心就是:先喂高质量上下文,再严格限制阶段,最后用自己的 taste 多轮迭代。

    以上回答由typeless全程人工说话整理而成,没有AI内容。

  • LexDAD 09-18 11:33
    19

    核心的问题在于很多理科的场景能够做一些 tool 验证(比如写代码),所以很多上下文的矫正其实是靠着 tool 来给反馈这么来推进的。人文社科类的纯靠模型自己的智力能力,高深的内容是比较难的。

* 帖子来源Linux.do
返回