话说现在最诚实的模型到底是哪个?

aya 2026-09-14 11:20 1

如题,今天发生了一件我非常崩溃的事,我让 astra 基于一个开源项目的依赖,帮我剪视频。它帮我剪了一整天,效果总是差强人意,但比装依赖之前确实提升比较大了


然后今天我看额度不够换了 sol,感觉差的模型就得狠狠骂!这一骂就骂出事情了,经过 sol 检查…… 这一整天,astra 根本就没给我装那个上游依赖!! 特么的,真的想捶死奥特曼


所有有没有那种诚实模型,不虚报的那种?或者有什么 agents.md 能实现诚实模型的效果?发哥诚实模型有木有!

最新回复 (17)
  • 鸡汁的肉丸 09-14 11:22
    1

    请多几个不同的模型相互监督,看看会不会好点?

  • calendar 09-14 11:23
    2

    去相亲吧,你会遇见世界上说话最诚实的模型

  • Amor_Oneself 09-14 11:24
    3

    最近 Astra 降智了,不太建议将任何任务交给它,也就是说可以暂时休息了

  • Mr.L 09-14 11:25
    4

    minni max 吧。

    记得有个排行榜

    好像智商不高,但是幻觉率是天花板级别的,比 claude, gpt 都强。

    做知识库应该不错。

  • VictorQuqi 09-14 11:28
    5

    BullshitBench,可作参考


  • ljj414 09-14 11:33
    6

    模型降智商肯定会出现这种问题,最好是写好工作流让不同的模型计划、执行、审查,互相监督很大程度上能避免。

  • 翠花上酸菜 09-14 11:33
    7

    可能没有吧,完全诚实的模型意味着没有幻觉,而幻觉问题应该暂时所有模型都有

  • aya 楼主 09-14 11:34
    8

    幻觉率高,应该算不太诚实吧?还是说我对这个的理解有误

  • aya 楼主 09-14 11:38
    9

    因为我不是做大型软件开发,是做那种长程一次性任务,所以计划、执行、审查,互相监督对我来说是比较浪费的。偏办公+编程之前的活儿了这个是

  • aya 楼主 09-14 11:38
    10

    看起来A​^-^天天吹嘘的价值观对齐也不是没有一点作用啊

  • VictorQuqi 09-14 11:41
    11

    这个榜也不能全信(


    应该是测输入胡编乱造的信息,看模型会不会顺着继续编。但是模型对着工作结果编报告,情景和此 Benchmark 的可能就不完全相同了


    之前用 Opus 4.8 的时候体验也比较差,谎话连篇

  • ljj414 09-14 11:46
    12

    那就分阶段整呗,多调一个模型来审查应该能解决

  • 小叮当 09-14 11:47
    13

    国产的模型目前好像不会降智,不会是真不会。

    国外那几家现在随机降智,已经变成开盲盒了。

  • 钯箔苯 09-14 11:48
    14

    claude家的模型应该是指令遵循做得最好的,个人看法

  • LIFE001400 09-14 11:48
    15

    这个榜单只评测了,在给出一个错误的前提的时候,它是否会指出用户的胡说八道,所以 Claude 的模型排的很高。但是它并没有反测另一方面,就是在给出一个正确的前提的时候,Claude 的模型是否会仍旧反驳用户。而在这一点上,Claude 的模型非常的显著的具有一个趋势,就是和用户对着干,就是不顺着你。例如 Fable,它认可你评论的概率是百分之零点几,但是它反对你的概率是百分之二十几,是在相同的问题的情况下,仅仅由于你的身份不同而导致的。所以我不认为它是一个诚实、可靠的模型。


    或许用更直白的话来讲,它是一个喜欢反驳用户的模型。所以,当它看到你具有错误前提时,会第一时间反驳你。但这并不代表它不会误伤。只是相比其他模型,其他模型更愿意顺从你,而这个模型更愿意讨厌你。


    这还有一个显著的问题是,它给的是问题去评测这个模型会不会诚实的有一个反馈。但是并不代表在可能一个庞大的代码库里面,它还能够给出诚实的反馈。因为这不仅仅依靠它是否想要诚实,而更依靠它的一个上下文能力

  • Mr.L 09-14 11:50
    16

    就是幻觉低。

    claude gpt 幻觉率 50% , minimax 能达到 20 30% ,具体数值忘记了。 ^-^

    当时看那个评测图就让我当时就记住了,minimax 适合知识库。

  • 当当946 09-14 12:09
    17

    余承东大模型 —— 一个诚实正直,不说假话的Big Model

* 帖子来源Linux.do
返回