Artificial Analysis发布医学复杂推理评测MLCR-AA,Claude断崖式领先,Kimi K3紧随其后

quaful 2026-08-24 11:11 1

Artificial Analysis发布医学复杂推理评测MLCR-AA,考察模型对复杂医疗病例报告的分析、推理能力,评分项包括完整性、准确性和简洁性:Medical Long Context Reasoning (MLCR-AA) | Artificial Analysis


评测结果,从完整性上,Claude Fable 5、Opus 5遥遥领先:


Kimi K3的完整性居然超过了GPT-5.6。


但准确性上,GPT-5.6 Sol和Terra强于Claude和Kimi K3,说明幻觉少。综合排名:


看来医学方面的问题,应该是Claude Fable 5/Opus 5 + GPT-5.6 Sol组合着看

最新回复 (1)
  • Coffee 08-24 11:56
    1

    但准确性上,GPT-5.6 Sol和Terra强于Claude和Kimi K3,说明幻觉少。综合排名:



    Kimi K3 做全面初筛,然后让 GPT-5.6 Sol 做事实核查

* 帖子来源Linux.do
返回