上海交通大学发布自进化大模型BigBang-V1,36B参数媲美千亿级巨模型

Bunn 2026-08-07 23:00 1

上海交通大学旗下Endless Frontier Lab研究团队近日推出新一代大语言模型BigBang-V1,凭借独创的对抗式自进化合成数据框架,仅用约1万条高质量训练样本,便实现了远超同规模模型的综合性能表现。


传统大模型训练高度依赖人类专家设计的训练任务,随着模型能力逼近人类水平,这一路径正面临明显瓶颈。BigBang团队提出全新思路,让模型在知识边界处自主生成、自主验证任务,从而突破人类知识上限的束缚。


BigBang-V1基于Qwen 3.6(35B-A3B)进行高效后训练,其核心框架由两大组件构成。其一为生成器智能体,负责持续提出并求解难度递增的科学与技术问题;其二为评判器智能体,从正确性、难度、可扩展性、多样性四个维度评估生成内容,并以真实前沿研究任务校准合成数据分布。通过生成器与评判器的迭代博弈,框架最终构建了跨多领域约1万条高难度后训练样本,以极低的数据成本实现了显著的性能飞跃。


在涵盖长程搜索、软件工程、科学研究、AI研究的8项代表性基准测试中,BigBang-V1在所有8项测试中均取得35B规模模型的最高分。


在科学研究方向,BigBang-V1于FrontierScience Research得分46.2,Humanity’s Last Exam得分50.3,BioMysteryBench-HD得分15.7,PaperBench(Code-Dev)得分53.6,上述四项均超越参数量达1.6万亿的DeepSeek V4 Pro Preview。


在代码能力方面,SWE-Bench Pro得分54.2,位居35B模型首位。在长程搜索方面,BrowseComp得分76.5,同样领跑同规模模型。

最新回复 (6)
  • 思维建筑工 08-07 23:18
    1

    如果能力真的和评分相当的话那真是核弹爆炸了,这么小的模型家用电脑都能部署吧?

  • ANON 08-07 23:21
    2

    小模型真能(不泄题)做Humanity’s Last Exam么?

    我直觉以为这个测试应该是小模型杀手

  • lightjunction 08-07 23:26
    3

    希望不是又一个做题家模型,跑分数据看看就行了

  • SunwardGrace 08-07 23:27
    4

    小模型的评测我觉得只能看看,目前没发现有啥泛化性比较好的小模型,泛化性太差的话日常使用很难受。这种小模型比较适合固定场景应用

  • hwang 08-07 23:30
    5

    1 万条高质量训练样本




    长程搜索、软件工程、科学研究、AI 研究的 8 项代表性基准测试中



    偏科王者?

    这种拿来专门做一些专精工作应该不错,比如说把训练样本 换成小程序开发相关的,然后拿来做小程序开发

  • 夏日渐长 08-07 23:47
    6

    这个模型的启动是不是要说“冰冰冰 冰冰冰 板鸭板鸭板鸭”^-^

* 帖子来源Linux.do
返回