双非本硕也要发顶会? 一个普通研究生的碎碎念(简单分享一下想法

maple 2026-06-24 22:16 1

开头先致歉,本人其实并没有发顶会,目前是中稿了一篇CVPR Findings,距离真正的CVPR main track还有一点差距,我作为整篇论文的一作和唯一学生作者也真的是尽力了。


简单介绍下个人背景


目前我是就读于福建一所双非院校,本科也是双非,两所院校甚至都不是双一流,而且我还是工作了2年后才去读的研,也算是debuff拉满了。目前是在外联培,联培单位不放实习,所以在这边基本只能搞搞科研,我也就把心思都放到这个上面了,目前除了已经中的这一篇,大概还有4~5篇一区论文在路上,在双非里也算是有点成果了吧。由于系统内的导师就是联培单位的导师,所以并没有学校内的导师,联培对我的指导也很少,基本就是导师可以帮忙改改论文的程度,其他几乎

都要靠自己探索和努力,不过依旧很感谢我的导师,为我提供了帮助。


写这篇帖子也是想记录一下自己的过去,也希望我自己的一些想法能够帮助到在科研苦海里的研究生们,不过本人能力并不突出,经验仅供参考,如果有错误也欢迎批评指正,另外也想跟各位聊聊后续的发展,无论是科研还是工作,希望各位佬友畅所欲言



好像写的有点难懂,我后续会润色一下,各位佬友有什么问题可以随时评论,我都会看的



一个有趣的idea


什么叫有趣呢?让别人看到后会想原来还能这样,或者想为什么这个方法会有效呢,在或者这篇论文提出了一个特别重要,但是大家普遍会忽视的问题。只要满足这三个中的任意一个,我认为都可以叫做有趣的idea,只要这个idea多数人会觉得有趣,那么这篇论文的价值一定不低。 科研并不一定是探索什么方案排列组合能够获得最高的性能(这个在工业界可能是需要的),而是思考这个方案是否把人类的认知往前推进了一步。 比如大家其实并不在乎用汽车跑的比马更快,而且相比于马,汽车是否把人类对于交通工具的认知更加推进了一步。


有趣的idea来自哪里


相比于网上说的多看论文,多做实验外。我觉得更多的来自对于一件事物本质的质疑和思考。还是拿汽车举例,相传 亨利·福特(Henry Ford) 说过一句话 If I had asked people what they wanted, they would have said faster horses. 这句话大概是说在汽车出现前,人们出行会想要一匹更快的马,而不一辆汽车。这个其实就是对出行这个事情本质的思考,人们想要的是一个更快的交通工具,但是很难直接表达出来,而是表述出“我想要一匹更快的马”,这就需要有人准确的发掘出这个更加本质的问题,并提出一个比较好的解决方案,这就是一个很好的idea。科研的idea也来自这个,比如视频理解,我们可以去想,目前视频理解为什么问题答不对,是因为没看到(优化帧采样,注意力机制),还是根本就没看瞎猜(强制模型输出视觉证据、解决模态融合问题),还是现在的benchmark其实跟实际生活根本不符(长视频理解、流式视频理解、更新的benchmark),这些都是可行的方。我们来更近一步如果真的是模型没看到,那么如何让模型真的“看到”,如何保证看到的是关键信息而不是背景信息,如何保证看到的信息不会扰乱答案的输出,如何在保证模型在能正确回答问题的前提下尽量减少视觉token以提高效率等等,当我们深入4层,基本就有一定的想法或者认知了,这时候可以提出一些简单的假设,去搜索相关的文献来验证。

另外还有一个来源,借用一句老话”没有问题创造问题也要上“,可以找下目前领域的SOTA模型,在能够正确复现后尝试增加各种扰动或者噪声,如果模型性能出现明显下降,那么这个或许就是一个可以进一步的方向



个人认为其实这个想法可以拓展到非常多的领域,去创业,做产品等等,能够思考用户真正的痛点,市场真正的空白,往往也是契机所在的地方,另外马斯克的第一性原理感觉跟这个也是相同的思想




还有一点,能否使用AI来想Idea,我认为当然可以,AI的信息总结和搜集能力所很强的,但是他们对于方向的把控却不够强,claude想的idea很符合逻辑,不过也往往太符合逻辑了,导致想出来的普遍已经被其他人做过了,gpt往往能将一个方案改上好几遍,不断的加防御性的论述,这个也是不合理的,你需要对一个idea有一个判断,在目前AI科研的趋势下,人能发挥的特长就是判断,知道什么能做什么不能做,剩下的让AI去做。



一个有效的methodology


当我们准确的发现了一个问题,那么接下来就该找一个有效的方案了,如果你的方案设计符合目前主流的神经网络设计方法,或者用到了强baseline,且没有做根本架构上的改变,那么是否SOTA其实只是工程问题,并不是创新性问题,你可以用很多方法让一个对baseline影响不是很大的模块优化到SOTA,但是是否SOTA并不影响你这篇论文是否能中稿,对顶会顶刊也是如此,就像我上面说的,科研并不一定是探索性能最好的方案,而是追求这个方案是否把人类的认知往前推进了一步。另外目前AI很发达了,只要你有一个大概的优化想法,让AI帮你设计,基本不会差的太多,但是让AI设计这也限制了方案的上限,他们很难写出 Attention is all you need,这样的论文,不过对于大多人来说,这个够用了。


一个吸引人的story


可能大家听说过无数次“你需要讲一个好的故事”,但是很少有人能够讲清什么叫“好故事”,我认为一个“好故事”需要以下这几点


一个“痛”且“痒”的问题


首先你提出的这个问题必须真实,这个问题越“痛”,越“痒”,越让审稿人觉得你提出的这个问题必须要解决不可,那么这个就是一个很好的问题。如果能让审稿人觉得,你这个问题非常关键,哪怕你的方案解决的不够好,但是发出来可以让其他人意识到这个问题,让这个问题有更好的解决,那么你这篇论文也有很大的可能被录取。但是很多人可能研究方向比较小众,或者泛用性偏差,那么我认为比较好的切入点是“为高楼添砖加瓦”,以大模型举例,如果你只是研究LLM在某个方向上的下游任务,可以说这个方向为LLM中的XXX能力的提升提供了探索方向。甚至如果你无法在一个benchmark上达到SOTA,那么最好的方式是限定范围,比如在动作识别上,目前已经有很多识别算法达到了97%以上的性能,你再去卷那百分之零点几的性能要耗费的精力很大,不如缩小一下范围,比如在低光场景下实现稳健的动作识别,这样即使你的性能不如目前的SOTA模型,你也可以用适用范围不同来回复审稿人


一个反直觉的切入点


当我们发现了一个问题,如果我们还想用比较大众化的解决方法,比如某个小众领域在单模态下性能不佳,就从其他领域迁移多模态的方法,然后实现了性能的提升,那么可能会被审稿人说你这个的工程上的改进,并不算创新。不过如果不是投顶会顶刊,这样已经够了,只要你的逻辑能自洽,证据充分(后续会讲),那么多数不会过分难为你。

不过,如果目标真的是顶会顶刊,那么就需要一个”反直觉“的切入点,领域内普遍这样做,那么就要说这么做存在缺陷;领域内普遍默认某个情况,那么就说这个情况不合理。比如异常动作识别领域,普遍做法就是跟分类任务或者检测任务类似,去学习特征表示,但是ECCV 2025(好像是)有一篇动作异常检测的论文,就将这个任务转化为概率任务,如果一个人的关节出现的位置没有落在一个高概率的区间内,就可以判定这个是异常的动作。这个相当于提出了一个打破这个领域普遍处理方法的新范式,就是一个很好的切入点。



最后更新日期:6月25日 15:16 后续会不断更新


最新回复 (3)
  • 吉木木 06-24 22:30
    1

    佬友厉害,我认为自己努力做的事情就是最好的^-^

  • LinuxDoIt 06-24 22:35
    2

    膜拜大佬,希望多分享一下科研思路,对我很受用。

  • yunyi 06-25 21:41
    3

    感谢佬的文章,深入浅出,对我很有启发

* 帖子来源Linux.do
返回