连续扩散语言模型(Continuous DLM)来了吗?站内没有讨论,想和大家讨论讨论。

Admmmmm 2026-06-07 21:15 1

首先放一些链接,我就不假模假样地生成一些东西了,这里已经有不少介绍。


字节会师何恺明!开源连续扩散语言模型Cola DLM-51CTO.COM

何恺明推出ELF、字节开源Cola DLM,两者都放弃「预测下一个token」,能否开辟大模型新路径? - huMAnG0d的回答 - 知乎

https://www.zhihu.com/question/2038213982293579409/answer/2039012493549426216

何恺明团队新作,「嵌入式语言流」ELF来了 - 机器之心的文章 - 知乎

https://zhuanlan.zhihu.com/p/2037839190705034058




我为什么对这个感兴趣呢?因为前几天计划做这个诗歌生成实验的时候,曾经有计划做过用diffusion生成。

https://linux.do/t/topic/2302507?u=admmmmm

还有就是单纯感觉这个很有意思。

最新回复 (4)
  • Chiney 06-07 21:30
    1

    感觉连续扩散语言模型很有趣诶,因为这个next-token一直都不算是符合人类主流的想法,因为总感觉人类的思维其实是——把支离的词源组合成一句话,而不是按照下个词元来作预测,所以我觉得还是很有搞头的这部分。不过啊啊啊要不是要准备考研了,不然真的很想研究下。

  • 欣欣|林可欣 06-07 21:32
    2

    扩散模型过去就是快在一个底稿上面开始解析出内容

    但是扩散完全脱节的概率吗?我不懂原理。我觉得他不应该脱离概率

    解码器只是一种算法,一种确定的算法吗 (因为在完全相同的配置,完全相同的种子情况下,可以生成完全相同的图片)


    现在Diffusion模型最大的特点就是超级超级快,如果未来还能变得聪明。那将再次重构整个AI世界

  • imperatorcaesar 06-07 22:10
    3

    但是吧,擴散模型感覺幻覺會很強阿

  • ktze 06-07 22:19
    4

    好思路,人类组织措辞的时候肯定不是一个token接一个token的,而是类似从零散的空间中逐渐成型,虽然仔细想想感觉扩散未必是描述这个过程的正确形态,但某些地方确实感觉挺类似的

* 帖子来源Linux.do
返回