Kimi Code 支持原生视频理解了, 不是抽帧看图

Sophomores 2026-06-23 12:36 1

刷抖音看到 Kimi Code 更新了视频解析, 让cc翻了下仓库.



如果这个能力跑通了, 感觉对动态场景的提升很明显啊.


比如软件测试, 录一段操作视频直接丢给模型, 它能理解完整的交互流程而不是猜几张截图之间发生了什么.


再比如视频蒸馏复刻和理解.


有没有在用 Kimi Code + Kimi套餐的大佬实测过视频理解的效果? 非常好奇实际体验怎么样.

最新回复 (9)
  • Firefox 06-23 12:38
    1

    但是怎么感觉还是抽帧看图啊

    只是抽得更细了


    否则那个token感觉顶不住啊

  • Sophomores 楼主 06-23 12:39
    2

    视频字节是完整给模型的, token消耗这个我也很好奇.

  • 惊鱼 06-23 12:41
    3

    这个功能很强,但是 Kimi 基模能力不太够吧,如果是 GLM 搭配上这个多模态能力就好了

  • HLiny 06-23 12:55
    4

    kimi的多模态之前只是可用水准,蹲一个测评看看

  • YaLei Li 06-23 12:58
    5

    听起来很牛的样子,不知道实际用下来效果如何。

  • anzi 06-23 13:12
    6

    能不能提取的是靠线上模型?还是插件调用

  • 老饼 06-23 13:17
    7

    那是只有kimi的订阅才会走这个逻辑? 用三方api的话默认走这条路不是崩了

  • SErAphLi 06-23 13:19
    8

    这到最底层不是还是抽帧吗…视频说到底也就是图片流啊, 所以最后不也是抽帧看图吗…就算是ViT也是拿图片啊

  • Anew 06-23 13:20
    9

    我有一计:视频输入不算token,算是用户提交的训练语料,这样两全其美,有助于模型能力大幅提升,也有助于用户大胆的使用

* 帖子来源Linux.do
返回