在一台Mate70鸿蒙手机上跑起来了千问2.5模型

狐狸汉克 2026-03-22 19:37 1



设备是Mate70 Pro,鸿蒙6.0.0.130,完全本地部署千问2.5 0.5b参数模型。使用llama.cpp作为后端推理模块。

感觉NPU根本没发力,纯CPU硬算的,速度大概1秒一个token,目前还在优化,但是至少证明是可行的。

破案了,我没开SIMD指令并行处理,开了之后能跑到50多token/s,CPU基本上能吃满,就是NPU不知道在干嘛,如何才能调用

最新回复 (14)
  • Febonacci 03-22 19:38
    1楼

    速度大概1秒一个token



    只能说一秒一token不卡, 二token流畅

  • 匿名者 03-22 19:46
    2楼

    50个还是可以啊。

  • 狐狸汉克 楼主 03-22 19:46
    3楼

    破案了,没开优化,我说9030干这个不说轻轻松松但是应该也没太大压力吧

  • 菠菠菠萝 03-22 19:56
    4楼

    佬,部署0.5B模型的作用是 ^-^

  • Meiko Mei 03-22 19:57
    5楼

    没作用,为了证明它能

  • 菠菠菠萝 03-22 19:58
    6楼

    也很强了,需要什么硬件资源吗?手机端部署最终是形成了一个什么文件

  • Grogu 03-22 20:24
    7楼

    可以在无聊的时候和它瞎扯 ^-^

  • 狐狸汉克 楼主 03-22 21:13
    8楼

    目前是证明了:



    1. 纯血鸿蒙可以跑大语言模型(这是我们去年华为揭榜挂帅竞赛的方向),目前还在继续探索极限

    2. 麒麟芯片性能还不错,毕竟是跑在手机端上的芯片,性能调度做的也不错

      还在探索极限,打算整理一下在国产替代区写一篇文章 ^-^




    手机端使用的是gguf格式的模型文件,还在研究怎么转化成鸿蒙专用的om格式文件

  • john.wick 03-22 21:41
    9楼

    太厉害了佬,仰望佬

  • missylusi 03-24 14:50
    10楼

    这样手机就是ai智能手机了吗。能做啥东西啊

  • 狐狸汉克 楼主 03-24 14:52
    11楼

    应该不算,我在mate70 Pro上测千问3.5 2B可以到达10token/s,但是Nova 12Pro上只能有1Token/s,对硬件要求还挺高的。不过我感觉跑点简单对隐私要求强的(比如日程管理之类的)应该还不错?

  • Jerry Hou 03-24 14:55
    12楼

    wow,看起来不错啊~继续努力~

  • 越小越可怜 03-24 23:43
    13楼

    我是mate x6应该也能跑跑吧

  • JulieSapir 09-29 22:28
    14楼

    NPU不知道在干嘛



    佬,最近我也在折腾鸿蒙,貌似是因为系统没开放NPU权限,app没法调用

* 帖子来源Linux.do
返回