qwen-audio-3.0-asr-flash系列语音识别模型发布,10小时免费额度

Mozi 2026-07-31 13:50 1



qwen-audio-3.0-asr-flash-streaming


qwen-audio-3.0-asr-flash-streaming


qwen-audio-3.0-asr-flash-filetrans




fun-asr-flash-2026-06-15模型用了一个月了,准度是高于豆包语音识别2.0的,没想到这么快又发布新的语音识别了

阿里巴巴的这些网站是真复杂,有阿里云百炼平台,又有千问 AI 平台

相互还同步 API 密钥,应该额度也是同步的




最新回复 (19)
  • Mozi 楼主 07-31 13:56
    1

    不清楚现在的安卓端的语音输入法是不是用的这个模型

  • xLinux 07-31 14:01
    2

    Flash 五分钟时长也太短了吧^-^^-^^-^

  • Leon01 07-31 14:02
    3

    好快的更新!fun 都还没来得及玩,现在向我们走来的是 3.0 系列

  • Mozi 楼主 07-31 14:03
    4

    长音频用另一款文件转写模型

    大部分语音识别的厂商都是这样做的

  • Mozi 楼主 07-31 14:03
    5

    Fun 应该是另一个团队的另一个路线,和这个千问系列是不一样的

  • Bubble7766 07-31 14:09
    6

    坐等开源 之前qwen-asr-2.5非常不错 3.0不知道本地跑起来如何

  • fengchris 07-31 14:13
    7

    不知道通义听悟用的是啥模型 反正免费时长好多

  • Mozi 楼主 07-31 14:36
    8

    我已经用上这个 API 了,速度比FUN ASR Flash要快

    也支持识别很多专业名词,比如 OpenClaw、Anthropic、Grok、Claude Code、Desktop、Codex

  • Attiv 07-31 14:55
    9

    卧槽登录前显示余额100%,登录后免费余额变成0了…

  • Mozi 楼主 07-31 14:56
    10

    你是不是看错了?是不是看使用量了

  • Attiv 07-31 15:06
    11

    发现怎么回事了……我账号以前给项目上买过服务器,欠费了…

  • zljbjh 07-31 15:09
    12

    这个是 qwen3-asr 的闭源+改进版?

  • 佩恩 07-31 15:59
    13

    佬是用的流式模式还是整段音频的识别?我试了流式感觉质量一般 ^-^

  • Mozi 楼主 07-31 16:00
    14

    流式模式肯定比整段音频要差得多的

    我从来都是用整段模式的,我现在语音输入全都是用的这个模型

  • Mozi 楼主 07-31 16:21
    15

    是的,这个模型已经坐稳第一了。豆包那个 2.0 模型到现在还不更新,都已经半年多了

  • 路人A 07-31 16:42
    16

    又不上openrouter吗?根本看不懂百炼API怎么在Spokenly里接入,Openai兼容不知道能不能通

  • Mozi 楼主 07-31 16:51
    17

    走的是 DashScope 原生 multimodal-generation 端点

    那个千问3 ASR是走的OpenAI兼容的

  • neteroster 07-31 16:56
    18

    阿里的asr产品线复杂的不行,好多模型、版本,翻译也是独立的模型,每个模型的优势和对比也没有一个地方说的很明白,所以就一个一个试…

  • Colia Savendii 08-21 11:19
    19

    千问这个平台我支付宝扫码登录了4次愣是没登上,用手机号才行,何意味 ^-^

* 帖子来源Linux.do
返回