想请教下:有没有轻量实时的视听融合方案,判断目标方位是否有人说话?

ted0220 2026-08-28 14:47 1

大家好,想请教一个实时视听判断的问题。

目前自己搭了一套阵列麦克风,可以做一定程度的波束拾音和声源方向估计。但现在遇到的问题是:即使声音方向和画面中的人物对上了,也无法确认这个声音确实是他发出的,反射声或附近声源也可能造成误判。

所以想增加视觉嘴型判断,通过 MediaPipe 获取嘴部关键点,再结合 VAD 、DOA 和人物位置,判断目标方位的人是否真的在说话。

之前了解过 Light-ASD 、TalkNet 、SyncNet 等方案,但这些方案都只能用于后处理,计算量也比较大,无法直接接入实时链路。

想请教大家:

1. 这个方向是否合理?
2. 有没有成熟的轻量流式模型或开源方案?
3. 如果没有,自己训练一个以嘴部时序、VAD 和 DOA 为输入的轻量模型是否可行?

不要求每一帧都给出结果,证据不足时输出 unknown 也可以。欢迎有相关经验的朋友指点一下,谢谢。
最新回复 (2)
  • yuiffy 08-28 15:52
    1
    没做过视觉和阵列的,用过阿里维护的 funasr 里面有 asr+说话人识别,通过音频声线识别的。我看飞书会议有时候能区分说话人,可能也是基于这个说话人识别能力。
  • ted0220 楼主 08-28 15:58
    2
    @yuiffy 是的,阿里的应该都是通过声纹特征来做聚合,之前也研究过声纹相关内容,目前开源的声纹技术对环境要求还是相对严苛,如果在嘈杂的环境几乎就失效了,而且都是后处理,无法实时验证,感觉这个方向还挺好玩
* 帖子来源V2EX
返回