如何让 ai 软件提取不到视频文件里的人声为字幕?

laodao 2026-07-31 15:25 1

就是在保证普通用户正常听见视频里的人声的前提下。
如何让现在的主流 ai 视频字幕提取软件无法将视频里的人声读取和生成字幕。
能解决可以有偿付费。
最新回复 (18)
  • Rickkkkkkk 07-31 15:26
    1
    这个问题你直接问 codex 无解吗?
  • laodao 楼主 07-31 15:32
    2
    @Rickkkkkkk 问了,不行才提问的,你可以问问,谁能给出好的解决方案,我可以给的大红包。
  • maocat 07-31 15:35
    3
    源视频加密,自己开发视频解密播放器
    然后你得问题变为:
    如何防止用户用手机在音响旁边进行录音提取字幕
  • laodao 楼主 07-31 15:36
    4
    @maocat 就是常规可以上传抖音,哔站或者 youtube 的视频,不考虑加密
  • mofish 07-31 15:38
    5
    AI 字幕的原理是用音频跑一遍 asr ,正常的 asr 识别会识别所有的声音内容,要忽略背景人声或者这种主讲副讲人声,需要对模型进行定向增强
  • jackOff 07-31 15:54
    6
    做不到,除非牺牲用户体验,搞极其吵人的背景音乐
  • qczone 07-31 16:02
    7
    视频的人声必须是中/英这种常见的语言吗?如果不是可以换成小语种的音频 + 正确语言的字幕,这样不影响观看体验,普通的 asr 不一定能正确识别
  • loading 07-31 16:02
    8
    应该是无法实现,你做再多干扰,一个滤过器就给你过滤了,不是说滤波器有多强,是人耳实在太弱了,你为人能听,总不能太恶心吧。
  • jackOff 07-31 16:15
    9
    或者你一个视频里使用多门语言,在字幕里加上此时的语言是啥,目前 asr 技术识别语言可能都只擅长单语言
  • justfindu 07-31 16:22
    10
    这就跟能够让用户查看图片情况下不让他用相机拍下来?
  • Puteulanus 07-31 16:26
    11
    https://www.bilibili.com/video/BV1WXjX6vEu6/

    之前刷到的,是个思路,不一定对大模型有用
  • firefox12 07-31 16:43
    12
    窃听屏蔽器的原理吧, 可以听到 但是录音录不下来
  • gaogao321 07-31 16:49
    13
    @firefox12 有道理啊,发射人类耳朵听不到、但对麦克风传感器具有破坏性的高频超声波,使附近的手机、录音笔等设备录下的音频变成一片无法还原的“嗡嗡”杂音。
  • Greenm 07-31 16:50
    14
    反过来应该挺好做的,AI 可以分析人耳不能听到。
  • laodao 楼主 07-31 20:40
    15
    @gaogao321 对的,核心就是要这种实现方式。就是加入特定波干扰 asr 的识别,但是对正常人来说又没区别。
  • laodao 楼主 07-31 20:44
    16
    @Puteulanus 感谢,确实是这个思路
  • TimePPT 07-31 22:02
    17
    @laodao 这个思路只能解决唤醒词误触发,因为那个在端侧的。现在云端模型没那么傻。
  • laodao 楼主 07-31 23:34
    18
    @TimePPT 我已经找到多篇相关论文,核心原理和这个差不多,更系统的解决这个问题。云端模型可能比这个还傻,比如 openai 的语音模型只要识别到特定音频波暗号,就直接结束识别,后面的内容就不识别了。
* 帖子来源V2EX
返回