做了一个漫画翻译的工具网站,分享下实现思路

hankeyyh 2026-09-28 13:26 1

从很早开始看漫画,一直追的是各种汉化组的翻译。感觉修图嵌字都是辛苦活,最近想看看用 AI 能做到哪一步。调研了一下 github ,开源项目还不少。


总体来说,翻译步骤一般包括:



  • 文字定位(包括气泡文字+嵌在画面中的文字)

  • OCR

  • 翻译

  • 擦字

  • 重绘


文字定位感觉是最重要的一步,是否找齐所有文字段,框定的范围是否完整,直接决定后续 OCR 的质量和擦字是否干净。很多文字边缘会有振假名的情况,一开始测试总是会漏掉它们,导致擦字有残留。


OCR+翻译其实可以用视觉大模型一次完成,不过测试下来感觉成本有些高,所以还是分成两步。


试用下来效果比较好的模型:




  • 文字检测:YOLOv8-seg 用于气泡检测,RT-DETR-v2 用于气泡外文字定位;




  • OCR:manga-ocr 专门为漫画场景训练的 OCR 模型;




  • 翻译:deepseek 或任何大模型,设定好 prompt 就行;




  • 擦字:气泡有明确边界,所以气泡内直接用 OpenCV 根据阈值来擦。气泡外用 lama_large ;




  • 重绘:不需要模型,根据之前检查得到区域算出安全区,用 skia 画上去;




目前这个工具主要用于翻译日漫,做了个在线版本: https://mangasense.xyz


有兴趣可以试试,不用登录。


ps. 感觉 GPU 成本还是挺高的,用的 A10 ,一天 20 多刀...有类似经验的朋友,能讲讲有什么便宜点的办法吗?

最新回复 (5)
  • orion1 09-28 13:33
    1楼
    挺厉害的,
    但我试了下漫画直接扔给 AI 也能做到把文字翻译过来镶嵌了
  • miniliuke 09-28 13:56
    2楼
    @orion1 是的不追求自动化直接打包发给 gpt 网页就行了...如果没有大模型,是很好的产品,但是被降维打击了,除非成本上面有很大优势
  • hankeyyh 楼主 09-28 14:38
    3楼
    @orion1 是的,不过我用 gpt 测试发现,大模型返回的图片,一些细节会和原图不同,翻译质量上也差点。估计图片处理的 pipeline 不能很好适配
  • laurent 09-28 15:06
    4楼
    和开源的 koharu-rs/koharu 有什么优势呢?
  • alie123 09-28 15:52
    5楼
    腾讯云的 A10 你去找渠道商说不定能拿到 2000 以内的价格,量大的话能到 1500 以下(带宽 5M )
* 帖子来源V2EX
返回