外语视频,现场同传。
给 YouTube、Netflix、哔哩哔哩加上实时双语字幕,直播也能翻。开源免费,Key 只存在你自己的电脑上。
46 秒,看完全部。
静音循环播放;点右下角打开英文旁白
有字幕翻字幕,没字幕听声音。
视频自带字幕时,直接拿播放器自己请求的字幕文件,整集一次翻完并缓存,再看不花钱。直播或没有字幕时,录下标签页的声音交给本机识别,再由大模型断句翻译。
- 讲者停顿后 1.5–2.5 秒出译文,质量优先,延迟也不失控
- 自动判断讲的是哪种语言,听错了可以在菜单里改
- 声音在你自己的电脑上识别,不上传
断句 · 纠错 · 翻译你选的翻译服务
断句交给模型,不写规则。
识别端按停顿切出的片段不是句子,还带错字。所有待定片段连同上文一起交给模型:它决定哪几段是一句、顺手纠错、再翻译。没说完的先标「待续」,讲者一停就确认。
- 边翻边上屏,不用等一整段说完
- 每句话确认说完了才定下来,半截话不上屏
- 上屏的句子不改、不重复显示
画面、声音、字幕,同一时刻。
识别和翻译总要一点时间。打开延迟播放,画面和声音整体往后推几秒,字幕就能在讲者开口的那一刻出现,像看延时直播。蓝牙耳机的输出延迟也会自动补上。
- 延迟几秒可以自己设,也可以关掉
- 有版权保护、没法延迟的画面会自动按实时播放
三种字幕,按场合挑。
在播放器菜单里随时切换;字号、颜色、背景、位置也都能按自己的习惯调。
专业场合,术语不走样。
按视频自动选用合适的词库,专有名词按你定的译法翻。内置一份美联储财经词库作示例,其他行业可以自己新建,或从表格导入。
- 词条同时当识别热词,专有名词听得更准
- 剧集会整集通读一遍,人名、称呼统一译法
- 可以加自己的翻译规则
may / could / likely 的语气强弱,不改变鹰鸽倾向;数字写成「25个基点」「3.75%至4%」。你可能还想知道
没找到答案的,README 里有完整说明。
支持哪些网站?
- YouTube
- 自动字幕、上传字幕直接翻;直播和没字幕的视频听声音同传。
- Netflix
- 自动选原声语言字幕,日剧直接日译中;没有字幕时听声音。
- 哔哩哔哩
- UP 主字幕和 AI 字幕(AI 字幕要登录);都没有就按段下载音轨识别,几秒出第一句。
- U-NEXT
- 只能听声音翻译,原因见下面。
- 任何网页
- 翻译此页(双语对照或仅译文)、选中文字翻译。
怎么安装?
还没上架 Chrome 网上应用店,先用开发者模式加载,需要 Chrome 130 以上。
- 下载代码,打开
chrome://extensions,开启「开发者模式」,「加载已解压的扩展程序」选 simulcap 目录。 - 设置页「网站授权」点一键授权;开发者模式加载时 Chrome 会扣留网站权限。
- 「翻译服务」选一家、填 Key,点「测试」看延迟。
要花钱吗?
扩展免费。翻译用你自己的 Key,按 1 小时连续讲话估算(约 40 万输入、3 万输出 tokens):
| 翻译服务 | 预设模型 | 输入 / 输出(每百万 tokens) | 1 小时约 |
|---|
2026 年 10 月各家官网价,1 美元 ≈ 7.1 元。字幕文件整集只翻一次,再看走缓存;本机识别和同传语音不收费;打开「深度理解」用量是上表的数倍。
听声音识别需要准备什么?
运行仓库 local-asr 里的 start.sh(Windows 用 start.cmd),首次会在独立环境里装依赖、下载约 1 GB 模型,之后一直开着就行。只翻字幕文件的话可以跳过。也可以改用云端识别(内置 Deepgram,用你自己的 Key)。
支持哪些语言?
译文语言可选,默认简体中文,大模型能翻的语言都可以。识别语言可以自动判断:英语、日语有专用模型,其他语言用 Whisper 多语言模型。扩展的菜单有中文、日本語、English。
我的数据会上传吗?
没有自己的服务器,不收集任何数据。Key 只存在本机浏览器,只发给你选的那家服务,视频页面里的脚本也拿不到;声音在本机识别,不保存;网页文字只在你点「翻译此页」或选中文字后发给网页翻译服务;诊断日志默认关闭。
为什么 U-NEXT 只能听声音?
U-NEXT 的字幕是烧录在视频画面里的,没有单独的字幕文件可读;画面有版权保护,也不能延迟播放,所以字幕会比声音晚 1–2 秒。
免费的谷歌 / 必应翻译和大模型有什么区别?
机器翻译一句一句地翻,用不上上下文,深度理解、统一人名术语、参考后文这几项会变灰。想免费又要大模型的质量,可以选智谱。
能和其他字幕翻译扩展一起用吗?
不建议。同类扩展都会拦截播放器的字幕请求、隐藏原生字幕,同时启用会互相干扰,用 Simulcap 时先停用其他的。