视频转文字 · 语音转写

把视频、音频里的说话内容一键转写成带时间戳的文字字幕。完全在你的浏览器内完成,文件不上传服务器。

✓ 100% 免费 ✓ 无需安装 ✓ 安全私密(本地文件不上传) ✓ 支持 SRT / VTT / TXT / MD
🎬

拖拽视频 / 音频到这里,或

支持 MP4、WEBM、MOV、MKV、MP3、WAV、M4A、FLAC、OGG、AAC 等;也可粘贴网络视频 / 音频直链

链接需指向可直接下载的视频或音频文件。本站会通过服务器代理抓取该文件(需登录,单文件上限 300MB),随后在你的浏览器内完成转写,不会经过任何第三方。
使用说明与隐私
  • 本地文件(拖拽/选择)全程在浏览器内解码与识别,不会上传到任何服务器。
  • 网络视频/音频链接:当对方站点不允许跨域直取时,会由本站服务器代理抓取到浏览器内再识别,字节不留存;此方式需登录且单文件上限 300MB。
  • 识别由 Whisper 模型在本地完成,模型与运行时已托管在本站,首次转写时从本站加载(base 约 75MB),之后浏览器会缓存。
  • 部分视频封装(如 MKV)浏览器可能无法直接解码音频,建议先转为 MP4 / MP3 后使用。
  • 语言:选「自动检测」时会先抽取音频开头及中段几个 30 秒片段,由模型预测语种再固定用于全片(结果标题旁会显示检测到的语种);若音频是多人多语种混杂,自动检测可能只命中其中一种,建议在「语言」中手动指定。
  • 中文简繁:Whisper 对中文的输出在简/繁之间并不稳定(部分视频会得到繁体字)。默认「简体」会在识别后用 OpenCC 统一转成简体;需要繁體时选「繁體」;「不转换」则保留模型原始输出。仅当语种为中文时该选项生效。
  • 请仅对拥有合法权利的音视频内容进行转写。