CASE STUDY · 01

AI 视频翻译工具

把外语视频与已有字幕,转化为可校对、可交付的中文 / 双语字幕。

从命令行 MVP 出发,逐步完成语音识别、AI 翻译、术语校正、字幕导出与 Windows 桌面 GUI 打包,解决“能跑”之外的真实使用问题。

PythonWhisperDeepSeekFFmpegTkinterPyInstaller

THE PROBLEM

字幕翻译不只是翻译。

外语视频处理通常横跨音频提取、语音识别、翻译、时间轴、专有名词与最终交付。任一环节失真,都会让字幕无法直接使用。

本项目的目标是把这些环节串成可重复执行的流程,并为用户保留校正与介入的空间:翻译不是黑箱输出,而是可检查、可修订的工作结果。

WORKFLOW

从输入到交付。

01

视频 / SRT

选择原始视频或已有字幕文件

02

识别与分段

Whisper 识别语音并保留时间轴

03

AI 翻译

按批次翻译字幕,保留上下文

04

术语校正

用术语表修正人名和专有名词

05

输出交付

生成 SRT、双语字幕或内嵌视频

AI 视频翻译工具的字幕处理结果示例
测试输出示例:中文外挂字幕已上移,原始日文硬字幕保留在画面底部。

OUTPUT EXAMPLE

可校对的结果,才是有用的结果。

输出不止是一份机器翻译文本,还保留了字幕时间轴、原文和可替换的中间结构。对于影视、课程或访谈类素材,用户可以继续校对术语、调整字幕位置与选择最终交付方式。

中文 SRT / 日中双语 SRT

可选内嵌字幕 MP4

可回头修改的字幕记录与人工翻译模板

中文外挂字幕上移后的男性采访画面
原文与译文分层显示
中文外挂字幕上移后的女性采访画面
不同人物镜头下的字幕可读性

CAPABILITIES

为真实使用场景,而不只是一次演示而做。

01

视频转中文字幕

自动提取音频、识别原文与时间轴,再生成可用的中文 SRT。

02

已有字幕直译

跳过语音识别,直接将原始 SRT 翻译为中文或日中双语字幕。

03

术语表校正

用 JSON 维护人名、剧名与专有名词,降低语音识别与翻译偏差。

04

多种交付结果

支持外挂 SRT、双语 SRT、内嵌字幕视频及 JSON 中间结果。

05

桌面化使用

提供文件选择、参数配置、运行日志与停止任务的 Windows GUI。

06

人工兜底

没有 API Key 时可导出翻译模板,人工处理后再回写生成字幕。

AI & ENGINEERING

把 AI 能力放进可控流程。

保留时间轴

Whisper 先完成原文分段,翻译只处理文本,避免字幕与画面错位。

批量调用

按字幕片段批量发送翻译请求,在速度、成本与语境连贯性间取得平衡。

保留人工校正

术语表、JSON 中间结果和人工模板,让用户能校正与接管关键内容。

从脚本走向工具

在命令行 MVP 基础上增加 GUI 和 EXE 打包,降低真实使用门槛。