SaveXTube 教程:本地 AI 智能转写、AI 总结与思维导图
内置端侧 Whisper 语音转文字与大模型智能解析。零云端依赖,离线提取带时间戳文稿、区分发言人、一键生成 AI 总结摘要与思维脑图。
下载长视频、讲座或会议记录后,无需花费数小时从头听到尾。SaveXTube 提供纯本地端侧离线 AI 智能解析工作台,毫秒级定位关键信息,自动提炼结构化知识。
1
第一步:在设置中开启「自动区分发言人」与模型配置
发言人声纹分离功能需要在设置中开启。打开 SaveXTube Desktop 客户端,点击左侧导航栏的 「设置」,切换到 「模型」 标签页:
- 开启自动区分发言人:勾选红框标注的 「自动区分发言人」(转写完成后自动分析声纹特征并标注发言人 1、发言人 2 等);
- 默认发言人数:支持选择「自动检测」或手动指定具体人数;
- 声纹分离模型:支持
PyAnnote 3.0 + 3D-Speaker CAM++(约 20 MB · 阿里达摩院多语言声纹聚类与人声切片模型),点击 「下载并设为当前模型」; - 保存生效:点击 「保存」 按钮完成声纹引擎配置。
2
第二步:在「文件」列表中右键选择「开始转写」
打开 SaveXTube 客户端左侧的 「文件」 页面,在任意已下载的视频或音频项目上右键点击,在弹出的菜单中选择 「开始转写」,系统将自动调用本地 Whisper 语音引擎与声纹模型进行离线极速转写。
3
第三步:智能解析工作台与发言人声纹定位
转写完成后,客户端将弹出全功能智能解析工作台,清晰展示音视频播放与带发言人标注的完整逐字稿:
- 发言人统计与声纹时间线:如左下方红框所示,清晰展示每个发言人(如
Speaker 1 (61%)、Speaker 2)的发言时长占比与声波时间线分布; - 逐字稿发言人标注:右侧文稿区自动按发言人(如
0:00 Speaker 1、4:29 Speaker 1)分段排版; - 时间戳毫秒级跳转:点击文稿中的任意时间戳,左侧播放器自动毫秒级同步定位播放对应片段;
- 调整说话人:点击「调整说话人」可随时手动更正说话人归属或自定义命名。
4
第四步:AI 核心总结、思维导图与多格式导出
除逐字稿外,工作台还提供深度的知识提炼与导出工具:
- ✦ AI 总结:调用大模型智能提炼视频核心背景、逻辑主线与高价值摘要结论;
- ⌘ 思维导图:以直观树状脑图呈现全篇视频结构,层次分明;
- 一键导出:点击右上角 「导出」 按钮,可直接导出为带发言人和时间戳的 SRT 字幕、TXT 文本或 Markdown 笔记。