功能介绍
模智声桌面版(WinMZS)—— 覆盖语音、视频与文字的一站式 AI 内容创作平台
一、语音转文字(离线高精度)
采用 Whisper 深度学习识别引擎,支持普通话、英语等多语种音频转写:
- 支持常见音频格式(MP3/WAV/M4A 等),长音频自动分段处理;
- 边录边识别的实时预览,也可对已有录音整段转写;
- 自动断句与标点整理,结果可复制、可保存为文本;
- 全程本机离线推理,音频不出电脑,隐私安全;识别引擎不可用时自动降级为 Windows 内置识别。
二、文字转语音(多音色多风格)
将文字合成为自然流畅的人声朗读:
- Edge 神经网络语音:数十种中文男女声,支持新闻、客服、聊天等多种风格与语速调节;
- 合成结果保存为 MP3,可用于配音、有声读物、课件讲解;
- 离线环境自动回退 Windows 本地语音,保证始终可用;
- 支持克隆声音合成(见下文),生成专属音色的朗读音频。
三、声音克隆(XTTS 本地训练)
只需几段本人录音样本,即可训练出高度相似的专属声音:
- 软件内一键录音采集样本,样本管理、训练任务队列全自动化;
- 训练完成后可用克隆声音朗读任意文字,效果接近真人;
- 训练与推理全部在本机完成(内置 XTTS 模型与便携 Python 环境),无需联网、不泄露声纹数据。
四、数字人讲解视频
一张人物照片 + 一段讲解文字,自动生成会说话的数字人视频:
- 自动合成语音并驱动照片口型与表情,画面自然;
- 可选男声、女声或您的克隆声音;
- 适合课程开头、产品讲解、宣传口播等场景,导出标准 MP4。
五、文档讲解视频
把 PPT 或 PDF 变成有声有色的讲解视频:
- 自动解析文档:逐页导出画面并提取页面文字(PDF 扫描页自动 OCR 识别);
- 逐页编辑讲解词,选择音色与风格后自动配音;
- 每页视频自动烧录字幕,最终一键合并为完整讲解 MP4。
六、图片讲解视频
用一组图片做出有声有色的讲解视频:
- 多张图片按顺序添加、上下移动调整,支持项目管理;
- 每张图片可配录音、导入音频或用文字转语音生成讲解配音(女声/男声/克隆声音);
- 讲解文字可自动保存为字幕并烧录到画面,最终一键合成完整讲解 MP4。
七、短视频配音
为现有视频替换或叠加解说音频:
- 支持消除视频原声或原声与新音频混合;
- 按视频时长或音频时长智能对齐;
- 可选烧录字幕,快速产出成品短视频。
八、视频压缩
在尽量保持清晰度的前提下大幅减小视频体积:
- 四档压缩档位:清晰优先、均衡推荐、体积优先、极致压缩;
- 均衡档位采用智能码率压缩(CRF 26),同清晰度下通常可缩小 50%~80% 体积;
- 实时进度显示,压缩完成后可直接播放、打开位置或另存,日常分享与存储首选。
账号与离线使用说明
软件启动后使用账号登录(可在软件内直接注册):
- 登录成功一次后即可离线使用软件,离线宽限期 7 天;
- 联网时软件每 24 小时自动静默校验授权,不影响使用;
- 软件仅上传必要的文字操作日志用于服务改进,不上传您的音频、视频等文件。