商用版
商用版
7. 商用版
微信:wxwubug 备注需求
Email: lipku@foxmail.com
Telegram: https://t.me/livetalking
商用版体验地址: https://livetalking.top/
功能总对比表
| 能力维度 | 开源版 | 商用版 |
|---|---|---|
| 数字人模型 | ||
| wav2lip 口型模型 | ✅ | ✅ |
| musetalk 口型模型 | ✅ | ✅ |
| ultralight 轻量模型 | ✅ | ✅ |
| wav2lipls 高画质口型模型 | ❌ | ✅ |
| 实时视频源驱动(摄像头/视频输入) | ❌ | ✅ |
| 音频特征 | ||
| Mel / Whisper / HuBERT 特征 | ✅ | ✅ |
| 推理性能 | ||
| TensorRT 推理加速 | ❌ | ✅(wav2lipls 支持) |
| Ascend NPU 支持 | ❌ | ✅ |
| avatar 缓存管理(LRU 淘汰,保护活跃会话) | ❌ | ✅ |
| 推流 / 输出 | ||
| WebRTC 输出 | ✅ | ✅ |
| RTMP / RTCPush / 虚拟摄像头 | ✅ | ✅ |
| LiveKit 全双工音视频输出 | ❌ | ✅ |
| 实时音频流输入(WebSocket 流式推音) | ❌ | ✅ |
| TTS 语音合成 | ||
| EdgeTTS / GPT-SoVITS / Doubao / 腾讯 / Azure / Qwen 等 | ✅ | ✅ |
| 阿里云 CosyVoice TTS | ❌ | ✅ |
| TTS 试听功能 | ❌ | ✅ |
| TTS 增强参数(音量/语速/音调/指令/模型) | ❌ | ✅ |
| 流式 TTS 忙闲标志(消除 chunk 间隙误判静音、画面闪烁) | ❌ | ✅ |
| 自适应动作 / 会话 | ||
| 多并发会话 | ✅ | ✅ |
| 自适应动作切换(根据对话内容自动切换动作/形象) | ❌ | ✅ |
| 会话级动态参数(每连接可配模型/配置) | ❌ | ✅ |
| 前端 / 客户端 | ||
| 浏览器静态页面(基础连接、文本驱动、API 对接示例) | ✅ | ✅ |
| 独立桌面客户端(Electron 应用,Windows/Mac 安装包) | ❌ | ✅ |
| 实时语音对话 + 唤醒词打断(支持阿里云/腾讯云/FunASR 三种ASR) | ❌ | ✅ |
| 透明背景/绿幕抠像(WebGL 实时抠像,可调相似度/平滑度/溢色) | ❌ | ✅ |
更多详情请联系咨询
7.1 wav2lip升级版
对wav2lip网络结构做了升级优化;音频特征改为hubert;用lstm网络添加前后帧关联。 提供192和384模型以及接入livetalking代码
7.2 数字人功能
- 语音交互;提供同步字幕与数字人说话开始、结束事件通知;支持用唤醒词打断数字人说话
- vue客户端,支持背景透明,可以动态切换数字人背景
- 实时音频流输入,适用于从外部得到音频流(比如音频到音频的大模型)实时输入给数字人播报
- 动作切换,能在调用数字人说话时(human接口)同时指定一个动作,让数字人说话时做指定动作 效果演示
其他功能:
- python客户端
独立视频窗口显示,提供python接口交互,适用于python项目集成如直播场景。效果演示 - 多数字人同时出镜
同一个画面支持多个数字人对话,通过api指定每个数字人说话和对应音色,效果演示 - 摄像头驱动数字人动作和表情
主播在摄像头前不用说话,可以做表情和动作,通过api驱动主播唇形同步 - 与livekit对接
将数字人接入livekit中,效果演示
7.3 其他
- 数字人管理系统
提供avatar形象、tts语音合成、动作编排的管理。
用户菜单、api权限控制 - wav2lip升级版模型训练及微调代码和训练数据
- 数字人直播软件