跳至内容
商用版

商用版

7. 商用版

微信:wxwubug 备注需求
Email: lipku@foxmail.com
Telegram: https://t.me/livetalking
商用版体验地址: https://livetalking.top/

功能总对比表

能力维度开源版商用版
数字人模型
wav2lip 口型模型
musetalk 口型模型
ultralight 轻量模型
wav2lipls 高画质口型模型
实时视频源驱动(摄像头/视频输入)
音频特征
Mel / Whisper / HuBERT 特征
推理性能
TensorRT 推理加速✅(wav2lipls 支持)
Ascend NPU 支持
avatar 缓存管理(LRU 淘汰,保护活跃会话)
推流 / 输出
WebRTC 输出
RTMP / RTCPush / 虚拟摄像头
LiveKit 全双工音视频输出
实时音频流输入(WebSocket 流式推音)
TTS 语音合成
EdgeTTS / GPT-SoVITS / Doubao / 腾讯 / Azure / Qwen 等
阿里云 CosyVoice TTS
TTS 试听功能
TTS 增强参数(音量/语速/音调/指令/模型)
流式 TTS 忙闲标志(消除 chunk 间隙误判静音、画面闪烁)
自适应动作 / 会话
多并发会话
自适应动作切换(根据对话内容自动切换动作/形象)
会话级动态参数(每连接可配模型/配置)
前端 / 客户端
浏览器静态页面(基础连接、文本驱动、API 对接示例)
独立桌面客户端(Electron 应用,Windows/Mac 安装包)
实时语音对话 + 唤醒词打断(支持阿里云/腾讯云/FunASR 三种ASR)
透明背景/绿幕抠像(WebGL 实时抠像,可调相似度/平滑度/溢色)

更多详情请联系咨询

7.1 wav2lip升级版

对wav2lip网络结构做了升级优化;音频特征改为hubert;用lstm网络添加前后帧关联。 提供192和384模型以及接入livetalking代码

7.2 数字人功能

  1. 语音交互;提供同步字幕与数字人说话开始、结束事件通知;支持用唤醒词打断数字人说话
  2. vue客户端,支持背景透明,可以动态切换数字人背景
  3. 实时音频流输入,适用于从外部得到音频流(比如音频到音频的大模型)实时输入给数字人播报
  4. 动作切换,能在调用数字人说话时(human接口)同时指定一个动作,让数字人说话时做指定动作 效果演示

其他功能:

  1. python客户端
    独立视频窗口显示,提供python接口交互,适用于python项目集成如直播场景。效果演示
  2. 多数字人同时出镜
    同一个画面支持多个数字人对话,通过api指定每个数字人说话和对应音色,效果演示
  3. 摄像头驱动数字人动作和表情
    主播在摄像头前不用说话,可以做表情和动作,通过api驱动主播唇形同步
  4. 与livekit对接
    将数字人接入livekit中,效果演示

7.3 其他

  1. 数字人管理系统
    提供avatar形象、tts语音合成、动作编排的管理。
    用户菜单、api权限控制
  2. wav2lip升级版模型训练及微调代码和训练数据
  3. 数字人直播软件