#LatentSync技术原理
字节跳动开源的基于音频条件潜在扩散模型的端到端唇同步框架,基于潜在扩散模型,以音频条件潜在扩散模型为基础,利用 Stable Diffusion 强大能力,直接建模复杂的音频与视觉之间的关系,实现高质量的唇形同步. 从而制作虚拟主播与数字人等应用
#部署环境
win11 16G显存 (4060Ti)
git version 2.47.1.windows.2
conda 24.11.3
#前期准备
cuda环境
检查:
nvcc --version
nvidia-smi
#部署流程
下载项目源码:
git clone https://github.com/bytedance/LatentSync.git
conda使用国内镜像:
conda config --add channels https://mirrors.tuna.tsinghua.edu.cn/anaconda/p