境配置到生成第一個(gè)說(shuō)話頭像)
SadTalker 本地部署指南從環(huán)境配置到生成第一個(gè)說(shuō)話頭像【免費(fèi)下載鏈接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation項(xiàng)目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker你手上有一張照片和一段旁白音頻想要一個(gè)口型隨聲音自然開(kāi)合的視頻SadTalker 本地部署就是做這件事的輸入一張單圖和一個(gè) wav 文件輸出口型同步、頭部動(dòng)作自然的說(shuō)話頭像視頻。這篇文章帶你從零在自己電腦上跑通第一次生成全程只需要三步時(shí)間成本主要取決于首次依賴下載的速度。先看機(jī)器條件滿足這三項(xiàng)就可以開(kāi)始開(kāi)始之前對(duì)照環(huán)境逐項(xiàng)確認(rèn)Python 版本3.8 到 3.10 均可啟動(dòng)腳本會(huì)自動(dòng)校驗(yàn)Windows 建議 3.10內(nèi)存與磁盤(pán)8GB 以上內(nèi)存16GB 更穩(wěn)妥10GB 以上可用磁盤(pán)空間用于代碼、模型和依賴ffmpeg合成輸出視頻必須用到缺失會(huì)在啟動(dòng)時(shí)報(bào)錯(cuò)顯卡NVIDIA 顯卡能明顯加速純 CPU 也可以跑只是慢顯存低于 4GB 時(shí)把分辨率固定在 256部署方式的選擇看下面的對(duì)照第一次體驗(yàn)走 WebUI 路徑最短后續(xù)要批量處理再考慮命令行。部署方式硬件要求適用場(chǎng)景本地 WebUI本文8GB 內(nèi)存起步GPU 可選長(zhǎng)期使用、數(shù)據(jù)不出本機(jī)命令行推理同上批量處理、腳本化調(diào)用社區(qū) Docker 鏡像需 Docker 環(huán)境快速驗(yàn)證、環(huán)境隔離拉取代碼并完成環(huán)境自檢這一步的目的是拿到代碼后讓啟動(dòng)腳本自動(dòng)搭好 Python 環(huán)境你不需要手動(dòng)安裝任何依賴。git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker確認(rèn)方式目錄里能看到webui.sh、launcher.py、app_sadtalker.py等文件即拉取成功。接著啟動(dòng) WebUImacOS 與 Linux 執(zhí)行bash webui.shWindows 用戶直接雙擊webui.bat即可。首次運(yùn)行會(huì)自動(dòng)創(chuàng)建 venv 虛擬環(huán)境并安裝 PyTorch 及全部依賴終端滾動(dòng)大量 Installing 日志屬于正常現(xiàn)象耐心等待它跑完。確認(rèn)方式瀏覽器自動(dòng)打開(kāi)本地頁(yè)面默認(rèn)地址 127.0.0.1:7860看到左側(cè)可上傳圖片與音頻、右側(cè)有參數(shù)區(qū)和Generate按鈕的界面環(huán)境就搭好了。下載模型文件并核對(duì)目錄模型權(quán)重不包含在代碼里需要單獨(dú)下載這一步最容易被跳過(guò)。bash scripts/download_models.sh該腳本會(huì)把 4 個(gè)核心權(quán)重下到checkpoints/目錄、4 個(gè) GFPGAN 增強(qiáng)權(quán)重下到gfpgan/weights/目錄。下載完成后核對(duì)一下ls checkpoints看到 mapping_00109-model.pth.tar、mapping_00229-model.pth.tar、SadTalker_V0.0.2_256.safetensors、SadTalker_V0.0.2_512.safetensors 四個(gè)文件即正常。腳本用 wget -nc 下載中斷后直接重跑即可續(xù)傳網(wǎng)絡(luò)不穩(wěn)定時(shí)可從官方 release 手動(dòng)下載對(duì)應(yīng)文件放進(jìn)同一目錄。跑通第一個(gè)說(shuō)話頭像在 WebUI 頁(yè)面按順序填寫(xiě)輸入有三個(gè)地方需要留意輸入照片正面、五官清晰、無(wú)遮擋方圖或略豎的圖最穩(wěn)。下面這張正面人像就是一個(gè)典型合格輸入。音頻wav 格式最穩(wěn)手頭沒(méi)有音頻文件時(shí)非 Windows 系統(tǒng)可以在文本框輸入文字用內(nèi)置 TTS 生成語(yǔ)音。參數(shù)face model resolution 先用 256512 更清晰但更慢preprocess 默認(rèn) crop 適合人臉特寫(xiě)想讓全身圖動(dòng)起來(lái)就選 full 并勾選 Still Mode。藝術(shù)風(fēng)格的輸入同樣適用整體效果通常比真實(shí)照片更穩(wěn)定點(diǎn)擊Generate后等待生成時(shí)間取決于音頻長(zhǎng)度與分辨率普通顯卡上大約每分鐘音頻幾十秒。完成時(shí)右側(cè) Generated video 區(qū)域直接播放成片文件同時(shí)保存在results/目錄。排錯(cuò)與效果調(diào)優(yōu)以下問(wèn)題按出現(xiàn)頻率排序每條按現(xiàn)象、原因、修復(fù)說(shuō)明。提示 ffmpeg is not recognizedffmpeg 未安裝或不在 PATH 中。Linux 執(zhí)行 conda install ffmpegmacOS 執(zhí)行 brew install ffmpegWindows 把 ffmpeg 可執(zhí)行文件加入 %PATH% 后重開(kāi)終端。CUDA out of memory顯存不足。把 face model resolution 切到 256、調(diào)低 batch size或啟動(dòng)前設(shè)置 PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128仍失敗就改用純 CPU 模式跑。checkpoints 下缺文件或提示文件損壞unexpected EOF模型下載中斷導(dǎo)致不完整。重跑 bash scripts/download_models.sh 續(xù)傳或手動(dòng)重新下載對(duì)應(yīng)文件。音頻解碼報(bào)錯(cuò)Invalid data found程序只支持 wav 與 mp3 輸入。用 ffmpeg 先把其他格式轉(zhuǎn)成 wav 再上傳。效果調(diào)優(yōu)建議expression_scale控制表情幅度命令行推理默認(rèn) 1.0表情夸張時(shí)降到 0.5~0.8 試試face model resolution256 出片快512 細(xì)節(jié)好顯存夠就直接用 512GFPGAN as Face enhancer勾選后人臉更清晰生成時(shí)間約翻倍preprocess全身圖配 full Still Mode頭部動(dòng)作少、更不易抖動(dòng)讀到這里之后批量處理多組圖片與音頻src/generate_batch.py參數(shù)詳解與使用建議docs/best_practice.mdDocker 與 macOS 安裝說(shuō)明docs/install.md常見(jiàn)錯(cuò)誤清單docs/FAQ.md下一步建議挑一張自己的正面照片配一段你滿意的旁白分別用 256 和 512 分辨率各生成一次對(duì)比口型同步度與人臉細(xì)節(jié)你會(huì)對(duì)哪些參數(shù)值得花時(shí)間調(diào)優(yōu)立刻有數(shù)。【免費(fèi)下載鏈接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation項(xiàng)目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考