
SadTalker 新手避坑指南語音驅動說話頭像視頻生成的完整快速上手步驟【免費下載鏈接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation項目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker想只用一段音頻就讓一張照片開口說話SadTalker 是一款語音驅動說話人臉動畫工具CVPR 2023輸入一張圖片加一段音頻就能產出嘴型對齊、頭部會動的說話頭像視頻。這是面向新手的完整快速上手路徑覆蓋環境搭建、模型下載、生成第一個成片與高頻報錯的坑。SadTalker 到底做了什么一句話說清原理不復雜模型把音頻拆成表情和頭部姿態兩組系數同時給源圖片配一個 3D 人臉模型擬合出臉部結構再把系數逐幀渲染出來就得到了一個人在說話、點頭的視頻。你不需要關心系數本身只需記住兩點音頻只支持 wav 和 mp3 格式圖片里的人臉盡量正對鏡頭且清晰。這兩點做得越好出片質量越穩。SadTalker 安裝步驟從代碼到模型文件的 4 步第一步把代碼克隆到本地git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker后續所有命令都在 SadTalker 目錄下執行。第二步準備一個 Python 3.8 虛擬環境用 conda 隔離環境能避免和你其他項目的依賴打架conda create -n sadtalker python3.8 conda activate sadtalker第三步安裝 PyTorch、依賴和 ffmpeg先裝 PyTorch按你機器的 CUDA 選版本再裝依賴清單最后裝 ffmpeg——它是視頻編解碼的基礎pip install torch torchvision torchaudio pip install -r requirements.txt conda install ffmpeg第四步執行模型下載腳本拿全模型文件這步最容易被跳過也是后續報錯的最大來源。模型下載腳本會把預訓練模型拉到checkpoints/GFPGAN 面部增強權重拉到gfpgan/weights/bash scripts/download_models.sh腳本面向 Linux/macOS內部用 wget。Windows 用戶可以按 README 手動下載模型文件放進相同目錄結構即可。SadTalker 安裝驗證3 個輕量檢查項裝完先別急著生成跑三個檢查就知道環境是否健康PyTorch 是否可用執行python -c import torch; print(torch.__version__)能打印版本號即可有顯卡的話再順手確認torch.cuda.is_available()。ffmpeg 是否在命令行里執行ffmpeg -version能打印版本信息即可。模型文件是否齊全執行ls checkpoints應看到SadTalker_V0.0.2_256.safetensors等文件且gfpgan/weights/目錄非空。缺哪個就重跑一次下載腳本補哪個。 生成第一個語音驅動說話頭像視頻環境就緒直接出片。項目自帶示例素材拿來就用python inference.py --driven_audio examples/driven_audio/bus_chinese.wav \ --source_image examples/source_image/full_body_1.png \ --result_dir results三個參數各管一攤--driven_audio是驅動音頻只認 wav/mp3--source_image是源圖人臉越正、越清晰輸出越穩--result_dir指定輸出目錄成片保存為results/時間戳.mp4。上面命令用的就是這張全身源圖換成你自己的肖像即可。沒有獨顯的話加一個--cpu參數也能跑只是慢一些。?? 常見報錯與避坑4 個高頻問題直接給解法CUDA 顯存不足怎么辦CUDA out of memory通常是素材太長或分辨率偏高。設一個環境變量限制顯存切分粒度再重跑export PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128 python inference.py ...Windows 下把export換成set。還報 OOM就縮短音頻長度、分段生成。遇到 ModuleNotFoundError 或 unexpected EOF 報錯模型文件不完整加載階段報ModuleNotFoundError或RuntimeError: unexpected EOF ... The file might be corrupted一般是模型文件沒下全、下載途中截斷了。直接重跑bash scripts/download_models.sh腳本會跳過已存在的文件只補缺失部分。補完仍報錯就對照下載源核一下文件大小更多情況見官方 FAQ。遇到 ffmpeg is not recognized 報錯說明 ffmpeg 不在命令行環境里。Linux 用conda install ffmpegmacOS 用brew install ffmpegWindows 需要把 ffmpeg 加入 PATH。遇到音頻解碼報錯Invalid data / Header missing通常是音頻格式不對SadTalker 只支持 wav 或 mp3。用 ffmpeg 轉成 wav 再喂給它ffmpeg -i 輸入.mp4 -vn 輸出.wav進階技巧參考視頻姿態控制與面部增強生成用參考視頻控制頭部姿態--ref_pose默認頭部運動完全由音頻生成。想讓人頭跟著某段特定視頻的節奏動就用--ref_pose指定參考視頻python inference.py --driven_audio examples/driven_audio/chinese_poem1.wav \ --source_image examples/source_image/art_0.png \ --ref_pose examples/ref_video/WDA_AlexandriaOcasioCortez_000.mp4成片的頭部姿態會跟隨參考視頻參考視頻比音頻短時參考視頻會循環使用。只想借它的眨眼改用--ref_eyeblink即可。examples/source_image/里還有多張不同風格的輸入圖。要提醒一句模型只對寫實人像或接近寫實的人像效果好二次元風格不適用。面部增強生成GFPGAN 修復模糊人臉輸出臉糊的話加一個人臉修復網絡python inference.py --driven_audio examples/driven_audio/imagine.wav \ --source_image examples/source_image/full_body_2.png \ --preprocess full --still --enhancer gfpgan--preprocess full加--still是全身圖組合動畫整圖但保持原有頭部姿態--enhancer gfpgan只增強人臉區域權重在第四步已隨腳本下好。想連背景一起變清晰再加--background_enhancer realesrgan。再給兩個順手的細節--expression_scale 1.5會讓表情動作更強烈調成 0.7 則更收斂默認是 1.0。另外嫌敲命令麻煩可以跑bash webui.shWindows 雙擊 webui.bat開一個本地 WebUI頁面上調參、出片和推理入口命令完全等價。全部參數速查見參數文檔。收尾記住三件事虛擬環境裝依賴、下載腳本跑全再生成、報錯先查模型文件是否完整。按這條路徑走從裝環境到出第一個說話頭像視頻不會太長。遇到新坑先翻一遍docs/FAQ.md大部分問題都有現成答案。【免費下載鏈接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation項目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker創作聲明:本文部分內容由AI輔助生成(AIGC),僅供參考