長(zhǎng)視頻生成完整上手指南)
從跑通到出片JoyAI-Echo 分鐘級(jí)長(zhǎng)視頻生成完整上手指南【免費(fèi)下載鏈接】JoyAI-EchoJoyAI-Echo這是一個(gè)獨(dú)立的、僅用于推理的版本旨在實(shí)現(xiàn)分鐘級(jí)多鏡頭音視頻生成。它采用了經(jīng)過(guò)蒸餾的DMD生成器、配對(duì)的跨模態(tài)記憶以及故事級(jí)別的一致性。其性能的核心在于一個(gè)跨模態(tài)視聽(tīng)記憶庫(kù)能夠在長(zhǎng)達(dá)五分鐘的視頻中保持角色外觀和語(yǔ)音音色的一致性。同時(shí)一個(gè)訓(xùn)練后處理流程將基于記憶的強(qiáng)化學(xué)習(xí)與分布匹配蒸餾相結(jié)合實(shí)現(xiàn)了7.5倍的速度提升顯著增強(qiáng)了視覺(jué)質(zhì)量和對(duì)齊效果。項(xiàng)目地址: https://ai.gitcode.com/jd-opensource/JoyAI-EchoJoyAI-Echo 是一款分鐘級(jí)多鏡頭音視頻生成工具給它一份鏡頭腳本它能產(chǎn)出帶同步音頻的長(zhǎng)視頻故事最長(zhǎng) 5 分鐘角色外觀和音色在鏡頭切換之間保持穩(wěn)定推理速度比原始多步管線快約 7.5 倍單張 48GB 顯存的顯卡就能跑默認(rèn)配置。官方 GSB 用戶(hù)測(cè)試?yán)飳?duì)比同場(chǎng)景競(jìng)品的偏好度為音頻質(zhì)量 81.7%、提示遵循 80.6%、視覺(jué)美觀 63.6%、角色一致性 59.4%長(zhǎng)視頻場(chǎng)景的優(yōu)勢(shì)比較明確。機(jī)器能不能跑顯存、依賴(lài)和權(quán)重先核對(duì)默認(rèn)配置是 1280×736 分辨率、每鏡頭 241 幀、25fps峰值顯存約 46–50GB所以單張 H100/A10080GB或任何 48GB 以上的卡都能直接跑。顯卡更小也不是不能用把幀數(shù)和分辨率降下來(lái)即可命令見(jiàn)后文。核對(duì)項(xiàng)要求GPU 顯存峰值 46–50GB單卡 48GB 起即可軟件棧Python 3.11 PyTorch 2.8 CUDA 12.8另需 FFmpeg權(quán)重文件主權(quán)重 echo-longvideo-release.safetensors 與文本編碼器 gemma-3-12b/軟件棧對(duì)應(yīng)倉(cāng)庫(kù)里的 environment.yml 和 requirements.txt照著裝即可。權(quán)重需要單獨(dú)獲取后放到推理目錄下的 checkpoints/布局固定為checkpoints/ ├── echo-longvideo-release.safetensors └── gemma-3-12b/另外注意許可邊界該項(xiàng)目基于 LTX-2遵循 LTX-2 Community License限定學(xué)術(shù)研究與非商業(yè)用途商用需另行聯(lián)系版權(quán)方。第一次推理怎么跑通代碼和推理腳本從倉(cāng)庫(kù)獲取git clone https://gitcode.com/jd-opensource/JoyAI-Echo cd JoyAI-Echo環(huán)境用 uv 兩步搞定也支持 conda按 environment.yml 創(chuàng)建uv venv --python 3.11 .venv source .venv/bin/activate uv pip install --extra-index-url https://download.pytorch.org/whl/cu128 -r requirements.txt權(quán)重就位后直接運(yùn)行python inference.py結(jié)果輸出在 inference_result/outputs/提示文件名/inference_時(shí)間戳/ 下視頻和音頻在同一目錄。第一次建議就用默認(rèn)配置跑一個(gè)單鏡頭確認(rèn)畫(huà)面、音頻、輸出路徑都沒(méi)問(wèn)題再去做多鏡頭。提示詞怎么寫(xiě)每個(gè)鏡頭包含六個(gè)部分提示詞文件放在 prompts/ 目錄下內(nèi)容是單個(gè) JSON 對(duì)象prompts 字段是一個(gè)字符串列表每個(gè)字符串就是一個(gè)完整鏡頭寫(xiě)一個(gè)字符串出單鏡頭寫(xiě)多個(gè)就是多鏡頭故事。新鏡頭會(huì)自動(dòng)參考前面鏡頭的視覺(jué)與語(yǔ)音記憶故事級(jí)一致性由跨模態(tài)記憶庫(kù)維持。每個(gè)鏡頭內(nèi)部按固定順序?qū)懥糠秩绷四牟糠稚蓵r(shí)哪部分就容易失控部分寫(xiě)什么角色與主體畫(huà)面中所有人的外觀年齡、體型、發(fā)型、五官、服裝有臺(tái)詞的還要寫(xiě)音色動(dòng)作與臺(tái)詞角色做什么、說(shuō)什么風(fēng)格整體視覺(jué)與情緒基調(diào)如寫(xiě)實(shí)電影感、冷調(diào)日光鏡頭運(yùn)動(dòng)景別與運(yùn)鏡如面部穩(wěn)定特寫(xiě)、腰部以上中景背景主體身后的場(chǎng)景與細(xì)節(jié)音效與 BGM場(chǎng)景聲音和背景音樂(lè)或明確寫(xiě)無(wú)背景音樂(lè)官方特別強(qiáng)調(diào)一點(diǎn)提示詞先過(guò)增強(qiáng)器再推理。多鏡頭用 prompts/long_story_writer_system_prompt.md單鏡頭用 prompts/short_story_writer_system_prompt.md把簡(jiǎn)短想法擴(kuò)寫(xiě)成規(guī)范的鏡頭描述——不擴(kuò)寫(xiě)直接喂模型效果明顯偏弱。效果不達(dá)預(yù)期時(shí)怎么調(diào)癥狀調(diào)整角色外觀或音色前后鏡頭漂移每個(gè)鏡頭用同一套描述詞寫(xiě)角色服裝、發(fā)型、音色別換說(shuō)法畫(huà)面和文字描述對(duì)不上先用增強(qiáng)器把提示詞擴(kuò)寫(xiě)成完整鏡頭描述再推理顯存不夠或生成太慢降幀數(shù)和分辨率python inference.py --num-frames 121 --video-height 480 --video-width 832多鏡頭銜接生硬在相鄰鏡頭提示詞里補(bǔ)過(guò)渡描述保持場(chǎng)景與時(shí)間線連貫先用單鏡頭、低分辨率把整條流程跑通確認(rèn)畫(huà)面和聲音都正常后再回到默認(rèn) 1280×736、241 幀出正式片子提示詞記得先過(guò)增強(qiáng)器再交給模型。【免費(fèi)下載鏈接】JoyAI-EchoJoyAI-Echo這是一個(gè)獨(dú)立的、僅用于推理的版本旨在實(shí)現(xiàn)分鐘級(jí)多鏡頭音視頻生成。它采用了經(jīng)過(guò)蒸餾的DMD生成器、配對(duì)的跨模態(tài)記憶以及故事級(jí)別的一致性。其性能的核心在于一個(gè)跨模態(tài)視聽(tīng)記憶庫(kù)能夠在長(zhǎng)達(dá)五分鐘的視頻中保持角色外觀和語(yǔ)音音色的一致性。同時(shí)一個(gè)訓(xùn)練后處理流程將基于記憶的強(qiáng)化學(xué)習(xí)與分布匹配蒸餾相結(jié)合實(shí)現(xiàn)了7.5倍的速度提升顯著增強(qiáng)了視覺(jué)質(zhì)量和對(duì)齊效果。項(xiàng)目地址: https://ai.gitcode.com/jd-opensource/JoyAI-Echo創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考