
NVIDIA Cosmos 世界模型快速上手從安裝到生成第一條物理AI視頻【免費(fèi)下載鏈接】cosmosNVIDIA Cosmos is an open platform of world models, datasets, and tools that enables developers to build Physical AI for robots, autonomous vehicles, smart infrastructure, and more.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/cosmos7/cosmosNVIDIA Cosmos 是一個(gè)面向物理AI的世界模型開(kāi)源平臺(tái)覆蓋機(jī)器人、自動(dòng)駕駛和智能基礎(chǔ)設(shè)施等場(chǎng)景的數(shù)據(jù)生成需求。對(duì)使用者的核心能力只有兩條路用一段文字直接生成視頻Text2World或者拿一張圖片、一段已有視頻讓模型把接下來(lái)的世界續(xù)出來(lái)Video2World。本文按這個(gè)思路走一遍完整流程從確認(rèn)機(jī)器能否跑到調(diào)出第一條像樣的視頻。? 先確認(rèn)機(jī)器能不能跑動(dòng)手裝之前對(duì)一遍這張表。任何一項(xiàng)不滿足后面的步驟都會(huì)卡住項(xiàng)目要求操作系統(tǒng)Ubuntu 20.04 / 22.04 / 24.04官方只支持 UbuntuGPUNVIDIA 顯卡建議顯存 24GB 起步容器環(huán)境Docker且已安裝 NVIDIA Container Toolkit磁盤至少預(yù)留 50GB 用于存放模型權(quán)重軟件棧本身不需要你手動(dòng)裝官方 Docker 鏡像會(huì)把 Python 依賴全部帶進(jìn)容器這也是后文所有命令都在容器里執(zhí)行的原因。安裝、拿權(quán)限、拉模型四步出第一條視頻第一步克隆倉(cāng)庫(kù)并構(gòu)建鏡像。git clone https://gitcode.com/GitHub_Trending/cosmos7/cosmos cd cosmos docker build -t cosmos .第二步啟動(dòng)容器并進(jìn)入。docker run -d --name cosmos_container --gpus all --ipchost -it -v $(pwd):/workspace cosmos docker attach cosmos_container第三步解決模型權(quán)限。Cosmos 的權(quán)重托管在 Hugging Face 上到 Hugging Face 的 Token 頁(yè)面創(chuàng)建一個(gè)權(quán)限為 Read 的訪問(wèn)令牌然后執(zhí)行huggingface-cli login登錄。另外去 Mistral AI 的 Pixtral-12B 模型頁(yè)面點(diǎn)擊 Agree and access repository 同意授權(quán)——Video2World 的提示上采樣器依賴這個(gè)模型不點(diǎn)頭下載腳本會(huì)在轉(zhuǎn)換它的權(quán)重這一步失敗。第四步下載預(yù)訓(xùn)練權(quán)重。PYTHONPATH$(pwd) python cosmos1/scripts/download_diffusion.py \ --model_sizes 7B 14B \ --model_types Text2World Video2World下載內(nèi)容落到checkpoints/目錄。這個(gè)腳本不止拉 DiT 主干還會(huì)一并取回 Guardrail 護(hù)欄模型和 CV8x8x8 視頻分詞器如果下載了 Text2World會(huì)額外帶上 12B 的提示上采樣器下載了 Video2World則會(huì)轉(zhuǎn)換并保存 Pixtral-12B 權(quán)重。顯存或磁盤緊張時(shí)把--model_sizes 7B 14B縮成--model_sizes 7B即可后面的示例都用 7B。用法一文字生成視頻Text2WorldPYTHONPATH$(pwd) python cosmos1/models/diffusion/inference/text2world.py \ --checkpoint_dir checkpoints \ --diffusion_transformer_dir Cosmos-1.0-Diffusion-7B-Text2World \ --prompt 一個(gè)機(jī)器人站在大型倉(cāng)庫(kù)中貨架整齊燈光均勻鏡頭固定 \ --video_save_name my_first_video \ --offload_prompt_upsampler跑完在輸出目錄里找my_first_video命名的視頻文件。需要換 14B 模型時(shí)把--diffusion_transformer_dir改成Cosmos-1.0-Diffusion-14B-Text2World步數(shù)、guidance 等參數(shù)默認(rèn)即可想調(diào)優(yōu)見(jiàn)調(diào)質(zhì)量一節(jié)。用法二從圖片 / 已有視頻續(xù)寫世界Video2World這條路的輸入是一張圖片或一段視頻模型基于它生成后續(xù)畫面PYTHONPATH$(pwd) python cosmos1/models/diffusion/inference/video2world.py \ --checkpoint_dir checkpoints \ --diffusion_transformer_dir Cosmos-1.0-Diffusion-7B-Video2World \ --input_image_or_video_path cosmos1/models/diffusion/assets/v1p0/video2world_input0.jpg \ --num_input_frames 1 \ --video_save_name v2w_demo \ --offload_prompt_upsampler--num_input_frames決定取輸入的前幾幀作為條件默認(rèn) 1 幀即單圖也支持 9 幀。倉(cāng)庫(kù)cosmos1/models/diffusion/assets/v1p0/里備有現(xiàn)成的示例圖片和視頻可以直接拿來(lái)試。四個(gè)模型、兩類結(jié)構(gòu)怎么選模型結(jié)構(gòu)輸入適合場(chǎng)景Cosmos-1.0-Diffusion-7B-Text2World擴(kuò)散純文本快速迭代、顯存受限約 24GB 可跑Cosmos-1.0-Diffusion-14B-Text2World擴(kuò)散純文本追求更高畫面質(zhì)量Cosmos-1.0-Diffusion-7B-Video2World擴(kuò)散圖片/視頻 文本基于真實(shí)素材續(xù)寫未來(lái)Cosmos-1.0-Diffusion-14B-Video2World擴(kuò)散圖片/視頻 文本高質(zhì)量視頻續(xù)寫Cosmos-1.0-Autoregressive-4B自回歸圖像 文本世界模型研究方向、NeMo 微調(diào)Cosmos-1.0-Autoregressive-12B自回歸圖像 文本同上質(zhì)量更高選擇邏輯很簡(jiǎn)單做生成演示或批量產(chǎn)數(shù)據(jù)選擴(kuò)散系列要接 NeMo 做后訓(xùn)練、研究世界建模本身再看自回歸系列4B / 12B。擴(kuò)散系列內(nèi)部 7B 和 14B 的差別只在質(zhì)量與耗時(shí)的權(quán)衡接口完全一致。讓輸出更好看提示詞和三個(gè)旋鈕提示詞方面四個(gè)建議來(lái)自官方實(shí)踐一段提示只描述一個(gè)連續(xù)場(chǎng)景不要寫鏡頭切換長(zhǎng)度控制在 120 詞左右太長(zhǎng)反而拖慢上采樣且容易跑偏少寫相機(jī)運(yùn)動(dòng)指令當(dāng)前版本對(duì)這類控制的支持有限多用具體名詞和形容詞堆視覺(jué)細(xì)節(jié)比如材質(zhì)、光線、空間布局。上采樣器默認(rèn)開(kāi)啟負(fù)責(zé)把你的短提示擴(kuò)寫成細(xì)節(jié)更豐富的長(zhǎng)提示提示超過(guò) 250 詞時(shí)腳本會(huì)自動(dòng)跳過(guò)它用--disable_prompt_upsampler可以強(qiáng)制關(guān)閉保持原始意圖。三個(gè)質(zhì)量旋鈕都是推理腳本的通用參數(shù)默認(rèn)值見(jiàn)括號(hào)--num_steps擴(kuò)散采樣步數(shù)默認(rèn) 35步數(shù)越多質(zhì)量越好、耗時(shí)越長(zhǎng)--guidanceguidance 尺度默認(rèn) 7控制畫面跟隨提示詞的強(qiáng)度--height/--width輸出分辨率默認(rèn) 704 x 1280可換成 1:1、4:3、16:9 等比例。顯存不夠怎么辦五個(gè)組件可以按需逐個(gè)從 GPU 挪到 CPU對(duì)應(yīng)五個(gè)開(kāi)關(guān)--offload_prompt_upsampler、--offload_text_encoder_model、--offload_diffusion_transformer、--offload_tokenizer、--offload_guardrail_models。官方給出的三檔配置顯卡組合開(kāi)關(guān)峰值顯存參考RTX 3090 / 409024GB全部五個(gè)約 24GBA10040GB--offload_prompt_upsampler --offload_guardrail_models約 57GBH10080GB--offload_prompt_upsampler約 74GB24GB 機(jī)器的完整寫法在核心命令后追加四個(gè)開(kāi)關(guān)即可--offload_tokenizer \ --offload_diffusion_transformer \ --offload_text_encoder_model \ --offload_guardrail_models批量生成走 JSONL每行一條提示詞倉(cāng)庫(kù)cosmos1/models/diffusion/assets/v1p0/batch_inputs/text2world.jsonl有現(xiàn)成格式。在 text2world 腳本上加--batch_input_path jsonl路徑 --video_save_folder outputs/結(jié)果會(huì)按批次落盤到指定目錄。邊界、時(shí)長(zhǎng)與下一步先把限制說(shuō)清楚免得踩坑輸出幀數(shù)固定 121 幀--num_video_frames只有這一個(gè)選項(xiàng)采樣幀率默認(rèn) 24fps可用--fps按需調(diào)整單視頻推理耗時(shí)參考7B 約 380 秒14B 約 590 秒。安全護(hù)欄是強(qiáng)制啟用的沒(méi)有關(guān)閉入口生成內(nèi)容會(huì)過(guò)內(nèi)容安全過(guò)濾檢測(cè)到的自動(dòng)模糊處理人臉。做發(fā)布前的內(nèi)容審核時(shí)把它算進(jìn)流程而不是當(dāng)作可選項(xiàng)。往深處走的兩條路針對(duì)自有數(shù)據(jù)做后訓(xùn)練看 cosmos1/models/POST_TRAINING.md多 GPU 推理看 cosmos1/models/diffusion/nemo/inference/README.md。下一步怎么做先在 24GB 級(jí)別的機(jī)器上用 7B Text2World 跑通全鏈路卸載開(kāi)關(guān)全開(kāi)確認(rèn)流程沒(méi)斷再用 14B 或 Video2World 對(duì)比同一場(chǎng)景的輸出質(zhì)量決定日常用哪個(gè)規(guī)格穩(wěn)定之后切到 JSONL 批量模式把單條 380 秒的耗時(shí)攤到批量生產(chǎn)里。參考文檔與源碼后訓(xùn)練指南 cosmos1/models/POST_TRAINING.md、多GPU推理 cosmos1/models/diffusion/nemo/inference/README.md、擴(kuò)散模型推理源碼目錄 cosmos1/models/diffusion/inference/【免費(fèi)下載鏈接】cosmosNVIDIA Cosmos is an open platform of world models, datasets, and tools that enables developers to build Physical AI for robots, autonomous vehicles, smart infrastructure, and more.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/cosmos7/cosmos創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考