AI活用
ComfyUIで動画生成を始める|Text-to-VideoとImage-to-Videoの設計入門
ComfyUIの動画生成は、画像生成のworkflowに「時間軸(frame数)」と「Encode工程」が加わった構造です。T2VとI2Vの違い、Frames÷FPS=秒数の関係、VRAMと生成時間が何で決まるか、生成・補間・Upscale・Encodeを分ける理由を、特定modelに寄らない共通土台として解説します。
AIとつくる、実践プログラミング・コーディングメディア
ARCHIVE
ComfyUIの動画生成は、画像生成のworkflowに「時間軸(frame数)」と「Encode工程」が加わった構造です。T2VとI2Vの違い、Frames÷FPS=秒数の関係、VRAMと生成時間が何で決まるか、生成・補間・Upscale・Encodeを分ける理由を、特定modelに寄らない共通土台として解説します。
ComfyUIの生成速度は、workflow・model・commit・Driver・解像度・seedを固定し、初回Load(Cold)と2回目以降(Warm)を分け、起動ログの「Prompt executed in」秒数とnvidia-smiのPeak VRAMを同じ方法で記録すれば比較できます。CSVに残す記録設計まで解説します。
公式Dockerイメージはなく、公式の手動インストール手順をDockerfileに写し、NVIDIA Container ToolkitでGPUを通し、models・output・custom_nodesをVolumeに出す構成が基本です。Python依存は分離できてもGPU DriverやVRAMはHost依存のままという境界まで扱います。
ComfyUIのVRAM不足は、CUDA OOM・共有メモリ退避・遅さを区別し、nvidia-smiでPeakを記録してから、Batch・解像度・Model・Control系・Offloadを一つずつ切り分けると直せる範囲が分かります。記録表つき。
ローカルLLMのモデル規模・量子化・contextによるメモリの考え方、GPUと統合メモリの違い、用途別の選び方、購入前チェックを解説します。