ComfyUI 视频模型工作流 使用记录
引言
创作目标
制作「AI 避难所」类视频:遇险 → 抛出物品 → 爆炸烟雾 → 变成避难所。
痛点
线上闭源视频 API 按量计费,费用较高。
方案
搭建本地 ComfyUI 视频工作流,利用自备的 RTX 5070 Ti 16G 显卡生成视频,以节省成本。
全文分为两部分:第一部分为环境与依赖搭建,第二部分为工作流实践,含本地与线上两个方案。
一、环境与依赖搭建
包含 ComfyUI 环境容器、节点与模型的安装配置,以及常见问题排查。
1.1 环境容器(沙盒机制)
- 使用 ComfyUI Desktop。
- 默认自动检测并启用国内 Python 源,无需手动更换。
- 目录结构分为全局 ComfyUI 目录与子容器 ComfyUI 两层,后者以沙盒形式隔离,可并存多个版本环境。
- 设计原因:
- 不同工作流对环境要求各异(CUDA、Python 版本等存在差异),独立沙盒便于切换。
- 环境复杂,沙盒便于快照备份,支持快速回滚与恢复。
- 设计原因:
- 环境安装基本无障碍;若卡在下载或加载 Manager 等节点,启用代理即可。
1.2 工作流导入
- 工作流呈现为画布形式,本质是一个 JSON 文件,便于分享与导入。
- 导入工作流后,系统会提示缺失的节点与模型:
- 节点:默认下载缓慢,可借助代理安装。
- 模型:体积通常达十几 GB,推荐使用磁力工具下载。
1.3 节点安装
- 自定义节点由第三方封装,通常托管于 GitHub 仓库。
- 安装步骤:
- 进入 ComfyUI 的
custom_nodes目录。 git clone拉取自定义节点仓库。- 需使用 ComfyUI 的 Python 环境安装其
requirements依赖。该环境为节点自带的虚拟环境,路径通常在ComfyUI/.venv/Scripts/目录下(Windows 下路径含空格需加引号),例如:"ComfyUI/.venv/Scripts/python.exe" -m pip install -r requirements.txt
- 进入 ComfyUI 的
1.4 模型下载与归档
默认下载方式过慢,建议采用以下流程:
- 在 HuggingFace 检索模型名称。
- 点击下载,待浏览器弹出下载提示。
- 右键复制下载链接。
- 将链接导入 Motrix 等下载工具,可显著提升速度。
下载小技巧:
- 重命名:下载文件名称可能退化为数字与符号组合,丢失原模型名,须在下载时手动填写名称。
- 分类存放:下载时应同时指定对应模型类别目录,按类别归档后方可被识别:
diffusion_modelslorasLLMvaetext_encoders
下载完成后,在 ComfyUI 中刷新即可识别。
FAQ
1. 已下载模型但无法识别
- 原因:工作流作者为模型名称添加了前缀或斜杠(如 XXLTX 前缀),导致名称不匹配。
- 处理步骤:
- 在模型选择中选用「从库中使用」。
- 选择对应的模型。
- 点击右上角打勾确认。
- 系统将自动应用该模型。
二、本地 ComfyUI 工作流方案
2.1 流程设计
- 初始设定:雪山滑雪遇雪崩 → 掏出打火机 → 变为未来科技打火机造型建筑。
- 流程:先用九宫格分镜工作流生成分镜图(支持文字与图片参考),再以 LTX 2.3 多宫格导演台生成视频。
2.2 九宫格分镜生成(FLUX.2 Klein)
- 详解视频:https://www.bilibili.com/video/BV12ukMBqEwb
- 工作流(RunningHub):https://www.runninghub.cn/post/2012959545563291649/?inviteCode=rh-v1270
- 功能:支持文字与图片参考,生成一致性九宫格分镜图。
2.3 提示词反推节点升级(Qwen3 → Qwen3.5)
- 背景:该工作流内置 Qwen3 反推节点用于图片提示词反推与扩写,速度偏慢且版本落后(Qwen3.5 已发布),遂替换升级为 Qwen3.5,验证可行。
- Qwen3.5 详解视频:https://www.bilibili.com/video/BV1WfwezZET7
- 安装:
git clone https://github.com/lihaoyun6/ComfyUI-llama-cpp_vlm放入custom_nodes,再使用 ComfyUI 的 Python 环境安装其requirements依赖(参照 1.3)。llama-cpp-python默认安装为 CPU 计算版本,需按下述 FAQ 替换为 GPU 版 wheel。
常用参数说明
- 避免 Thinking 模式(
chat_handler):该参数控制 Qwen3.5 的思考模式,开启会将思考过程一并输出,导致提示词不纯净,反推时应避免开启。 - 图像参考方式(
inference_mode):one by one单图、images多图、video视频帧;多图参考需选images。 - 提示词预设(
preset_prompt):提供多种风格模板,如Normal - Describe、Prompt Style - Tags、Prompt Style - Detailed/Extreme Detailed、Creative - Short Story等。
FAQ
1. llama 节点运行慢,负载集中在 CPU 而 GPU 无负载
- 原因:
llama-cpp-python默认安装的是 CPU 计算版本。 - 解决方案:
- 查询 Python 与 CUDA 版本:在 ComfyUI 应用环境(沙盒)的设置中,界面会提示 Python 与 CUDA 版本。
- 在
https://github.com/JamePeng/llama-cpp-python/releases
下载匹配的 .whl 文件。命名规则:
win适配 Windows,cp313对应 Python 3.13,cu130对应 CUDA 13.0。 python -m pip uninstall llama_cpp_python卸载默认版本。python -m pip install [.whl 路径]安装对应版本。
- 替换后即可启用 GPU 加速,推理速度显著提升。
2. requirements 依赖与 GPU wheel 的关系
pip install -r requirements.txt会安装节点全部依赖,其中包含llama-cpp-python,但默认得到的是 CPU 计算版本。- 手动安装 CUDA 版 wheel 是对该包本身的替换:先卸载默认版本,再安装对应版本。
- 两者不重复:requirements 中除
llama-cpp-python外的依赖仍需安装,该包则最终以 wheel 覆盖,从而启用 GPU。
2.4 视频生成(LTX 2.3 多宫格导演台)
- 详解视频:https://www.bilibili.com/video/BV1DSKS6CE1Q
- 工作流(RunningHub):https://www.runninghub.cn/post/2062170832935411714/?inviteCode=n2w0z6hs
- 功能特点:
- 支持多种宫格布局:2×2、3×2、3×3 九宫格等。
- 关闭宫格功能后,支持首尾帧视频生成与纯文生视频。
- 导播轨内可自由添加文字或图片,按需搭配组合输入。
2.5 结果与问题
- 分镜图一致性不足:滑雪、掏打火机等开头场景尚可,进入避难所后的内部房间装饰描述一致性差、画面突兀。
- 视频不连贯:因分镜图一致性差,尽管强调一镜到底,仍出现 PPT 式画面跳转。
- 本地模型与线上闭源模型差距大:使用相同分镜图与相同提示词,分别使用本地模型与线上模型生成视频。
- 本地模型生成效果基本不可用,画面扭曲,出现不可名状的奇怪物体与异常的手脚。
- 线上模型效果明显更好,尚可观看。
- 差距过大,已超出通过优化提示词或工作流所能弥补的范围,故放弃本地视频生成。
三、线上闭源模型方案
3.1 模型验证
- 将九宫格图提交线上视频模型(Seedance 2.0 mini)测试:效果优于本地,但仍存在某些分镜画面跳转,无法一镜到底。
- 根因:分镜图一致性差。
3.2 预研头部作品
- 参考头部 UP 主的 AI 避难所视频,归纳其做法:
- 使用线上闭源 Seedance 2.0(最新版),最长单条视频 15 秒。
- 每 15 秒设置隐蔽转场,利用烟雾弥漫、视野遮蔽、开门等瞬间切换镜头。
3.3 方案确定:参考图生视频
- 技术路线:放弃九宫格图生视频,改用参考图生视频。各大 AI 视频平台支持上传多张(最多 9 张)参考图生成视频,且参考图不增加积分消耗。
- 分镜设计(按 15 秒分段):
- 第一段:极限运动 → 遇险 → 抛出物体 → 炸开烟雾 → 冲入烟雾 → 走出烟雾看到避难所外观 → 走向大门 → 手按门把手定格,以尾帧衔接下一段。
- 第二段:进入室内,参观装潢与各房间。
- 注意:避难所外观设计应避免从外部看到室内装修。
- 参考图设计:
- 视觉环境氛围图:海上冲浪、低人称视觉、巨浪来袭、海上暴风雨环境。
- 烟雾扩散图:立体烟雾模型,透明背景,无杂乱元素干扰。
- 避难所外观图:大门不宜过远,几步即可到达;外观以文生图生成,可自由设计、反复抽卡。