Featured image of post ComfyUI 视频模型工作流 使用记录

ComfyUI 视频模型工作流 使用记录

本地 ComfyUI 视频工作流实践:环境与节点模型安装、九宫格分镜、Qwen3.5 提示词反推、LTX 2.3 导演台,以及与线上 Seedance 2.0 的实测对比

ComfyUI 视频模型工作流 使用记录

引言

创作目标

制作「AI 避难所」类视频:遇险 → 抛出物品 → 爆炸烟雾 → 变成避难所。

痛点

线上闭源视频 API 按量计费,费用较高。

方案

搭建本地 ComfyUI 视频工作流,利用自备的 RTX 5070 Ti 16G 显卡生成视频,以节省成本。

全文分为两部分:第一部分为环境与依赖搭建,第二部分为工作流实践,含本地与线上两个方案。

一、环境与依赖搭建

包含 ComfyUI 环境容器、节点与模型的安装配置,以及常见问题排查。

1.1 环境容器(沙盒机制)

  • 使用 ComfyUI Desktop。
  • 默认自动检测并启用国内 Python 源,无需手动更换。
  • 目录结构分为全局 ComfyUI 目录与子容器 ComfyUI 两层,后者以沙盒形式隔离,可并存多个版本环境。
    • 设计原因
      1. 不同工作流对环境要求各异(CUDA、Python 版本等存在差异),独立沙盒便于切换。
      2. 环境复杂,沙盒便于快照备份,支持快速回滚与恢复。
  • 环境安装基本无障碍;若卡在下载或加载 Manager 等节点,启用代理即可。

1.2 工作流导入

  • 工作流呈现为画布形式,本质是一个 JSON 文件,便于分享与导入。
  • 导入工作流后,系统会提示缺失的节点与模型:
    • 节点:默认下载缓慢,可借助代理安装。
    • 模型:体积通常达十几 GB,推荐使用磁力工具下载。

1.3 节点安装

  • 自定义节点由第三方封装,通常托管于 GitHub 仓库。
  • 安装步骤:
    1. 进入 ComfyUI 的 custom_nodes 目录。
    2. git clone 拉取自定义节点仓库。
    3. 需使用 ComfyUI 的 Python 环境安装其 requirements 依赖。该环境为节点自带的虚拟环境,路径通常在 ComfyUI/.venv/Scripts/ 目录下(Windows 下路径含空格需加引号),例如:
      "ComfyUI/.venv/Scripts/python.exe" -m pip install -r requirements.txt
      

1.4 模型下载与归档

默认下载方式过慢,建议采用以下流程:

  1. 在 HuggingFace 检索模型名称。
  2. 点击下载,待浏览器弹出下载提示。
  3. 右键复制下载链接。
  4. 将链接导入 Motrix 等下载工具,可显著提升速度。

下载小技巧:

  • 重命名:下载文件名称可能退化为数字与符号组合,丢失原模型名,须在下载时手动填写名称。
  • 分类存放:下载时应同时指定对应模型类别目录,按类别归档后方可被识别:
    • diffusion_models
    • loras
    • LLM
    • vae
    • text_encoders

下载完成后,在 ComfyUI 中刷新即可识别。

FAQ

1. 已下载模型但无法识别
  • 原因:工作流作者为模型名称添加了前缀或斜杠(如 XXLTX 前缀),导致名称不匹配。
  • 处理步骤:
    1. 在模型选择中选用「从库中使用」。
    2. 选择对应的模型。
    3. 点击右上角打勾确认。
    4. 系统将自动应用该模型。

二、本地 ComfyUI 工作流方案

2.1 流程设计

  • 初始设定:雪山滑雪遇雪崩 → 掏出打火机 → 变为未来科技打火机造型建筑。
  • 流程:先用九宫格分镜工作流生成分镜图(支持文字与图片参考),再以 LTX 2.3 多宫格导演台生成视频。

2.2 九宫格分镜生成(FLUX.2 Klein)

  • 详解视频:https://www.bilibili.com/video/BV12ukMBqEwb
  • 工作流(RunningHub):https://www.runninghub.cn/post/2012959545563291649/?inviteCode=rh-v1270
  • 功能:支持文字与图片参考,生成一致性九宫格分镜图。

2.3 提示词反推节点升级(Qwen3 → Qwen3.5)

  • 背景:该工作流内置 Qwen3 反推节点用于图片提示词反推与扩写,速度偏慢且版本落后(Qwen3.5 已发布),遂替换升级为 Qwen3.5,验证可行。
  • Qwen3.5 详解视频:https://www.bilibili.com/video/BV1WfwezZET7
  • 安装:git clone https://github.com/lihaoyun6/ComfyUI-llama-cpp_vlm 放入 custom_nodes,再使用 ComfyUI 的 Python 环境安装其 requirements 依赖(参照 1.3)。llama-cpp-python 默认安装为 CPU 计算版本,需按下述 FAQ 替换为 GPU 版 wheel。

常用参数说明

  • 避免 Thinking 模式chat_handler):该参数控制 Qwen3.5 的思考模式,开启会将思考过程一并输出,导致提示词不纯净,反推时应避免开启。
  • 图像参考方式inference_mode):one by one 单图、images 多图、video 视频帧;多图参考需选 images
  • 提示词预设preset_prompt):提供多种风格模板,如 Normal - DescribePrompt Style - TagsPrompt Style - Detailed / Extreme DetailedCreative - Short Story 等。

FAQ

1. llama 节点运行慢,负载集中在 CPU 而 GPU 无负载
  • 原因:llama-cpp-python 默认安装的是 CPU 计算版本。
  • 解决方案:
    1. 查询 Python 与 CUDA 版本:在 ComfyUI 应用环境(沙盒)的设置中,界面会提示 Python 与 CUDA 版本。
    2. https://github.com/JamePeng/llama-cpp-python/releases 下载匹配的 .whl 文件。命名规则:win 适配 Windows,cp313 对应 Python 3.13,cu130 对应 CUDA 13.0。
    3. python -m pip uninstall llama_cpp_python 卸载默认版本。
    4. python -m pip install [.whl 路径] 安装对应版本。
  • 替换后即可启用 GPU 加速,推理速度显著提升。
2. requirements 依赖与 GPU wheel 的关系
  • pip install -r requirements.txt 会安装节点全部依赖,其中包含 llama-cpp-python,但默认得到的是 CPU 计算版本。
  • 手动安装 CUDA 版 wheel 是对该包本身的替换:先卸载默认版本,再安装对应版本。
  • 两者不重复:requirements 中除 llama-cpp-python 外的依赖仍需安装,该包则最终以 wheel 覆盖,从而启用 GPU。

2.4 视频生成(LTX 2.3 多宫格导演台)

  • 详解视频:https://www.bilibili.com/video/BV1DSKS6CE1Q
  • 工作流(RunningHub):https://www.runninghub.cn/post/2062170832935411714/?inviteCode=n2w0z6hs
  • 功能特点:
    • 支持多种宫格布局:2×2、3×2、3×3 九宫格等。
    • 关闭宫格功能后,支持首尾帧视频生成与纯文生视频。
    • 导播轨内可自由添加文字或图片,按需搭配组合输入。

2.5 结果与问题

  • 分镜图一致性不足:滑雪、掏打火机等开头场景尚可,进入避难所后的内部房间装饰描述一致性差、画面突兀。
  • 视频不连贯:因分镜图一致性差,尽管强调一镜到底,仍出现 PPT 式画面跳转。
  • 本地模型与线上闭源模型差距大:使用相同分镜图与相同提示词,分别使用本地模型与线上模型生成视频。
    • 本地模型生成效果基本不可用,画面扭曲,出现不可名状的奇怪物体与异常的手脚。
    • 线上模型效果明显更好,尚可观看。
    • 差距过大,已超出通过优化提示词或工作流所能弥补的范围,故放弃本地视频生成。

三、线上闭源模型方案

3.1 模型验证

  • 将九宫格图提交线上视频模型(Seedance 2.0 mini)测试:效果优于本地,但仍存在某些分镜画面跳转,无法一镜到底。
  • 根因:分镜图一致性差。

3.2 预研头部作品

  • 参考头部 UP 主的 AI 避难所视频,归纳其做法:
    • 使用线上闭源 Seedance 2.0(最新版),最长单条视频 15 秒。
    • 每 15 秒设置隐蔽转场,利用烟雾弥漫、视野遮蔽、开门等瞬间切换镜头。

3.3 方案确定:参考图生视频

  • 技术路线:放弃九宫格图生视频,改用参考图生视频。各大 AI 视频平台支持上传多张(最多 9 张)参考图生成视频,且参考图不增加积分消耗。
  • 分镜设计(按 15 秒分段):
    • 第一段:极限运动 → 遇险 → 抛出物体 → 炸开烟雾 → 冲入烟雾 → 走出烟雾看到避难所外观 → 走向大门 → 手按门把手定格,以尾帧衔接下一段。
    • 第二段:进入室内,参观装潢与各房间。
    • 注意:避难所外观设计应避免从外部看到室内装修。
  • 参考图设计:
    1. 视觉环境氛围图:海上冲浪、低人称视觉、巨浪来袭、海上暴风雨环境。
    2. 烟雾扩散图:立体烟雾模型,透明背景,无杂乱元素干扰。
    3. 避难所外观图:大门不宜过远,几步即可到达;外观以文生图生成,可自由设计、反复抽卡。