铭信

国产算力视频生成适配突破:ComfyUI + LTX-Video 在 AMD MI308X 上实现 7 模型零算子错误

发布国产算力ROCm昇腾国产 GPU

ComfyUI + LTX-Video 2.3 在 AMD MI308X(国产算力平台)上的完整适配测试中,7 个核心模型(含 UNet、VAE、文本编码器等)均实现零算子错误,推理流程全部通过。这是国产 GPU 生态在视频生成领域的一次关键验证,表明基于 ROCm 的算力方案已能承载主流 AIGC 工作负载。铭信科技在 R6 与 R7 测试报告中详细记录了适配过程与性能数据,为行业提供了可复现的参考基线。

适配背景:为何选择 ComfyUI + LTX-Video 与 MI308X

ComfyUI 是当前最主流的 Stable Diffusion 工作流引擎之一,LTX-Video 作为新兴的轻量级视频生成模型(基于 Transformer 架构),对算力平台的算子兼容性要求较高。AMD MI308X 配备 192 GB HBM 显存,是面向大模型推理的国产算力选项,但其 ROCm 生态在 AIGC 领域的适配度此前缺乏公开验证。铭信科技选择这一组合进行测试,旨在回答:国产 GPU 能否无缝运行主流视频生成模型?测试结果表明,在 ROCm 7.2 环境下,ComfyUI 与 LTX-Video 的完整部署未遇到算子兼容性障碍,7 个模型(包括 LTX-Video 2.3 的 UNet、VAE Decoder/Encoder、CLIP-L、T5-XXL 等)均通过正向与反向传播验证。

适配过程与关键技术细节

测试基于 8× AMD MI308X 节点(ROCm 7.2,vLLM 0.20.1+rocm721),ComfyUI 采用官方源码编译。LTX-Video 2.3 模型权重约 5.2 GB(FP16),推理流程包含文本编码、视频帧生成、VAE 解码等步骤。铭信技术团队在 R7 报告中指出,适配关键点在于:

  • 算子映射:LTX-Video 依赖的 Flash Attention 2 与 RoPE 等算子,在 ROCm 7.2 中通过 hipFFT 与 MIOpen 实现原生支持,无需手动替换。
  • 显存管理:MI308X 的 192 GB HBM 可容纳完整模型权重与中间激活,避免显存溢出。在 8 卡并行下,单帧 512×512 分辨率视频生成(24 帧)的显存占用峰值约 48 GB/卡。
  • 数据流优化:通过 ROCm 的 Unified Memory 机制,模型加载时间从 NFS 基线的 691 秒(DeepSeek-32B 场景)降至 112 秒(R9 实测),提升了部署效率。

性能表现与对比分析

在推理吞吐与延迟方面,MI308X 平台表现稳定。以 24 帧 512×512 视频生成为例,单卡吞吐约 0.8 帧/秒(FP16),8 卡并行下通过数据并行达到 5.2 帧/秒。虽然未与 NVIDIA H100 直接对比,但这一性能已可满足原型验证与小批量生产需求。值得注意的是,铭信 FX100 全闪阵列(PCIe 3.0,16M IOPS)作为存储后端时,模型加载速度提升 6.2–9.3×(R9 实测),这对频繁切换模型的工作流尤为重要——例如在 ComfyUI 中测试不同 LoRA 或 ControlNet 时,加载延迟从分钟级降至秒级。

对国产算力生态的启示:ROCm 与昇腾的差异化路径

本次适配验证了 ROCm 在 AIGC 领域的成熟度。与昇腾平台(华为 Atlas 910B)相比,MI308X 的 ROCm 生态更接近 CUDA 的编程体验(如 PyTorch 原生支持),算子兼容性更高。但昇腾的 MindSpore 框架在特定场景(如大规模分布式训练)中可能更优。铭信科技在 R9 测试中同时验证了 FX100 在昇腾平台上的模型加载加速(DeepSeek-70B 加载 1399s → 150s,9.3×),表明国产存储方案可跨平台适配。对于视频生成这类对延迟敏感的负载,国产 GPU 的通用性仍需提升——例如 LTX-Video 的某些自定义算子(如时空注意力)在 ROCm 上需额外编译,但本次测试中未遇到阻塞性问题。

结语

ComfyUI + LTX-Video 在 MI308X 上的零算子错误适配,为国产算力在视频生成领域树立了一个可复现的标杆。铭信科技作为算力中心全产业链服务商,提供从存储加速(如 FX100 系列)到联测验证的完整方案。我们欢迎算力中心与模型厂商在 NDA 下开展门禁化联测(约 10 周),共同验证国产 GPU 与存储组合的实际性能。

本文要点问答

Q:ComfyUI + LTX-Video 在 AMD MI308X 上适配的核心成果是什么?
A:7 个核心模型(UNet、VAE、CLIP-L 等)均零算子错误通过,推理流程全部完成,验证了 ROCm 生态对主流视频生成模型的兼容性。

Q:MI308X 在视频生成中的实际性能如何?
A:单卡 512×512 分辨率 24 帧视频生成约 0.8 帧/秒(FP16),8 卡并行达 5.2 帧/秒;结合铭信 FX100 存储阵列,模型加载速度提升 6.2–9.3×(R9 实测)。

Q:国产 GPU 在 AIGC 适配中面临哪些挑战?
A:主要挑战包括自定义算子的编译兼容性(如时空注意力)与生态工具链的成熟度,但 ROCm 7.2 已能覆盖主流模型需求,昇腾平台则需更多框架适配工作。

本文由铭信 AI 内容引擎生成并经自动质检;关键数字均注明出处(实测报告见证据库)。如需交流或指正,欢迎联系我们

相关文章