模型

CogVideoX

仅本地 开源 可商用
智谱AI · CogVideoX · CogVideoX License · 5B · 上下文 —
能做什么
视频生成内容创作
部署门槛
高端 24G+
≥ 11.4GB
上下文
token 窗口
参数
5B
CogVideoX

01基础参数

参数规模
5B
上下文窗口
输入模态
text
可生成
video
模型系列
CogVideoX
开源许可
CogVideoX License
主要语言
en

02推荐部署方案

推荐 diffusers/ComfyUI

03部署门槛详情

硬件等级 高端 24G+ · 最低显存 11.4GB

04Benchmark 评测

待补充

05适用场景

✓ 适用
短视频内容创作、数字营销素材生成、AI视频研究与开发
✗ 不适用
无需视频生成的纯文本/图像任务、对实时性要求极高的场景、超长复杂视频内容生成

06部署与限制

⚙ 本地部署建议
建议使用NVIDIA Ampere架构及以上GPU(如A100、H100)。使用diffusers库并启用enable_sequential_cpu_offload等优化可降低显存占用,BF16精度下最低约需9GB显存。INT8量化可进一步降低门槛但会降低推理速度。推荐使用PyTorchAO或Optimum-quanto进行量化以支持更小显存GPU。
⚠ 已知限制
官方文档指出模型仅支持英语输入。推理速度较慢,生成5秒视频在A100上约需1000秒,H100上约需550秒,关闭优化可提速但显存占用急剧增加约3倍。CogVideoX License对商业用途有访问量限制(月活超100万需联系商业团队)。

07详细介绍

CogVideoX是智谱AI开源的一款视频生成模型,与旗下视频生成产品「清影」技术同源。其中CogVideoX-5B是参数量更大的版本,旨在提供比入门级2B模型更高的视频生成质量。模型采用3D变分自编码器(VAE)压缩视频的空间与时间信息,并结合专家Transformer(Expert Transformer)处理文本与视频潜在表示,从而实现从文本描述到视频内容的生成。

该模型主要面向视频内容创作和AI技术研究场景。在部署上,通过使用diffusers库并启用CPU offload、切片(slicing)与平铺(tiling)等优化,可以在BF16精度下以最低约9GB的显存运行,优化后甚至可在消费级显卡(如RTX 3060)上进行推理。然而,生成同样时长的视频仍需较长时间,且模型仅官方支持英语输入,使用前需合理评估硬件与需求。

08官方资源

09同类模型