CogVideoX是智谱AI开源的一款视频生成模型,与旗下视频生成产品「清影」技术同源。其中CogVideoX-5B是参数量更大的版本,旨在提供比入门级2B模型更高的视频生成质量。模型采用3D变分自编码器(VAE)压缩视频的空间与时间信息,并结合专家Transformer(Expert Transformer)处理文本与视频潜在表示,从而实现从文本描述到视频内容的生成。
该模型主要面向视频内容创作和AI技术研究场景。在部署上,通过使用diffusers库并启用CPU offload、切片(slicing)与平铺(tiling)等优化,可以在BF16精度下以最低约9GB的显存运行,优化后甚至可在消费级显卡(如RTX 3060)上进行推理。然而,生成同样时长的视频仍需较长时间,且模型仅官方支持英语输入,使用前需合理评估硬件与需求。