
5 分钟跑通 CogVideoX一张显卡用一句提示词生成 10 秒视频【免费下载链接】CogVideotext and image to video generation: CogVideoX (2024) and CogVideo (ICLR 2023)项目地址: https://gitcode.com/GitHub_Trending/co/CogVideo给一句话拿到一段 10 秒的视频而且是在你自己的显卡上跑——这就是 CogVideoX 视频生成想解决的事。它是智谱开源的视频生成模型系列覆盖文本到视频、图像到视频、视频续写和风格转换四种玩法最新的 1.5 版本一次能出 10 秒、16fps、1360×768 的画面5B 模型用 diffusers 推理只需约 10GB 显存连老款 1080Ti 都能跑 2B 版本。读完这篇文章你会有一条从克隆仓库到出片的最短路径外加几个让画面稳定的调参技巧。3 分钟跑通克隆仓库git clone https://gitcode.com/GitHub_Trending/co/CogVideo装依赖要求 Python 3.103.12pip install -r requirements.txt跑官方推理脚本 cli_demo.pypython inference/cli_demo.py \ --prompt A girl riding a bike. \ --model_path THUDM/CogVideoX1.5-5b \ --generate_type t2v几分钟后./output.mp4里就是你的第一条 CogVideoX 生成视频。嫌命令行麻烦的话gradio_composite_demo 可以起一个带网页界面的版本还能顺带超分和插帧。核心能力拆给你看一句话生成 10 秒视频t2v 模式只需要一个--prompt。以前做个 5 秒动画要找素材、剪辑、合成现在提示词写详细点模型直接给你一镜到底。提示词质量直接决定出片质量模型是在长文本上训练的所以主体 动作 环境 光线写全比写一句短句效果好得多。嫌自己写不过瘾仓库里 convert_demo.py 可以直接把短句交给 GLM-4 这类大模型扩写成训练同款的长描述。把静态照片变成会动的镜头图生视频image-to-video用一张图当首帧生成视频只需把--generate_type换成i2v、加一个--image_or_video_path指到图片上。1.5-5B-I2V 版本还支持任意分辨率输入。以前想给海报或产品图配动态感要么找动画师要么用转场硬凑现在一张照片进去画面里的云、水面、人群自己就动起来了。比如这张海滩照片丢进 I2V 模式就能让海浪和晚霞活过来给已有视频续命换装v2v 模式接受一段视频加一个提示词把画面转到潜空间再整体重画给老录像换个画风、给实拍片补个特效都不用重新拍。另外仓库里 caption 工具 集成 CogVLM2-Caption视频转文字描述模型能把视频批量变成文字标签——做数据集的朋友会知道这一步有多省事。进阶玩法 避坑进阶玩法DDIM 逆转换重绘DDIM Inversion把视频反向解码回潜空间的技巧可以把一段已有视频转成潜变量改一下提示词再重新采样画面框架还在、内容重画。仓库里的 ddim_inversion.py 直接可用5B 和 1.5-5B 都支持。LoRA 微调专属模型想让模型学会你的角色、品牌或固定画风不用全量训练——LoRA只训练少量参数的省显存微调方式用几分钟视频加描述就能调出来单张 4090 就够方案见 finetune/README.md。常见坑与解法显存爆了原因通常是整模型常驻显存。开启enable_sequential_cpu_offload()把模型层轮流挪进显存或者直接跑量化推理脚本 cli_demo_quantization.pyINT8 下 5B 模型约 4.4GB 显存。出片太慢A100 上 5B 一条片要 3 分钟起步。先把num_frames从 81 降到 49、步数从 50 降到 30速度立竿见影。中文提示词效果拉胯模型只吃英文输入。先用大模型把中文翻成详细英文再喂进去这是官方明确建议的姿势。一句话收尾 资源指引一张显卡跑通文生视频到图生视频的全流程。README 中文版模型规格表finetune/README.mdLoRA 微调指南inference/全部推理脚本caption 工具视频转文字【免费下载链接】CogVideotext and image to video generation: CogVideoX (2024) and CogVideo (ICLR 2023)项目地址: https://gitcode.com/GitHub_Trending/co/CogVideo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考