首页 / 资讯中心 / 文章详情

LongCat-Video模型选择指南:LongCat-Video、Avatar与Avatar 1.5该选哪个?

LongCat-Video模型选择指南:LongCat-Video、Avatar与Avatar 1.5该选哪个? ★ FEATURED ARTICLE
LongCat-Video模型选择指南LongCat-Video、Avatar与Avatar 1.5该选哪个【免费下载链接】LongCat-Video项目地址: https://gitcode.com/GitHub_Trending/lo/LongCat-VideoLongCat-Video 是美团开源的 13.6B 参数视频生成模型家族一个框架里提供了基础视频生成LongCat-Video、音频驱动数字人Avatar和升级版数字人Avatar 1.5三套模型。很多新手下载了仓库却不知道从哪入手——这篇指南用大白话讲清楚三者分别能做什么、参数和速度有何差异、你的场景该选哪个并附上一键运行步骤帮你 10 分钟跑通第一个数字人视频。一、先搞清楚三个模型各是什么LongCat-Video 采用统一架构设计文本生成视频Text-to-Video、图像生成视频Image-to-Video、视频续写Video-Continuation都由同一个模型原生支持配合块稀疏注意力Block Sparse Attention和由粗到细的生成策略几分钟内即可生成 720p、30fps 的长视频。维度LongCat-VideoAvatar (1.0)Avatar 1.5定位基础视频生成底座音频驱动数字人生产级音频驱动数字人核心能力文生视频、图生视频、长视频续写、交互式生成音频文本/图像生成口播视频支持单人/多人音频流更准的嘴型同步、风格化角色、快速推理音频编码器—无音频输入Wav2Vec2Whisper-Large-v3同步更准推理速度常规步数常规步数步数蒸馏最快8 步出片支持 INT8 量化省显存长视频原生支持分钟级续写无色彩漂移支持分段续写物理合理性与时间稳定性更强适用对象内容创作、创意短片口播视频、单人数字人正式交付的口播、访谈、对唱类视频 简单记忆LongCat-Video 管画面Avatar 管开口说话Avatar 1.5 管说得又快又准。二、如何根据场景选择模型场景 1只需要画面不涉及说话 → 选 LongCat-Video写一句提示词生成短片、给一张静态图加动作、把已有视频续写成分钟级长片或是做可交互的视频用底座模型即可。相关入口脚本文生视频run_demo_text_to_video.py图生视频run_demo_image_to_video.py长视频续写run_demo_long_video.py交互式生成run_demo_interactive_video.py不想写命令直接启动网页界面run_streamlit.py场景 2做单人数字人口播 → 选 Avatar 或 1.5输入一张人物照片 一段音频如唱歌、朗读模型会生成嘴型匹配的动态视频支持音频文本at2v和音频图像ai2v两种模式还能通过--num_segments分段续写长口播。示例配置可直接参考 assets/avatar/single_example_1.json场景 3做双人对话、对唱等多人视频 → 选 Avatar / 1.5 多人模式多人模式支持两路音频输入audio_type有两种玩法para合并模式两段音频等长同时叠加播放适合双人同时说话的访谈、对唱add拼接模式先后说话自动静音补齐间隙适合一问一答。示例配置见 assets/avatar/multi_example_1.json三、Avatar 与 Avatar 1.5 的关键差异嘴型同步1.5 用 Whisper-Large-v3 替换 Wav2Vec2口型对齐明显更准速度1.5 通过步数蒸馏step distillation把推理压到8 步且--use_distill在 1.5 上是必选项显存1.5 支持 INT8 量化--use_int8显存更省消费级显卡更友好泛化1.5 扩展到动漫、动物、复杂真实场景等风格化领域长时间生成时物理合理性和时序稳定性也更强画质两者均支持 480P / 720P--resolution控制1.5 输出 25fps1.0 为 16fps。结论新项目直接上Avatar 1.5只有当你需要与 1.0 权重完全对齐时才选 Avatar 1.0。音频处理相关源码在 longcat_video/audio_process/模型主体定义在 longcat_video/modules/avatar/想深入原理可阅读 LongCat-Video-Avatar-1.5-Tech-Report.pdf。四、快速上手从克隆到出片的最快路径第 1 步获取代码git clone --single-branch --branch main https://gitcode.com/GitHub_Trending/lo/LongCat-Video cd LongCat-Video第 2 步搭建环境conda create -n longcat-video python3.10 conda activate longcat-video # 安装 PyTorch 与 FlashAttention-2按 CUDA 版本调整 pip install torch2.6.0cu124 torchvision0.21.0cu124 torchaudio2.6.0 --index-url https://download.pytorch.org/whl/cu124 pip install ninja psutil packaging pip install flash_attn2.7.4.post1 # 安装依赖Avatar 功能额外需要 librosa、ffmpeg 与音频依赖 pip install -r requirements.txt conda install -c conda-forge librosa conda install -c conda-forge ffmpeg pip install -r requirements_avatar.txt第 3 步下载模型权重三个模型按需用哪个下哪个pip install huggingface_hub[cli] huggingface-cli download meituan-longcat/LongCat-Video --local-dir ./weights/LongCat-Video huggingface-cli download meituan-longcat/LongCat-Video-Avatar-1.5 --local-dir ./weights/LongCat-Video-Avatar-1.5第 4 步跑通第一个数字人视频torchrun --nproc_per_node2 run_demo_avatar_single_audio_to_video.py \ --context_parallel_size2 \ --checkpoint_dir./weights/LongCat-Video-Avatar-1.5 \ --stage_1ai2v \ --input_jsonassets/avatar/single_example_1.json \ --use_distill --model_type avatar-v1.5 --use_int8多人视频则运行 run_demo_avatar_multi_audio_to_video.py单人脚本为 run_demo_avatar_single_audio_to_video.py。项目采用 MIT 协议开源见 LICENSE可放心用于商业场景。五、避坑清单官方推荐的关键参数音频 CFGaudio_guidance_scale3–5 之间效果最佳想嘴型更准就调高提示词要长要细1.5 明确建议写出人物外貌、动作、场景例如一位黑色长发的年轻女性微笑着说话穿白色衬衫坐在明亮的咖啡馆里比短句效果好得多缓解重复动作--ref_img_index在 0–24 之间保证一致性设 30 可减少重复动作--mask_frame_range默认 3适当调大可进一步抑制重复但过大易出伪影分辨率显存紧张先用 480p 验证流程再切 720p 出成片。六、常见问题FAQQ显存不够怎么办优先使用 Avatar 1.5 的--use_int8量化 8 步蒸馏显存占用最低多卡可用--context_parallel_size做上下文并行context parallel 实现见 longcat_video/context_parallel/。Q三个模型权重要全下载吗不用。只跑基础视频下 LongCat-Video做数字人下 Avatar-1.5 即可其依赖底座模型的 tokenizer/VAE 组件。Q音频必须是纯人声吗脚本内置了人声分离audio-separator会自动从带背景音的音频中提取人声原始音频直接丢进去就行。七、一句话选型总结创意短片、图生视频、长视频→ LongCat-Video️单人/多人数字人口播新项目→ LongCat-Video-Avatar 1.5--model_type avatar-v1.5 --use_distill --use_int8与旧版 1.0 行为对齐的存量流程→ Avatar 1.0选对模型只是第一步配合长提示词与合理的音频 CFG你的数字人视频就能直接进入交付水准。【免费下载链接】LongCat-Video项目地址: https://gitcode.com/GitHub_Trending/lo/LongCat-Video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?
咨询建站