首页 / 资讯中心 / 文章详情

video-use 技能实战指南:用对话式 Agent 完成视频剪辑、调色、字幕与动画合成

video-use 技能实战指南:用对话式 Agent 完成视频剪辑、调色、字幕与动画合成 ★ FEATURED ARTICLE
AI 技能/插件音视频视频处理人工智能【免费下载链接】video-useEdit videos with coding agents项目地址https://gitcode.com/GitHub_Trending/vid/video-use点击查看免费下载导读video-use是一个开源、基于对话驱动的视频编辑技能Skill它让 Claude Code、Codex 等具备 Shell 能力的编码 Agent 能够阅读原始素材并自主完成剪辑决策转写、切条、调色、叠加动画、烧录字幕最终产出final.mp4。本文以仓库根目录的 SKILL.md 为骨架结合 helpers/ 下五个 Python 工具的真实实现系统讲解其设计原则、12 条硬性规则、完整工作流、EDL 格式、剪辑工艺、调色模型、字幕风格与动画编排。读完本文你将掌握如何安装并驱动这套流水线理解每条生产正确性规则背后的 ffmpeg 原理并能独立为一个多镜头multi-take素材集产出可直接交付的成片。一、设计原则LLM 不看视频而是读视频video-use的核心哲学只有一句话LLM 从原始转写文本 按需视觉信息中进行推理。它不会把视频逐帧丢给模型那会产生数百万 token 的噪声而是只维护一个真正值得保留的派生产物——按短语打包的转写文件takes_packed.md其余一切填充词标记、重拍检测、镜头分类、强调打分都在决策时刻即时推导。SKILL.md 用 7 条原则勾勒整体设计LLM 从原始转写 按需视觉推理。唯一的派生产物是takes_packed.md。音频优先视觉跟随。剪辑候选来自语音边界与静音间隙仅在决策点才下钻到画面。询问 → 确认 → 执行 → 迭代 → 持久化。在用户用自然语言确认策略之前绝不触碰剪辑。泛化。不预设视频类型先看素材、再问用户、然后剪辑。艺术自由是默认值。文档中所有具体数值、预设、字体、颜色、时长、音高结构都是一个已验证视频的工作示例不是强制要求唯一必须遵守的是 Hard Rules。自由发明。如果素材需要文档中未描述的技术分屏、画中画、下三分之一身份卡片、反应剪辑、变速、定格、交叉淡化、匹配剪辑、L-cut、J-cut……直接用 ffmpeg 和 PIL 构建不必等待许可。展示前自验。自己都不愿意交付的结果不要呈现给用户。这一设计直接呼应 README 中LLM never watches the video的表述转写层始终加载用 ElevenLabs Scribe 拿到词级时间戳、说话人分离和音频事件打包成约 12KB 的takes_packed.md视觉层按需调用用timeline_view生成胶片条 波形 词标签 PNG只在决策点使用。二、12 条硬性规则生产正确性不可妥协SKILL.md 强调这些规则一旦偏离就会产生静默失败或坏输出它们不是品味问题而是正确性问题。逐条解读如下字幕最后应用——在滤镜链中必须排在所有覆盖层overlay之后否则覆盖层会遮挡字幕静默失败。逐段抽取 → 无损-c copy拼接而不是单次 filtergraph 全片处理否则叠加覆盖层时每一段都会被二次编码。每个段边界做 30ms 音频淡入淡出afadetin:st0:d0.03,afadetout:st{dur-0.03}:d0.03否则每个切口都会出现可闻的爆音。覆盖层使用setptsPTS-STARTPTST/TB把动画的第 0 帧平移到覆盖窗口起点否则覆盖窗口内看到的是动画的中间帧。主字幕master SRT使用输出时间线偏移output_time word.start - segment_start segment_offset否则段拼接后字幕错位。绝不在单词中间切断每个剪切边都吸附到 Scribe 转写给出的词边界。每个剪切边都要留边距padding工作窗口 30–200ms。Scribe 时间戳有 50–100ms 漂移留边可吸收漂移快节奏剪紧一点电影感剪松一点。只使用词级逐字 ASR。绝不用 SRT/短语模式会丢失亚秒级间隙数据绝不用归一化的填充词会丢失编辑信号。按源文件缓存转写。除非源文件本身变化否则绝不重新转写。多个动画用并行子代理绝不串行。通过Agent工具同时生成 N 个总墙钟时间 ≈ 最慢的一个。执行前确认策略。用户批准纯英文计划之前绝不触碰剪辑。所有会话输出写入videos_dir/edit/绝不写入video-use/项目目录内部。规则 2、3、5 在 helpers/render.py 中有完整的工程化落地见第五节规则 10 在动画编排一节有专门的并行子代理模板。三、目录布局与会话内存技能本体位于video-use/仓库根用户素材放在任意目录所有会话产物统一落在videos_dir/edit/videos_dir/ ├── source files, untouched └── edit/ ├── project.md ← 会话记忆每次会话追加 ├── takes_packed.md ← 短语级转写LLM 的主要阅读视图 ├── edl.json ← 剪辑决策 ├── transcripts/name.json ← 缓存的原始 Scribe JSON ├── animations/slot_id/ ← 每个动画的源 渲染 推理 ├── clips_graded/ ← 带调色与淡入淡出的逐段抽取 ├── master.srt ← 输出时间线字幕 ├── downloads/ ← yt-dlp 下载产物 ├── verify/ ← 调试帧 / 时间线 PNG ├── preview.mp4 └── final.mp4其中project.md是跨会话的持久记忆每次会话在文件末尾追加一节包含Strategy一段话描述方案、Decisions镜头选择、剪切、调色、动画及原因、Reasoning log非显而易见决策的一行推理、Outstanding遗留事项。下次启动时读取该文件用一句话总结上次会话再询问是否继续——这正是 SKILL.md 原则 3 中persist的载体。四、安装与冷启动检查首次安装的完整步骤在 install.md克隆仓库、安装 Python 依赖、安装 ffmpeg、注册技能、配置 ElevenLabs API key。日常会话不必重跑安装冷启动只需验证以下几点ELEVENLABS_API_KEY可解析——来自环境变量或仓库根目录.env缺失时请用户粘贴写入.env绝不写入用户的videos_dirffmpegffprobe在 PATH 中Python 依赖已安装仓库内执行uv sync或pip install -e .若会话需要 HyperFrames 或 Remotion 槽位需 Node.js npmHyperFrames 目前要求 Node.js 22yt-dlp、HyperFrames、Remotion、Manim 仅在首次使用时安装首次使用的动画环境搭建发生在槽位目录内而不是 video-use 仓库根目录。HyperFrames 可用npx --yes hyperframes ...调用Remotion 可用npx create-videolatest脚手架或作为槽位内项目级依赖安装技能内置了skills/manim-video/构建 Manim 槽位时阅读其 SKILL.md。依赖清单见 pyproject.tomlrequests、librosa、matplotlib、pillow、numpy可选动画依赖manim。注意 helpers 没有 console scripts一律以python helpers/name.py直接调用。技能通过符号链接注册如~/.claude/skills/video-use/或~/.codex/skills/video-use/helpers 与 SKILL.md 必须保持同级。安装验证要求对真实文件跑一条真实命令而不是仅检查文件存在。五、Helpers 工具链源码级拆解六个 helper 脚本构成完整流水线全部位于 helpers/脚本职责关键参数transcribe.py单文件 Scribe 调用--num-speakers N、--language、--edit-dir有缓存transcribe_batch.py4 工作线程并行转写--workers默认 4、--num-speakerspack_transcripts.pytranscripts/*.json→takes_packed.md--silence-threshold默认 0.5stimeline_view.py胶片条 波形 PNGvideo start end、--n-frames、--transcriptrender.py段抽取 → 拼接 → 覆盖层 → 字幕--preview、--draft、--build-subtitles、--no-subtitles、--no-loudnormgrade.pyffmpeg 滤镜链调色--preset、--filter、--analyze、--list-presets5.1 转写层Scribe 词级 ASRhelpers/transcribe.py 先用 ffmpeg 把视频抽成单声道 16kHz PCM WAV-ac 1 -ar 16000 -c:a pcm_s16le再上传到 ElevenLabs Scribe 接口。请求参数值得注意call_scribe见 helpers/transcribe.pymodel_idscribe_v1diarizetrue——说话人分离tag_audio_eventstrue——标记(laughs)、(sighs)、(applause)等音频事件timestamps_granularityword——词级时间戳这是规则 8 的实现基础可选language_code与num_speakers已知说话人数时能提升分离准确率。输出完整 JSON 写入edit_dir/transcripts/video_stem.json。按源文件缓存文件已存在则直接跳过上传规则 9。transcribe_batch.py负责多镜头素材的并行转写默认 4 个工作线程支持--workers调整它按扩展名.mp4/.mov/.mkv/.avi/.m4v等扫描目录并跳过已有转写的文件。5.2 打包层takes_packed.md 的生成算法helpers/pack_transcripts.py 是LLM 主要阅读视图的制造者。其核心函数group_into_phraseshelpers/pack_transcripts.py按两条规则断句静音 ≥ 阈值默认 0.5s——利用 Scribewords数组中spacing类型条目携带的间隙信息说话人切换——speaker_id变化即断句。音频事件audio_event会保留在短语文本中并加括号如(laughs)这正是剪辑工艺中音频事件即信号的数据来源。输出格式## C0103 (duration: 43.0s, 8 phrases) [002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted. [006.08-006.74] S0 We fixed this.行首[start-end]是短语级时间范围S0是说话人编号剥离了speaker_前缀。按 SKILL.md 的测算一小时素材打包后约占原始 Scribe JSON 的 1/10 token且从纯文本就能获得词边界精度——这就是12KB 文本 少量 PNG 替代 4500 万 token 帧噪声的关键。5.3 视觉下钻层timeline_viewhelpers/timeline_view.py 是唯一的视觉下钻工具给定video start end产出合成 PNG等间隔抽取 N 帧拼成胶片条默认 10 帧、在下方渲染 RMS 波形包络、叠加词级标签、并用半透明蓝色阴影标注 ≥400ms 的静音间隙find_silences阈值 0.4s。SKILL.md 明确警告这不是扫描工具只在决策点使用存疑停顿、重拍对比、切口抽查绝不能在后台循环扫描每一句。5.4 调色层grade.py 的两种模式helpers/grade.py 提供两种工作方式自动模式默认——auto_grade_for_clip用 ffmpegsignalstats滤镜采样约 10 帧统计亮度均值YAVG、动态范围YMIN/YMAX、饱和度SATAVG按位深归一化后套用决策规则过暗提 gamma、过平提对比度、极平提饱和。所有调整硬性钳制在 ±8% 以内绝不施加创意色偏——目标是看起来干净但不像调过色。预设模式——--preset指定命名滤镜--list-presets可查看全部subtleeqcontrast1.03:saturation0.98安全底线neutral_punch对比度 轻微 S 曲线无色偏最小修正warm_cinematic12% 对比度、压黑、-12% 饱和、暖阴影冷高光的青橙分离、胶片曲线SKILL.md 注明来自真实发布视频对 talking head 安全none直通拷贝用户未要求调色时的默认值。任何其他风格用--filter raw ffmpeg直接传滤镜串。两条硬性要求调色在段抽取阶段逐段施加而不是拼接后再调否则二次编码以及不测肤色就不要激进。调色心智模型是 ASC CDLout (in * slope offset) ** powerslope 管高光、offset 管阴影、power 管中间调最后全局饱和度。5.5 渲染层render.py 的六阶段管线helpers/render.py 完整实现规则 1–5管线顺序见模块 docstring 与main逐段抽取extract_all_segments→extract_segment每段一个独立 MP4调色滤镜 30ms 音频淡入淡出烘焙进段内规则 3。质量阶梯final 为 1080plibx264 fast CRF 20preview 为 1080pmedium CRF 22draft 为 720pultrafast CRF 28仅供切口验证。竖屏素材按高度缩放scale-2:1920保持朝向无损拼接concat_segmentsconcat demuxer -c copy不重编码规则 2字幕构建--build-subtitles→build_master_srt从各源转写 EDL 偏移计算输出时间线时间规则 5按 2 词一句、遇标点断句、大写化合成build_final_composite覆盖层逐个setptsPTS-STARTPTST/TB平移帧 0规则 4overlayenablebetween(t,start,end)挂载字幕滤镜排最后规则 1响度归一默认开启两遍 loudnorm 到 -14 LUFS / -1 dBTP / LRA 11社交平台标准preview/draft 模式用单遍近似HDR → SDR检测color_transfer为 PQsmpte2084或 HLGarib-std-b67时前置zscaletonemap链hable 映射、desat0转 Rec.709 SDR——否则 8-bit 输出仍携带 HDR 元数据在录屏与社交上传的二次编码中会过饱和、过曝。EDL 的grade字段可为预设名、原始滤镜串或autoresolve_grade_filter按段分析并施加逐段微修正。六、八步工作流从清单到交付SKILL.md 定义的标准流程盘点Inventoryffprobe每个源transcribe_batch.py批量转写目录pack_transcripts.py生成takes_packed.md抽样一两个timeline_view获得视觉第一印象。预扫描问题通读takes_packed.md记录口误、明显说错的词、要避免的表达形成纯文本清单并喂给编辑简报。对话Converse用自然语言描述所见基于素材提出针对性问题收集内容类型、目标时长/宽高比、审美/品牌方向、节奏感受、必须保留的时刻、必须剪掉的时刻、动画与调色偏好、字幕需求。不要用固定清单——每类素材该问的问题都不一样。提出策略4–8 句话描述形态、镜头选择、剪辑方向、动画计划、调色方向、字幕风格、时长估算。等待确认规则 11。执行通过编辑子代理简报产出edl.json在存疑处用timeline_view下钻动画交给并行子代理逐段调色render.py合成。预览render.py --preview1080p 可评估质量。自评展示用户之前对渲染输出不是源素材在每个切口边界 ±1.5s 窗口跑timeline_view逐图检查切口视觉不连续/闪烁/跳变、边界波形尖峰漏网的爆音、字幕被覆盖层遮挡规则 1 违规、覆盖层错位或显示错误帧规则 4 违规。再抽样开头 2s、结尾 2s 与 2–3 个中间点检查调色一致性、字幕可读性、整体连贯性用ffprobe核对时长符合 EDL 预期。自评上限 3 轮——3 轮后仍有问题就标记给用户而不是无限循环。迭代 持久化自然语言反馈 → 重新规划 → 重新渲染绝不重新转写规则 9确认后出最终渲染追加写入project.md。七、剪辑工艺音频优先的切口决策SKILL.md 给出可操作的口径音频优先切口候选来自词边界和静音间隙保留高峰笑声、妙语、强调节拍要延伸过去把反应也剪进来——笑声本身就是节拍说话人交接需要语流间的空气常见 400–600ms快节奏更短电影感更长音频事件即信号(laughs)、(sighs)、(applause)标记节拍延伸越过它们静音间隙是切口候选≥400ms 通常最干净150–400ms 的短语边界可用但需目检150ms 不安全处于短语中间切口留边示例随附的发布视频实测首词前 50ms、末词后 80ms蒙太奇剪紧、纪录片放松始终落在 30–200ms 工作窗口规则 7绝不割裂地分别推理音轨与画面——每个切口必须同时满足两条轨道的质量要求。八、编辑子代理简报多镜头选优的标准模板当任务是从多个镜头中为每个节拍选出最佳一条时SKILL.md 建议派发独立子代理简报结构如下结构本身是承重的音高形状示例不是You are editing a type video. Pick the best take of each beat and assemble them chronologically by beat, not by source clip order. INPUTS: - takes_packed.md (time-annotated phrase-level transcripts of all takes) - Product/narrative context: 2 sentences from the user - Speaker(s): name, role, delivery style note - Expected structure: pick an archetype or invent one - Verbal slips to avoid: list from the pre-scan pass - Target runtime: seconds常见结构原型可选、可改、可发明Tech launch/demo 用HOOK → PROBLEM → SOLUTION → BENEFIT → EXAMPLE → CTA教程用INTRO → SETUP → STEPS → GOTCHAS → RECAP访谈是(QUESTION → ANSWER → FOLLOWUP)循环旅行/活动用ARRIVAL → HIGHLIGHTS → QUIET MOMENTS → DEPARTURE纪录片用THESIS → EVIDENCE → COUNTERPOINT → CONCLUSION音乐/演出用INTRO → VERSE → CHORUS → BRIDGE → OUTRO。规则包括起止时间必须落在转写的词边界上切口留边30–200ms优先 ≥400ms 静音作为切口无更好镜头时才保留不可避免的口误并在reason注明超预算就删节拍或收尾报告总时长并自我修正。输出为无散文的 JSON 数组并附一行总时长核验[{source: C0103, start: 2.42, end: 6.85, beat: HOOK, quote: ..., reason: ...}, ...]九、EDL 格式剪辑决策的单一事实来源edl.json是执行与渲染之间的契约完整结构如下出自 SKILL.md{ version: 1, sources: {C0103: /abs/path/C0103.MP4, C0108: /abs/path/C0108.MP4}, ranges: [ {source: C0103, start: 2.42, end: 6.85, beat: HOOK, quote: ..., reason: Cleanest delivery, stops before slip at 38.46.}, {source: C0108, start: 14.30, end: 28.90, beat: SOLUTION, quote: ..., reason: Only take without the false start.} ], grade: warm_cinematic, overlays: [ {file: edit/animations/slot_1/render.mp4, start_in_output: 0.0, duration: 5.0} ], subtitles: edit/master.srt, total_duration_s: 87.4 }字段语义grade是预设名或原始 ffmpeg 滤镜串可为autooverlays是已渲染的动画片段start_in_output决定其在成片时间线上的挂载起点subtitles可选且最后应用。ranges中的start/end是源素材本地时间渲染器据此抽取并计算输出时间线偏移。十、字幕三个值得推理的维度字幕有三个维度需要推理断句每行 1/2/3 个词或整句、大小写UPPER/Title/Natural、位置距底部边距。组合取决于内容bold-overlay短平快技术发布、快节奏社交2 词一句、UPPERCASE、遇标点断句、Helvetica 18 Bold、白字黑描边、MarginV抬高。SKILL.md 示例给出MarginV35而仓库实际随附的SUB_FORCE_STYLEhelpers/render.py使用MarginV90——代码注释说明这不是品味而是平台安全区规则TikTok/IG Reels/Shorts 的 UI标题、用户名、音乐、右侧操作栏覆盖竖屏帧底部约 25–30%libass 按PlayResY288相对缩放画布MarginV90可将字幕基线抬到距底部约 30% 处在任何宽高比下都避开 UI不要无故降到 75 以下。以随附实现为准FontNameHelvetica,FontSize18,Bold1, PrimaryColourH00FFFFFF,OutlineColourH00000000,BackColourH00000000, BorderStyle1,Outline2,Shadow0, Alignment2,MarginV90natural-sentence叙事、纪录片、教育4–7 词断句、句子大小写、自然停顿处断句、MarginV60–80、字号更大、最大宽度略宽。仓库未随附该模式的 force_style需要时自行设计。render.py --build-subtitles会按 2 词一句、标点断句的算法从逐源转写自动生成master.srtbuild_master_srt见 helpers/render.py对每个段取落在段范围内的词成句后按词.start - 段.start 段偏移映射到输出时间线输出前统一大写化并去除尾部标点。硬性要求仍是规则 1最后应用与规则 5输出时间线偏移。十一、动画编排按槽位选引擎并行子代理构建动画必须匹配内容与品牌调色板、字体、视觉语言都来自对话绝不假设默认值用户未给时在策略阶段提出调色板并等待确认。引擎选择不搞一刀切HyperFrames——浏览器原生 HTML/CSS/GSAP 视频合成产品 UI 动效、网页转视频、mockup 转视频、动态排版、落地页/故事板宣传、数据驱动 UI 状态、透明 WebM 覆盖层以及需要确定性帧捕获 lint/validate/render 检查的片段。槽位内用npx --yes hyperframes init . --example blank --non-interactive --skip-skills脚手架构建后跑适用的检查lint、validate、可行时草稿渲染最后npx --yes hyperframes render . -o render.mp4或--format webm -o render.webm需要 alpha 时Remotion——React/CSS 组合、组件状态、可复用 React 原语或既有品牌系统。槽位内用npx create-videolatest脚手架或本地安装 Remotion用项目本地remotion render输出render.mp4再用ffprobe核验时长与分辨率Manim——正式图表、状态机、公式推导、图形变形深度内容见 skills/manim-video/SKILL.mdPIL PNG 序列 ffmpeg——简单覆盖卡片计数器、打字机文本、单条柱状揭示、渐进式绘制迭代快、任意审美随附发布视频即用此法。混合使用不被禁止例如 PIL 背景 HyperFrames/Remotion 图层叠加。EDL 的overlays.file必须指向真实渲染产物路径。时长经验值上下文相关同步解说类须 1× 可读——简单卡片约 3s 底线、通常 5–7s、复杂图表 8–14s节拍同步的强调动效MV、快剪0.5–2s 即可此时1× 可读降级为1× 可辨识切出前终帧保持 ≥1s通用压在配音上时总时长 ≥旁白时长 1s通用绝不并行揭示多个独立元素——眼睛一次只能追踪一个新东西。动画落点时机同步解说类拿到落点词的词级时间戳让覆盖层提前reveal_duration秒开始使落定帧正好与说出的落点词重合否则动画与旁白脱节。缓动通用绝不用 lineardef ease_out_cubic(t): return 1 - (1 - t) ** 3 def ease_in_out_cubic(t): if t 0.5: return 4 * t ** 3 return 1 - (-2 * t 2) ** 3 / 2ease_out_cubic用于单次揭示缓慢落定ease_in_out_cubic用于连续绘制。打字文本锚定技巧按完整字符串宽度居中而非部分字符串宽度否则揭示过程中文本会左移。示例配色发布视频仅为众多审美之一近黑背景(10,10,10)、橙色强调#FF5A00/(255,90,0)、暗灰标签(110,110,110)、Menlo Bold 字体/System/Library/Fonts/Menlo.ttcindex 1、≤2 个强调色、约 40% 留白、极简装饰——终端的复古技术感。这只是一种风格。并行子代理简报——每个动画一个子代理通过Agent工具提示词必须自包含子代理没有父上下文包含 10 项①一句话目标只做一个动画[规格]。别的都不做②绝对输出路径edit/animations/slot_id/render.mp4③精确技术规格分辨率、fps、编码器、pix_fmt、CRF、时长④具体调色板值RGB 元组、hex 或设计系统引用⑤字体路径及索引⑥逐帧时间线何时发生什么、用什么缓动⑦反清单无装饰、无多余、未指定就不加标题⑧代码模式参考内联复制 helpers跨槽位不 import⑨交付清单脚本、渲染、ffprobe 核验时长、报告⑩不要提问任何歧义都选最显然的解释并继续。一个子代理只产出一个文件文件名唯一并行代理互不覆盖。十二、输出规格与抗模式清单输出规格默认匹配源素材除非用户另有要求。常见目标1920×108024电影感、1920×108030屏幕内容、1080×192030竖屏社交、3840×2160244K 影院、1080×108030方形。render.py默认把任意源缩放到 1080p其他目标需传--filter或编辑抽取命令。值得主动询问用户交付格式。抗模式清单无论什么风格都会翻车的做法分层预计算编解码格式USABILITY/tone 标签/镜头层——过度工程决策时从转写即时推导即可手调的时刻打分函数——LLM 选得比任何启发式都好Whisper SRT/短语级输出——丢失亚秒级间隙数据必须词级逐字本地 CPU 跑 Whisper——慢且归一化填充词用托管 Scribe合成前把字幕烧进基底——覆盖层会遮住它们规则 1有覆盖层时用单次 filtergraph——双重重编码用逐段抽取 拼接线性缓动——机械感必须三次缓动段边界硬切音频——可闻爆音规则 3按部分字符串居中打字文本——随增长左移多个动画串行子代理——必须并行确认策略前就动手剪辑——绝不允许重新转写已缓存源——不可变输入的不变输出预设视频类型——先看、再问、最后剪。结语video-use的全部功力浓缩在 SKILL.md 这份技能文档里12 条硬性规则保证输出的生产正确性7 条原则划定必做与艺术自由的边界而 helpers/ 下的脚本把每一条规则都变成了可执行、可验证的工程实现。无论你的素材是 talking head、蒙太奇、教程、旅行还是访谈这套转写 → 打包 → 推理 → EDL → 渲染 → 自评的流水线都能以对话方式驱动产出自检通过的成片。动手前请务必通读 install.md 完成环境搭建并在每次会话中让全部输出落在videos_dir/edit/之下。赞分享AI 技能/插件音视频视频处理人工智能【免费下载链接】video-useEdit videos with coding agents项目地址https://gitcode.com/GitHub_Trending/vid/video-use点击查看免费下载相关推荐video-use 安装部署实战指南为 Claude Code / Codex 等 Coding Agent 配置对话式视频编辑器video use 安装部署实战指南为 Claude Code / Codex 等 Coding Agent 配置对话式视频编辑器 video use 是一套AI 技能/插件音视频视频处理人工智能OpenMontage Avatar-Video 技能中的 HeyGen 视频背景配置完全指南颜色、图片、视频与绿幕合成OpenMontage Avatar Video 技能中的 HeyGen 视频背景配置完全指南颜色、图片、视频与绿幕合成 导读 本文聚焦 OpenMontag人工智能AI Agent音视频媒体生成工作流自动化终极智能视频剪辑指南5分钟学会AI自动字幕剪辑终极智能视频剪辑指南5分钟学会AI自动字幕剪辑 AutoCut是一款革命性的智能视频剪辑工具它通过AI技术将复杂的视频剪辑过程简化为文本编辑操作。无论你是视人工智能语音音视频创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?
咨询建站