这几个月我一直在用Wan 3.0做电商类的30秒商品视频从最初只会丢一张商品图让它随便生成到后来把多张图参考、视频参考、声音参考都塞进工作流踩了不少坑也摸出了一些门道。今天想把这套“三类参考怎么分工配合”的经验完整整理一遍尤其是当你手里素材很多——好几张商品图、一段实拍视频、一段语音或音乐——却不知道怎么喂给模型时这篇文章应该能帮你省下大量试错时间。先给结论图参考决定“商品长什么样”视频参考决定“画面怎么动”声音参考决定“节奏怎么走”。三者不是堆料越多越好而是各管一摊、有主有次。如果顺序搞反了或者权重没分配好轻则画面变形重则30秒成片拍成“四不像”。下面我按实际工作流的顺序把每一层参考怎么用、怎么取舍、怎么排优先级从头到尾拆开来聊。1. 30秒商品视频的底层逻辑先定规划再谈分工很多人拿到Wan 3.0之后第一件事就是急着传素材、点生成结果发现出的片子要么商品像被人捏过要么镜头乱到看不清在卖什么。这个问题的根源不在于模型能力而在于你根本没想清楚“30秒到底要表达什么”。所以我想先聊一个听起来有点虚、但实际决定成败的问题为什么这三类参考必须分层管理。1.1 为什么参考信息必须“分层”三类输入各管哪一摊你可以把Wan 3.0理解成一个非常听话但容易“过度理解”的实习生。你给它一张商品图它知道要拍这个商品你再给它一段视频它会以为你想复刻里面的动作你再丢一段声音它又会尽量让画面去踩声音的节奏。问题是当这些信息纠在一起时模型并不知道哪条指令更重要于是它会自己找妥协方案最后常常妥协出一个平均但平庸、甚至画面硬伤的结果。所以我的习惯是在打开Wan 3.0之前就先把素材分成三层表意层、动态层、情绪层。表意层由多张图参考负责任务是锁定商品的外观、材质、配色、核心细节、包装特征说白了就是告诉模型“你给我老老实实拍这个东西”。动态层由视频参考负责任务是告诉模型画面里商品的运动轨迹、镜头的运动方式、转场节奏也就是“东西怎么动、镜头怎么切”。情绪层由声音参考负责任务是确定成片的情绪基调、节奏卡点、高潮位置实际上就是“观众在什么时间点该有什么感受”。这三层的信息密度完全不同。图参考是最硬的信息视频参考是中间态的信息声音参考是最软的信息。优先级我习惯这样排画面主体冲突时图参考优先运动方式冲突时视频参考优先节奏卡点冲突时声音参考优先。但这里的“优先”不等于权重拉满而是说在生成前做素材取舍时要清楚哪个参考是“底稿”哪个是“锦上添花”。1.2 30秒是“极限信息密度”容错率比短视频更低市面上大多数商品短视频是15到60秒而30秒是一个非常尴尬的长度段。它比抖音信息流前3秒的黄金时间更长但比小红书深度种草的视频又短观众往往是滑到就决定要不要看完。这意味着30秒的成片必须做到“前3秒抓人、中间有信息推进、结尾有记忆点”任何一个环节出现画面崩坏、节奏拖沓观众手指一划就过去了。Wan 3.0一次生成的长度通常有限30秒成片一般需要分段生成再拼接。而分段生成最大的麻烦是每一段都是独立推理商品外观在段与段之间可能发生漂移——这就是为什么多张图参考不能被省掉。你不可能指望提示词里写一句“保持同一个杯子”就真的能保持模型对文字的注意力远没有对图像那么强。换句话说所有参考分工的本质都是为了在“自由生成”和“精确控制”之间找一个平衡点。30秒的片子足够长长到你必须给模型每10秒一个明确的任务也足够短短到任何一段崩了都会毁掉整体观感。所以动手之前先花10分钟做规划绝对不亏。2. 图参考是地基商品一致性主要靠它兜底我在刚开始用Wan 3.0时最喜欢堆图一张不够传三张恨不得把详情页所有角度都塞进去。结果生成出来的商品要么把两个角度杂交成四不像要么背景元素乱入。后来我才意识到多张图参考不是“多传多好”而是“分工明确地传”。2.1 多张图参考的正确姿势谁当主体谁当环境假设你要做一个保温杯的30秒视频手里有五六张图白底产品图、侧视图、细节纹理图、户外场景图、人物手持图、包装盒图。如果一口气全传进去Wan 3.0会无所适从。我的做法是只挑3张以内并且给它们排好角色第一张主体定妆照。选一张正面偏45度、背景干净、商品占画面主体60%以上的图。它的作用是告诉模型“这是主角”。这一张权重最高宁可其他所有参考都翻车这张不能翻。第二张核心卖点细节图。比如杯盖的密封圈、杯身的磨砂质感、内胆的材质反光。这张参考的作用不是让模型复刻构图而是让模型在特写镜头里别把细节画飞。第三张氛围环境图。这张最灵活可以是使用场景也可以是模特手持状态。它决定了画面里“配角”和“环境”长什么样如果你希望成片是户外露营风就放一张山野手持的图如果是办公室桌面风就放一张办公桌特写。这三张图各管各的在传给模型之前先自己在本地标注好避免“拍脑袋乱传”。实际操作中第一张图决定90%的商品一致性第二张图决定特写镜头的可信度第三张图决定整体氛围。如果手头素材不够宁可只传前两张也不要强行凑三张。2.2 图参考过多反而出问题怎么控制在3张以内为什么是3张以内原因在于Wan 3.0这类扩散式视频模型在接收多图输入时它理解的不是“这些图是同一物体的不同视角”而是“这些图都跟输出有关”。当你传了4张以上模型会开始给不同图片分配注意力权重有些图它可能只取了背景里的某个元素甚至把两张图的商品特征混合在一起——保温杯杯盖用A图、杯身用B图、背景用C图结果出来的东西看着就不对劲。我自己的踩坑记录里传5张图生成的保温杯杯盖变成了另一张图里旁边的马克杯的杯盖颜色从雾霾蓝变成了灰蓝色。后来我再也不用超过3张图参考除非是同一个物体从完全一致的角度拍摄的纯背景替换但那又没必要了。如果你确实有非常多的角度想展示比如30秒视频里需要出现“正视图、侧视图、俯视图、细节特写”我的建议是不要靠图参考去实现多角度而是靠分段生成。第一段用第一张主体照出主角度第二段想切侧面时把“侧视图”作为新的首帧图传给第二段生成而不是把所有细节预设在一次生成里。这样既保住了每段的商品一致性又实现了多角度展示Wan 3.0的分段生成机制也天然允许你每段换首帧。3. 视频参考是动作指导别让它背“画面内容”的锅很多人在Wan 3.0里上传视频参考是希望模型能“照着这个视频拍一个一样的”但实际上视频参考的作用很微妙。它更像一个动作轨迹的参考线告诉模型镜头和物体应该怎么动而画面内容本身仍然主要靠图参考来锁定。如果你把视频参考当成“改图工具”让它去决定画面里是什么商品结果通常会让你失望。3.1 视频参考选什么动作轨迹优先画面风格其次30秒商品视频里最常见的视频参考来源有这么几类同类商品的官方广告片动作设计专业、运镜流畅但画面风格与你的商品可能不搭。自己用手机拍的简易Demo动作逻辑匹配度高但画面质感差。网络上找的酷炫转场模板节奏感强但商品本体的动作不多。我的经验是选视频参考时先看动作轨迹不要被画面风格迷惑。比如你想做一个“商品从桌面旋转升起、镜头推进到细节、然后落入使用场景”的30秒片子那你需要找的视频参考是那种包含“旋转—推进—拉远”三段式运镜的素材哪怕它拍的不是同类商品也没关系因为Wan 3.0会把视频里的运动方式迁移到你的商品上。如果你找的视频参考里商品本身有强烈的品牌特征或结构特征反而容易干扰输出——模型可能把参考视频里商品的颜色、形状迁一部分过来和图参考打架。所以视频参考的优先级是镜头运动模式 物体运动速度 画面构图 背景风格 商品外观。越靠前的属性越重要越靠后的属性越不建议依赖视频参考来获取。3.2 视频参考的“降权”技巧不想完全照搬时怎么办有时候你找到一段特别合适的运镜参考但它的画面节奏太慢远远超过你想要的30秒信息密度。在Wan 3.0的参数面板里通常会有类似“参考强度”或“视频参考权重”之类的选项具体名称取决于版本如果你不想视频参考完全主导画面我建议把权重放到0.3到0.5之间同时把提示词写得明确一点比如“快速推近”“轻微旋转上升”。这样模型会参考视频的运镜逻辑但不会死板地逐帧复刻。还有一个容易被忽略的细节视频参考的长度会影响成片的节奏。我一开始拿一段15秒的视频参考去生成30秒的视频结果模型把原本15秒内的动作拉长成了30秒画面后半段明显拖沓。后来我学乖了上传视频参考之前会先裁剪到目标时长的三分之一甚至更短比如生成10秒片段我只给3到5秒的视频参考让模型有空间在参考动作的基础上自由发挥而不是被节奏绑架。如果你手里只有一段比较长的视频参考也不用非得全传进去。可以先用剪辑工具截取最核心的2到4秒片段再作为视频参考上传。说实话一段干净的短参考比一段冗长的长参考有用得多。4. 声音参考定节奏30秒的“第一编剧”声音参考是我常用Wan 3.0时最晚才开始认真研究的模块但后来发现它对成片质感的提升最大。很多教程会把声音参考放在“附加功能”里一笔带过但实际上当你做30秒这种长度可控的内容时声音参考几乎决定了整个片子的结构。4.1 声音参考的本质锁定时长、情绪与转场点Wan 3.0的声音参考通常支持你上传一段音频让模型在生成视频时参考声音的情绪、节奏甚至风格。注意它不是简单地把声音混入视频当作背景音乐而是让视频画面去匹配声音的情绪走向。举个例子我做一个茶叶礼盒的30秒视频时上传了一段舒缓的古筝配乐。那么模型生成的画面前半段就会偏慢、偏静镜头推拉也会均匀柔和如果我在第15秒左右给了一段节奏变快的音轨画面在那个时间点附近就会出现更快的转场或运镜。这就是声音参考对“节奏层”的强控制。对于30秒的视频我的声音参考规划通常是这样的0到5秒声音平缓画面用于建立商品整体认知对应一个缓慢推进的起始镜头。5到20秒声音逐渐丰富层次增加画面进入卖点展示阶段转场频率变高细节特写集中在这一段。20到30秒声音情绪收束或者上推画面出现品牌Logo、包装场景或“使用结果”收尾干净有力。这段规划我会在生成前就写在小本子上而不是生成后去凑。因为声音参考一旦确定前中后三段的画面内容、镜头速度、转场位置基本就被框住了。没有声音参考时模型自己随机发挥的节奏往往会偏慢这对30秒信息流视频是很致命的。4.2 声音与画面卡点先有声还是先有画实操中有一个很常见的疑问到底先找音频再生成视频还是先生成视频再配音如果你用的是Wan 3.0的声音参考功能那一定是先有声音参考再生成视频。因为模型在推理阶段就会根据音轨的节奏去安排画面的结构和转场生成后的画面天然就带着卡点痕迹。如果你先生成视频再配音那声音参考就没有任何意义只能靠后期剪辑对节奏反而更麻烦而且画面动作与音波的匹配度远不如生成时同步规划。但这里要提醒一句声音参考不要用完整版的歌曲或纯人声旁白素材。Wan 3.0对声音参考的处理更多是“提取情绪和节奏特征”而不是精细地逐拍对齐。如果你上传一段人声密集的旁白模型很容易把语音的情绪起伏当成节奏起伏结果画面切换点跟嘴巴吐字的节奏对上而不是跟内容逻辑对上。我测试下来的最佳实践是上传“纯音乐、无歌词、节拍清晰”的音频作为声音参考如果有人声旁白需求等视频生成完再进剪辑软件补录而不是一开始就混进去。另外如果你希望某些特定节点强行卡声音比如第12秒正好一声重音响起那么最好在提示词里也显式指定一句类似“在12秒附近出现一个快速转场”的补充描述不要指望模型只听声音就精确到秒。声音参考提供的是宏观节奏而提示词负责微观控制。5. 实操过程三种参考配合生成30秒商品成片理论聊了不少下面把我最近做的一个摩卡壶30秒种草视频的完整流程走一遍。这个案例比较典型因为它同时涉及“多张图产品图、细节图、场景图、视频参考一段倒咖啡的实拍、声音参考一段轻快的爵士乐”很能说明三种参考怎么配合不打架。5.1 前期准备整理素材清单我先花20分钟把素材整理清楚形成一张自制清单素材类型素材内容在视频中的任务预计放置位置图参考1摩卡壶45度白底图锁定主体外观第一段全段图参考2壶盖、分流嘴细节特写锁定细节卖点第二段特写部分图参考3阳光下的木质桌面场景锁定环境氛围整段背景基调视频参考3秒“镜头从壶身推近至壶嘴”片段提供推近动作轨迹第二段开场声音参考15秒轻快无歌词爵士乐锁定节奏和情绪全片节奏骨架我当时没有用模特手持图因为这个商品的核心卖点是“壶身造型和萃取效果”不是生活方式场景。如果强行加入人物反而可能分散模型对商品的注意力。整理素材的过程也是做减法的过程跟“想展示什么”相比更重要的是“哪些素材可能制造冲突”。图参考三张里面的环境图其实是在第二段特写时才真正发挥作用的但因为生成时是分段制作每段都复用这三张图所以环境的一致性从头到尾都有保障。5.2 分段生成与拼接0到10秒、10到22秒、22到30秒30秒视频我不指望一次生成直接完成中间一定会分三段。分段的好处是每段可以单独调整提示词、切换首帧图、微调参考权重拼接时再用视频剪辑软件把三段接起来。第一段0到10秒建立认知。图参考主图 环境图视频参考不传声音参考爵士乐前10秒提示词重点“白色摩卡壶放置在木质桌面上镜头缓慢推进桌面光影柔和清晨氛围商品占画面中央干净构图”生成第一段时我不传视频参考是因为开头需要稳定、清晰地展示商品全貌这时候画面一旦有大幅运动观众根本看不清楚产品长什么样。声音参考的前半段节奏平缓正好匹配这种慢推进。首帧图就用了第一张白底图模型在首帧约束下壶的外观基本不会跑偏。第二段10到22秒展示细节与动态。图参考三张全传视频参考3秒推近片段声音参考爵士乐中段10秒提示词重点“镜头从壶身快速推近至壶嘴紧接着切换至咖啡液缓缓流出的特写木质桌面上的光影变化整体节奏轻快细节锐利”这一段的视频参考只给了3秒“推近”轨迹没有给完整画面所以模型在动作上参考了推近逻辑但画面内容仍然由图参考兜底。特写镜头里壶嘴出现了两次一次是镜头推近停住一次是咖啡液流出虽然原视频参考里没有咖啡液但提示词补足了这一层生成的画面反而比硬让模型复刻视频参考更加自然。第三段22到30秒收尾与品牌记忆点。图参考主图 环境图视频参考不传声音参考爵士乐最后8秒提示词重点“镜头缓缓拉远露出完整摩卡壶和咖啡杯暖色调背景虚化画面安静下来停留在一个完整的静物构图上”最后这段我特意把节奏放缓对应音频结尾的情绪回落。拉远镜头在全片里形成一个“先近后远、先快后慢”的弧线观众看完前面的快节奏后在结尾处得到一个喘息点反而容易记住商品全貌。这里也没传视频参考因为收尾动作简单靠提示词就能控制不需要外部视频再带节奏。三段生成完成后我用剪辑软件把3段拼起来中间没有加任何转场直接硬切。因为每段的末帧和下一段的首帧之间有声音节奏衔接硬切反而干净利落。如果你发现段与段之间商品位置有轻微跳变可以把下一段的首帧图替换为上一段的最后一帧截图这样画面衔接会顺滑很多。5.3 参数与权重调整建议表下面是我常用的一组参数配置参考不同版本界面文字可能略有差异思路是通用的参数项第一段0-10秒第二段10-22秒第三段22-30秒图参考数量2张3张2张视频参考权重不启用0.4不启用声音参考权重0.50.70.5画面运动幅度低高低提示词中“节奏”关键词缓慢、平稳快速、推进、切换拉远、安静、停留这个配置的核心逻辑是声音参考决定三段整体的节奏曲线图参考决定三段内的商品一致性视频参考只在中间那段作为“动作催化剂”出现。你不能让视频参考在开头和结尾也喧宾夺主否则整条片子会显得一直在动没有呼吸感。6. 常见问题与排查技巧实录这条工作流我跑了几十条片子遇到的问题五花八门这里挑几个最典型的连同排查思路一起整理出来方便你直接对照解决。6.1 商品主体变形、换色、换结构这是最让人崩溃的问题好不容易生成了一段结果商品颜色错了或者结构多了一个不该有的部件。排查方向先看图参考是不是超过3张如果是先删到3张以内。看图参考之间是否存在明显冲突比如一张白底图是雾面质感另一张场景图是高光质感模型可能取两者的平均导致材质感不对。提示词里尽量不要出现与图参考相悖的描述比如图里是白色壶身提示词却写了“黑色壶身”这种矛盾大概率会让模型纠结后选错。我的经验是主体变形时“图参考优先”原则最管用删掉所有环境图和细节图只保留一张主体定妆照重新生成。如果只保留一张图主体仍然变形那基本可以确定是首帧设置问题检查一下是否把上一段生成的视频某一帧误设成了首帧。6.2 动作僵硬或运镜乱跳生成结果要么商品一动不动像个静物摄影要么镜头陀螺一样乱转找不到节奏。排查方向视频参考权重过高时模型容易乱动先降到0.3到0.4试试。提示词里是否写了互相矛盾的动作描述比如“缓慢推进”和“快速旋转”同时出现。声音参考的节奏如果特别强模型可能为了卡点频繁切换镜头导致画面不稳。解决办法是把声音参考权重降一点或者在提示词里写明“仅前3秒快速转场其余时间保持平稳”。我还发现一个规律当你希望商品有动作但又不想镜头乱晃的时候提示词里应该优先描述“商品的动作”而不是“镜头的动作”。比如“咖啡液缓缓流入杯中”比“镜头急速推进”更稳定。模型对物体运动的理解往往优于对镜头语言的理解尤其是商品视频这种画面内运动主体非常明确的场景。6.3 声音与画面错位生成出来的画面节奏和声音参考对不上或者看起来是各管各的。排查方向检查声音参考是否包含人声或过于复杂的音色如果是换成纯音乐再试。提示词里不要写具体秒数比如“15秒时出现一个爆点”模型并没有那么精确的计时能力你写的秒数它往往理解不了。更好的做法是描述“前段平缓、中段紧凑、结尾安静”让模型按段落情绪去对齐。分段生成时每段的声音参考时间点要对上片段本身的起止时间不要把30秒的音频完整塞给10秒的生成任务。如果声音参考和画面错位严重我通常干脆放弃“让模型自己卡点”转而在剪辑软件里调整音频位置把声音拖到画面对应的卡点上。但这里有个前提画面必须有明显的转场或动作变化才方便对声音的节奏点。所以生成时就算不看声音参考也最好在提示词里设计好“转场点”这样后期对卡点的操作空间会大很多。6.4 三段拼起来不连贯三段单独看都挺好拼在一起却像三个不同视频的拼接商品位置、光影方向都对不上。排查方向三段生成时使用的图参考必须一致尤其主体参考图不能换换一张图哪怕同一个商品模型理解的“长相”也会有偏差。检查每段的首帧是不是上一段的末帧如果不是裁剪上一段的最后一帧作为下一段的首帧图。声音参考的三段片段最好来源于同一首曲子并且衔接处的音量、情绪要匹配如果前一段是高亢部分、后一段突然安静画面再连贯也会觉得“断了”。我后来学会了一个比较省力的拼接方法把三段生成任务放到同一轮工作流里用同一个商品主体图加不同的动作描述去生成商品的白平衡、光影逻辑会更统一。个别段落如果不满意只重生成那一小段就行不要整条重跑。7. 结合Wan 3.0做30秒商品的几条心得讲完流程和排查最后再分享几条我这几轮实操下来真正觉得有价值的心得这些不属于某一个具体步骤而是贯穿在整个工作流里的思路。第一参考素材是给模型“划重点”的不是给它“交功课”的。很多人在这一步容易囤素材总觉得给得越多、控制越精细其实Wan 3.0的注意力是有限的它更擅长接收“少而精准”的指令。三张图、一段短视频、一段音乐这是我自己测试下来不会让模型过载的边界值。如果超过这个数量我宁可多花时间分两次生成而不是硬塞进一次。第二声音参考的优先级应该提到图参考之前来规划。听起来可能有点反直觉但30秒的视频里声音节奏决定观众能看到多少信息。我经常先听几遍参考音频在纸上画出一条“情绪曲线”再按曲线去规划画面内容而不是先想好画面再找音频来配。后者很容易出现音频跟画面情绪打架的情况。第三商用场景下别指望一次生成就是终版。我用Wan 3.0生成30秒商品视频通常一条片子至少要跑三轮第一轮出结构第二轮修细节第三轮调节奏。第一轮先不管小瑕疵重点看商品是否一致、分镜逻辑是否顺畅第二轮针对明显的变形和动作问题做局部重生成第三轮才把所有素材拼起来配合剪辑软件统一校准字幕、声音卡点。这套流程听起来慢实际上比每轮都期待一步到位要高效很多。目前在30秒商品视频这个场景里Wan 3.0已经能覆盖我从策划到出初稿的大部分工作但真正决定片子能不能用的仍然是我在前面做素材规划和权重分配的那20分钟。三类参考的分工说到底就是精准控制与信任放权的平衡。希望这套经验能帮你少走一些弯路。
阅读完成 · 觉得有帮助?