首页 / 资讯中心 / 文章详情

大模型重构营销广告链路:从内容生成到智能定向的实战

大模型重构营销广告链路:从内容生成到智能定向的实战 ★ FEATURED ARTICLE
1. 项目背景与业务痛点拆解货拉拉的营销广告业务和传统电商、本地生活服务平台有相似处但又有自己的特殊节奏。平台同时连接着C端用户发货人、收货人和B端司机群体两类人群的诉求、使用场景、决策链路完全不同用户端要的是“便宜、快、靠谱”司机端要的是“单量稳定、顺路、收入高”。广告投放如果只靠一套通用文案、一套通用素材转化效果一定差因为它没有触及不同人群的真实需求。这个项目启动的契机很直接——原有的营销广告内容生产链路遇到瓶颈。运营团队每天需要产出大量广告文案、落地页内容、活动标题、Push文案和短信内容人力有限产出速度跟不上业务投放节奏更麻烦的是不同渠道朋友圈、抖音、快手、搜索、厂商商店、自有App弹窗对文案风格、字数、卖点的要求都不一样同一套内容改来改去效率低且质量参差不齐。当时我们团队做了一次业务调研发现几个比较扎心的事实广告文案的点击率在不同渠道差异很大但运营同学普遍没有精力针对每个渠道单独做内容调优。用户画像标签虽然很丰富但广告系统里做定向时用的还是规则匹配那一套比如“过去7天叫过车、配送距离超过5公里、订单金额大于50元”这种硬条件没有利用大模型对用户意图做更细的刻画。内容审核依赖人工每天几千条素材送审节假日和活动大促期间甚至过万审核压力大漏审和误判都出现过。广告投放后的数据复盘主要靠BI报表人工解读发现问题慢缺少从“内容—线索—成交”的完整归因。这些痛点凑在一起我们才判断大模型在货拉拉营销广告这个场景里不是赶时髦而是真的能拆掉这些堵点。一句话总结项目目标——用大模型重构营销广告从内容生产、用户定向、风险审核到效果归因的整条链路。1.1 营销广告业务的特殊性货拉拉的广告业务和纯互联网电商有本质区别。核心在于决策成本高、履约链条长。用户下单之前要考虑的不只是价格还有车型是否匹配、司机是否靠谱、货物安全怎么保障、搬运服务怎么算钱。广告如果只打“便宜”两个字用户看完很可能没有感觉因为便宜背后有一堆他还没想清楚的顾虑。这就导致内容生产的复杂度上升。一条有效的广告文案要同时解决“让用户有点击欲望”和“让用户降低决策顾虑”两个任务。传统运营写文案靠经验写得好不好往往看感觉。大模型介入后我们可以把“促成转化”这个目标拆解成多个子能力——卖点提炼、场景还原、信任背书、行动号召然后把每个子能力变成可量化的生成任务。这一步是整套系统的地基。另一个特殊点是双端人群。C端用户看广告是“我需要搬家/拉货谁家靠谱”司机看广告是“跑货拉拉能不能多赚钱”。两端的关注点完全不同但广告系统过去往往共用一套素材库。我们后来做的核心工作之一就是把人群拆开用大模型分别建模生成差异化的创意内容。1.2 大模型能解决哪些具体问题立项评审时技术委员会最关心的问题是大模型在这里到底是生产力工具还是架构核心我们的回答是前期当生产力工具中期嵌入工作流后期成为具备决策能力的智能体。具体拆下来落地场景分四块广告创意内容生成用大模型生成多渠道适配的文案、标题、卖点、短句、落地页文案替代人工从零创作。用户意图理解与精细定向用大模型把用户的行为序列、订单记录、搜索词转成语义标签让广告系统能识别“用户处于什么阶段、可能想要什么服务”。素材合规审核用大模型对生成素材和外部素材做前置审核过滤违规词、夸大承诺、敏感表述减少人工审核压力。广告数据分析与归因用大模型自动生成投放日报、解读数据波动原因、标记异常让运营把精力放在策略调整而不是做表上。这四块一开始是并行做的但落地顺序有讲究。创意内容生成最容易见效我们首月就上线了意图理解需要数据清洗和模型调优排第二审核和数据分析在跑通前两项后才完整接入。事实证明这个节奏是对的——先让业务方看到效率提升后面的资源协调才顺利。2. 技术选型与系统架构落地任何大模型应用落地第一步都是选型。这一步没想清楚后面所有工作都会返工。我们在技术方案评审时对比了三类路线方案优势劣势纯API调用公有大模型接入快效果稳定无需运维数据出域风险成本不可控定制能力弱开源大模型私有化部署数据可控支持微调长期成本低需要GPU资源和推理优化迭代维护成本高大模型API开源小模型混合兼顾效果与成本灵活度高架构复杂需要做好路由策略最终选了第三条路线——混合架构。核心判断依据是营销广告场景对数据安全有合规要求用户手机号、订单详情、行为轨迹这些字段不适合大量上传到公有大模型但完全私有化部署一个大参数量模型训练和推理成本在项目初期算不过来。所以我们的策略是核心生成任务走私有化部署的中等规模模型复杂推理和辅助任务走公有大模型API中间加一层路由网关做分流。2.1 模型选型API还是私有化部署具体到模型选择我们做了两轮测试。第一轮测试是通用能力评估。把货拉拉真实的广告文案样本脱敏后分别喂给不同类型的大模型让它们生成同风格的新文案然后由运营团队盲测打分。打分维度包括语义准确度、卖点完整度、渠道适应性、有无违规风险。这轮测试主要淘汰掉那些中文营销文案能力明显不行的模型。第二轮测试是成本模拟。我们统计了过去一年营销广告文案的调用量峰值得出结论——大促期间单日生成请求会超过数十万次如果全走公有云API按当时的token计费标准一个月的账单会非常吓人。于是我们定了一个规则简单生成任务比如短标题、Push文案、短信内容走私有化部署的模型复杂生成任务比如活动整体营销方案、多卖点长文案、跨渠道内容改写走公有大模型API。成本直接降了一个量级。私有化部署选型上我们重点考虑了中文语义理解能力和生成指令跟随能力同时要求模型支持低显存推理和量化部署。最终用了7B到14B级别的开源模型做底座配合LoRA微调来适配货运行业术语和营销话术。效果上微调后的7B模型在某些营销文案任务上已经能逼近通用大模型的效果而单次推理延迟能做到几百毫秒以内线上完全够用。2.2 整体链路设计从请求接入到内容下发整套系统在架构上分五层我这边画一个简化的链路描述第一层业务接入层。运营配置活动信息、选择渠道、填写简要需求比如“给同城搬家用户写一条朋友圈广告文案要突出价格透明和车辆实时定位”。所有业务系统统一走这层接入。第二层任务编排层。收到请求后先做任务解析拆出文案类型、目标人群、渠道限制、字数要求、需要突出的卖点然后从知识库拉取相关的历史优秀文案、用户画像标签、活动规则最后组装成完整的提示词。第三层模型路由层。根据任务类型和成本策略决定走私有化小模型、公有大模型API还是先小模型生成再大模型优化。第四层内容治理层。生成结果先过规则过滤器敏感词、违禁词、字数限制过模型审核器广告法合规、夸大风险、价值观安全最后进入人工抽检队列。第五层效果回收层。生成内容下发到广告平台后回传曝光、点击、转化数据形成“生成—投放—反馈—优化”闭环。链路设计里一个容易被忽视的点任务编排层其实决定了生成质量上限。同样是“写一条搬家广告”如果输入到模型的提示词只有这句话生成结果大概率是套话。我们后来在编排层接入了知识库召回把“附近3公里的车型库存”“近7天该渠道转化最高的文案TOP10”“该品类的用户高频关注点”全部作为上下文注入生成质量肉眼可见地提升。2.3 为什么选择“小模型大模型”混合架构做技术方案时有同事提出过质疑既然已经有API可以调用为什么还要自己部署一个私有化模型这不是重复造轮子吗我的回答是成本和稳定性的账值得细算。成本账很好理解。公有大模型API按token计费而营销广告内容生成的特点是请求量大、单次内容短。一条短信文案可能就几十个字但为了生成这几十个字每次要消耗几百甚至上千token的上下文。日均几十万次请求单月成本就是几十万上下。自己部署的私有化模型一次性投入GPU资源后续边际成本几乎可以忽略。稳定性账更关键。广告投放有强时效性大促期间晚上8点到12点是投放高峰如果API服务在这个时间出现限流或波动运营连替代方案都没有。私有化部署之后我们自己控制资源水位核心链路不依赖外部服务心里踏实得多。混合架构还有一个隐性优势可以针对特定任务做定向优化。通用大模型再强也不会比我们更懂“货拉拉”的车型体系、计价规则、司机接单逻辑。通过微调和提示词约束私有化模型在这些垂直任务上能做到效果和成本双优。而开放性创意任务比如“为一个新上线的搬家套餐想一句刷屏级slogan”公有大模型的表现更稳定该花的钱还是得花。3. 营销场景核心功能与实操细节架构定了之后真正的硬仗在功能落地。我们按业务优先级分四条线推进创意内容生成、用户意图理解、合规审核、数据归因。每一条线都踩了不少坑我把核心方案和实操细节展开讲。3.1 广告创意文案生成提示词工程和模板设计创意文案生成是最早上线的功能也是运营同学感知最强的一个功能。他们打开内部工具输入活动名称、目标人群、卖点关键词几十秒内就能拿到一版可用的文案草稿。这个功能能做出来靠的不是模型有多聪明而是我们把提示词工程做得足够细。这里分享一个我们最终沉淀下来的提示词框架角色设定你是一名深耕同城货运行业的营销文案专家对货拉拉的产品服务、用户群体和行业术语非常熟悉。 任务目标为[XXX活动/产品]生成面向[目标人群]的广告文案。 渠道限制该文案将投放于[渠道名称]渠道要求[字数限制/风格要求/格式要求]。 核心卖点必须涵盖[卖点1]、[卖点2]、[卖点3]但不要全部堆砌按用户关注度排序。 用户顾虑目标用户常见的顾虑包括[顾虑1]、[顾虑2]文案中需通过[信任背书/数据说明/场景描述]等方式间接缓解。 语气风格[品牌调性关键词]避免[禁止出现的表达]。 参考示例[投放渠道历史高转化文案1-3条]。 输出要求只输出最终文案不做解释。这套模板看起来简单但每一行都是踩坑踩出来的。比如“不要全部堆砌”这句是因为我们发现模型很容易把三个卖点全部罗列出来反而削弱了核心卖点的冲击力。再比如“用户顾虑”这一栏最初我们没有加生成出来的文案经常是纯自嗨型讲了一堆平台优势但对用户真正担心的事情只字不提。另外一个实操经验模板里的“参考示例”不一定放整条文案可以只放开头句或结尾句让模型学习的是表达方式而不是内容结构。我们试过把完整文案放进去模型很容易产生复制嫌疑尤其是高频词会被重复使用渠道审核容易误判为搬运。3.2 用户画像分析与广告定向从规则到语义的跨越广告定向是消耗系统比较核心的环节。过去货拉拉广告平台用的基本都是规则定向地域、活跃时间、订单频次、客单价区间等。规则定向的问题是标签硬、缺乏弹性。一个用户最近搜索过“搬家公司费用”但这周没用货拉拉按照规则他属于沉默用户广告就不太会展示给他但从语义角度看他明显处于搬家需求的高意向阶段只是还没货比三家。我们做的第一件事是用大模型把用户的原始行为日志变成结构化语义标签。具体的做法将用户近30天的行为事件搜索词、浏览品类、订单记录、优惠券点击、App页面行为序列化。构造预训练提示词让大模型输出JSON格式的用户意图标签包括需求阶段了解期、比价期、决策期、服务类型偏好搬家、拉货、同城配送、价格敏感度高/中/低、决策驱动点价格、速度、服务保障。对输出的标签做频次统计和向量化写入用户实时特征库。广告定向系统在做流量分发时从特征库拉取语义标签与广告投放计划做相关性匹配。这套方案的收益是明显的。一个真实案例过去投搬家广告定向条件是“最近30天下过搬家订单的用户”覆盖人群很窄换上语义标签后可以覆盖“搜索过搬家公司、浏览过搬家套餐、价格敏感度高、处于比价期”这类潜力用户投放规模几乎翻倍而转化成本没有明显上涨。需要提醒的是大模型做用户意图识别不能直接拿原始数据进行。我们前期做了大量的数据脱敏工作手机号、详细地址、车牌号这些敏感信息要提前替换或剔除。这一块必须和合规团队对齐了再做等到上线再补就晚了。3.3 内容审核与合规大模型兜底营销内容的合规审核在广告行业是红线。货拉拉的广告素材要满足广告法、平台规则同时还要符合公司内部品牌规范。过去审核靠人工每天处理几千条素材眼睛都快看花了漏检率很难压到零。引入大模型做前置审核后我们的审核链路变成三段式第一段快筛。基于规则引擎做敏感词、违禁词、免税词、绝对化用语比如“最”“第一”“顶级”的快速过滤。这段响应时间小于10毫秒把明显有问题的素材先拦下来。第二段模型审核。把规则引擎放行的素材送入大模型让它从语义层面判断是否存在夸大宣传、价格误导、服务承诺过度、价值观风险等。比如“保证2小时内必达”这种表述规则引擎不一定能发现但模型能意识到这是无法兑现的承诺。第三段人工抽检。大模型审核通过的素材按一定比例进入人工复核。这个比例我们初期设置得比较高跑稳后逐步降低现在是全量走模型、抽检靠人工。模型审核的提示词也经历了多轮迭代。一开始我们只输入“请判断以下文案是否合规”模型反馈很笼统很难直接作为审核依据。后来改成了“请逐条标注风险类型、风险等级、具体问题片段、修改建议”输出结构化审核同学看一眼就能做决定效率提升非常明显。这里有一个人工智能应用里的经典问题——幻觉。审核场景对错误的容忍度极低误判一条素材要么导致违规内容上线要么把好素材错误驳回。我们的应对方法是模型审核永远是“建议方”而不是“决定方”。规则引擎判断违规的直接拦截模型判断有风险的进入人工队列不允许模型单独做最终决定。3.4 素材生成多模态的探索文案跑通之后团队自然想往图片和视频素材延伸。毕竟广告投放中图片素材的点击率权重远高于文案。我们做了一个阶段性的探索用多模态大模型生成广告配图、banner底图、简单的短视频脚本。坦白说这个方向目前还处于“半成品”状态。大模型生成的图片在审美上问题不大但在合规和品牌一致性上容易翻车。比如车身上的logo变形、人物手指数量不自然、场景细节失真这些用户一眼就能看出来投放出去反而损伤品牌感。我们现在的做法是把多模态大模型定位成“辅助出图工具”运营提需求大模型生成草图和参考图再由设计同学在专业工具里做精修和规范调整。这样既省了从零开始的创意时间又保证了出图质量。短视频脚本方面大模型的表现更实用一些尤其是分镜描述、口播文案、字幕建议这些偏语言的部分能直接生成初稿给拍摄团队参考。多模态这条路一定要走但不要指望一步到位。先解决“从无到有”再解决“从有到精”节奏上稳一点不会错。4. 实战复盘从数据准备到效果评估前面讲的是架构和功能这一部分聊聊落地过程中最花时间、也最考验功力的环节数据、评估和成本。4.1 微调数据的准备少而精胜过粗而多虽然我们的基础模型用的是开源底座但直接拿通用模型跑营销文案效果只能算勉强能看。真正让效果发生质变的是微调阶段的数据质量。我们先从历史数据中筛选了约数万条优质营销文案样本标准是投放后点击率高于渠道平均水平的、通过合规审核的、用户反馈无投诉的。然后做清洗和标注去掉包含具体时间、价格等已过期信息的文案。对文案进行结构化标注适用渠道、目标人群、核心卖点、文案风格、转化目标。对明显夸大、有合规风险的文案做剔除避免模型学到坏习惯。针对货运行业特有的术语和场景补充了一批人工重写的种子样本比如“微面”“4米2”“同城配送”“爬楼费”“等待费”这些词的正确用法。微调方法上选了LoRA只训练低秩适配层。原因很实际全参微调需要的数据量更大训练周期更长而且容易灾难性遗忘——模型原来会的通用能力被冲掉LoRA则把影响范围控制在增量知识上对原有能力干扰小训练资源消耗也更可控。训练的时候也做了一些尝试。比如混合比例我们试过纯营销数据、营销数据通用数据混合最终发现加10%-20%的通用指令数据可以让模型在营销任务上的泛化能力更好而不是只学会背模板。这个细节很多人容易忽略。4.2 评估指标与线上回归机制评估大模型生成内容的质量是最容易产生争议的环节。运营说好技术说数据不涨两边各说各话。我们的解决办法是指标分层每个功能都有自己的北极星指标和辅助指标。文案生成任务的核心指标是采纳率——运营从模型生成的文案中直接选用或稍作修改后使用的比例。这个指标非常诚实运营如果觉得模型生成的内容不行他们宁愿自己写。我们统计过文案采纳率从第一周的不足20%经过微调和提示词迭代后稳定在了50%以上最高到了60%出头。用户意图识别的评估则不同不直接看文案效果而是看后续投放的表现。我们会做AB实验一组人群用规则定向一组人群用大模型语义定向对比两组的点击率、下单率、获客成本。这种评估周期相对长但结论具有说服力。广告审核模块评估三个指标误判率好文案被拦截的比例、漏检率问题文案未拦截的比例、审核效率单均审核耗时。这三个指标互相牵制追求零漏检必然导致误判率上升所以我们会设定一个容忍区间在业务接受范围内找平衡点。线上回归机制也有讲究。所有大模型生成的文案不会直接全量投放先通过灰度环境跑小流量观察点击和转化数据达标后再放量。如果一条文案产生了明显异常比如点击率显著低于历史均值系统会自动把该文案标记为低质量并从备选池中重新生成替代版本。这个自动化兜底机制很有用运营不用时刻盯着数据。4.3 成本控制经验GPU、Token和人工成本很多团队做大模型项目只盯着模型本身的成本忽略了人力成本和其他隐性支出。这会导致项目汇报时被管理层质疑“投入产出比不自洽”。我们梳理过成本分三块第一块是GPU资源。私有化部署需要常驻推理资源这是我们当前成本的大头。优化手段包括模型量化从FP16压到INT8显存占用直接减半速度反而更快、动态批处理把并发请求攒一批再推理提高吞吐、错峰部署大促前扩容、平时缩容按流量计划调节资源池。第二块是API调用费用。我们通过任务路由策略让简单任务尽量留在本地模型复杂任务才走API。这招省下来的钱比想象中多得多。另外还把提示词做了压缩去掉冗余背景信息每次调用的token量下降明显——同样的效果成本能少三到四成。第三块是人工标注和评估成本。微调需要标注数据效果评估需要人力打分这部分成本前期经常被低估。我们后来建了一个内部标注小组运营同学轮值参与既保证标注质量也让他们更了解模型的输出逻辑后续使用配合度更高。5. 常见问题与排查技巧实录做这个项目快一年踩过的坑可以写成一本小册子。挑几个最典型的问题整理成速查表每条都是真实经历。常见问题典型表现排查思路与解法生成内容重复率高不同活动文案开头句高度相似检查参考示例是否固定化增加随机种子在提示词中明确“改变句式结构”微调数据中引入更多句式变体幻觉导致事实错误文案中出现不存在的车型、服务承诺将业务知识库接入RAG生成前检索真实信息在提示词中标注“只基于提供的资料”对日期、价格类字段做生成后规则校验审核误判增多好文案被频繁驳回收集被误判样本分析触发维度调整审核提示词的严格程度增加白名单表达引入“风险分级”而非“一刀切”用户标签发散同一用户在不同时段意图标签差异大引入时间衰减因子近7天行为加权增加意图标签稳定性校验对低置信度结果直接丢弃线上效果波动文案点击率忽高忽低优先排查渠道差异不同渠道基准不同检查投放时间、竞争环境关注文案被用户跳过后的负面反馈私有化模型推理慢高峰期请求排队升级动态批处理考虑量化感知训练对简单任务设置超时降级到本地规则模板5.1 幻觉问题怎么压大模型的幻觉问题在营销场景里特别要命。广告文案本来就要求准确真实如果模型凭空捏造一个“平台新用户首单立减50元”的优惠信息运营直接拿去投放第二天就可能被用户投诉或平台处罚。我们压幻觉的组合拳有三层第一层是提示词约束。在生成任务里明确告诉模型只能使用给定的活动信息改写时不能新增事实。这个听起来简单但在指令遵从能力弱的模型上效果有限。第二层是RAG检索增强生成。把活动规则、套餐价格、服务说明这些结构化资料放进知识库每次生成前先把相关文档检索出来作为上下文喂给模型。这样模型生成时是基于事实的而不是靠记忆瞎编。第三层是生成后校验。所有包含数字、价格、日期、承诺的文案生成后都要走一遍规则校验与知识库里的真实数据比对不一致的直接打回重新生成。这三层加起来基本能把事实性错误控制到可接受的范围。5.2 线上效果波动怎么归因运营问得最多的问题就是上周点击率挺好这周怎么掉了是模型不行了还是投放安排变了真实的排查顺序是先看渠道再看定向然后看内容和频次最后才轮到模型。很多波动和模型本身没有关系比如周末和节假日的用户注意力分散、广告位竞争加剧、竞品同期投放加码、活动优惠力度变化这些外部因素占了大头。为了降低归因难度我们搭了一套简易的波动诊断面板把关键维度的变化量并列展示出来。运营发现点击率下降先看一眼诊断面板就能快速定位问题方向不需要每次都拉技术和算法团队排查。这个工具比任何算法优化都能提升团队效率。还有一个小经验不要把单一指标作为大模型效果的判断依据。广告效果是多因素叠加的结果文案、素材、定向、出价、落地页体验共同决定转化。真要评估大模型的贡献还是得靠AB实验控制变量用多维度的对比来说话。5.3 从“能用”到“好用”的三件小事最后分享三个我们在项目临近收尾时做的优化单看都不起眼但对体验提升帮助不小。第一件是流式输出。文案生成原本是等模型全部生成完一次性展示一个长文案要等好几秒运营同学在工具前干瞪眼。改成流式输出后字是一个字一个字蹦出来的虽然总时长没缩短多少但体感快了太多配合上取消按钮运营等不及可以直接中断重新生成。这个交互上的小改动让工具的日常使用率涨了不少。第二件是一键改写。运营拿到一版文案大部分时候不是完全不能用而是局部想调整。我们在工具上加了“选中片段重新生成”“换一种语气”“扩写/缩写”几个按钮让运营只改自己不满意的地方而不是整段推翻重来。这个功能背后其实就是几条不同的提示词路由开发量不大但真正的把“人工修正”的摩擦降下来了。第三件是收藏夹与版本对比。把历史生成的优秀文案沉淀到团队自己的“灵感素材库”可以按渠道、品类、风格筛选。新活动进来时运营先翻素材库再决定是否让模型生成。这个过程看似回归“人工”但实际上是把模型和历史经验做了互补团队越用越顺手。6. 一点个人的实操体会这项目做下来我最大的感受是大模型在营销广告场景里的价值不在于某个单点能力有多惊艳而在于它能把过去靠人力堆砌才能完成的事情变成一条可复制、可迭代、可持续优化的流水线。项目刚启动时内部也有人说“广告文案本来就是运营的活儿用不着上大模型”。但跑了一年之后团队已经没有一个人愿意回到过去那种纯手工写文案、人工查素材、拍脑袋定定向的工作方式了。工具好不好用一线同学的态度是最真实的投票。给准备做类似项目的朋友三个建议第一从业务方最痛的环节切入不要一上来就搞一个大而全的平台。我们最初只做了“广告文案生成”一个小功能但因为它解决了运营每天都要面对的重复劳动问题后面的一切资源协调和推广都顺了很多。第二技术方案设定好边界大模型不是万能的。该用规则用规则该用模型用模型该上人工上人工。混合架构虽然不如“全上大模型”听起来那么高大上但它才是真正能稳定支撑业务的选择。第三效果评估规则前置。在做任何功能之前先和业务方对齐“什么叫效果好”让数据和标准先行。没有这个前提后面每一次迭代都会陷入“你觉得好我觉得不好”的争论。大模型在营销广告里的应用现在还在快速演进中。我们的实践只是这个方向上的一小块拼图伴随着模型能力的迭代和成本结构的优化这个场景还有很大的演进空间。希望这篇分享能给正在做类似探索的团队一些参考少走几步弯路。
阅读完成 · 觉得有帮助?
咨询建站