文章目录 · 7 个章节

走出”一键生成”的幻觉,定义”理解-策略-生产”的解构架构。
引言:走出”一键生成”的幻觉
市面上大部分AIGC投放工具在卖同一个故事:输入产品信息,一键生成素材,直接投放。

听起来很美。但凡做过投放的人都清楚,素材生产链路的核心瓶颈从来不是”生成”。生成是最简单的一步——现在随便一个多模态模型都能给你吐出一条15秒的视频脚本,配上TTS和图生视频,产量根本不是问题。
问题是:你生成的东西,投放系统根本不认。
不认的意思不是格式不对,是这条素材承载的信息——它的钩子结构、情绪节奏、卖点排布——跟你要打的人群和场景之间,没有任何可计算的关联。你只是在用AI的速度,批量生产”看起来像素材的东西”。
这就是”一键生成”的幻觉:它解决了生产速度,但跳过了理解和策略。
我们过去半年在做的事情,是把这个链路拆开,重新定义三层架构:
-
理解层(多模态解构):让系统真正”看懂”一条素材的基因结构
-
策略层(意图驱动生成):从投放意图出发,反推素材应该长什么样
-
生产层(创意蒸馏):从组合爆炸中蒸馏出真正值得探索的创意方向
三层不能塌缩成一步。塌缩了就是”一键生成”,就是幻觉。
还有一个贯穿全局的设计原则:投放前置。
传统逻辑是”做素材→投放→看结果”。我们的逻辑反过来:投放目标在前,先定义素材需要满足什么条件,再生产。这个原则在之前《意图驱动的增长中台》里展开讲过,这篇不再赘述背景,直接拆工程实现。
一、多模态解构:构建”向量+关系型标签”的混合基因库
为什么需要”基因”这个概念

素材的可复用单元不是一整条视频。
一条跑量素材之所以跑量,可能是因为前3秒的钩子结构,可能是因为中段的情绪反转,可能是因为结尾的行动号召方式。你复制整条素材没用,你需要知道是哪个”基因片段”在起作用。
传统做法是人工打标:运营看完素材,标上”悬念开头""价格刺激""真人出镜”这些标签。这个方式有两个死穴:
第一,成本。 (说句扎心的,不是人力成本高,而是时间成本导致的机会成本高)
第二,失真。 人打标是主观归因,同一条素材不同人标出来的东西不一样。更要命的是,人倾向于用自己熟悉的维度去归类,导致标签体系越来越封闭,新的有效特征根本进不来。
所以我们需要模型来做这件事。但只用模型也不够,这里需要一个双引擎设计。
双引擎:向量引擎 + 关系型标签引擎
向量引擎做的事情是语义相似性。把素材的各个模态(画面、文案、音频、节奏)编码成向量,扔进向量数据库。你拿一条跑量素材去检索,能找到”跟它像”的素材。这个能力在素材探索阶段很有用——你不知道该往哪个方向做的时候,先看看跟已有爆款相似的都有什么。
关系型标签引擎做的事情是结构化归因。把素材拆成可枚举的特征维度:开头类型(悬念/冲突/利益点)、情绪弧线(上扬/下沉/反转)、卖点位置(前置/中插/后置)、视觉风格(真人/动画/混剪)等等。这些标签可以做条件过滤,可以做交叉分析,可以跟跑量数据做相关性建模。
为什么两者要并存?
单用向量的死角:你能找到相似素材,但你不知道”为什么相似”,无法归因,也无法指导生产。“跟爆款像”不是一条可执行的生产brief。
单用标签的死角:维度是人定的,你定不出来的维度就永远捕捉不到。而且标签是离散的,跨模态的微妙关联(比如画面节奏和文案情绪的配合)标签表达不了。
混合架构才是答案:标签做归因和过滤,向量做探索和补盲。两个引擎共享同一个素材ID体系,查询时可以联合使用。
打标维度为什么要从投放侧定义
这一点极其重要,直接决定后面归因层能不能用。
如果你从内容侧定义维度——“画面好不好看""剪辑顺不顺畅""配乐是否合适”——这些东西跟跑量之间没有稳定的统计关系。内容好不好是主观的,但跑不跑量是客观的。
我们的维度定义逻辑是反过来的:先看投放侧关心什么,再定义素材需要被拆成什么。
投放侧关心的核心变量:3秒完播率(钩子质量)、点击率(兴趣激发)、转化率(行动驱动)、跑量周期(衰减速度)。那么素材的打标维度就应该围绕这些变量去设计:什么样的开头结构影响3秒完播、什么样的卖点排布影响点击、什么样的CTA方式影响转化。
这就是”投放前置”原则在感知层的落地:打标维度不服务于内容审美,服务于投放归因。
实现细节和成本控制
模型选择:感知层的核心任务是多模态理解,我们主力用的是 Gemini 3.0 Flash。选Flash不选Pro的原因很简单:感知层是批量任务,日均要过几万条素材,这层的成本敏感度最高。Flash在视频抽帧理解、文案语义提取、结构化输出这几个子任务上精度够用,不需要上更重的模型。
粒度选择:视频素材我们按”段”做拆解,不是按帧。一条素材通常拆成3-5个语义段(开头钩子、问题铺垫、卖点展示、社会证明、CTA),每个段独立打标。按帧做粒度太细,成本不可控,而且帧级别的特征对投放归因没有直接意义。
规则 vs 模型的分工:有些特征用规则就够了——比如视频时长、是否有字幕、是否有人脸、BGM类型——这些不需要过模型。模型处理的是需要语义理解的部分:钩子类型判断、情绪弧线识别、卖点提取和排布分析。
二、策略大脑:基于RAG的”意图-指令”映射机制

归因层:跑量数据 × 素材特征的相关性建模
有了素材基因库之后,下一步是跟跑量数据做交叉。
逻辑很直白:把每条素材的结构化标签和向量特征,跟它在各个渠道的投放表现(CTR、CVR、跑量金额、衰减曲线)做关联分析。目标是找到”什么样的素材基因组合,在什么人群/场景下,跑量概率更高”。
但这里有几个必须诚实面对的难点:
数据噪声。 跑量数据本身不干净。同一条素材在不同计划、不同出价、不同时段跑出来的结果差异巨大。投放侧的变量太多——出价策略、定向设置、竞争环境、平台流量分配机制——这些都不是素材本身能控制的。
相关性≠因果。 这是最容易踩的坑。你发现”带真人出镜的素材平均CTR高15%“,但这可能不是因为真人出镜本身有效,而是因为你们团队做真人素材的那个编导水平比较高。归因层输出的所有结论,我们内部都标注置信度等级,高置信的才会进入策略生成环节,低置信的只作为探索方向。
现阶段置信度评估方式: 【AB验证机制、样本量门槛、统计显著性标准】
意图驱动的策略生成
归因层告诉你”什么样的素材基因跑量概率高”,但它不直接生成素材。中间还差一步:意图还原。
这是整个引擎设计里我最想讲的部分,也是跟市面上大多数方案差异最大的地方。
大多数方案的逻辑是:历史数据→统计规律→直接生成。“过去跑量的素材长这样,那就再生成一批类似的。”
这个逻辑的问题是:它在复制过去,不在理解用户。
我们的逻辑多了一层:先还原用户在这个场景下的意图是什么,再定义素材需要完成什么任务。
举个例子。同样是推一款阅读类App:
-
针对”打发时间”意图的用户,素材的任务是制造即时满足感,钩子要快、爽点要密
-
针对”找好内容”意图的用户,素材的任务是建立内容品质信任,需要展示内容深度和独特性
-
针对”社交货币”意图的用户,素材的任务是制造分享欲,需要有话题性和争议性
同一个产品,不同意图,素材的结构、节奏、卖点排布完全不同。如果你只看历史跑量数据做统计,你会把这些意图混在一起,得出一个”平均最优”的结论——而平均最优在投放里往往意味着平庸。
RAG在这里的角色
策略生成不是凭空让模型编。我们用RAG做了一套检索增强的策略生成机制:
知识库构成:
-
历史跑量素材的归因结论(来自归因层)
-
历史投放策略和对应效果的结构化记录
-
品类级别的意图模板库(不同品类用户的典型意图图谱)
生成流程:
-
输入当前投放目标(人群、场景、预算、预期指标)
-
检索匹配的历史归因结论和意图模板
-
模型基于检索结果生成结构化的素材brief
输出不是素材本身,是生产指令。 一条brief大概包含:目标意图描述、推荐的钩子类型、卖点排布顺序、情绪弧线建议、参考素材ID、预估的CTR区间。

异构模型路由
不是所有的策略生成任务都需要最强的模型。
-
简单的素材衍生(换钩子、调卖点顺序)走轻量模型,成本低、速度快
-
全新方向的策略探索走大模型,需要更强的推理和创造能力
-
涉及跨品类迁移的策略走大模型+更丰富的RAG上下文
我们做了一层路由逻辑,根据任务复杂度自动分发。
现阶段人工还卡在哪
说实话,策略层目前还不能全自动。
人工介入最重的环节是意图模板的维护。不同品类用户的意图图谱,现在主要靠有经验的投手和运营整理,模型辅助结构化。这个环节要做到全自动,需要的不是更强的模型,而是更多的验证数据——意图假设→素材生产→投放验证→意图修正,这个闭环跑的次数还不够多。
另一个人工卡点是brief的质量审核。模型生成的brief有时候逻辑自洽但实操不可行——比如它建议”用真实用户UGC风格的开头”,但你的素材团队根本没有UGC素材的生产能力。这种”生产可行性”的约束,目前还是人工在把关。
三、基因对齐:跨模态语义的一致性校验
素材与文案割裂的真实成本
这个问题不展开讲大家可能没感知,但一旦展开你就会发现,投放中有相当比例的浪费来自这里。
先说一个认知前提:不同品类,画面和文案的权重是不一样的。
-
画面主导型(真人短剧):用户决策在前3秒的视觉冲击——演员颜值、场景质感、冲突画面。文案是辅助,用户本来也不怎么看字。这类品类画面文案轻度割裂的损耗不大。
-
配音主导型(小说推文):用户的注意力锚点在声音——配音的情绪、节奏、语气决定了用户会不会继续听下去。画面反而是氛围载体。这类品类如果配音传递的情绪跟画面风格不一致,用户会感到”哪里不对”,但说不出来,直接划走。
-
口播主导型(网赚类App):信任建立主要靠真人口播的说服力,画面是背书。口播内容和视觉信息必须咬合,你嘴上说”提现秒到账”,画面却展示的是跟提现无关的功能界面,用户接收到的信息是矛盾的。
-

说个真实的例子。我们有一条小说素材,消耗非常高,拉出来一看——画面稀碎,就是几张静态图片来回切,制作水平约等于PPT。但配音极其能打,情绪拿捏到位,节奏卡得死死的。这条素材跑量完全靠声音在扛。
反过来想,如果当时有对齐校验,系统会判定这条素材”画面质量不达标”然后打回吗?不会,因为对齐校验不是质量审核,是一致性校验。这条素材的画面虽然粗糙,但跟配音在服务同一个意图(制造悬念感),所以意图层是对齐的。
这个例子恰好说明:对齐校验的优先级必须按品类加权,不能一刀切。 小说推文类素材,配音的权重要远高于画面质量;真人短剧类素材,画面一致性才是核心。
对齐机制的工程设计
我们目前的对齐校验分两层:
语义层对齐: 把素材画面的语义描述(来自感知层的解构结果)和文案的语义表达做相似度计算。不是简单的关键词匹配,是语义级别的——画面在传递什么信息,文案在传递什么信息,两者的信息向量之间的距离是否在阈值内。
意图层对齐: 更高一层,检查画面和文案是否在服务同一个用户意图。画面在激发好奇心,文案也应该在激发好奇心,而不是画面在激发好奇心、文案在做理性说服。这一层依赖策略层输出的意图定义。
校验失败的素材走什么路径:
-
轻度不对齐(语义层偏差但意图层一致):自动建议文案微调方向,人工确认后修改
-
重度不对齐(意图层矛盾):直接打回重新生成,不进入投放池
可行性评估: 这层的工程复杂度中等,主要成本在语义计算上。因为对齐校验是在素材进入投放池之前做的(不是实时的),可以批处理,成本可控。
四、创意蒸馏:从”制造垃圾”到”有效探索”
组合爆炸的实际规模

先说一个真实的现状。
我们日产素材3-5万条。听起来很夸张对吧?拆开看就知道了——其中一大半是”伪变体”:加角标、镜像翻转、加毛玻璃横转竖、换BGM、改字幕颜色……一条素材”裂变”出几十条”新素材”,产量数字就上去了。
这不是素材多样性,这是在制造垃圾。
投放平台的去重机制越来越聪明,这些操作本质上基因没变,平台识别的还是同一条素材。你以为在做AB测试,实际上在用不同的包装纸反复测同一个东西,消耗的是真金白银的测试预算。日产3-5万条素材,真实基因可能也就几千条,剩下的都是噪声。
这就是行业里追产量的真实面貌:大家都知道这些伪变体没用,但不做的话数据报表上素材量就掉下来,没人敢停。
一个campaign真正的组合空间是这样的:假设你有N个钩子类型 × M个卖点排布 × K个视觉风格 × L个CTA方式,排列组合下来是N×M×K×L个候选方向。
全测不现实,但这里要纠正一个常见的思维陷阱:蒸馏的目标不是”压缩测试集”,而是”提升跑出率”。
蒸馏的核心:不是测更少,是出更好的创意
很多人一听”蒸馏”、“帕累托筛选”,第一反应是”哦,就是砍掉不好的,少测一点”。
不是。
砍掉伪变体只是第一步,是清理噪声,把那些加角标镜像横转竖的垃圾先去掉,这一步甚至不需要什么算法,规则就能做。真正有价值的蒸馏是:在去掉噪声之后的真实基因空间里,帮你找到更好的创意方向——那些你的团队凭经验想不到、但数据显示大概率有效的组合。
这是一个从”做无用功”到”做有效探索”的转变:
-
过去:日产3-5万条,一大半是伪变体,真实基因方向可能就那么几个,翻来覆去在已知方向上做微调。感觉很忙,但创意空间实际上在萎缩。
-
现在:先把伪变体干掉,不做无用的努力。然后基于归因层的数据,在真实基因空间里做有方向的探索——哪些基因组合从来没测过但预估得分高?哪些跨品类的成功模式可以迁移过来?
帕累托前沿的概念用在这里:在所有候选组合中,找到那些”在任何一个维度上的提升都必须以另一个维度的下降为代价”的解。但我们不是用帕累托来砍方向,而是用它来发现方向——那些处在前沿上但从来没被测试过的点,才是真正的金矿。
具体实现:
-
基于归因层的历史数据,对每个候选组合的各维度表现做预估
-
用多目标优化算法(我特么没想好怎么弄这块,@Claude来点作用啊)筛出帕累托前沿
-
重点关注前沿上的”未探索区域”:预估得分高但历史测试数据少的组合
-
根据当前投放优先级(跑量 vs ROI vs 生命周期)做加权,输出最终的测试方向
这层对效率的直接影响: 不是”测更少的素材”,而是”把每一次测试都花在有信息量的方向上”。不做伪变体的无用功,不在已经验证过的方向上反复确认,把资源集中在真正能拓展创意边界的地方。跑出率上去了,单条有效素材的获取成本自然下来。
五、成本与可行性:值不值得做

推理成本的真实账
整个引擎跑一轮(从素材解构到策略生成到对齐校验到蒸馏筛选),单条素材的全链路成本:2-10块
跟人工做同样事情的成本对比:1.5-3.5块
结论是: 我不明白(浙江奉化口音),目前在我们的体系里就是AI产量>人工,但是费用也是>人工,折算后并不划算,所以这里的工程化方案确实还有待考究。
模型选择的性价比判断
不是每一层都需要最贵的模型。我们当前的选型逻辑:
-
感知层(多模态解构):这层吃的是视觉理解和结构化输出能力。主力模型是 Gemini 3.0 Flash,选它的原因很直接——多模态理解能力够用,推理速度快,成本是同级别模型里最低档的。感知层是批量跑的,日均处理量大,这层如果用重模型,成本直接爆炸。Flash级别在素材结构化拆解这个任务上,精度已经够了。
-
策略层(意图映射+brief生成):这层需要更强的推理和创造性,我们用 Opus4.5 做策略推理。MiMo在逻辑链路比较长的任务上表现稳定,生成brief的结构化程度也够。跨品类迁移等复杂场景会路由到更大的模型。
-
对齐校验层:这层主要是语义相似度计算,不需要生成能力,用embedding模型就够,成本极低。
-
蒸馏层:这层是数值优化问题,不走LLM,传统的多目标优化算法解决。
工程复杂度分级
| 模块 | 复杂度 | 当前状态 | 判断 |
|---|---|---|---|
| 感知层-标签引擎 | 中 | 已跑通 | 值得做,ROI明确 |
| 感知层-向量引擎 | 中高 | 在跑,结论置信度待提升 | 值得做,但维护成本需注意 |
| 归因层 | 高 | 在跑,结论置信度待提升 | 值得做,是核心差异化 |
| 策略层-RAG+意图映射 | 高 | 半自动,人工兜底 | 值得做,但别急着去人工 |
| 对齐校验 | 中 | 基础版已上 | 按品类优先级推进 |
| 创意蒸馏 | 中高 | 原型阶段 | 值得做,测试预算节省明显 |
整体判断: 这套引擎不是一个”要不要做”的问题,是”按什么优先级做”的问题。感知层和归因层是地基,必须先稳;策略层是核心差异化,值得持续投入;对齐和蒸馏是锦上添花,可以按需推进。
结语:从”素材工厂”到”自进化意图网络”
说说现在跑到哪了。

感知层的双引擎已经在跑,日常素材入库都会自动过一遍解构。归因层有初步结论,但置信度还在提升过程中,目前是”可参考但不能盲信”的状态。策略层的RAG检索已经搭好,意图模板还在积累阶段,brief生成目前是模型出初稿、人工审核修改。对齐校验在部分品类上线了基础版。蒸馏还在原型验证。
诚实地说,现在的系统更像是一个”半自动的策略辅助工具”,而不是一个全自动的素材引擎。
但方向是清楚的。
终局不是更快地生成素材,而是系统对用户意图的理解越来越准。当感知层积累了足够多的素材基因数据,归因层跑出了足够可信的结论,策略层的意图模板被验证了足够多次——整个系统就会形成一个自进化的闭环:投放结果反向修正意图理解,意图理解正向优化素材生产,素材生产的投放结果再次反向修正。
这个闭环一旦转起来,就不再是”素材工厂”了,而是一个”意图网络”——它理解你的用户要什么,理解你的投放要什么,然后持续逼近那个最优解。
这不是工具升级,是投放决策链的重构。 我们不再只是在生产素材,我们在构建一套理解用户意图的基础设施。素材只是这套基础设施的输出物之一。
谁先把这个闭环跑通,谁就拿到了下一代投放竞争的入场券。

本文是”意图驱动的增长中台”系列的技术实践篇。上一篇从经营视角聊了素材模块整体想法,这篇拆的是素材引擎这一个模块的工程实现。后续会继续写其他模块的技术拆解,对这个方向感兴趣的可以后台留言交流。
本文首发于微信公众号 kelovp.ai,原始发布时间为 2026年3月28日。查看公众号原文。