文章目录 · 4 个章节
Hi,各位好,又到了每周更新的时间。在上一篇发出之后大家对我的写的内容有认可也有质疑,当然我觉得能有讨论都是好事,基于这个背景我接下的周更将紧密结合工程和实际的ShowCase来论证意图驱动是相对较为正确的答案。有人反馈说终局的自动化过于理想,这里我再说几个自动化进程难以逾越的几个高墙:组织结构、压力负载、管理手段。这几个都和人相关,没有一个系统能负载每天花2000w预算出去的压力(至少当前情况下是),这句本质是讲清投放负责人和自动化负责人的工作职责,为老板分忧也是很关键的,所以从压力负载看之前的系统过于理想和激进。但是从组织结构看AI势必会精简公司结构,我对AI的看法不是所谓提效,而是重塑生产流程。这个论点在于如果AI写的代码能够100%实现需求,那么会写代码就不是什么生产技能,所以程序员就是非必须的,程序员的角色在互联网的生产链条就被开除了。同样的,构建经营中台只是顺手解决其他角色罢了。我对构建这样的系统表示感到无奈,但是又不得不做。
当然,写文章的时候有点情感丰富了,我们重新把问题聚焦回当前的文章,文章我大概规划了8-10章,从架构、经营、内容、执行、资产、组织、安全多方面描述,直到看到意图驱动的增长Agent真正诞生。好了,废话不多说,我们进入今天的话题:投放系统的协议化重构与多 Agent 协作

开头直接放上视频版本(依旧斥巨资0.8元生成,发昏头的minimax还有变声期,看看吧):
范式转移:为什么传统的“操作面板”失效了?
说实话,现在大部分做工具的人还没醒过味儿来。他们还在卷什么 UI 交互、卷什么数据大屏。但站在搞 AI 原生系统的视角看,这些东西全是累赘。

1. 工作流程是给“人”设计的,AI 不需要这套“裹脚布”
大家得搞清楚一个逻辑:现在的 B 端系统,不管是 CRM 还是投放后台,之所以设计成那样,是因为人在生理上有极限。人眼一眼看不了几千行数据,所以得做分页;人脑一次处理不了几十个变量,所以得做层级菜单。
但我的观点是:服务端才是唯一的真理,而现有的工作流程全是服务于人的“残障设施”。 AI 根本不需要看图表,也不需要点按钮。如果你还按照“人”的操作习惯去设计系统,那你就是在给 AI 拖后腿。我们要重塑的不是“怎么让操作更方便”,而是要把整套流程重塑成一个直接触发的逻辑网络。AI 进来直接调协议,那些为了照顾人而设计的“点击、跳转、确认”,通通该扔进历史的垃圾堆。
2. OpenClaw 只是个“助听器”,做不了“工业级大脑”
现在大家都在聊自动化,很多人会联想到 OpenClaw 这种模拟点击的方案。说实话,这东西在个人助手领域非常出色,它能帮员工处理那些重复的、没有 API 支持的琐碎杂事,是提效的利器。在前面的文章里,我提到过OpenClaw,当时我认为它能处理非标场景,目前看强度没有那么高(纯吃模型强度,不如ClaudeCodeCLI本地构建,成本也是麻的不行)
但如果把它放到工业级 Agent 编排里,它就显得力不从心了。
因为模拟 UI 操作的本质是“外挂”。你敢把每天花预算的决策链条,挂在一个模拟人工点击的脚本上吗?
我们要做的不是让 AI 像人一样去“学”怎么点后台,而是把系统的能力(改价、换素材、监控)直接打散成一个个标准的 MCP(模型上下文协议)工具包。
-
分工明确: 模拟点击去处理那些边缘的、碎片化的个人任务。
-
核心重塑: 真正的工业级编排,必须走协议握手。
把系统能力原子化,通过 MCP 进行功能分发。员工想用,调助手接入;Agent 协作,直接协议调取。这才是让 AI 真正进入系统底层、处理核心增长逻辑的正路子。

3. 在 Agent 逻辑下,B端前端影响力降低,转变为审计和报表中心
这句话可能挺得罪前端同学,但这就是现实。(听说得物已经是了)
既然我们推崇的是“意图驱动”,那“操作面板”这个词儿就不该存在了。以前投放员盯着屏幕点点点,现在负责人只要说一句:“ROI 守住 1.1,今天给我砸 500w 进去。”剩下的事儿,是后台一堆 Agent 跟逻辑网关在那儿每秒钟对齐几万次。
在这个过程里,哪儿还需要什么按钮?哪儿还需要什么表格?B端服务前端唯一的价值,就是留个“观察窗”给决策者看一眼进度,观测一下当前的经营情况。 所有的 UI 逻辑最后都会塌缩成一段 JSON 协议。当操作入口消失的时候,传统意义上的 B 端前端也只能到这了。
逻辑重构:将投放系统升级为“逻辑网关”

很多公司的投放系统其实就是个 API 转发器:前端传个 JSON,后端改改字段调媒体接口。这种架构下,Agent 进来就是灾难。我们要做的迁移,本质上是把 “控制权” 从人手里的 UI 面板,转移到一套 “协议解析器” 里。

1. 第一步:剥离业务逻辑,抽象“原子协议”(The DSL Layer)
现在系统里,改出价、关计划、换素材的代码肯定散落在各个 Service 里。迁移的第一步,就是把这些动作协议化。
别再去管什么 batchUpdateAdPrice 这种具体的函数。要定义一套领域特定语言(DSL)。 比如:{ "action": "ADJUST_BID", "target": "campaign_123", "value": "+10%", "condition": "ROI < 1.2" }。 不管是 Agent 发出的指令,还是那个快要被废弃的前端发出的指令,通通得转化成这套协议。这套协议就是系统的“通用语”,它屏蔽了字节、腾讯 那些傲慢且各异的接口定义(广点通听说本周也开通了MCP工具的能力)。
2. 第二步:构建“逻辑网关”——做个冷血的过滤器
逻辑网关(Logic Gateway)不是个简单的 Gateway,它是带状态感知的。 在我们的 Java 架构里,我会加一个校验链(Interceptor Chain)。Agent 的指令进来,必须横着过这几道关卡:
-
权限与配额层: 这个 Agent 有没有权限动这 500w 预算?
-
风控熔断层: 这是最关键的。我会在这里写死一些“硬逻辑”。比如:如果过去一小时内已经提价了 3 次,网关直接拦截第 4 次,管你 Agent 推理得再怎么天花乱坠,直接 403。
-
状态对齐层: Agent 以为计划是开启的,但实际媒体端已经关了。网关要负责这种“意图”与“现实”的最终一致性校验。
架构方案: 别在原来的单体服务里搞。单独起一个逻辑网关服务,通过 Redis 做实时的风控状态存储,用 Kafka 接收 Agent 的异步意图。

3. 迁移路径:别搞“大爆炸”,搞“影子执行”
我知道大家担心:1500w 预算,万一重构出 Bug 怎么办? 我的迁移策略是:影子协议模式(Shadow Mode)。
-
第一阶段(只读接入): 保持原有的 UI 操作不动。让 Agent 跑在后台,它生成的指令发给逻辑网关,网关只做记录和校验,但不真正下发给媒体 API。你通过日志看 Agent 的意图和你的逻辑网关拦截率。
-
第二阶段(MCP 灰度): 选几个非核心的小账号,通过 MCP 把能力放出去。这时候,人还是负责人,Agent 像是实习生,指令过网关后,需要人在 UI 上点一下“准许”。
-
第三阶段(全自动意图驱动): 当你发现网关的拦截规则已经能挡住 99% 的风险时,直接砍掉 UI 的确认按钮。这时候,前端正式“死亡”,系统进入 Agent + 逻辑网关的自循环。
-

4. 程序员的转型:从写 CRUD 到写“判定逻辑”
迁移完成后,后端团队就不再需要去对接什么新接口了。 工作变成了:不断完善逻辑网关里的规则引擎。 媒体接口变了?改协议适配器。 业务逻辑变了?改风控插件。 至于具体的投放怎么操作?那是 Agent 的事。
这也就是我说的,程序员的角色被重塑了。程序员不再是搬运 API 的苦力,而是那个构建规则、守护预算的“总设计师”。这种无奈的重塑,其实就是为了把人从那种低效的“搬砖”里彻底解脱出来。
5.权限重构:从“人看页面”到“Agent 调用功能”
别觉得重构就是重写。你现在的权限系统和自动化插件,其实就是逻辑网关的“前置胎盘”。我们要做的,是把这些散装的功能,聚合成一个具备 “主权” 的中心。现在的权限可能是控制“谁能看这个菜单”、“谁能点这个按钮”。Agent 进来之后,它根本不看菜单。你得把权限降维,从 页面级 全部压到 接口级(Action-Level)。别再分什么“投放经理”还是“投放助理”了。在网关层,你要定义的是 “功能权限包”。比如,“出价微调包”赋予 Agent 每小时 ±5% 的改价权,“素材替换包”赋予它调用素材库的权利。 现在的权限系统要加上 “环境感知”。人操作时,权限是宽松的;Agent 操作时,权限是受限的。这就是我说的“给 Agent 套笼子”。
6.架构落地:怎么把现有的 Controller 给办了?
这里我比较纠结的点是基于现有的系统直接抽MCP还是彻底的重塑底层原子能力,本周的时候我想了很久也没有得出明确结论。不过在我写的另外一个服务我直接用RPC+SSE搞了一个新的MCP服务,既承担了网关API的服务,也成了MCP的服务。这个问题下周我再回答。
多 Agent 体系下的“职能分解”
很多人搞多 Agent 喜欢在那儿卷开源模型、卷本地部署,说实话,在工业级投放这种每秒钟都在烧钱的场景下,那点算力成本根本不是大头, “决策准确率” 才是命门。我的思路很简单:全闭源,顶配拉满,然后用一套“双重校验(Double Check)”的逻辑,把这些大模型当成工具人来使。
在我的体系里,Agent 不是一个全能的“神”,而是一条流水线上的螺丝钉。别指望一个模型能把素材分析、策略推演、代码执行全干了。我们要的是职能分解,是把每个模型的长处榨干,同时用另一双眼睛盯着它。

1. 经营大脑:Claude 4.6 Opus (核心推理)
为什么选它?因为它的逻辑厚度目前是独一档的。
-
职责: 它负责吃进所有的业务背景——ROI 目标、大盘趋势、老板的战略意图。它产生的不是“点个按钮”这种指令,而是 “经营决策协议”。
-
它是这条链条上的“总指挥”,但它毕竟是个 AI,偶尔会产生那种“虽然逻辑自洽但业务自杀”的幻觉。所以,它绝对不能拥有最终执行权。
2. 关键决策验证:Codex 5.4 (Double Check 审计员)
这就是我说的全闭源双重校验。当 Claude 4.6 出了一个重大的调价或者预算分配决策时,我不直接下发,而是把这个决策连同当前的实时上下文,扔给 Codex 5.4。
- 逻辑: Codex 5.4 这种模型对逻辑边界极度敏感。它的任务只有一个:挑刺。 * 判定: 如果 Codex 觉得 Claude 的逻辑在参数范围、风险阈值上存在偏差,直接打回重推。两个模型必须在协议层面达成 Consensus(共识),指令才能流向逻辑网关。 这就是为了防止 Claude “犯傻”把 2000w 瞬间挥霍掉。
3. 素材感知:Gemini 1.5 Flash (切帧与多模态分析)
素材是投放的命脉。这里我不用笨重的本地方案,直接上 Gemini。
-
流程: 我们用 FFmpeg 自动对广告视频进行关键帧切片,然后进行图片+字幕输入的视频理解
-
职责: Gemini 1.5 Flash 的长处在于它那个恐怖的上下文窗口和低廉的价格。它负责扫描这些切帧,分析视频里的视觉元素、文案钩子、甚至是模特的表情。
-
输出: 它会把视频转化为一套 “素材特征标签”,回传给经营大脑。这也就是我说的重塑生产流程:你不需要人肉去刷视频,AI 已经帮你把视频看完了,并告诉大脑这个素材为什么起量。(各家云厂商视频VL的钱都很贵,后面我自己跑跑测算一下,比如降低分辨率节省Token之类都可以尝试)
4. 执行派发:MiniMax-m2.5-Highspeed (高速指令官)
到了最后一步往媒体接口灌数据的时候,脑子已经不重要了,快和便宜才是王道。
-
职责: 它的任务是把前面两道审计通过的“经营协议”,翻译成具体渠道的媒体 API 指令。
-
优势: MiniMax 这款模型在指令遵循和吞吐量上非常出色,而且成本极低。它就是逻辑网关前的“传声筒”,负责把高层意图快速、准确地压进各平台的 API 里。
关于闭源模型的安全问题:本质上是把 AI 当成了 “外聘的专家”。我请它来出主意,给它看独立的报表,但我不给它我保险柜的钥匙,也不带它去见我的客户,各个Agent之间权限收敛,行为可追溯,理论上无严重的安全风险(记得不要用不靠谱的中转站)

演进路径:从“辅助手”到“数字经营者”
从传统的配置面板进化到 Agent 自治,不是一蹴而就的,这中间涉及到控制权的逐步让渡,以及系统对风险承载能力的量化过程。

1. L1:规则驱动的“被动防御”
这是大家目前最熟悉的阶段。系统里跑着一堆“死规则”:ROI 低于 1.2 就关计划,消耗超过 500 就报警。
-
逻辑核心: 这时候的系统本质上是个 “带保险丝的插座”。它没有思考能力,所有的动作都是基于既定阈值的条件反射。
-
现状: 人依然是操作的主体,系统只是在最极端的情况下负责断电保命。
2. L2:Agent 介入的“影子决策”
这是重构逻辑网关后的第一步,也是建立信任的关键期。
-
逻辑核心: 经营大脑(Claude 4.6) 开始根据实时数据输出调优指令,并由 Codex 5.4 进行逻辑审计。
-
控制权: 指令到了逻辑网关后会停住,在前端弹出一个“确认”框。
-
实操意义: 这个阶段是为了通过“人工确认”来喂数据。我们在后台记录人对 Agent 指令的采纳率。只有当 Agent 的策略在 95% 的情况下与资深投放的意图对齐时,我们才敢放开下一阶段的权限。
3. L3:意图驱动的“半自治共生”
在这个阶段,繁琐的 UI 操作被正式砍掉,系统入口转向了 MCP 功能分发。
-
逻辑核心: 人不再下达“出价 5.5 元”这种微观指令,而是下达 “模糊意图”。比如:“在 ROI 守住 2.2 的前提下,今天把消耗拉升 20%”。
-
控制权: Agent 拆解意图,通过逻辑网关直接执行。但网关会设一个硬性的 “风险熔断水位”(比如:单次预算变动不得超过 30%)。
-
角色转变: 前端页面塌缩为审计看板。人变成了 “边界定义者”——不教 AI 怎么做,只规定 AI 绝对不能干什么。
4. L4:全链路“意图驱动”的自治终局
这是生产流程重构的终点,也是意图驱动增长 Agent 的真正诞生。

-
逻辑核心: 感知 Agent(Gemini) 自动通过 FFmpeg 切帧分析素材表现,经营大脑(Claude)根据反馈实时调整全局策略,验证 Agent(Codex) 确保逻辑无误, 执行 Agent(MiniMax) 完成毫秒级派发。
-
控制权: 所有的常规经营动作全部由 Agent 闭环完成。
-
人的位置: 投放负责人和程序员从繁琐的生产链条中“撤退”,进入 “经营裁判” 的位置。你只需要盯着损益表(P&L),通过调整 Agent 的底层奖励逻辑(Reward Function)来驱动增长。
本文首发于微信公众号 kelovp.ai,原始发布时间为 2026年3月14日。查看公众号原文。