全闭源精锐选型:用"异构智能"替换"全能幻觉"
文章目录 · 6 个章节
Claude Opus 4.6 + Codex 5.4 + MiMo-V2-Omni + MiniMax m2.7 的分层决策架构实录

Hi,各位朋友,又到了每周见面的时间,在过去的一周里,我尝试构建数据基础的MCP服务,以及视频理解的底座服务:video-pipline-highlight,在这个服务里我借着openrouter免费模型healer-alpha测试了视频理解的强度:在没有字幕的情况下模型能准确识别刀剑神域的第一集内容,不过受限于机器的能力我没有做到高光点识别、分段剪辑的能力,当前做到了这一步:
🎬 视频理解: Gemini-Flash/Healer-Alpha 分析视觉内容
🎤 语音识别: Faster Whisper 多语言自动语音识别
🧠 多模态融合: DeepSeek 合并视觉和音频时间线
📝 故事摘要: AI 驱动的故事提取
🔊 解说生成: 引人入胜的短视频脚本
🎙️ 文本转语音: Minimax TTS 语音生成
📺 自动字幕: SRT 字幕生成
✂️ 视频渲染: 最终合成与音频叠加
🎭 多集混剪: 统一 LLM 理解多集内容,智能混剪到单视频
我相信随着迭代应该能逐步跟山我设想的。好了,开始今天的观点输出,先叠个甲:这篇文章不是模型横评,也不是”AI 改变投放”的概念文,在工业级投放场景里,用一个全能模型走天下,不是聪明,是懒。废话不多说,开始今天的内容。
开始之前依旧放上视频版本:
一、全能模型是一个代价昂贵的懒惰选择
这个判断可能会让一些人不舒服,但我在自动化这件事上踩过足够多的坑,有资格说。

在 Demo 和 POC 阶段,一个 GPT-5 当然够用——你需要的是跑通,不是跑稳。但一旦进入日耗有规模的投放场景,全能模型的代价会在三个维度同时爆:
贵 你在用旗舰模型做的大量工作,本质上是在让一个博士生抄 Excel 表格。Opus 级别的模型处理一次 JSON 参数校验,和处理一个复杂 IAP 策略博弈,Token 消耗量级差不多,但输出价值差了一个数量级。这笔账很好算。
慢 全能模型的推理链条长。当你的系统需要在 200ms 内完成”看素材 → 出策略 → 校验参数 → 下发指令”的完整闭环,单模型串行调用的延迟根本不可接受。
逻辑平庸。 这是最致命的。全能模型在跨领域任务里会做”妥协”——它在内容理解和数学校验之间找平衡,结果两件事都做得不够好。内容分析没有视频垂类模型敏锐,数学审计没有代码模型严谨,策略博弈也缺乏真正的”激进 vs 防御”的立场感。
正确答案不是找一个更好的全能模型。正确答案是重新定义分工。
我要构建的是一套异构智能体系:每个模型只在它的天命领域运行,任务路由由意图总线统一调度,模型之间通过标准化协议握手,而不是靠 Prompt 里的一段”请注意”来约束行为——那种方式本质上还是在赌运气。
这套体系里,我选了四个模型:Opus 4.6(经营决策层)、Codex 5.4(数学警察层)、MiMo-V2-Omni(内容感知层)、MiniMax m2.7 High-speed(高频执行层)。

二、决策层:Opus 4.6 与 Codex 5.4 的”二元对冲”

Opus 4.6:抽雪茄的操盘手
Opus 4.6 在这套体系里只做一件事:在复杂的变现博弈中给出有立场的判断。它不跑脚本,不做参数填充,它是经营意志的载体。
在短剧投流场景,“变现博弈”指的是 IAP(内购付费)和 IAA(广告变现)之间的动态平衡。这个判断不是线性的——它受 eCPM 季节性波动影响(Q4 大促期 eCPM 通常上涨 30%~80%,此时 IAA 侧权重应该上调),受用户 LTV 分层影响(高 LTV 段用户不该被广告频次骚扰),受素材衰减曲线影响(同一批素材跑到第 7 天往往进入疲劳期,继续加价是在烧钱)。
Opus 4.6 的输出是一个结构化 JSON 决策包:
{
"trace_id":"op-20250318-0042",
"decision_type":"aggressive",
"bid_multiplier":1.38,
"iap_weight":0.45,
"iaa_weight":0.55,
"rationale":{
"ecpm_trend":"上行(+22% vs 7d avg)",
"ltv_segment":"mid_tier_bulk",
"material_decay_score":0.31
},
"risk_flag":false,
"ltv_ceiling_check":"pending_codex"
}注意最后一个字段:ltv_ceiling_check: "pending_codex"。这是整个对冲机制的关键——Opus 明确知道自己的决策需要被 Codex 复核,它不假装自己的数学一定对。这个字段是我故意设计进去的,目的是在协议层就把”策略归策略、校验归校验”的边界固化下来。
Codex 5.4:戴眼镜的精算师
Codex 5.4 的职责是数学警察,只做一件事:复核 Opus 吐出的参数包,判断逻辑是否闭环,数字是否越界。

它不管策略是否激进——那是 Opus 的判断域。它只关心:在这套参数组合下,系统会不会穿透 LTV 红线?出价倍率在当前流量成本下是否可持续?IAP/IAA 的权重之和是否等于 1.0?
一个真实的驳回场景:
Opus 提交的决策包:
{
"bid_multiplier": 1.38,
"iap_weight": 0.45,
"iaa_weight": 0.60,
"ltv_ceiling_check": "pending_codex"
}Codex 的审计响应:
{
"audit_result":"REJECTED",
"rejection_code":"WEIGHT_SUM_OVERFLOW",
"detail":"iap_weight(0.45) + iaa_weight(0.60) = 1.05,超出归一化约束",
"ltv_check":{
"current_ltv_est":42.3,
"ceiling":40.0,
"breach":true,
"breach_margin":"+5.75%"
},
"action":"CIRCUIT_BREAKER_TRIGGERED",
"fallback_to":"last_stable_config_id: cfg-20250317-0089"
}几个细节值得说清楚:
Codex 的驳回是生冷不忌的。它不尝试修正,不给出”建议参数”,只执行一键熔断,回滚到上一个稳定配置。修正是 Opus 下一轮重推的任务,不是 Codex 的工作范围。
LTV 红线是硬约束,不是参考值。这条线一旦设定,Codex 不接受策略层的任何 override。这是整套体系防止”过度乐观决策”的核心保险丝。
两个模型之间没有自然语言交流。它们通过 JSON 协议握手,Trace ID 全程贯通,任何字段异常都触发审计失败。这才是真正的防幻觉机制,不是在 Prompt 里写”请确保逻辑正确”。
三、感知层:MiMo-V2-Omni 的像素级内容审计
为什么选小米的 MiMo-V2-Omni
我知道这里会有人问:小米出的模型?认真的?

认真的。MiMo-V2-Omni 是小米今年推出的多模态模型,支持图像、音频的联合理解。它不是通用多模态的平替,但在视频叙事理解这个垂类上,它有一个对我们场景特别关键的特质:对”视觉+语音”双轨输入的整合理解,明显好于单纯描述画面的通用模型。
通用多模态模型(GPT-5V、Claude Vision)在短剧素材审计上有一个结构性缺陷:它们倾向于描述画面,不判断叙事意图。你拿到的是”第 12 秒出现了一个女性角色,表情看起来有些悲伤”,但你需要的是”第 12 秒色温从暖调切冷调,叙事节奏还没走到情感爆发点,这个剪辑会让用户提前预判结局,付费动机在这里流失”。两件事差很多。
成本维度同样不能忽略。MiMo-V2-Omni 目前通过小米官方 API 接入,处于免费期。据公布的定价方向,正式收费后预计约为 Gemini Flash 的 20%。我们的管线里感知层调用频次最高——每个素材入库都要跑——成本敏感度也最高。这个价格位置使它在当前阶段有很强的工程可行性。当然免费是当前时点的状态,这件事值得持续关注。
真正的成本杀手:多宫格输入,不是直接丢视频

很多人在用多模态模型做视频理解的时候犯同一个错误:直接把视频文件丢进去。这不只是贵,还慢,效果也不一定比”聪明地送帧”更好。直接送视频意味着模型处理大量重复的低信息密度帧——两个静止镜头之间的过渡帧对叙事判断毫无贡献,但它们实实在在地消耗 token。
我们的管线用的是三路混合输入:多宫格关键帧图像 + 本地 Whisper ASR 文字 + 结构化时间戳索引。
第一路:FFmpeg 提帧 → 多宫格拼图
先用 FFmpeg 按场景变化提取关键帧,再把 9 帧拼成一张多宫格图像送给模型。
# Step 1: 按场景切变提取关键帧
ffmpeg -i input.mp4 \
-vf "select='gt(scene,0.4)',showinfo" \
-vsync vfr -q:v 2 frames/frame_%04d.jpg
# Step 2: 付费引导位密集采样(45~65 秒区间,2fps)
ffmpeg -i input.mp4 -ss 00:00:45 -to 00:01:05 \
-vf fps=2 frames/cta_%04d.jpg拿到关键帧之后,用 Python 把 9 帧拼成 3×3 的宫格图:
from PIL import Image
def make_grid(frame_paths, cols=3, cell_size=(320, 180)):
rows = (len(frame_paths) + cols - 1) // cols
grid = Image.new("RGB", (cols * cell_size[0], rows * cell_size[1]))
for idx, path in enumerate(frame_paths[:9]):
img = Image.open(path).resize(cell_size)
x, y = (idx % cols) * cell_size[0], (idx // cols) * cell_size[1]
grid.paste(img, (x, y))
return grid为什么拼宫格而不是逐帧送?两个原因。第一,9 帧合并成一张图,视觉 token 消耗大约是逐帧送的 30%,差距很显著。第二,宫格的空间排列本身就是时序信息——模型能从左上到右下感知叙事的时间流向,不需要额外说明帧顺序。这个技巧不复杂,但效果是实测过的。
第二路:本地 Whisper 跑 ASR,文字单独进 prompt
视觉帧捕捉的是画面,但短剧的叙事意图很大程度上藏在台词和旁白里。我们本地部署 Whisper(medium 模型,GPU 推理),对每个素材跑完整转录,拿到带时间戳的字幕文本。
这段文字不叠加在图上,单独放在 prompt 的文本部分:
[视觉输入]: <九宫格图像>
[语音转录(Whisper,00:00~01:30)]:
00:03 女声:你以为你是谁?
00:07 男声:我知道你在等我。
00:12 [背景音乐切换,弦乐入]
00:45 旁白:这一刻,她选择了沉默。
01:10 字幕:【付费解锁后续剧情】
[任务]: 基于以上视觉序列和语音内容,输出素材叙事完整性评分和内容损耗分析。为什么分离而不叠加?图像叠字幕会让模型在理解画面构图的同时处理文字,注意力通道被抢,容易出现理解漂移。分轨输入让模型分别锚定视觉逻辑和语义逻辑,最后做整合判断,效果更稳定。
MiMo-V2-Omni 的结构化输出:
{
"material_id":"vid-20250318-0312",
"total_decay_score":0.31,
"frame_analysis":[
{
"grid_position":"row1_col3",
"timestamp_approx":"00:00:12",
"frame_type":"emotion_peak",
"issue":"color_temperature_break",
"severity":"medium",
"narrative_impact":"情感代入路径中断,色温突变早于剧情爆发点约 8 秒"
},
{
"grid_position":"row2_col3",
"timestamp_approx":"00:00:52",
"frame_type":"cta_position",
"issue":"none",
"cta_visibility_score":0.87,
"asr_alignment":"旁白与画面叙事同步,付费引导位有效"
}
],
"overall_verdict":"可投,建议修复第 12 秒色温问题后优先级上调"
}注意 grid_position 字段——这是宫格输入带来的副产品,模型可以直接用网格坐标定位问题帧,不依赖精确时间戳。total_decay_score 会实时喂给 Opus 作为调价上下文:decay_score 超过 0.5 的素材,Opus 会压低出价倍率。烂素材配高出价是最典型的资金浪费,这个逻辑没什么争议。
四、执行层:MiniMax m2.7 High-speed 的高频心跳
为什么执行层要单独选型

很多系统在执行层犯同一个错误:Opus 或 GPT-5 级别的模型一路用到底,包括最后那步”把参数写进投放平台的 API 里”。
这是在用火箭发动机驱动自行车。
执行层的任务特征和决策层完全不同:不需要推理,不需要创意,只需要结构化指令跟随——快、准、稳,扛住高并发。 当 Agent 体系下达了 100 个 SKU 的调价指令时,执行层需要在 2 秒内把所有指令翻译成巨量引擎、腾讯广点通、磁力引擎三套差异化参数并完成下发。这时候你需要的不是智慧,是吞吐量。
MiniMax m2.7 High-speed 在这个场景里的成本大约是 Opus 的 1/40,Instruction Following 的稳定性经过测试是够用的。
逻辑路由:平台差异化参数翻译
不同投放平台的出价逻辑存在显著差异——巨量用 oCPM,腾讯有自己的竞价系数体系,Google UAC 的 tROAS 设定方式又不一样。m2.7 的任务是把上游统一决策包翻译成各平台可直接消费的格式:
// 上游统一指令(Opus 出、Codex 审计通过)
{
"trace_id":"op-20250318-0044",
"action":"bid_adjust",
"bid_multiplier":1.25,
"target_segment":"mid_ltv"
}
// m2.7 翻译后 → 巨量引擎
{
"platform":"oceanengine",
"ad_group_id":"xxx",
"bid_type":"OCPM",
"ecpm_bid":48.5,
"audience_package":"mid_ltv_v3"
}
// m2.7 翻译后 → 腾讯广点通
{
"platform":"gdt",
"adgroup_id":"xxx",
"bid_strategy":"TARGET_CPA",
"target_cpa":32.0,
"audience_extend":false
}关键是:m2.7 不做策略判断,只做格式映射。 平台规则的更新维护在一份独立的路由配置表里,m2.7 忠实执行这份配置表的翻译动作。策略是 Opus 的事,校验是 Codex 的事,m2.7 只管最后这一公里。
五、意图总线:让四个模型协同而不失控

硬件是模型,软件是协议
四个模型各自跑在自己的领域,如果没有统一的协调机制,它们只是四个孤立的 API 调用。真正让这套体系变成”系统”的,是意图总线(Intent Bus)——一套轻量级的内部协议,定义数据如何在四个模型之间流动,以及任何环节出错时系统如何响应。
数据流:一次完整决策的路径
[素材上传]
↓
[FFmpeg 提帧 → 多宫格拼图 + 本地 Whisper ASR]
↓
[MiMo-V2-Omni] → 内容损耗分值(decay_score, frame_issues)
↓
[Opus 4.6] → 策略决策包(bid_multiplier, iap/iaa weight, rationale)
↓
[Codex 5.4] → 审计结果(APPROVED / REJECTED + circuit_breaker)
↓(仅 APPROVED 通过)
[MiniMax m2.7] → 平台差异化参数下发
↓
[执行日志回写] → 供下一轮 Opus 决策的上下文每一步都携带同一个 trace_id,从 FFmpeg 预处理到最终平台下发,全链路可追溯。任何节点的输出如果不符合下游的 schema 约束,立即触发 PIPELINE_HALT,系统进入安全回滚模式,回到上一个 last_stable_checkpoint。
状态机:五个核心状态
IDLE → SENSING(MiMo-V2-Omni 分析中)
SENSING → DECIDING(Opus 决策中)
DECIDING → AUDITING(Codex 审计中)
AUDITING → EXECUTING(m2.7 下发中)
EXECUTING → IDLE(本轮完成,日志回写)
任意节点 ERROR → SAFE_ROLLBACK → IDLESAFE_ROLLBACK 是这套状态机里最重要的一条边。它意味着系统永远有一个可信的”上一个状态”可以回到——不管是 MiMo 没看懂素材、Opus 给出了格式异常的 JSON,还是 Codex 触发了熔断。不存在”系统卡在中间状态”的情况。 投放系统作为花钱的出口,这条保险很重要,我在过去的系统里没有设计好这块吃过亏。
错误分级:不是所有错误都值得全量回滚
这里有一个工程细节很多人会忽略——错误分级。
Level 1(软警告): MiMo-V2-Omni 对某个宫格帧的分析置信度低于阈值(画质太差或强运动模糊导致理解困难)。处理方式:跳过该帧,继续流程,标记该素材需要人工复审。
Level 2(硬中断): Codex 审计失败,参数违反约束。处理方式:本轮决策作废,回滚到上一个稳定配置,等待 Opus 重推新决策包。
Level 3(系统级故障): 任意模型 API 连续失败超过 3 次,或执行层平台 API 返回鉴权错误。处理方式:触发告警,停止所有自动化操作,等待人工介入。
Level 3 的设计原则我认为在投放系统里是一条铁律:自动化系统应该在不确定的时候主动停下来,而不是继续跑然后希望问题自己消失。 相信我,希望问题自己消失这件事,往往会让你在第二天早上收到一个非常难看的消耗数字。
六、这套体系真正在保护什么
最后说一个很少被人讨论的问题:多模型异构体系的本质,不是提升上限,而是管控下限。

单模型全能方案的上限可能很高,但下限是不可控的——一次幻觉、一次参数估算错误、一次对素材的误判,都会在没有任何校验的情况下直接作用于投放系统。在日耗有规模的投流场景,一次无约束的错误决策可以在几小时内造成非常严重的损失。这不是理论风险,这是我们踩过的坑。
异构体系的价值在于:
-
MiMo-V2-Omni 把关内容质量,防止烂素材配高出价的浪费
-
Codex 把关数学逻辑,防止 Opus 的策略乐观主义穿透财务红线
-
状态机把关流程完整性,防止系统在中间状态失控
-
m2.7 把关执行精度,防止参数在翻译到平台时出现格式错误
这是一套分层防御,不是一套追求”更聪明”的体系。
代价也要说清楚:架构复杂度上升,调试难度增加,模型之间的 schema 兼容性需要持续维护。这不是适合所有人的方案。它适合那些已经把投流跑到一定规模、开始被”单模型全能方案的不稳定性”咬过的团队。
如果你还在 Demo 阶段,一个 GPT-5 够用了。
如果你的日耗已经到了让你开始关心”决策错误的代价”的量级,这套体系值得认真考虑。
本文首发于微信公众号 kelovp.ai,原始发布时间为 2026年3月21日。查看公众号原文。