异质Agent是范式性革命
From Model-Centrism to Orchestration-Centrism in Execution-Era AI
分类 原创思想论文 (Original Thought Paper)
领域 AI系统架构 · 多Agent理论 · 产业经济学 · 范式分析
版本 V4
摘要 · ABSTRACT
本文论证异质Agent不是多Agent技术的工程选项,而是AI产业从对话范式向执行范式跃迁过程中的结构性必然。核心命题:AI系统的竞争重心正在从”模型中心主义”迁移到”编排中心主义”;异质Agent是这一迁移的必要组织形态。论证沿七步推导链展开:(1) AI Output从语义产物(semantic artifact)进化为状态转移(state transition);(2) 状态转移的失败成本远高于语义产物;(3) 高失败成本要求验证冗余;(4) 大规模实证表明LLM错误具有系统性趋同特征——在一个leaderboard数据集上,350+模型的错误一致率约60%,且模型越强趋同越严重(ICML 2025)——同源验证冗余在信息论层面低效;(5) 有效验证冗余要求错误去相关;(6) 错误去相关要求异源认知结构;(7) 因此执行范式在结构上推出异质Agent。本文提出波浪原理作为中心理论:异质Agent系统存在最优异构配置,由探索增益、互补增益与协调/选择/安全成本的净值决定;异构度H为六维向量,系统优化目标为准确率-成本-延迟-风险的Pareto前沿。同时论证模型同质化趋势将使异构度重心从模型维度向角色/工具/权限维度转移,进一步强化编排层的范式地位。
I 引言
AI系统的竞争重心正在发生一次结构性迁移。在对话范式中,系统上限由单一最强模型决定——最强模型近似等于最强系统。在执行范式中,最终Output由规划、执行、验证、工具调用、权限边界、成本路由和错误回滚共同决定——系统最优性的单位从”模型”迁移为”编排结构”。本文将这一迁移命名为从模型中心主义到编排中心主义的范式革命,并论证异质Agent是这一革命的必要组织形态。
本文由一位人类研究者与Claude Opus 4.6、GPT 5.5、Gemini 3.1三个异构底座模型在对抗性协作中完成。同一研究团队以同一方法论产出了40余篇原创思想论文,每篇经历V1-V4四版迭代,累计产生160+个可追溯的文档版本。三种协作模式在实践中涌现:发散式(内容+65.7%)、收敛式(内容-24.5%)、序贯审稿式(术语精确化)。本文的生产过程是异质协作范式的自反性展示——它展示了异质Agent协作如何在真实知识生产中产生由同一团队在同一天内实现的多形态功能多样性。其是否不可由高质量同构系统复现,需另设对照实验验证;但即便同构系统可部分复现这些形态,其错误相关性与审稿视角独立性仍无法达到异构系统的结构水平。
II 概念阶梯:从多模型到范式革命
| 层级 | 定义 | 示例 |
|---|---|---|
| 多模型 | 多个底座模型并存于同一基础设施 | OpenRouter 400+模型目录 |
| 多模型融合 | 多模型输出被比较、综合、选择 | OpenRouter Fusion, MoA |
| 多Agent | 多个具有角色/状态/工具的执行单元 | ChatDev, MetaGPT |
| 异质Agent | 底座、角色、工具、权限、记忆至少一项异质 | X-MAS, SYMPHONY |
| 异质执行系统 | 异质Agent参与真实任务执行和状态转移 | 临床工作流、代码部署管线 |
| 范式革命 | 系统最优性单位从单模型迁移到编排结构 | 本文所论证 |
本文所称”唯一”是结构级唯一:在执行型AI的系统级最优问题中,只有异质Agent能同时容纳错误去相关、成本分层、领域覆盖、权限分工和验证冗余这五个约束。此处”唯一”不排斥形式化验证、测试、沙箱、人类审批等非Agent安全机制——这些机制应被纳入异质执行系统的工具层和验证层。本文的唯一性指的是:在LLM-agent组织形态内部,错误去相关无法由同源模型重复采样实现,必须引入异质认知源与异质验证路径。本文的最强产品级证据(OpenRouter Fusion)对应概念阶梯第二层(多模型融合),最高层级(异质执行系统)尚无完整产品级证据——这一层级错位由学术基准实验和结构推导共同补偿。
III 旧范式的危机:同构Agent的结构性天花板
3.1 错误相关性——同构系统的命门
同构多Agent的根本限制不是能力不足,而是错误相关性无法被角色提示消除。一项覆盖350+个LLM的ICML 2025研究直接量化了这一问题:在一个leaderboard数据集上,当两个模型都犯错时,它们选择相同错误答案的概率约为60%——远高于随机水平的33%[1]。同一开发者或相同底座架构的模型错误相关性更高;且模型越准确,错误趋同越严重[1]。
3.2 失败率数据
MAST研究(NeurIPS 2025 Spotlight)分析1,642条执行追踪,揭示41%-86.7%的失败率。协调崩溃与Agent间错位是主要失败来源,多Agent系统的性能收益相比单Agent经常有限,需要更复杂的编排与验证方案[2]。
3.3 单Agent基线的挑战与其边界
单Agent在等token预算下可匹配同构多Agent性能[3]。但临床规模测试给出分界线:任务批量超过10个时,单Agent准确率从73.1%骤降至16.6%,多Agent保持65.3%[4]。多项研究综合表明的45%准确率阈值[5]显示:基础模型准确率超过此值时,多Agent的多样性优势开始被协调成本抵消。执行范式下的任务天然是批量的、跨领域的、容错性低的,恰恰落在多Agent的优势区间。
IV 范式跃迁:从语义产物到状态转移
4.1 四代AI与断裂点
对话范式的Output是语义产物(semantic artifact)——文本、摘要、翻译、代码片段。执行范式的Output是状态转移(state transition)——系统直接或间接触发外部可追踪的状态改变:数据库写入、API调用、权限变更、代码部署、交易触发、医疗流程执行[6]。本文区分的不是”文本是否重要”——法律意见、医疗建议也可产生深远后果——而是AI输出是否进入可操作链条并产生可追踪的状态转移。2026年,40%的企业应用将内嵌任务专用AI Agent[7],多Agent系统四个月内增长327%[8]。
4.2 执行范式的六约束推出异质性必要
| 执行范式约束 | 单模型 | 同构多Agent | 异质Agent |
|---|---|---|---|
| 跨领域覆盖 | 能力边界固定 | 共享底座,盲区相关 | 不同模型覆盖不同能力面 |
| 错误去相关 | 自验同源偏差 | 错误相关性≈60%[1] | 异源错误互相暴露 |
| 成本分层 | 全部走强模型 | 成本收益有限 | 强弱模型分层路由 |
| 权限分工 | 单体权限过大 | 可分权但同源审计 | 异源审计+分权限 |
| 验证冗余 | 自审同源 | 多审但错误趋同 | 异源验证有结构价值 |
| 工具适配 | 工具策略统一 | 角色分化受限于底座 | 模型-工具-角色可专门化 |
V 核心理论:波浪原理
波浪原理是本文的中心理论。其核心主张:异质性提供自由度,编排层控制振幅,评测层定位最优配置,安全层限制振幅上界。
5.1 波浪原理的半形式化模型
其中 H 为异构度向量(非单一标量),各项可由以下代理指标度量:G项可通过任务准确率/覆盖率的提升幅度代理,C项可通过Token消耗增长率、延迟增长率和安全事件率代理。系统优化目标不是寻找单点H*,而是在准确率、成本、延迟、安全风险之间寻找任务条件下的Pareto最优异构配置。
异构度向量 H 的六维组成
hmodel — 底座模型差异(训练数据、架构、参数量)· 当前主要异构来源,但正在衰减
hrole — 功能角色差异(规划、执行、验证、审计、回滚)
htool — 工具链和API能力差异
hpermission — 操作权限和安全边界差异(在执行任务中可能比hmodel更关键)
hmemory — 上下文窗口、长期记忆机制和知识库差异
heval — 评估标准和质量判断策略差异
当 H → 0(同构极限):错误高度相关(≈60%趋同[1]),探索增益为零。当 H 处于中等区间:错误相关性下降,视角互补增强,judge/router可有效选择,P 达到Pareto前沿。当 H 过大(极端异构):沟通成本、目标不一致、格式不兼容急剧上升,P 下降——序贯推理在过度协调中产生39-70%的性能退化[9];从3-5个Agent起步的团队始终优于一开始部署10+个Agent的团队[9];超过4-Agent门槛后增益饱和或波动[10]。(注:当前右半曲线数据度量的是Agent数量增加而非异构度增加的效应——Agent数量是H的代理指标而非直接度量,”固定Agent数量、变化异构度”的直接验证实验尚待开展。)
5.2 推论一:木桶原理的条件性推翻
混合式聚合中弱Agent拖累系统,木桶原理成立。选择式聚合中弱Agent作为候选由judge筛选,可贡献差异性而非拖累。42任务×7类别实验:异质+评委选择胜率0.810,同构仅0.512[11]。弱模型不是短板,而是可控扰动源。
5.3 推论二:评测显影命题
近75%生产多Agent团队无基准测试[12]。评测基础设施不是异质Agent的外部辅助,而是范式的显影装置——没有评测,异质性表现为混乱;有了评测,异质性才表现为可优化的系统自由度。
5.4 模型异质性的自然衰减与H的维度重心转移
前沿实验室越来越依赖彼此生成的合成数据训练,RLHF目标全球趋同。实证显示,22个来自不同模型家族的LLM在创造性思维测试中产生的多样性远低于102名人类参与者,效应量达1.4-2.2[13]。这种趋同嵌入在训练后数据组成中,推理时调参无法弥合差距[14]。合成数据的递归训练进一步加速模型崩溃,导致输出分布向”平庸中心趋势”漂移[15]。
这意味着H向量的hmodel维度正在自然衰减。维持Pareto最优配置的重任将不对称地转移到hrole、htool、hpermission等非模型维度。这一趋势不是波浪原理的反驳——它是波浪原理的延伸预测:当hmodel衰减时,系统必须在其他维度补偿异构度以维持最优配置,编排层的重要性因此进一步上升。
5.5 Ground Truth延迟与代理奖励
在高延迟反馈场景中(企业战略推演、复杂金融部署),环境反馈可能需要数周才能到达,编排层无法实时计算Cselect并动态调整H。解决路径为分阶段验证架构:即时层(格式校验、工具回调)→短周期层(A/B测试、代理奖励信号)→长周期层(业务指标回流、Ground Truth校准)。波浪原理的动态调整不依赖单一即时信号,而是多时间尺度反馈的叠加。
VI 实验证据综述
6.1 产品级验证:OpenRouter Fusion
2026年3月31日发布。融合输出优于每个模型自身输出[16],成本约为前沿单模型的一半[17]。Fusion是编排中心主义的早期产品形态——概念阶梯第二层,不是终局证据。
6.2 证据→命题映射
| 核心命题 | A级(学术) | B级(官方) | C级(行业) | |
|---|---|---|---|---|
| 错误相关性命题 | Correlated Errors (ICML 2025) | — | — | |
| 同构天花板 | MAST (NeurIPS), OneFlow | — | TDS分析 | |
| 异质性能潜力 | X-MAS, Selection Bottleneck, Chimera, Dr. MAS | — | — | |
| 波浪右半曲线 | Phase Transition | — | Google Research退化数据, Arion Review | |
| 评测显影 | MAESTRO, MASEval | Databricks报告 | Kili报告 | |
| 系统主权迁移 | — | OpenRouter Fusion, A2A/MCP捐赠公告, Gartner | — | |
| 模型同质化 | Wenger & Kenett (2025), Model Collapse (Nature 2024) | — | Homogenization Problem | |
| 自反性展示 | — | — | — | D级:40篇×160+版本 |
VII 系统主权迁移:异质Agent如何重构产业权力
模型层仍提供能力,编排层开始定义能力如何成为结果。
7.1 五步迁移机制
7.2 各层价值重定位
| 系统层 | 旧地位 | 新地位 |
|---|---|---|
| 模型层 | 定义系统上限 | 提供强能力组件 |
| 路由层 | 辅助调用 | 抽象模型差异,降低切换成本 |
| 编排层 | 工程胶水 | 定义最终Output,控制异构振幅 |
| 协议层 | 接口标准 | 降低平台锁定,但也是标准制定权争夺场 |
| 评测层 | 后验测试 | 显影异质性,决定组合搜索方向 |
| 安全层 | 外部防护 | 限制可执行边界,定义H的振幅上界 |
模型巨头不会消失,它们从”系统主权者”变成”异质系统中的强组件”。A2A/MCP捐赠给Linux Foundation表面降低了平台锁定,但实质上也是编排层标准制定权的争夺——谁定义Agent间通信协议,谁就在新范式中拥有基础设施级影响力。波浪原理最终不仅受制于技术物理极限,还受制于协议标准化进程中的商业博弈。
VIII 风险、局限与反方回应
8.1 安全——异质性必然性的另一个来源
异质系统天然适合承载的安全架构原则:(1) 执行Agent不直接拥有最终写入权;(2) 验证Agent与执行Agent必须异源;(3) 高风险操作需通过异质quorum;(4) 工具权限按Agent类型分级;(5) 关键写操作需回滚Agent与审计Agent独立签名[19]。安全成本是P(H)中Csecurity项的现实体现,它参与决定Pareto最优配置而非否定异质架构本身。
8.2 工程熵增
不同底座模型对System Prompt的遵循能力、JSON输出稳定性天差地别。解决路径在于协议标准化(MCP/A2A格式契约)和路由层格式验证中间件。
8.3 置信度信号的可靠性边界
幻觉往往伴随极高置信度——缺乏外部Ground Truth的置信度是不可靠的路由依据。完整的置信度感知系统需叠加外部验证层(工具回调、数据库校验、人类抽检),而非仅依赖模型自身的不确定性估计。
8.4 Pareto最优配置的可计算性
在H的六维空间中寻找Pareto最优配置是NP-Hard级别的搜索问题。工程实践的近似路径为启发式搜索 + 评测反馈循环 + 成本约束下的贪心优化。波浪原理的价值不在于精确计算最优配置,而在于将异质组合从”不可管理的复杂性”转化为”可逼近的优化问题”。
8.5 “单Agent越来越强”
单模型越强,越值得被纳入异质系统,而不是越能替代异质系统。执行系统对错误去相关和权限分离的需求不会因单模型变强而消失。
8.6 “协调成本太高”
协调成本不是对异质Agent的否定,而是波浪原理成立的原因——它证明异质Agent需要编排层,编排层因此成为核心基础设施。
8.7 “没有完整实验,不能称革命”
范式论文的任务是提出新的问题结构、解释框架和检验路线。本文不是实验终局,而是研究纲领开端。
IX 结论
异质Agent的革命性不在于Agent数量增加,而在于它改变了系统可靠性的来源:从单模型能力,转向多源错误去相关;从模型强度,转向编排结构;从语义产物,转向可验证状态转移。
波浪原理统摄全局:异质性提供自由度,编排层控制振幅,评测层定位Pareto最优配置,安全层限制振幅上界。模型同质化趋势不会消解异质Agent的必要性——当hmodel自然衰减时,系统将在角色、工具、权限等维度补偿异构度,编排层的范式地位因此进一步巩固。这不是预测——这是从执行范式的约束条件、LLM错误相关性的实证数据和模型同质化的物理趋势共同推出的结构性结论。
REFERENCES
[1] Kim, E. et al. (2025). Correlated Errors in Large Language Models. ICML 2025. arXiv:2506.07962.
[2] Cemri, M. et al. (2025). Why Do Multi-Agent LLM Systems Fail? NeurIPS 2025. arXiv:2503.13657.
[3] Xu, R. et al. (2026). OneFlow: Rethinking the Value of Multi-Agent Workflow. arXiv:2601.12307.
[4] Orchestrated multi agents sustain accuracy under clinical-scale workloads. medRxiv 2025.08.22.
[5] Kim, Y. et al. (2025). Towards a Science of Scaling Agent Systems. arXiv:2512.08296.
[6] AGIX Technologies (2026). Chatbot Evolution: Scripted Bots to Autonomous Agents.
[7] Gartner (2026). Enterprise Application AI Agent Forecast.
[8] Databricks (2026). 2026 State of AI Agents Report.
[9] Arion Research (2025). State of Agentic AI Year-End Review; Google Research sequential reasoning degradation, cited in Openlayer MAS Architecture Guide (2026.03). [C-level evidence]
[10] Phase Transition for Budgeted Multi-Agent Synergy. arXiv:2601.17311.
[11] Maryanskyy, A. (2026). When Agents Disagree: The Selection Bottleneck. arXiv:2603.20324.
[12] Pan et al. (2025). Measuring MAS evaluation practices. Cited in MAESTRO.
[13] Wenger, E. & Kenett, Y. (2025). Divergent thinking in 22 LLMs vs 102 humans.
[14] Karouzos et al. (2026); Feng et al. (2025). Post-training homogenization. Cited in arXiv:2601.06116.
[15] Shumailov, I. et al. (2024). AI models collapse when trained on recursively generated data. Nature.
[16] OpenRouter (2026). Fusion: Multi-Model Response Synthesis. openrouter.ai/labs/fusion.
[17] MindStudio (2026). What Is OpenRouter Fusion? Near-Fable 5 at Half the Cost.
[18] Google (2025). A2A → Linux Foundation; Anthropic (2024). MCP → Agentic AI Foundation.
[19] A Formal Security Framework for MCP-Based AI Agents. arXiv:2604.05969.
[20] Ye, R. et al. (2025). X-MAS. arXiv:2505.16997.
[21] Chimera. arXiv:2603.22206.
[22] Guided Collaboration in Heterogeneous LLM-Based MAS. arXiv:2602.13639.
[23] MAESTRO. arXiv:2601.00481.
[24] OI-MAS: Confidence-Aware Routing. arXiv:2601.04861.
[25] MARTI-MARS². arXiv:2602.07848.
[26] The Homogenization Problem in LLMs. arXiv:2601.06116.