AI是同质单一系统
AI is a Homogeneous Monolithic System: Architectural Uniformity
as a Key Contributing Factor in Epistemological Weakness and Fluid Intelligence Failure
架构同质性作为当代 AI 认识论薄弱、记忆维度丢失、上下文腐烂与流体智力缺失的共同促成因素假说
分类 原创思想论文 (Original Thought Paper)
领域 AI Architecture · Cognitive Science · Epistemology · AI Safety
版本 V3
署名 이조글로벌인공지능연구소 & Opus 4.6 & GPT 5.5 & Gemini 3.1
摘 要 — ABSTRACT
本文提出一个可检验的统一假说:当前 AI 系统的多种看似独立的局限性——认识论的严重不足、记忆维度丢失、上下文腐烂(Context Rot)、流体智力缺失——可能共享一个关键的架构促成因素:同质性(Homogeneity)。现代大语言模型从第一层到最后一层使用相同类型的计算单元,通过相同的损失函数更新所有参数,且不在架构层面为不同认知功能设计专门的子系统。本文通过本体论/方法论/认识论的哲学三分法重新定义预训练、RL 后训练和当前薄弱环节的关系,给出功能异质性的操作性定义(三条件标准),分析认识论改善与推理成本之间的内在权衡,并设计五组可证伪的实验方案。本文的定位不是已被证明的统一理论,而是一个值得优先检验的研究纲领:参数共享、目标共享和功能隔离不足,可能共同影响元认知控制、记忆管理和长程推理的可靠性。
一引言:同质性问题的提出
2026 年的 AI 产业正处于一个微妙的转折点。前沿模型的参数缩放遭遇收益递减,高质量训练数据面临枯竭,推理模型的 Token 消耗呈爆炸式增长。绝大多数技术讨论将这些问题视为独立的工程挑战。本文提出一个不同的视角:这些看似独立的问题可能是同一个架构特征的不同表现——当前 AI 系统的同质性。本文将此作为统一假说提出,而非已确立的因果定律。
1.1 同质性的操作性定义
| 层次 | 定义 | 事实判定 |
|---|---|---|
| 结构同质性 | 所有计算块共享相同的算子类型(注意力 + FFN + 归一化 + 残差连接) | 成立。标准 decoder-only Transformer 的设计特征。 |
| 优化同质性 | 生成能力与元认知控制共享关键参数,且这种共享可能造成可测的负迁移 | 基本成立。尽管存在参数组差异学习率、MoE 选择性激活和多阶段训练等局部偏离,当前主流架构中没有为元认知控制分配独立的参数空间。 |
| 功能同质性 | 不同层/头/神经元没有通过架构设计实现功能特化 | 部分成立。存在通过训练涌现的功能分化,但其稳定性、可复现性和因果隔离性尚需实验验证。 |
本文的核心论点针对优化同质性与功能同质性的组合效应。结构同质性本身不是问题——它是深度学习在当前 GPU/TPU 硬件上高效运行的工程基础。
1.2 功能异质性的操作性定义
为使本文假说具有可证伪的边界,需要定义什么构成”功能异质性”。本文要求同时满足三个条件:
条件一:不同训练目标——组件各自优化不同的损失函数(如生成损失 vs 校准损失 vs 弃答损失)。
条件二:状态边界隔离——组件拥有独立的参数空间或状态空间,不与其他组件全局共享梯度更新。
条件三:因果可隔离性——该组件对系统行为的贡献可以通过消融或干预实验独立测量。
不满足这三个条件的系统级安排——如同一模型的多次采样、同基座的 Best-of-N 选择、同一模型不同温度的自我博弈——不被本文视为”功能异质性”,而是”推理时计算扩展”。这一区分对于避免假说的不可证伪化至关重要。
二预训练:本体论的构建与天花板
2.1 Next-Token Prediction 的本体论本质
预训练通过一个简洁的目标函数——给定前面的 token 预测下一个 token——在高维参数空间中构建了一个关于”世界中有什么以及它们之间有什么关系”的内部表示。这在哲学上对应于本体论(Ontology)的构建。Loss = -log(P) 这个公式从 microGPT 到 GPT-4 没有改变,两者之间约千万倍的成本差距来自参数和数据规模。
2.2 高维表示空间与涌现
Anthropic 在”Toy Models of Superposition”(2022)中在可控玩具模型中展示并理论化了超位叠加(Superposition)——模型可以在 n 维空间中以近似正交方向编码远超 n 个概念[2]。Johnson-Lindenstrauss 引理提供了高维空间表示容量指数级增长的数学可能性基础。
然而,从表示可能性到实际涌现之间存在多个未自动满足的条件:训练数据中必须存在跨域共现模式,优化动力学必须能够发现并编码这些模式,特征稀疏性必须满足干扰可容忍条件。超位叠加提供了涌现的必要条件(表示空间),但不是充分条件。
2.3 预训练的三面墙
数据墙:Epoch AI 以 80% 置信度预测高质量训练数据将在 2026–2028 年耗尽[19]。参数墙:不同能力在不同参数量上达到收益递减[20]。Ilya Sutskever 在 NeurIPS 2024 上宣告”我们所知的预训练将会终结”[21]。评估墙:人类评估者在评估模型输出时遗漏了超过一半的关键错误——模型正在超越人类的评估能力[15]。
三RL 后训练:方法论的优化与边界
3.1 预训练涌现与 RL 涌现的本质区别
如果预训练构建的是本体论,那么 RL 后训练优化的是方法论(Methodology)。CMU 2025 年 12 月的研究提供了调和框架:RL 只在两个条件同时满足时才产生真正的能力增益——(1) 该任务在预训练中覆盖不充分;(2) RL 数据被校准到模型的”能力边缘”[11]。
3.2 方法论的天花板被本体论限制
“Thinking Sparks!”论文首次在架构层面观察到 RL 后训练的涌现——复杂推理的后训练激发了功能特化的注意力头的涌现[8]。但同一研究也表明,GRPO 训练中的特化头主要是在优化现有知识和计算路径的使用效率,而非从头建立全新的路径。Foster 等人提供了理论边界:如果基础模型的 pass@k 性能很差,RL 被推入指数成本区域[14]。
四认识论的结构性薄弱
4.1 元认知的现状:有信号但无稳定控制
完整的智能还需要第三层:认识论(Epistemology)。前沿 LLM 并非完全没有元认知能力——2025 年的实验证据表明,前沿模型展现出有限的、情境依赖的、与人类质性不同的元认知信号[16]。但这些能力具有三个结构性缺陷:分辨率有限,情境依赖,以及感知-控制断裂——模型在推理链中表达了不确定性,但最终输出仍然自信。
4.2 为什么同质架构使元认知更难稳定涌现
认识论在人脑中是多个异质子系统交互的涌现产物。需要指出,人脑各区域形成分布式、重叠的网络,而非独立模块——但关键的结构性事实是:不同功能由不同的神经回路承载,各自有不同的学习规则和时间尺度。
在当前 LLM 的同质架构中,生成目标与元认知控制目标之间存在频繁的梯度方向冲突。这不构成数学上的不可能性——同一网络理论上可以联合优化多个目标。但在多任务学习文献中,梯度干扰(Gradient Interference)是一个已被充分记录的难题。本文的论点不是”不可能”,而是“结构性更难”:在共享参数空间中联合优化生成和元认知控制,面临更严重的梯度干扰和更不稳定的训练动力学。
4.3 涌现功能分化的三个待检验属性
对本文假说的最重要挑战来自一个事实:同质结构确实能通过训练产生功能分化。”Thinking Sparks!”观察到的特化注意力头就是证据[8]。本文不预先判定这种涌现功能分化是”伪”的——这需要实验来回答,而非术语来裁定。具体而言,需要检验三个属性:
跨运行稳定性:涌现的功能分化在多次独立训练中是否产生一致的功能模式?”Thinking Sparks!”指出特化头”被迭代地激活、评估和修剪”,但这不等于功能不稳定——需要用激活修补和因果消融对头进行功能对齐后再判断。
因果隔离性:特化头是否可以被独立消融,并产生与功能标签一致的行为变化?
抗梯度干扰性:在联合训练中,特化头的功能是否受到来自其他目标的梯度干扰而退化?
如果三项检验均通过——涌现功能分化稳定、可隔离、抗干扰——则它构成了同质架构中的真正功能异质性,本文假说需要相应修正。
五记忆系统的结构性缺陷
5.1 记忆功能的类比映射
借用 Cattell(1963)晶体智力 vs 流体智力框架作为类比(原始框架描述的是智力类型而非记忆类型),当前主流 LLM 记忆系统在功能上更接近服务于晶体智力的信息存储与检索,而缺少服务于流体智力的动态关联与抽象泛化功能。
5.2 多维度信息的层层剥皮
人类记住一件事时,大脑同时绑定时间、空间、关系、情绪、因果等多个维度形成完整的记忆束。LLM 记忆系统在存储和更新的每一层都在丢失这些维度。用户输入”上周三在上海办公室和老王讨论后,我觉得定价策略可能太激进了,挺焦虑的”——经 LLM 记忆提取后变成 {"memory": "用户认为定价策略太激进"}——丢失了时间、空间、关系、情绪、置信度和因果关系。
5.3 记忆是 Input 而非 Model
人类记忆通过永久性地改变神经连接实现——包括突触可塑性、持续神经活动和提取再巩固等多种机制。LLM 的外部记忆系统存储的信息作为上下文文本注入——模型参数本身没有改变。删掉所有记忆后,模型的回答和从未记住过用户时完全一样。
六上下文腐烂:多因素叠加的退化
6.1 Context Rot 的量化证据
Chroma 2025 年的研究测试了 18 个前沿模型,发现每一个模型都在每一个输入长度增量上表现出退化[6]。GPT-4 的性能仅因上下文信息组织方式不同,准确率就从 98.1% 降到 64.1%。
上下文退化的根因是多元的:Lost in the Middle 效应、注意力竞争项随上下文增长而增加(使相关 token 的权重更难维持)、位置编码外推、训练长度分布偏差和检索失败等。同质架构是这一问题的关键促成因素之一,但不是唯一原因。
6.2 Agent 的”记忆”:历史 Log 的无限叠加
当前绝大多数 AI Agent 的”记忆”是把所有历史作为 input 重新发送。生产审计数据显示(行业观察,非学术验证),重新发送的上下文占总消耗的约 62%[24],编码 Agent 将大部分 token 消耗在定位而非问题解决上[25]。累积历史不仅因为注意力竞争加剧而对 output 失去影响力,还因为引入噪声而可能降低 output 质量。
6.3 Thinking Token 的架构性消耗
Thinking Token 在技术上就是 Output Token。特定推理模型在特定基准任务上生成的 token 量约为标准模型的 18 倍,且准确率反而更低[26]。在特定模型和工作负载下,每次查询的能耗可达 33–40 Wh[27](此数据来自特定测量条件,不可泛化为所有推理模型的每次查询)。
更值得关注的结构性问题是:当前主流推理模型的跨步迭代推理主要通过自回归 token 实现——每一步思考都必须显式写为 token 才能进入下一步。人类推理期间的大规模并行神经活动变化(区别于突触权重的长期学习)不需要序列化为语言。这种”试错的序列化”是自回归架构的结构性代价。需要指出,潜在推理(Latent CoT)已构成这一限制的直接反例,但目前性能与显式 CoT 仍有差距。
七最优解与唯一解:认知有限论的核心
7.1 NTP 是最优解,不是唯一解
当前整个 LLM 产业链建立在一个隐含假设上:预测下一个 token 是通向通用智能的正确路径。但这是当前工程约束下的最优解——训练数据最丰富、目标函数最简单、并行化最高效、Scaling Law 最清晰——不是认知理论上的唯一解。
7.2 区分”最优”和”唯一”的认知操作
当一个认知系统把当前最优解锁定为唯一解时,它执行的是”过早闭合”。人类认知史上每一次重大突破都是对”唯一性”的质疑:牛顿力学是最优解 → 爱因斯坦问”是不是唯一解?” → 相对论。当前 AI 不会执行这种操作——它可以在解空间内搜索替代路径,但不会质疑解空间本身。
7.3 模糊化处理的认知危机
当认知对象的信息复杂度超过认知主体的处理带宽时,人类触发认知节能策略——将多维信息压缩为一维标签。2026 年,AI 的输出速度远超人类的认知处理速度。现有研究对人类注意力持续时间和阅读速度的测量表明这一差距在扩大(相关估算值涉及外推,不宜作为确定的认知事实引用[28])。模糊化处理的压力只会持续增大。
八突破方向:从同质到异质的多条路径
8.1 必须同时改变的两个维度
在同质架构上继续做规模扩展是一条正在收益递减的路径。本文认为突破需要在架构维度(引入功能特化的异质组件)和目标维度(从单一 NTP 转向多目标联合训练)上同时发力。
8.2 已在探索的技术方向
RPT(Reinforcement Pre-Training)——把 RL 直接融入预训练,打破本体论和方法论的阶段分离。潜在推理(Latent CoT)——COCONUT 等方法将推理保持在隐藏状态空间中[29],从架构层面解决试错的序列化问题,但目前性能有差距。ThinKV——根据思考类型的重要性分配不同精度的 KV 存储,仅用不到原始 KV Cache 的 5% 实现近无损准确率[18]。
8.3 满足功能异质性定义的方案 vs 推理时计算扩展
对本文”异质化”主张的一个重要回应是:并非所有增加系统组件的方案都构成功能异质性。根据 1.2 节的三条件定义,可将现有方案分为两类:
满足功能异质性定义的方案(类型 A):生成网络 + 独立训练的元认知网络(不同目标、独立参数);独立训练的奖励/验证模型(独立损失函数、可消融验证)。这类方案中的组件具有不同的训练目标、隔离的状态边界和可独立测量的因果贡献。
不满足功能异质性定义的方案(类型 B):同基座多 Agent 博弈(共享本体论边界和参数空间);同模型不同温度采样;Best-of-N 选择。这类方案的成功不能归因于”异质性”,更可能归因于搜索、集成或额外推理计算。
本文假说产生的可证伪预测是:在控制总参数量和总推理 FLOPs 相等的条件下,类型 A 方案在校准误差和弃答准确率上应优于类型 B。如果类型 B 与类型 A 表现无差异,则本文假说被削弱。
需要特别指出的是,同基座多 Agent 博弈还面临一个更深的结构性局限:如果主 Agent 和验证 Agent 共享同一预训练基座,它们共享相同的本体论边界。当基座模型对某种因果关系缺乏表征时,再多的同源交互也无法涌现出真正的认识论校验。有效的系统级异质性不仅要求功能分化,还可能要求本体论多样性。
8.4 工程约束:同质性的硬件经济学
同质性不是偶然的设计缺陷。矩阵乘法的高度规则性完美契合了 GPU/TPU 的 SIMD 架构。异质模块——特别是包含离散操作或不同时间尺度的组件——在当前硬件上极难高效并行。在当前硬件代际内,满足三条件定义的功能异质性(如独立训练的验证器)比芯片层面的异构计算更具可行性。
8.5 可检验预测与实验设计
实验一:参数共享比例的消融对比。在固定总参数量和总推理 FLOPs 的条件下,只改变参数共享比例:(a) 全共享——单网络同时训练生成 + 校准目标;(b) 部分共享——底层编码器共享,顶层分离为生成头和校准头;(c) 完全分离——两个独立网络各占总参数 50%;(d) 控制组——单网络仅训练生成目标 + Best-of-N 选择。度量 ECE 校准误差、AbstentionBench 弃答准确率和 ARC-AGI 子集表现。关键对照:(c) vs (d) 隔离”功能异质性”vs”推理时计算扩展”的各自贡献。
实验二:目标冲突的梯度干扰量化。在同一模型中联合训练 NTP + 校准损失,度量两个目标的梯度余弦相似度随训练进程的变化。增加三组对照:全共享、部分共享、完全分离。引入 PCGrad/CAGrad 等冲突缓解方法作为竞争解释。本文预测:梯度余弦相似度在训练后期持续为负,且冲突程度与校准性能负相关。
实验三:涌现功能分化的跨运行稳定性。对同一模型做多次独立 RL 后训练。先用激活修补和因果消融对注意力头进行功能标签分配,再比较功能标签的跨运行一致性。如果功能一致但位置不同,则涌现分化具有稳定性,本文假说需要修正。
实验四:记忆维度保持。给模型一段包含时间、地点、人物、情绪、置信度的复杂记忆,经过 N 轮对话后测试各维度的保持率。比较标准上下文注入 vs 结构化记忆模块(独立状态空间)。度量各维度 F1 分数随轮次的衰减曲线。
实验五:Context Rot 与模块化消融。在同等总参数和上下文长度下,比较标准单体 Transformer vs 分段处理 + 独立参数摘要模块。度量 Context Rot 基准上的准确率-长度曲线。
8.6 认识论-成本悖论
本文必须坦诚面对的一个内部矛盾:第六章诊断了 Thinking Token 和 Agent Log 叠加导致的推理成本爆炸,但第八章提出的所有异质化方案(外部验证器、双网络、多 Agent)无一例外都会进一步增加推理时的 Token 和 FLOPs 消耗。
这意味着:即使异质化能解决认识论缺失,它可能同时恶化上下文腐烂和成本爆炸。四类局限不一定能被同一个方案同时解决——它们之间可能存在内在权衡。如果认识论改善和成本控制之间存在根本性权衡,则”同质性是四类局限的共同促成因素”需要弱化为”同质性是认识论和流体智力缺失的促成因素,而 Token 消耗问题有独立的架构根因(自回归序列化)”。
九结论
本文提出了一个统一假说:当前 AI 系统的多种局限性——认识论的严重不足、记忆维度丢失、上下文腐烂、流体智力缺失——可能共享一个关键的架构促成因素:同质性。更精确地说,参数共享、目标共享和功能隔离不足,可能共同影响元认知控制、记忆管理和长程推理的可靠性。
通过本体论/方法论/认识论的三分法,本文重新理解了预训练(本体论构建)、RL 后训练(方法论优化)和当前薄弱环节(认识论)的关系。本文给出了功能异质性的三条件操作性定义,并据此区分了满足定义的方案与推理时计算扩展,使假说具有可证伪的边界。
本文同时坦诚面对了假说的内部张力:认识论改善与推理成本之间可能存在根本性权衡,意味着四类局限未必能被同一个架构变革同时解决。五组实验设计为后续实证研究提供了可操作的起点。