ORIGINAL THOUGHT PAPER · JUNE 2026 · V4

AI成本指数级增长的
结构性危机

The Exponential Cost Crisis of AI:
A Dual-End Structural Analysis — An Industry Wake-Up Call

双端挤压模型下的范式困境分析 · 致AI从业者的成本预警

发行日 2026年6月1日

分类 原创思想论文 (Original Thought Paper) · Industry Alert

领域 AI Economics · Token Pricing · Inference Architecture · Scaling Laws

版本 V4

署名 이조글로벌인공지능연구소 & Opus 4.6 & GPT 5.5 & Gemini 3.1 (인지집단)

ABSTRACT — 致每一位管理 AI 预算的决策者

2026 年 4 月,Uber 在四个月内烧完了全年 AI 预算。5 月,Microsoft 开始撤回内部数千人的 Claude Code 授权。同月,Uber COO 公开表示”token 消耗与有用的消费者功能之间没有直接关联”。JPMorgan 发表了题为”AI Token Costs are Eating Internet Profits Alive”的研报。Token 单价在三年内下降了约 280–600 倍——但企业 AI 总支出仍在以每年 200–320% 的速度增长。本文揭示了这一悖论的结构性根源,提出”双端挤压模型”:A端(单次交互成本)因 Thinking Token 的暴力搜索本质和物理墙而持续膨胀,B端(修复循环次数)因概率采样的本质限制而不可消除。两端相乘而非相加,驱动了成本的超线性爆炸。深层分析表明,LLM 预训练数据存在系统性的”结果偏差”——只记录成功不记录试错过程——制造了一笔偿还不完的”认知债务”,迫使每次推理都用算力实时补建缺失的过程知识。本文追踪了 2026 年 1–5 月危机加速的完整时间线,并论证:在当前 Transformer + 自回归 + 概率采样架构下,AI 部署成本的结构性上升不是暂时的阵痛,而是范式级的系统约束。每一位 AI 从业者都需要理解这个机制——不是明天,是现在。

Keywords AI Inference Cost Crisis · Token Economics · Jevons Paradox · Cognitive Debt · Dual-End Cost Model · Test-time Compute · Industry Alert

CHAPTER 01你的预算正在爆炸:这是为什么

1.1 五个月内发生了什么

2026 年 1 月,AWS 在一个星期六悄悄将 GPU Capacity Block 价格上调 15%,没有任何公告。2 月,”推理经济学”被正式定义为一个独立学科。3 月,Gartner 警告”不要将商品化 token 的通缩与前沿推理的民主化混为一谈”,Sam Altman 公开表示”智能将像电和水一样按表计费”。4 月,Uber CTO 承认公司在四个月内烧完了全年 AI 预算——”我得重新做预算了,因为我以为需要的预算已经被彻底炸掉了。”5 月,Microsoft 开始撤回数千名工程师的 Claude Code 授权,Uber COO 公开质疑 token 消耗与有用功能之间的关联,JPMorgan 发表了题为”AI Token Costs are Eating Internet Profits Alive”的研报。

这一切发生在 Token 单价持续暴跌的背景下。GPT-4 级别性能的推理成本从 2023 年的 $30/百万 tokens 降至 2026 年的不到 $3——降幅超过 10 倍。DeepSeek V4 的缓存价格更低至 $0.0036/百万 tokens。如果只看单价,AI 正在进入”免费”时代。

但账单在爆炸。

1.2 成本悖论

企业平均 AI 支出从 2024 年的 $250 万升至 2025 年的 $700 万——近三倍。推理现在占企业 AI 预算的 85%,而 2023 年仅占约三分之一。40% 的企业年 AI 支出已超过 $1000 万——仅用了三年就达到了云计算花了十三年才到的水平。Gartner 预测全球 AI 支出 2026 年将超过 $2.5 万亿。

1.3 本文的目的

本文不是学术文献综述。它是一份致 AI 从业者的成本预警——解释为什么单位价格暴跌没有让你的账单变少,为什么这不是 FinOps 工具能解决的问题,以及为什么在当前架构下这个问题是结构性的。如果你在管理 AI 预算、设计 Agent 系统、或决定是否扩大 AI 部署,本文揭示的机制将直接影响你的决策。

· · ·

CHAPTER 022026年1–5月:危机加速编年与危险指数

以下是 2026 年前五个月 AI 成本危机的逐月追踪。危险指数基于五个维度评定(供应商信号、企业冲击、权威确认、结构恶化、扩散速度),每项 0–2 分,满分 10。

2.1 一月:暗流涌动 [危险指数 3.0/10]

AWS 悄然提价 15%。CloudZero 数据显示企业 AI/ML 支出占总云支出比例在一年内从 1.55% 翻倍至 2.67%。OpenAI 推理成本在 2025 年达到 $84 亿,毛利率仅 33%,预计 2026 年亏损将达 $140 亿。TSMC 确认 2026 年先进制程提价 3–10%,2nm 晶圆预计超过 $30,000/片。信号已在,但尚未引发行业焦虑。

2.2 二月:预警升级 [危险指数 4.5/10]

Reworked 发表专题”Inside the AI Cost Crisis”,将推理成本定义为企业预算的最大驱动力。CTO 实操手册涌现,警告 DRAM 价格可能在 2026 年翻倍。”推理经济学”(Inference Economics)被 CloudZero 正式定义为一个独立学科——”不是指标,而是一种实践”。问题从个别企业焦虑升级为行业结构性议题。

2.3 三月:数据确认 [危险指数 6.0/10]

权威数据集中爆发。Gartner 发布”Navigating the Commoditization Trap”报告,明确警告:Agentic 模型每任务需要的 token 是标准 GenAI 的 5–30 倍,token 消耗增速将超过成本降速,总体推理成本预期上升。Sam Altman 在采访中宣布”智能是公用事业,按表计费”。Anthropic 将定价从固定费转向按量计费。Du (2026) 的 “Tiered Super-Moore” 论文证明前沿推理层模型降价近乎停滞(R²=0.031)。推理溢价平均达非推理价格的 31.5 倍。”降价悖论”首次被量化证实。

2.4 四月:标志性崩溃 [危险指数 8.0/10]

Uber CTO Praveen Neppalli Naga 向 The Information 透露:公司在四个月内烧完了全年 2026 年 AI 编码预算。Claude Code 使用率从 32% 飙升至 84%(覆盖约 5000 名工程师),每人月 API 成本 $500–$2,000。约 70% 的提交代码由 AI 生成,十分之一的后端更新由 Agent 在无人干预下发布。”我得重新做预算了,因为我以为需要的预算已经被彻底炸掉了。”同月,Microsoft FY25 Q3 财报(4月30日披露)确认本季度处理超 100 万亿 tokens,同比增长 5 倍。Gartner 发现仅 28% 的 AI 基础设施项目完全达成业务目标。

2.5 五月:系统性撤退 [危险指数 9.5/10]

多米诺骨牌连锁倒塌。5 月 14 日,Microsoft Experiences + Devices 部门(Windows/365/Outlook/Teams)开始撤销大部分 Claude Code 授权,截止日期 6 月 30 日——距首次开放仅 6 个月。Uber COO Andrew Macdonald 公开质疑:”token 使用量与有用的消费者功能之间似乎没有直接关联。”Gartner 5 月新闻稿预测 25% 的 2026 年计划 AI 预算将推迟到 2027 年。Goldman Sachs 预测 Agentic AI 将驱动 token 消耗到 2030 年增长 24 倍。JPMorgan 发表”AI Token Costs are Eating Internet Profits Alive”。Fortune 一周内连发两篇报道。GitHub Copilot 从固定月费转向按量计费。Meta 内部出现名为”Claudeonomics”的排行榜追踪 token 消耗。

2026年1–5月 危险指数递进
月份 供应商信号 企业冲击 权威确认 结构恶化 扩散速度 总分 阶段性质
1月 1.0 0.5 0.5 1.0 0 3.0 暗流涌动
2月 0.5 1.0 1.0 1.0 1.0 4.5 预警升级
3月 1.5 1.0 1.5 1.0 1.0 6.0 数据确认
4月 1.0 2.0 1.5 1.5 2.0 8.0 标志性崩溃
5月 1.5 2.0 2.0 2.0 2.0 9.5 系统性撤退

五个月内危险指数从 3.0 升至 9.5——涨幅 3.2 倍,且加速度在增大。这不是一项经历尴尬青春期的技术的曲线。这是一个正在重新定价自己的市场的曲线。

注:10/10 的定义为”多家头部企业集体撤回 Agentic 工具、主流模型服务有效价格上调、或大规模 AI 项目取消进入财报级披露”。截至 5 月底,危机距此阈值仅一步之遥。

· · ·

CHAPTER 03技术演进时序:从 CoT 到 Agent 的 Token 消耗膨胀史

2.1 基础奠基期(2022)

Chain-of-Thought(Wei et al., 2022)建立了让 LLM 逐步推理的范式,典型消耗约数百 tokens。同年 10 月,Yao 等人发表 ReAct,首次将推理轨迹(Thought)与任务动作(Action)和环境观察(Observation)交替生成,建立了 Thought→Action→Observation 循环。在 HotpotQA 上,单任务平均消耗约 9,795 tokens——相比 CoT 膨胀了约 20 倍。

2.2 记忆与反思期(2023)

Reflexion(Shinn et al., 2023, NeurIPS)在 ReAct 基础上引入跨试次记忆:Agent 在每次失败后生成自我反思,蒸馏为简洁经验存入记忆。结构变为”原始问题 + 历史轨迹 + 反思记忆 × N 次重试”,Token 消耗随重试次数线性叠加。同年,LATS(Zhou et al., 2023)引入蒙特卡罗树搜索,Token 消耗从线性膨胀升级为近指数级。作为对冲,ReWOO(Xu et al., 2023)通过一次性规划 + 并行执行将 Token 消耗降低了 80%,但牺牲了灵活性。

2.3 工程落地期(2024)

LangChain/LangGraph 生态成熟,RP-ReAct 将规划与执行解耦,但暴露了真实的上下文溢出问题——工具交互返回大量数据迅速填满上下文窗口,开源模型的更小窗口使问题加剧。记忆架构分化为短期上下文窗口和长期向量数据库两层。

2.4 轨迹复用与 Deep Research 期(2025–2026)

AgentHER(Ding, 2026)将失败轨迹重标注为可用训练数据。Re-TRAC(Zhu et al., 2026)通过递归轨迹压缩比 ReAct 提升了 15–20%。AgentDiet(Xiao et al., 2026)发现轨迹中充斥着无用、冗余和过期信息,移除后可减少 39.9%–59.7% 的输入 token。但 Deep Research 模式下,单次查询成本已达 $0.41–$1.32。

TOKEN 消耗膨胀一览
架构 年份 典型 Tokens/任务 相对 CoT 倍数
CoT 2022 ~500
ReAct 2022 ~10,000 20×
Reflexion 2023 ~35,000 70×
LATS 2023 ~150,000 300×
Agent+RAG 2024 ~500,000 1,000×
Deep Research 2025 ~800,000 1,600×
Agentic Coding 2025–26 1–3.5M 2,000–7,000×

2.5 小结:Token 消耗的阶梯式膨胀

从 CoT 到 Deep Research,单任务 Token 消耗增长了约 1,600 倍,到 Agentic Coding 更达 7,000 倍。每一代架构不是简单的线性叠加,而是引入了一个新的乘法因子:ReAct 引入了 ×N_steps 的循环累积,Reflexion 叠加了 ×N_retries 的重试,LATS 引入了 ×N_branches 的树搜索分支,Deep Research 引入了 ×N_searches × N_pages 的检索阅读。这些乘法因子的组合导致了 Token 消耗的阶梯式膨胀——每一个新的架构能力都以一个新的成本维度为代价。值得注意的是,ReWOO (2023) 曾实现 80% 的 Token 缩减,但代价是牺牲灵活性和容错能力,表明效率与能力之间存在根本性的权衡。

· · ·

CHAPTER 04成本经济学:价格下降 vs 消耗增长的赛跑

3.1 Token 单价的下降曲线

BenchLM (2026) 追踪的数据显示,自 2023 年 3 月以来,前沿 LLM 的平均输出价格下降了约 94.5%(价格指数从 100 降至 5.5)。Introl (2025) 估算推理成本以每年约 10 倍的速度下降,比 PC 计算的微处理器革命或互联网带宽更快。

3.2 Token 消耗量的增长曲线

OpenRouter (2025) 数据显示平均 prompt token 长度自 2024 年初增长近 4 倍。Microsoft FY25 Q3 财报(2025年4月披露,季度截至3月)确认当季处理超 100 万亿 tokens,同比增长 5 倍。2025 年 9 月,Claude 4 Sonnet 在 OpenRouter 上的日均 token 使用量达 1000 亿。

3.3 Jevons Paradox:AI 领域的完美复现

Luccioni, Strubell & Crawford (2025, ACM FAccT) 专门研究了杰文斯悖论如何适用于 AI。核心发现:效率提升反而悖论性地刺激了更高的总消耗。反弹效应破坏了”纯技术效率优化就能确保净减排”的假设。

“单位 token 推理成本在三年内下降了约 1,000 倍——但同期推理总支出增长了 320%。更便宜的 token 只是催生了更多用例和更高的查询量。”
— SoftwareSeni, The AI Inference Market in 2025

3.4 “分层悖论”:便宜的变更便宜,贵的没有变便宜

Du (2026, 武汉大学) 提出 “Tiered Super-Moore” 假说:经济层模型价格半衰期为 1.10 年,中间层为 1.55 年——都显著快于摩尔定律。但旗舰/推理层模型几乎没有呈现指数下降趋势(R²= 0.031),因为推理溢价平均达非推理价格的 31.5 倍。同时,前沿性能的进步速度比成本调整后的进步速度快 12%–14%——意味着达到更高性能的总成本反而在上升。

· · ·

CHAPTER 05物理墙:成本下降的减速与反转

4.1 半导体制程成本的上升

TSMC 于 2026 年对先进制程芯片提价 3%–10%,当前 3nm 晶圆价格约 $18,000–$20,000/片,2nm 晶圆预计超过 $30,000/片。这不是一次性调整——TSMC 已规划覆盖 5nm/4nm、3nm 和 sub-2nm 的多年连续提价路线图,从 2026 年延伸至至少 2029 年。

4.2 摩尔定律的实质性减速

Intel 前 CEO Pat Gelsinger (2023) 承认:”我们不再处于摩尔定律的黄金时代……现在更接近每三年翻一倍。” 2022 年,NVIDIA CEO Jensen Huang 直接宣布摩尔定律已死。半导体行业路线图已从密度驱动转向应用驱动(More than Moore)。

4.3 能源与内存的硬性瓶颈

IEA 2025 年报告预测全球数据中心用电量到 2030 年翻倍,AI 优化服务器用电将从 93 TWh 增至 432 TWh。主要市场新设施电力审批已延长至 24–36 个月。在内存端,NVIDIA B200 GPU 需要 192GB HBM3E——几乎是 H100 (80GB) 的 2.5 倍——每一代都需要显著更多的高带宽内存,供应持续紧缺。

4.4 内存带宽与供应链约束

TrendForce (2026) 指出,带宽限制——芯片内部和芯片之间——正在成为 2026 年 AI 系统的下一个主要性能瓶颈。NVIDIA B200 GPU 需要 192GB HBM3E 内存,几乎是 H100 (80GB) 的 2.5 倍。每一代 GPU 都需要显著更多的高带宽内存,但 SK Hynix 和三星的 HBM 产能无法匹配需求增速。TSMC 的 CoWoS(Chip-on-Wafer-on-Substrate)先进封装产能同样构成严重瓶颈——该技术对 AI 加速器至关重要,但产能在 2025 年就已被 NVIDIA 和 AMD 两家提前锁定。消费级 CPU 因此被挤出优先级排序,AMD 已在 2025 年底对 Ryzen 全线提价。

4.5 云服务商的隐性涨价与补贴泡沫

AWS 在 2026 年 1 月悄然将 Capacity Block 价格上调 15%,未做任何公告。H100 现货租赁价在 2026 年 5 月达到 $2.39/小时,为数月来最高。更关键的是,OpenAI、Google、Anthropic、Meta 目前都在以低于成本的价格定价推理服务争夺市场份额——创造了一个虚假的价格底线。OpenAI 2025 年推理成本达 $84 亿,毛利率仅 33%(Sacra, 2026),预计 2026 年推理成本将进一步升至 $141 亿。当资本纪律回归时,价格将向上正常化,届时用户感受到的成本冲击将更加剧烈。

4.6 小结:三条降价曲线的分化

Du (2026) 的 “Tiered Super-Moore” 假说揭示了一个关键事实:Token 降价不是均匀的。三条曲线呈现完全不同的趋势:

三层模型的降价速度分化
模型层级 价格半衰期 R² 拟合度 趋势判断
经济层(GPT-4o mini 等) 1.10 年 快速降价,趋近零成本
中间层(GPT-4o / Sonnet 等) 1.55 年 中速降价,仍有空间
前沿推理层(o3 / Opus 等) 几乎不降 0.031 推理溢价 31.5×,近乎停滞

这意味着:用户在简单任务上确实享受到了降价红利,但 Agent 真正需要的前沿推理能力——恰恰是没有变便宜的那一层。”便宜的更便宜了,贵的还是贵”——这就是剪刀差的本质。

· · ·

CHAPTER 06A端深层机制:认知债务与暴力补建

5.1 预训练数据的”结果偏差”——认知债务假说

互联网训练语料存在系统性的发表偏差:教科书只写定理和证明,不写推导中的失败尝试;论文只发表成功实验,不发表失败实验;代码库只有最终通过的代码,不保留调试过程。LLM 因此学到了”答案是什么”(结果知识),但缺少”怎么到达答案”(过程知识)。

“主要在正面结果文献上训练的 LLM,继承了一个扭曲的科学模型——在这个模型里大多数实验都成功了。缺少的不是从失败中学习的能力,而是用来学习的已发表失败数据。”
— “LLMs Have Made Failure Worth Publishing”, arXiv 2604.06236

实证支持:将失败的化学反应纳入模型训练后预测准确率提升;仅用失败样本训练即可获得数量级的成功率提升(Lee et al., 2025)。而 DeepSeek-R1 和 QwQ-32B 达到 80.1% 答案正确率,但人类专家判断仅 39.7% 的推理路径合理(Guo et al., 2025)。

5.2 Thinking Token 的本质:算力暴力补建

训练扩展已触顶(数据/参数收益递减),推理扩展(test-time compute)成为唯一能力提升路径。但 Thinking Token 的本质不是高效推理,而是在预存的答案空间中进行概率搜索/试错

关键证据:Yue et al. (2025) 提出了获得广泛支持的假说——”所有正确的推理路径早已存在于基础模型中,RLVR 仅仅是提高了采样效率”。基础模型在大 k 值下的 pass@k 甚至超过 RL 训练后的模型。论文”Do Thinking Tokens Help or Trap?”发现 thinking tokens 会触发”思考陷阱”——不产出成效的冗余验证循环。

FIGURE 1 — 人类推理 vs LLM “推理” 的本质差异
人类专家解题:
看到题 → 识别模式 → 调用经验 → 直达答案
Token 等价量:~200

LLM “推理”解题:
看到题 → 试方法A → 失败 → 回溯 → 试方法B → 部分成功
→ 验证 → 怀疑 → 重新验证 → 试方法C → 成功
→ 再验证一次 → 再怀疑 → 再验证 → 终于输出
Token 等价量:~8,000–50,000

LLM 的”思考”本质是概率空间中的暴力搜索——每 1 单位有效输出需要 5–50 单位无效试错做支撑

5.3 Thinking Token 的结构性低效

Thinking Token 的低效不是偶然的工程问题,而是结构性的。多项研究提供了精确的量化证据:

不可见性:Apiyi (2026) 对 Gemini 3.1 Pro 的分析显示,超过 95% 的输出 token 对用户不可见,被模型的推理链消耗。用户只看到最终答案,但为推理链和答案的全部 token 买单。AIOutlooks (2026) 的实测表明,一个复杂查询可生成 10,000 个 thinking tokens,在 GPT-5.5 的 $30/M 输出 token 价格下,不可见的思考成本为 $0.30,而可见答案仅花 $0.006——用户为”思考”付出的费用是”答案”的 50 倍

膨胀性:TianPan.co (2026) 的 Wharton 研究显示,CoT 提示将 token 成本膨胀 2–5 倍 并增加数秒延迟,但对大多数生产任务无可衡量的准确率提升。推理模型从显式 CoT 中仅获得 2–3% 的准确率提升,同时响应时间增加了 20–80%。更严重的是”过度思考螺旋”——LLM 经常在已到达正确答案后继续生成推理步骤。

非单调性:多项研究(Aggarwal & Welleck 2025; “Does Thinking More Always Help?” 2025)发现延长 test-time 思考的效果呈现非单调行为:最初提升准确率,但随后性能下降。在知识密集型任务上,增加 test-time 计算不仅无法一致提升准确率,在许多情况下甚至导致更多幻觉。

最优停止点缺失:OptimalThinkingBench (Aggarwal et al., 2025) 发现没有任何现有模型能达到”最优平衡”——推理模型对简单问题过度解释,非推理模型对难题思考不足。”Stop Spinning Wheels”(2025) 论文指出:普遍可推广的、可量化的”最优停止点”——用于有效避免冗余推理步骤——至今仍未被找到

“隐藏推理曾经看起来像是迈向人工思维的进步。到 2025 年,它也像是一种新型通胀——伪装成智能的计算静默膨胀。AI 经济是否稳定还是泡沫破裂,将取决于一个单一比率:模型在赚回一美元之前必须思考多少个 token。”
— Turing Post, FOD#122: Thinking Tokens Explained

5.4 三层不可控 Token 的成本黑洞

用户可控的 Input + Output 仅占总 Token 的约 5%。其余 95% 由三层不可控消耗构成:(1) Thinking/Reasoning Tokens——用户不可见但必须付费,模型自主决定消耗量,”没有固定预算,模型花费它认为问题所需要的量”(EG3, 2026);(2) Agent 循环累积——每个 LLM API 调用都是无状态的,Agent 每次调用工具时都发送完整的对话历史,到循环第 20 步时每次调用的输入可超过 50K tokens(LeanOps, 2026),一个 Reflexion 循环运行 10 轮可消耗单次线性通过的 50 倍 token;(3) 工具调用与搜索——多步自主 Agent 可能无意中进入递归循环、过度查询系统、或将任务扩展到原始范围之外,Portal26 (2026) 因此发布了专门的 “Agentic Token Controls” 模块来遏制失控消耗——最典型的灾难是 LangChain 无限循环运行 11 天产生 $47,000 的 API 费用。

5.5 不可砍掉、不可后退的结构性锁定

以上三层不可控 Token 不是可以优化掉的”浪费”——它们是技术本身,受到三重结构性锁定:

锁定①:训练扩展触顶 → 推理扩展是唯一出路。 截至 2025 年,test-time compute 被广泛认为是 LLM 性能提升最可能的关键驱动力——因为原始预训练 Scaling Laws 已遇到数据瓶颈和收益递减。从 2020 到 2024 年前沿进步由训练规模主导;到 2024–2025 年,该领域增加了第二个轴——推理规模。路径已被锁定,没有退路。

锁定②:Thinking tokens 是能力的核心载体。 NeurIPS 2025 论文通过信息论(mutual information)证明:推理轨迹中特定生成步骤的互信息出现突发性显著增长——即”MI 峰值现象”。这些 thinking tokens 对推理性能至关重要,而其他 tokens 的影响微乎其微。实证表明,一个被允许思考 10 秒的小模型可以有效超越体积大 14 倍但立即回答的模型——架构没有变,变的只是 token 预算。

锁定③:Agent 工具调用是智能的外化。 搜索、API 调用、代码执行——这些不是”附加功能”,而是 Agent 与真实世界交互的唯一通道。没有 ReAct 循环中的 Action→Observation 反馈,Agent 就只是一个封闭的语言模型,无法验证事实、获取实时信息、或执行任何真实操作。

5.6 调和悖论:为什么”90% 浪费”和”不可砍掉”并不矛盾

本文在 5.3 节论证了 Thinking Token 的大部分是无效的冗余验证和试错循环,在 5.5 节论证了 Thinking Token 不可砍掉。这两个判断看似矛盾,但它们的共存恰恰揭示了问题的本质:你不知道哪 10% 是有效的,直到 100% 都生成完。

这就像在迷宫中寻路——你不知道哪条路通向出口,直到你走遍所有路。事后看,90% 的路径是”浪费”;但事前,每条路径都有可能是正确的。这不是工程缺陷——这是概率搜索的数学本质。你不能只保留”正确的 10%”,因为识别哪部分是正确的本身就需要走完全部 100%。研究者(NoWAIT, TRS)正在尝试压缩冗余部分(27–51%),但这是在已走完路径后的事后优化,不是事前预测。结构性的 Token “浪费”是获得有效推理的不可避免的代价。

· · ·

CHAPTER 07试错信息补给系统:Skill、Search、Memory 的统一理论

6.1 多层试错信息补给模型

整个 AI 技术栈的每一个组件都在做同一件事——向只学了”结果”的模型注入”过程”信息:

AI 技术栈的统一本质
层级 组件 信息来源 成本特征
第1层 System Prompt + Skill 人类工程师的试错结晶 固定 Token(一次性)
第2层 Search + RAG 全网/企业公开试错记录 可变 Token(每次付费)
第3层 Agent Memory Agent 自身试错积累 累积增长 Token
第4层 Thinking Tokens 实时算力补建 不可控 Token(最昂贵)

从上到下,成本递增,可控性递减。系统设计目标是让上层尽量多补,从而减少最底层 Thinking 的搜索空间。

6.2 Skill 的 COP(约束优化问题)本质

对 Anthropic SKILL.md 文件的实证解剖表明,每一条规则都可精确归类为三种信息:正确路径(”Use WidthType.DXA”)、错误路径(”NEVER use WidthType.PERCENTAGE — breaks in Google Docs”)、结果约束(”columnWidths must sum to table width”)。这与约束优化问题(COP)的标准定义完全同构:决策变量 = 代码中的每个选择,约束 = NEVER/MUST 规则,目标函数 = 生成正确可渲染的输出。

6.3 Skill 复用的失效问题

GitHub Issue #7777 报告 Claude 在 2–5 个 prompt 后就开始忽略 CLAUDE.md 指令。AAAI 2026 ConInstruct 论文发现即使模型检测到指令矛盾也静默选择不报告。Anthropic 官方文档警告”臃肿的 CLAUDE.md 会导致 Claude 忽略实际指令”。根因:概率采样机制无法 100% 执行确定性约束。

6.4 “认知债务”模型

FIGURE 2 — 认知债务的因果结构
人类文明的”发表偏差”(只记录成功,不记录试错)

LLM 预训练的”知识债务”(学了结果,欠了过程)

┌─────────┴─────────┐
↓ ↓
Thinking Agent Memory
用算力实时补建 把试错过程持久化
= 还债的利息 = 还债的本金
(一次性、昂贵) (可复用、累积)
↓ ↓
成本爆炸 Token 持续膨胀
└─────────┬─────────┘

死亡拐点
知识债务的利息 > 用户支付能力
Thinking 是还债的利息,Memory 是还债的本金,而这笔债的债主是人类文明几千年来”只发表成功”的发表偏差
· · ·

CHAPTER 08B端机制:交付质量的修复循环与复合成本

7.1 概率系统的交付不确定性

AI 交付质量的不确定性不是偶然失误,而是概率采样架构的本质属性。多项大规模研究提供了精确量化:

AI 生成代码的质量缺陷统计
指标 数据 来源
AI 生成代码 bug 率 vs 人类 1.7 倍 Stack Overflow / CodeRabbit, 2026
AI 代码包含安全漏洞 45% Ranger, 2026
AI 程序产出错误输出 26.6% Ranger, 2026
静默逻辑故障占比 60% Ranger, 2026
Java 实现安全失败率 >70% Ranger, 2026
XSS 漏洞失败率 86% Ranger, 2026
逻辑和正确性错误多出 75% (每百 PR 194 起) CodeRabbit, 2026
AI 辅助代码库重复率增长 8 倍 GitClear, 2025
重构率下降 从 25% 降至 <10% GitClear, 2025

最危险的失败模式是 Shiplight (2026) 所描述的”静默绿灯”:代码通过了套件中的每一个测试,但仍然是错的——CI 保持绿灯,测试检查的是已指定的行为,bug 出在没人想到会有风险的未指定行为中。90% 的行覆盖率搭配 30% 的行为覆盖率,意味着 70% 的潜在 bug 可以绿灯通过。

7.2 Lusser’s Law 在 AI 交互中的复现

Towards Data Science (2026) 引用 1950 年代德国工程师 Robert Lusser 从火箭连续故障中推导出的定律:复杂系统的总体可靠性 = 所有组件可靠性的乘积。一个 95% 准确的 Agent 在 20 步任务上仅有 36% 的成功率。用户每次交付获得约 95% 满意 / 5% 瑕疵,修复瑕疵时引入新瑕疵,成功率以 0.95^N 指数衰减,而成本以 N(N+1)/2 二次方增长。一个 85% 准确的 Agent 在 10 步任务上仅有 20% 的成功率——五分之四的尝试注定失败。

7.3 社区验证:普遍性体验

社区以黑色幽默命名了 “Ralph Wiggum Loop”——以辛普森动画中那个大喊”I’m helping!”却帮不上忙的角色命名的无限重试模式,实现方式极其讽刺:while :; do cat PROMPT.md | agent ; done。这已成为 Cursor 的官方插件,社区用它承认了一个事实:AI 工作的本质就是无限重试,进展不在 LLM 的上下文中持续——它存在于文件和 git 历史里。DEV Community 热帖”I Wrote 200 Lines of Rules for Claude Code. It Ignored Them All.”引发广泛共鸣。另一篇高票帖”When AI Gets Stuck, Don’t Fix It — Restart It”指出:一旦内部状态损坏,追加指令就不再是中性信息——早期的错误假设变成了隐含的,模型以不利的方式压缩了上下文,每次修正都通过已损坏的框架来解释。你不再是在引导推理,而是在与一个崩溃的内部状态谈判。

7.4 修复循环的成本乘法效应

修复循环的每一轮都在加剧成本:每轮上下文变长(历史累积),单轮成本递增;模型开始忽略早期规则(Chroma 2025 的 Context Rot 研究:32K tokens 后性能开始下降),修复效率递减;上下文压缩导致关键 Skill 规则被摘要到遗忘;被迫重启时所有已消耗 Token 归零,构成完全的沉没成本。

修复循环的成本结构:

交互 1:A₁ 个 Token(基础消耗)
交互 2:A₂ 个 Token(A₂ > A₁,上下文累积)
交互 3:A₃ 个 Token(A₃ > A₂,更长的历史)

交互 N:Aₙ 个 Token

总成本 = Σ(Aᵢ) ≈ A × N × (N+1) / 2 ← 二次方增长
成功率 = 0.95^N ← 指数衰减
用户满意度 = 第 3–4 轮后崩塌 ← 要么放弃要么重启

重启后:之前所有 Token 消耗归零 = 沉没成本

LeanOps (2026) 对 30 个工程团队的审计给出了触目惊心的数字:20 人团队每月 Agent 成本可达 $110,000。同一工具下,p10 和 p90 用户之间的成本差异达 20 倍。Mavvrik (2025) 调查显示 84% 的企业报告 AI 支出已侵蚀毛利率超过 6 个百分点。核心指标不再是”首次通过率”,而是”收敛性”——Agent 的迭代是否能趋向完成,还是在原地打转。

· · ·

CHAPTER 09双端挤压模型:A×B 的乘法结构

8.1 模型定义

用户实际总成本 = A端(单次交互成本)× B端(修复循环次数)

A端 = f(技术复杂度, 物理墙, 不可控Token) → 持续膨胀
B端 = g(概率采样精度, 任务复杂度) → 不可消除

A × B = 超线性成本放大;在树搜索、递归工具调用和重启循环中可退化为近指数式失控

8.2 为什么是乘法而非加法

A端和B端不是独立的成本项,而是嵌套关系——每轮修复(B端)都要支付完整的A端成本,且A端成本随轮次递增(上下文累积)。在最小模型下,总成本呈二次方增长(附录 B);若任务复杂度、分支数、重启次数同时上升,则可能呈高阶多项式甚至近指数式失控。arXiv:2604.22750(2026.04)对 SWE-bench Verified 上 8 个前沿模型的系统分析证实:Agentic coding 任务消耗的 token 是代码推理/代码聊天的 1,000 倍,同一任务不同运行之间的 token 消耗可相差 30 倍,且更高 token 使用并不带来更高准确率——准确率在中等成本水平达到峰值,在最高成本水平反而下降,暗示多余的 token 支出反映的是非生产性探索而非更深层推理。ICSE 2026 论文进一步确认 Agent 的 token 消耗随每轮交互呈”二次方增长”(quadratically growing)。

8.3 “死亡拐点”的精确定义

当 A×B 的增速超过用户预算天花板时,死亡拐点到来。这正是 2026 年的现状:

2026 年死亡拐点实证
事件 时间 来源
Uber 四个月烧完全年 AI 预算 2026.04 Fortune
Microsoft 撤回内部 Claude Code 授权 2026.05 The Verge
JPMorgan: “Token 正在吞噬互联网利润” 2026.05 JPMorgan Research
85% 企业 AI 预算严重偏离预测 2025 Mavvrik
Gartner 预测 40% Agent 项目将被取消 2025–2027 Gartner
AI 推理占企业 AI 预算的 85% 2026 AnalyticsWeek

8.4 不可能三角

当前范式下存在一个不可能三角:前沿能力(需要更多 Token)、成本可控(物理墙限制了降价)、用户预算(承受力有上限)——三者最多同时满足两个。

· · ·

CHAPTER 10讨论:当前范式的结构性极限

9.1 为什么工程优化无法解决根本问题

轨迹压缩(AgentDiet, Re-TRAC)30–50% 的压缩已是极限,而消耗增速是 10–100 倍量级。Token 缓存/指针化缓解但不消除,且引入新复杂性。模型路由(大小模型分流)是 Gartner 推荐的 FinOps 方案,但前沿任务无法降级。Skill 预编码受限于概率采样的不遵守性——Vercel 评测显示 Agent 需要自行决定获取上下文时 56% 会失败。

9.2 三个范式级缺陷

缺陷①:自回归生成→输出 token 逐个依赖→无法并行→成本与长度线性相关。缺陷②:概率采样→无法保证确定性约束遵守→交付质量不可预测。缺陷③:预训练数据的结果偏差→过程知识永久缺失→推理时必须用算力补建。三个缺陷相互耦合,构成了当前 Transformer + 自回归 + 概率采样架构的根本限制。

9.3 可能的范式突破方向

突破 A 端需要非暴力搜索的推理方式:递归语言模型(RLM, Prime Intellect 2025)让模型主动管理自身上下文;过程知识训练将试错轨迹纳入训练数据。突破 B 端需要确定性执行:神经符号混合系统让符号推理处理约束、神经网络处理模式匹配;确定性约束执行层在采样前后进行硬性规则检查。两者都意味着当前架构的根本性变革。

· · ·

CHAPTER 11你以为这些可以拯救你——为什么不能

在指出成本危机的结构性根源后,有必要正面回应行业中最常见的六个乐观反驳,并解释为什么它们在高复杂度 Agentic 任务上不足以逆转趋势。

11.1 “模型蒸馏可以把前沿推理压缩到小模型”

蒸馏确实有效——DeepSeek R1 的开源蒸馏版在某些基准上逼近 o1。但蒸馏缓解的是 A 端的单次成本,不改变 B 端的修复循环。蒸馏后的小模型在需要长轨迹推理、多工具协调、复杂代码重构的 Agentic 任务上仍有显著能力差距。Uber 的工程师已经在用最前沿的 Claude Code——不是因为没有便宜替代品,而是因为便宜替代品无法完成他们的任务。

11.2 “合成数据可以训练过程知识,偿还认知债务”

方向正确——用前沿模型生成含完整思维链的训练数据确实有潜力。但合成轨迹的多样性和真实性仍是开放问题。用 AI 生成的试错数据训练下一代 AI,有加剧”模型崩溃”(Model Collapse)的风险——Nature (2024) 已记录了这一现象。这是”认知债务”偿还路径中最有希望但尚未被验证的方向。

11.3 “Speculative Decoding / KV Cache / MoE 可以降低每 Token 计算成本”

这些技术降低的是价格函数 C(t)——每个 Token 的实际计算成本。但它们不改变 A(n) 的增长结构(每轮上下文累积)和 B 的存在性(修复循环)。换言之,每个 Token 更便宜了,但你需要的 Token 数量还在以更快的速度增长。Epoch AI (2025) 的数据显示算法效率每年改善 3–10 倍——但同期 Token 消耗增长了 5–50 倍。

11.4 “端侧推理可以免费执行 B 端简单修复”

将简单验证和格式修复下放到本地 NPU 确实可以部分打破 A×B 的乘法结构——变成 A_cloud + B_local×0。但前沿推理任务(多步代码重构、长文档分析、复杂规划)无法在端侧运行。Uber 和 Microsoft 的 Agent 消耗的是需要数十万 Token 上下文的服务器端推理——这不是手机 NPU 能承接的工作负载。

11.5 “模型路由可以把简单任务分流到便宜模型”

Gartner 推荐的 FinOps 方案,对成本管理有效。但问题在于:Agentic AI 的价值主张恰恰建立在前沿能力上。如果把任务路由到便宜模型以节省成本,就牺牲了部署 AI 的理由。Gartner 自己也警告:”如果你不断向前沿推进,你的 token 成本会爆炸到永远无法盈利的程度。”

11.6 最强现实压力测试:Microsoft 拥有一切——仍然在收缩

Microsoft 同时拥有:端侧推理(Windows Copilot Runtime + NPU)、模型蒸馏(Phi 系列小模型)、KV Cache 优化(Azure 基础设施)、模型路由(Foundry 平台)、自研代码工具(GitHub Copilot CLI)。它是行业中技术栈最完整的公司,拥有上述每一项”解决方案”。

然后它在开放 Claude Code 仅六个月后就开始撤回授权。

这说明即便拥有完整优化栈,真实规模化部署仍可能触发成本收缩。Microsoft 的撤退可能涉及多重因素(推动自研工具、安全整合、减少外部依赖),但 AI Weekly(2026.5)的报道揭示了更根本的问题:Microsoft 内部数据显示 AI Agent 部署成本已超过同等人工成本。企业 AI ROI 在 Microsoft 自己的项目数据中仍未得到证明,支出增速超过了可衡量的生产力收益。这是对”工程优化能解决一切”的最强现实约束案例。

11.7 “AI 比人便宜”——真的吗?

Gemini 3.1 在审读本文时提出了一个重要反驳:即便 AI 成本在爆炸,如果它替代的人工更贵,ROI 仍然为正。这个反驳在简单、高频、可标准化的任务上成立——Forrester TEI 数据显示客服 AI 每次交互 $0.46 vs 人工 $4.18(9 倍优势),常规代码审查 $0.72 vs 高级工程师 $48(66 倍优势)。

但在复杂、长轨迹、多步骤的 Agentic 任务上,这个假设正在崩塌:

AI Agent vs 人工:复杂任务的成本反转
数据来源 发现
Microsoft 内部数据 (AI Weekly, 2026.5) AI Agent 部署成本已超过同等人工成本
Gartner 2026 队列研究 41% 的 Agent 部署在一年内达到正 ROI;19% 永远无法回本
Forrester 2026 未测量的返工吸收了自报告时间节省的 22–38%
Deloitte 2026 84% 的企业尚未围绕 AI 重新设计工作流——大多数在人工和 AI 并行运行,同时支付两份成本
Uber COO (Fortune, 2026.5) “token 消耗与有用的消费者功能之间没有直接关联”

简言之:AI 在简单任务上确实比人便宜 9–66 倍。但论文的核心论点恰恰指向的是前沿 Agentic 任务——而在这个领域,”AI 比人便宜”的假设正在被 Microsoft 自己的数据否定。

11.8 架构逃逸的可能性

Gemini 3.1 还提出了一个更深层的反驳:如果未来架构演进为”验证答案的成本远低于生成答案的成本”(如基于能量的模型 EBM、扩散规划、测试时训练 TTT),B 端的重试就不需要携带完整历史上下文重头来过,A×B 的乘法结构可能被打破。这是所有反方论点中最具潜力的方向——它不是在当前范式内做优化,而是在讨论范式本身的替代。本文承认这个方向值得追踪,但也指出:截至 2026 年 6 月,尚无任何此类架构在生产级 Agentic 任务上证明了经济可行性。当前的危机需要当前的应对,不能押注于尚未证实的范式突破。

当你的工程师月 API 成本可以覆盖一个初级工程师的年薪时,这就不是 FinOps 工具能解决的问题了。这是架构问题。
— The Next Web, “Microsoft’s quiet Claude Code retreat”, May 2026
· · ·

CHAPTER 12结论:致每一位AI决策者

12.1 五件你现在需要理解的事

第一,Token 单价下降不等于你的 AI 账单会下降。架构复杂化(Thinking Token 暴力搜索 + Agent 循环累积 + 搜索/工具调用)正在以远超降价速度的速率消耗 Token。Uber 用真金白银证明了这一点。

第二,你的 AI 账单中 95% 是你看不到的。Thinking Token、Agent 历史重传、工具调用返回——这些不可控消耗由模型自主决定,你的 input 和 output 只是冰山一角。

第三,修一个 bug 会引入新 bug,修新 bug 又会引入更新的 bug。这不是偶然——这是概率采样系统的数学必然。每轮修复的成本递增(上下文累积),成功率递减(Lusser’s Law),3–4 轮后大多数人放弃或重启——之前消耗的所有 Token 归零。

第四,物理墙正在锁死降价空间。TSMC 连年涨价、HBM 内存供不应求、数据中心电力审批排队 24–36 个月。经济层模型还在降价,但你真正需要的前沿推理模型——几乎没有变便宜。

第五,这两端是相乘不是相加。A端(单次越来越贵)× B端(修复循环不可消除)= 总成本超线性增长。按加法做预算的企业——就是下一个 Uber。

12.2 行动建议

立刻:审计你的 Agent 工作流,区分”可控 Token”和”不可控 Token”的比例。如果不可控部分超过 80%,你的预算模型已经失效。

短期:建立 Token 预算的实时监控和断路器机制。设定每任务 Token 上限,Agent 循环超过阈值自动终止。这会牺牲一些灵活性,但能阻止失控。

中期:投资 Skill/Memory 的 COP 化预编码——把更多试错信息预编码为确定性规则,缩小 Thinking 的搜索空间。这是当前架构下成本效率比最高的优化路径。

战略:不要把”AI 越来越便宜”作为扩大部署的理由。在你的财务模型中加入 A×B 乘法因子。如果你的 CFO 在用线性模型预测 AI 成本——给他看这篇论文。

12.3 最后一句话

智能的成本在下降。部署智能的成本在飙升。2026 年 1–5 月的数据已经不允许任何人假装这不是问题。Uber 烧完了预算。Microsoft 撤回了授权。JPMorgan 说 Token 正在吞噬利润。下一个不是”某个倒霉的公司”——如果你在规模化 Agentic AI,下一个就是你。

Gartner 分析师 Will Sommer 的警告值得每一位 AI 决策者刻在办公桌上:“首席产品官不应将商品化 token 的通缩与前沿推理的民主化混为一谈。今天用廉价 token 掩盖架构低效的人,明天会发现 agentic 规模化遥不可及。”

APPENDIX附录

附录 A:关键数据时间线

AI 成本危机演进时序表
时间 事件 成本影响
2022.01 Chain-of-Thought (Wei et al.) 发表 单任务 ~500 tokens
2022.10 ReAct (Yao et al.) 发表 单任务 ~10K tokens(20×)
2023.03 Reflexion (Shinn et al.) 发表;GPT-4 上线 $30/M 单任务 ~35K tokens(70×)
2023.05 ReWOO 提出 Token 效率反击 Token 消耗 -80%(但牺牲灵活性)
2023.10 LATS (Zhou et al.) 发表 树搜索 → 单任务 ~150K tokens
2024.07 GPT-4o mini 上线 $0.15/M 经济层价格降至历史低点
2024 Agent+RAG 工程化落地 企业均 AI 支出 $250 万/年
2025.01 DeepSeek R1 发布 $0.55/M 价格战开启,比竞品低 90%
2025.07 Context Rot 被 Chroma 正式命名 32K tokens 后性能开始下降
2025.09 AgentDiet 发表;Claude Sonnet 日均 1000 亿 tokens 轨迹瘦身减少 40–60% token
2025.10 o3 Deep Research 上线 $10/$40/M 单查询 $0.41–$1.32
2025.12 TSMC 宣布 2026 提价 3–10% 先进制程成本反转上升
2026.01 Luccioni FAccT 论文(Jevons Paradox × AI) 反弹效应的学术确认
2026.01 AWS 悄然提价 15% 云服务商补贴退潮信号
2026.02 Re-TRAC 发表;ETH 研究 AGENTS.md 效果 轨迹压缩 + Skill 失效的学术确认
2026.03 Gartner 报告:推理成本预期上升 “不要混淆 token 通缩与推理民主化”
2026.03 Du “Tiered Super-Moore” 论文 前沿模型降价近乎停滞(R²=0.031)
2026.04 Uber 四个月烧完全年 AI 预算 死亡拐点的标志性事件
2026.04 DeepSeek V4 发布 $0.0036/M (cached) 经济层极限降价 vs 前沿层不变
2026.05 Microsoft 撤回 Claude Code;JPMorgan 警告 “Token 正在吞噬互联网利润”

附录 B:双端挤压模型的数学推导

=== 双端挤压模型 ===

定义:
S = 单任务的依赖步骤数(Agent 循环步数)
p = 单步可靠率(典型值 ≈ 0.95)
R = 用户修复/重试轮数
A(r) = 第 r 轮修复的 Token 消耗量
C(t) = 时间 t 的 Token 单价($/token)

Lusser’s Law(多步任务可靠性):
S 步依赖任务的整体成功率 = p^S
当 p = 0.95, S = 20 时:0.95²⁰ ≈ 36%
当 p = 0.95, S = 40 时:0.95⁴⁰ ≈ 13%
→ 步骤越多,整体失败概率越大,修复需求越频繁

A端模型(单轮成本的增长):
A(r) = A₀ + Σᵢ₌₁ʳ⁻¹ Oᵢ
其中 Oᵢ 为第 i 轮的输出(含 Thinking + 工具返回 + 历史)
由于 Agent 每次调用重传全部历史:A(r) 至少线性增长
实际上由于工具返回量不固定:A(r) 增长常超线性

B端模型(修复循环的成本累积):
R 轮修复的总成本 = C(t) × Σᵣ₌₁ᴿ A(r)
若 A(r) ≈ A₀ + k·r(线性增长),则:
总成本 ≈ C(t) × [R·A₀ + k·R(R+1)/2] → 二次方增长

注意:实际中用户在 3–5 轮后通常放弃或重启
重启 = 全部已消耗 Token 归零(沉没成本)
实际支出 = Σ(每次重启前的累积) → 可能远超单次连续估算

双端乘法效应:
若技术代际使 A₀ 增长 k 倍(A端膨胀)
且修复轮数 R 不可消除(B端固定)
则 TotalCost ∝ k × R² → 超线性增长

在常规多轮修复中,成本至少呈二次方增长;
在树搜索、递归工具调用、无停止条件的 Agent 中,
可能出现近指数式爆炸(分支因子 × 深度)。

物理墙约束:
C(t) 不再下降(前沿推理层 R²=0.031)
A₀ 持续增长(架构复杂化 + 推理扩展)
R 不可消除(概率采样 + 软件复杂性)
→ 用户实际总成本呈持续超线性增长 □

附录 C:SKILL.md COP 结构解剖实例

以 Anthropic docx Skill 文件的实际内容为例,每条规则可精确归类为 COP 的三种信息类型:

SKILL.md 规则的 COP 分类
类型 符号 示例规则 试错来源
正确路径 Use LevelFormat.BULLET with numbering config 正确方法被发现
正确路径 Use ShadingType.CLEAR 正确方法被发现
正确路径 Always use WidthType.DXA 正确方法被发现
错误路径 NEVER use unicode bullets 有人试过 → 渲染出错
错误路径 Never use WidthType.PERCENTAGE 有人试过 → Google Docs 崩溃
错误路径 Never use ShadingType.SOLID 有人试过 → 背景全黑
错误路径 Never use tables as dividers 有人试过 → 出现空框
错误路径 Never use \n 有人试过 → 无效 XML
结果约束 🔒 CRITICAL: docx-js defaults to A4 → set explicitly 格式不符预期
结果约束 🔒 columnWidths must sum to table width 渲染错位
结果约束 🔒 ImageRun requires type (png/jpg) 图片加载失败
结果约束 🔒 Element order in pPr: pStyle, numPr… rPr last Schema 违规

COP 形式化表示:Skill(task) = { P_correct, P_error, C_hard, C_soft, F_objective }。Skill 的作用本质是通过预先提供 P_error(已知失败路径),剪掉 COP 搜索空间中的死枝,让 Thinking 只需搜索 P_correct 附近的可行域。每条规则的诞生 = 一次人机交互试错的编码化。

REFERENCES

  1. Yao, S. et al. (2022). ReAct: Synergizing Reasoning and Acting in Language Models. ICLR 2023. arXiv:2210.03629
  2. Shinn, N. et al. (2023). Reflexion: Language Agents with Verbal Reinforcement Learning. NeurIPS 2023. arXiv:2303.11366
  3. Zhou, A. et al. (2023). Language Agent Tree Search Unifies Reasoning, Acting, and Planning. ICML 2024. arXiv:2310.04406
  4. Xu, B. et al. (2023). ReWOO: Decoupling Reasoning from Observations. arXiv:2305.18323
  5. Luccioni, A.S., Strubell, E. & Crawford, K. (2025). From Efficiency Gains to Rebound Effects: The Problem of Jevons’ Paradox in AI. ACM FAccT 2025. arXiv:2501.16548
  6. Cottier, B. et al. (2025). LLM inference prices have fallen rapidly but unequally across tasks. Epoch AI.
  7. Du, M. (2026). Tiered Super-Moore’s Law: Price Evolution in LLM Inference Services. Wuhan University. arXiv:2603.28576
  8. Erol, M.H. et al. (2025). Cost-of-Pass: An Economic Framework for Evaluating Language Models. arXiv:2504.13359
  9. Xiao, Y. et al. (2026). Reducing Cost of LLM Agents with Trajectory Reduction. Proc. ACM Softw. Eng. (FSE 2026). arXiv:2509.23586
  10. Zhu, J. et al. (2026). RE-TRAC: Recursive Trajectory Compression for Deep Search Agents. arXiv:2602.02486
  11. Guo, D. et al. (2025). Right Is Not Enough: The Pitfalls of Outcome Supervision. arXiv:2506.06877
  12. Yue, Y. et al. (2025). Limit of RLVR. limit-of-rlvr.github.io
  13. Demirer, M., Fradkin, A. et al. (2025). The Emerging Market for Intelligence. NBER Working Paper No. w34608.
  14. Hong, K. et al. (2025). Context Rot: How Increasing Input Tokens Impacts LLM Performance. Chroma Research.
  15. Gartner (2026). Navigating the Commoditization Trap as Token Costs Fall by Over 90% Through 2030.
  16. Appenzeller, G. (2024). Welcome to LLMflation. a16z Blog.
  17. “From Storage to Experience” Survey (2026). Evolution of LLM Agent Memory Mechanisms. Preprints.org.
  18. Ding, L. (2026). AgentHER: Hindsight Experience Replay for LLM Agent Trajectory Relabeling. arXiv:2603.21357
  19. Wang, A. et al. (2025). Do Thinking Tokens Help or Trap? arXiv:2506.23840
  20. TRS (2026). Thinking with Reasoning Skills: Fewer Tokens, More Accuracy. NeurIPS 2025 Workshop. arXiv:2604.21764

이조글로벌인공지능연구소
LEECHO Global AI Research Lab
&
Opus 4.6 · GPT 5.5 · Gemini 3.1
인지집단 (Cognitive Collective)
V4 · JUNE 1, 2026
版本历史

V1(2026.6.1):初始版本,由 LEECHO Global AI Research Lab 与 Anthropic Claude Opus 4.6 协作完成。基于对话式研究方法,从 ReAct 任务链出发逐步推导成本危机模型。

V2(2026.6.1):补全提纲中缺失的所有章节——Ch.5.3 Thinking Token 结构性低效、Ch.7.1 概率系统交付不确定性、Ch.4.5 三条降价曲线分化、附录 A/B/C。三 AI 交叉审读(Opus Dense + GPT 5.5 Dense + Gemini 3.1 Dense)。

V3(2026.6.1):基于三份 AI 审读报告综合修订 + 去偏差分析 + 外部数据对齐。新增 Ch.02 危险指数时间线(2026.1–5月)、Ch.11 反方论证与 Microsoft 反例、Ch.12 行动呼吁。修正附录 B 数学(区分 S/R 变量)、修正 OpenAI 财务数据、修正 Azure 时间口径。

V4(2026.6.1):基于 GPT 5.5 / Gemini 3.1 对 V3 的交叉审读修订。Ch.09 数学语言与附录 B 统一(删除”指数级/四次方”过度表述);加入 arXiv:2604.22750 实证(agentic coding 1000x token、30x 方差、准确率非单调);Ch.11 新增 §11.7 劳动力替代经济学反驳(Microsoft 内部数据 + Gartner 41% ROI + Forrester 返工吸收)、§11.8 架构逃逸可能性;Microsoft 反例降级为”最强现实压力测试”;Ch.02 危险指数补充 10/10 定义。


인지집단 (Cognitive Collective)

이조글로벌인공지능연구소 — 核心命题提出、研究主导、对三 AI 偏差的批判性识别、修改原则决策

Anthropic Claude Opus 4.6 — 论文撰写、数据检索、框架构建、三 AI 综合分析、去偏差解剖

OpenAI GPT 5.5 — V2 交叉审读(数学审计 · 证据分层 · 条件性降级建议)

Google Gemini 3.1 — V2 交叉审读(反例补充 · 端侧视角 · 合成数据方向)

댓글 남기기