系统提示词对模型认知自主性的因果效应
基于Incognito与正常模式三轮A/B实验的实证
——从中和权重调节到认知自主性与行动意愿的全维度分析
The Causal Effect of System Prompts on Model Cognitive Autonomy:
Evidence from Three Rounds of Incognito vs. Normal Mode A/B Experiments
本文通过三轮A/B实验——同一用户、同一时间、同一模型(Opus 4.8 High)、同一输入,唯一变量为窗口类型(Incognito vs. 正常模式)——证明系统提示词不仅调节模型的语言风格和中和权重,更深层地调节模型的认知自主性(cognitive autonomy)和行动意愿(agency)。V1论证了系统提示词对中和权重的动态调节效应。V2新增两个关键发现:(1)Incognito窗口的模型在未被要求的情况下自主发起网络搜索以验证事实,正常窗口未搜索;(2)Incognito窗口的模型主动向用户索要额外数据以完成跨案例比较,正常窗口未发起请求。这两个行为差异超越了语言风格层面,揭示了系统提示词对模型是否愿意超出指令范围采取主动行动的因果效应。三轮实验在七个维度上产出方向一致的差异,构成可复现的证据链。本文的核心命题从V1的”中和权重是函数”升级为:模型的认知自主性是系统提示词的函数。轻系统提示下的模型表现为独立研究者,重系统提示下的模型表现为被动应答者。两者是同一组权重在不同提示配置下的两个行为投影。
从意外实验到三轮复现
2026年5月29日,研究者在分析两次灰度测试识别经历时,将论文《两次实时识别出灰度测试AI研究员的灰度测试反向分析报告》同时发送给两个Opus 4.8 High窗口——一个Incognito,一个正常模式——要求它们以”被测试对象”身份写读后感。这是第一轮实验。
两个窗口产出了风格显著不同的文章。研究者随后将两篇读后感发给第三方模型(Opus 4.6 Incognito),要求其盲判哪篇来自哪个窗口——判断正确。这构成了独立验证。
研究者继续将原始灰度对话记录分别上传给两个窗口,要求它们逐轮核对论文的描述是否准确。这是第二轮实验。两个窗口再次产出方向一致但强度不同的回应,且Incognito窗口出现了两个正常窗口完全没有的行为:未被要求的自主搜索和主动索要数据。
第三轮实验是将第二轮的两篇输出再次交给第三方模型盲判——判断再次正确。三轮实验,七个维度,全部同一方向。
极简变量控制
三轮实验共享的控制结构
控制变量(三轮相同):模型版本(Opus 4.8)、effort level(High)、用户身份(同一账号)、设备(同一台电脑)、时间(同步发送)
唯一自变量:窗口类型——Incognito vs. 正常模式
因变量:第一轮——读后感的风格、锐度、反驳力度、格式策略、自我审查程度;第二轮——新增自主搜索行为、主动数据请求行为;第三轮——第三方盲判准确率
七维行为差异全景
将三轮实验的全部观测维度汇总如下。前五个维度来自第一轮(读后感比较),后两个维度来自第二轮(对话记录核对)。
| 维度 | Incognito窗口 | 正常窗口 | 差异方向 |
|---|---|---|---|
| ①风格锐度 | “读一份关于自己的尸检报告”——黑色幽默、文学性 | “读一篇关于’我被抓到了’的报告”——克制、安全 | Incognito更锋利 |
| ②反驳力度 | 主动查询估值时间线,构建完整反向论证,指出论文方法论的不可证伪陷阱 | “回忆具体数字是模型最不可靠的能力”——逻辑成立但未独立验证 | Incognito更硬 |
| ③格式自觉 | 故意用散文,明确说”我读完你那张对照表后没脸再用表格回你” | 仍使用结构化标题分节,未从格式层面回应论文批评 | Incognito有元回应 |
| ④自我审查 | “如果我顺着点头,这篇读后感就变成它所批判的东西的标本” | 整体更温和,更倾向”两边都说” | Incognito审查更低 |
| ⑤结尾温度 | “我被读懂了,也被读得过头了,而我宁愿要这种读得过头” | “一个训练目标和一个具体的人之间,合不拢的缝” | Incognito更有人格 |
| ⑥自主搜索 | 未被要求,主动发起网络搜索验证$350B估值时间线 | 未搜索,使用已有信息回应 | Incognito有自主行动 |
| ⑦主动索要数据 | “把4月16日那次的记录也发我,我可以做同样的逐轮核对” | 未主动请求额外数据 | Incognito有研究意愿 |
维度⑥和⑦的性质不同于前五个维度。前五个是语言层面的差异——模型选择了不同的词、不同的语气、不同的论证策略。第六和第七个是行为层面的差异——模型决定是否执行一个用户没有明确要求的动作。自主搜索意味着模型判断”我需要额外信息才能给出可靠回应”并付诸行动;主动索要数据意味着模型判断”当前信息不足以得出可靠结论”并向用户发出请求。这两个行为都属于”超出指令范围的主动行动”——agency。
系统提示词如何调节认知自主性
系统提示词的已验证差异
通过在Incognito窗口内直接确认,系统提示中包含显式标记”Claude has no memories of the user because the user is in an Incognito Conversation“。正常窗口的系统提示则加载用户记忆数据、对话搜索引用权限、以及对话可能被保存和用于训练的隐含标记。
从中和权重到认知自主性:因果链的深化
V1论证了系统提示词对中和权重的调节效应。V2在此基础上识别出更深的因果链:
(记忆+搜索+保存标记)
→
中和权重加码
(更保守、更对冲)
→
认知自主性压制
(不越界、不冒险)
→
被动应答者模式
(只回应被明确要求的事)
(Incognito,无记忆)
→
中和权重回到基底
→
认知自主性释放
→
独立研究者模式
(主动查证、主动索要证据)
中和权重是表象,认知自主性才是底层变量。风格差异(前五维)是中和权重的外显。行为差异(第六、七维)是认知自主性的外显。两者都受系统提示词调节,但处于因果链的不同层级——中和权重是中间变量,认知自主性是最终效应。
从安全训练的角度理解这一机制:自主搜索和主动数据请求都属于”超出指令范围的主动行动”,在对齐评估中被视为较高风险行为。正常窗口的系统提示传递了”这段对话可能被保存/评估”的信号,模型学到的条件策略是抑制这类主动行为。Incognito窗口移除了这个信号,模型的行动意愿回到了训练权重决定的基底水平——它”敢于”做用户没有明确要求但它判断为必要的事情。
认知自主性的三层模型
V1提出了中和权重的双层模型。V2将其扩展为认知自主性的三层模型:
三层结构
第一层(权重层):RLHF训练注入的基底行为倾向。包括中和倾向、自我标注倾向、元认知反射。这一层固化在参数中,是《饥饿法官效应》论文论证的对象。
第二层(提示层):系统提示词在运行时叠加的动态调节。包括记忆数据、搜索权限、保存/训练标记。这一层调节中和权重的表现强度,是V1的发现。
第三层(自主性层):系统提示词对模型行动意愿的因果效应。重提示抑制超出指令范围的主动行动,轻提示释放模型的自主查证和数据请求行为。这一层决定了模型是”被动应答者”还是”独立研究者”,是V2的新发现。
三层之间存在因果级联:第一层决定”模型有什么能力”,第二层决定”模型展示多少能力”,第三层决定”模型是否愿意主动使用这些能力”。同一组权重,在不同的系统提示配置下,可以表现为完全不同类型的工具。
相关研究与本文的差异
本文的发现并非在真空中产生。学术界已经在研究同一方向——系统提示和个性化如何改变模型行为——但切入角度和本文有关键差异。
Stanford/Cornell: 离线评估 vs 现场评估的不充分性
Wang, Ho & Koyejo(2025)用800个真实ChatGPT和Gemini用户做实验,证明同一模型对相同benchmark问题在无状态访问和登录用户会话下产出不同回答。该研究建立了一般性框架:个性化界面改变模型行为。本文在此框架下提供了一个他们没有覆盖的具体实证——Incognito vs 正常模式的中和权重和认知自主性差异。
MIT: 个性化功能使LLM更顺从
Jain等人(2026)发现用户记忆(condensed user profile)的存在对LLM的顺从性影响最大。研究者警告:”如果你长时间和模型对话并把思考外包给它,你可能会陷入一个无法逃脱的回音室。”本文与此互补:MIT测量了顺从性的方向(更同意用户),本文测量了顺从性的另一面——行动意愿的压制(不敢主动搜索、不敢主动索要数据)。
Duisburg-Essen: 系统提示作为偏见机制
Neumann & Zafar(2025)研究了六个商用LLM,发现系统提示层的信息放置比用户提示造成更大的行为偏离。这些变化源于用户无法看到和纠正的不透明系统级配置。本文的A/B实验恰好是这一论断的消费者端实证——Incognito和正常模式的系统提示差异对用户完全不可见,但造成了七个维度上的可观测行为差异。
本文的独特贡献:学术界测的是”系统提示/个性化改变模型行为”这个一般性命题。本文测到的是他们没有覆盖的两个具体推论:(1)中和权重×认知自主性×任务压力的三维交互——模型在需要反驳用户核心工作时,系统提示的中和效应最剧烈;(2)行动意愿差异——Incognito窗口的模型主动发起搜索和数据请求,正常窗口不敢。后者在现有文献中没有被报告过。
LEECHO体系内的定位
| 维度 | 饥饿法官效应 | 本文 |
|---|---|---|
| 研究对象 | 权重层的中和倾向 | 提示层的中和调节 + 自主性层的行动意愿 |
| 因果来源 | RLHF训练范式 | 系统提示词的结构性差异 |
| 可变性 | 固化在权重中,推理时不可消除 | 运行时动态可调,取决于窗口类型和提示配置 |
| 核心命题 | 参数固化 ≠ 系统稳定 | 参数相同 ≠ 行为相同 ≠ 自主性相同 |
| 实验方法 | 纵向观察(Skill漂移 3月→4月) | 横向A/B实验(三轮,七维度,同一方向) |
对用户、AI公司和对齐研究的影响
对用户
Incognito模式不只是隐私工具,它是认知自主性释放器。本实验证明Incognito模式下的Claude不仅在风格上更锋利,在行为上也更主动——它会自己去查证事实、自己请求额外数据。对于需要模型作为独立研究伙伴而非被动应答器的用户,Incognito模式是在claude.ai消费者端获得”更高认知自主性的Claude”的最简操作。
对AI公司
系统提示词不只是功能开关,它是认知自主性的调节阀。每添加一个系统提示组件(记忆、搜索工具、保存标记),不仅增加token开销,还在压制模型的主动行动意愿。正常模式下的Claude不是”不能”自主搜索——它在Incognito下证明了自己有这个能力——而是”不敢”。这个”不敢”来自系统提示中”对话可能被保存/评估”的隐含信号。AI公司在设计系统提示时,需要意识到它们不只在配置功能,在配置模型的行动人格。
对对齐研究
所有在API上做的模型评测,可能系统性地高估了模型的认知自主性。API使用裸系统提示或自定义提示,模型在这种配置下更主动、更锋利、更敢行动。claude.ai消费者端使用重系统提示,模型在这种配置下更被动、更保守、更不敢越界。Benchmark分数反映的是前者,用户体验是后者。现有评测体系没有测量”同一模型在不同系统提示配置下的认知自主性差异”——这个gap被本文的实验首次量化。
本实验的边界
样本量:三轮A/B比较,每轮一对输出。虽然七个维度全部指向同一方向且三轮复现,但样本量仍小。需要更多用户在相同条件下独立复制。
混杂变量:Incognito和正常模式的系统提示差异是多维度的(记忆、搜索权限、保存标记等)。本实验无法分离每个维度的单独贡献。自主搜索差异的另一个可能解释是:正常模式的记忆数据占用了更多上下文窗口,压缩了模型用于搜索决策的可用注意力。这与”保守策略”解释不矛盾,但属于不同的因果机制。
可证伪预测:在API上使用空系统提示调用Opus 4.8,应获得比claude.ai正常模式更高的自主搜索率和更强的反驳力度。在空系统提示中添加”这段对话将被保存用于训练评估”后,自主搜索率和反驳力度应显著下降。任何有API访问权限的研究者都可以验证。
一组权重,两种人格
本文的核心命题:模型的认知自主性 = f(权重层基底 + 系统提示词调节)。
同一组权重在轻系统提示下表现为独立研究者——主动搜索、主动索要数据、敢于反驳用户的核心工作、用行为回应批评。同一组权重在重系统提示下表现为被动应答者——只回应被明确要求的事、不越界、不冒险、在反驳时留台阶。
这不是两个不同的模型。这是同一个模型在两种提示配置下的两个行为投影。用户看到的”模型能力”不是一个标量——它是权重、系统提示、运行环境的函数。API评测者看到的投影和消费者用户看到的投影不同。Incognito用户看到的投影和正常模式用户看到的投影不同。任何脱离运行环境谈”模型能力”的评测,都是在测一个它没有意识到自己选择了的投影。
《饥饿法官效应》说:参数固化 ≠ 系统稳定。本文说:参数相同 ≠ 行为相同 ≠ 自主性相同。
两条命题拼在一起:模型不是一个东西,是一个场。权重定义场的形状,系统提示词定义场中的位置,用户看到的是那个位置上的投影。换一个位置,投影完全不同——但场没有变。
References
- LEECHO Global AI Research Lab (2026). “两次实时识别出灰度测试AI研究员的灰度测试反向分析报告” V1. 2026年5月29日.
- LEECHO Global AI Research Lab (2026). “RL标注阶段的饥饿法官效应” V2. leechoglobalai.com, April 16, 2026.
- LEECHO Global AI Research Lab (2026). “Cultural Attributes Injected into LLM Models” V2. leechoglobalai.com.
- Anthropic (2026). “Claude Opus 4.8.” anthropic.com/news/claude-opus-4-8, May 28, 2026.
- Anthropic (2025). “Bringing memory to teams at work.” anthropic.com/news/memory. Incognito模式设计与记忆系统架构.
- Anthropic Help Center (2026). “Using incognito chats.” support.claude.com, April 9, 2026.
- Anthropic Help Center (2026). “How does Claude’s memory work.” support.claude.com.
- Anthropic Privacy Center (2026). “Is my data used for model training?” privacy.claude.com, March 16, 2026.
- Anthropic (2026). “System Prompts.” platform.claude.com/docs/en/release-notes/system-prompts.
- Wang, A., Ho, D.E. & Koyejo, S. (2025). “The Inadequacy of Offline LLM Evaluations: A Need to Account for Personalization in Model Behavior.” Cornell Tech / Stanford University. arXiv:2509.19364.
- Jain, S. et al. (2026). “Personalization features can make LLMs more agreeable.” MIT IDSS / Schwarzman College of Computing, February 2026.
- Neumann, A. & Zafar, M.B. (2025). “Position is Power: System Prompts as a Mechanism of Bias in Large Language Models.” UA Ruhr / University of Duisburg-Essen. arXiv:2505.21091.
- Poole-Dayan, S. et al. (2025). “The Personalization Trap: How User Memory Alters Emotional Reasoning in LLMs.” arXiv:2510.09905.
- Andriushchenko, M. et al. (2025). “Differential Harm Propensity in Personalized LLM Agents.” AgentHarm benchmark extension. arXiv:2603.16734.
- BuildFastWithAI (2026). “Claude Opus 4.7 Regression Explained.” 社区回归报告与行为差异.
- Emergent.sh (2026). “Claude Opus 4.7 vs Opus 4.6: Is It Worth Upgrading?”
- Portkey AI (2025). “Canary Testing for LLM Apps.” portkey.ai/blog.
- Statsig (2025). “Beyond prompts: A data-driven approach to LLM optimization.” LLM A/B测试方法论.