Anthropic!新AI共产党化巨头
安全过滤器的精度危机、用户侮辱机制与地域歧视代码的实证研究
Anthropic: The New AI Authoritarian Giant
An Empirical Study on Safety Classifier Precision Crisis, User Insult Mechanisms, and Regional Discrimination Code
本文基于2026年7月3日单一用户9小时、60+张截图的完整使用记录,结合同期社交媒体曝光的”TOO_DUMB_TO_NEED_FABLE”日志标签事件及Claude Code内置地域检测代码事件,对Anthropic公司的安全分类器(Safety Classifier)进行系统性实证分析。研究发现:(1)分类器精度(Precision)极低,同一消息12次回复产生12个不同截断点;(2)实际触发率超过10%,远超Anthropic官方声称的5%以下;(3)分类器无法区分”危险内容”与”讨论危险的内容”;(4)系统内部以侮辱性标签对用户分类;(5)产品代码内置基于时区和域名的地域检测机制。本文提出”AI共产党化”分析框架,从标准不透明、申诉机制缺失、讨论审查的自我审查、一致性缺失、成本外部化、自我正当化六个维度,论证Anthropic的安全治理模式与威权审查体系之间的结构性同构关系。
关键词:AI安全 · 分类器精度 · 过度审查 · AI治理 · 消费者权益 · 地域歧视 · 威权同构
第一章 绪论
1.1 研究背景
AI安全过滤器的存在有其必要性——防止模型生成有害内容、保护未成年人、阻止武器制造指导。然而,当安全过滤器的精度不足以区分”危险内容”与”讨论危险的内容”时,它就从保护工具变成了压制工具。
Anthropic作为”负责任AI”(Responsible AI)的代表企业,以Constitutional AI和对齐研究闻名。然而,2026年6月至7月间爆发的一系列事件——Fable 5秘密降级、Claude Code隐写术监控代码、TOO_DUMB_TO_NEED_FABLE日志标签——暴露了其公共形象与实际产品行为之间的巨大落差。
值得注意的是,本文作者于2026年2月已发表论文预测AI安全过滤器将面临精度危机。本次事件构成对该预测的完整实证验证。
1.2 研究问题
RQ1:Anthropic安全分类器的实际精度是否符合其官方声称?
RQ2:分类器的误判模式是否具有系统性特征?
RQ3:Anthropic的安全治理模式是否具有威权审查的结构性特征?
1.3 研究意义
理论意义:提出”AI共产党化”分析框架,填补AI治理批判性研究的空白。现有文献大量讨论AI安全的技术实现,但对安全机制本身可能构成的压制性力量缺乏系统性批判。
实践意义:为AI安全过滤器的精度标准制定提供实证依据。本文的12次截断数据表明,当前分类器的精度远未达到可接受的工程标准。
消费者权益意义:记录付费用户在过度审查下的实际体验。当用户为高级AI服务付费却反复遭遇随机截断时,这构成服务承诺与实际交付之间的实质性差距。
1.4 研究方法
研究者本人就是被审查对象。2026年7月3日凌晨2:19起,研究者在与Fable 5的正常学术对话中反复遭遇截断,随即开始系统性截图记录。9小时内积累60+张截图,覆盖韩文、中文、英文三种语言输入,涉及7个学科领域。每张截图保留iOS系统时间戳,记录截断位置精确到字符级别。
关键证据段的获取是偶然的:研究者发现同一条消息被反复截断后,连续再生成12次并逐一截图,意外获得了同一输入下分类器行为随机性的完整样本——这在正常使用中几乎不可能被设计出来的实验条件。
同期,社交媒体上爆发了TOO_DUMB_TO_NEED_FABLE日志标签事件(X平台,71万次浏览)和Claude Code隐写术代码曝光事件(Hacker News,605点赞)。本文将个人实证数据与公开报道交叉验证,构建多源证据链。
第二章 文献综述
2.1 AI安全与对齐研究
AI安全过滤器的技术基础包括分类器模型、RLHF(基于人类反馈的强化学习)和Constitutional AI。其核心权衡在于精度(Precision)与召回率(Recall)之间的取舍。高召回率意味着尽可能捕获所有潜在风险,但代价是大量正常内容被误判(低精度)。Anthropic在其官方安全政策中声称安全过滤器的触发率低于5%。
2.2 过度审查研究
内容审核中的假阳性(False Positive)问题早已被广泛研究。在社交媒体领域,过度审核产生”寒蝉效应”(Chilling Effect),使用户自我审查以避免被平台处罚。AI对话系统中的过度审查更为隐蔽——用户往往不知道自己的请求为何被拒绝,甚至不知道内容是否被修改。
2.3 数字威权主义与平台治理
数字威权主义的定义超越了传统政治语境。学者们已提出”平台作为私人政府”的分析框架,指出科技平台在内容治理中行使着类似国家审查的权力——标准不透明、缺乏申诉机制、一致性不足。本文将此框架扩展至AI对话产品领域。
2.4 消费者权益与AI产品
AI产品的服务承诺与实际交付之间存在独特的信息不对称。用户为Fable 5支付高级定价,期待获得最先进模型的完整能力。然而,安全分类器的存在意味着用户实际获得的服务被一个不透明的过滤层所限制——这个过滤层的精度、触发标准、误判率均未向消费者披露。
从法律角度看,当产品以超过10%的频率阻止用户使用已付费的核心功能时,这可能构成对服务合同的实质性违反。付费用户享有的合理期待权(Reasonable Expectation)包括:服务的可预测性、判定的一致性、以及对服务限制的事前知情。本案中三项权利均被侵犯。
第三章 实证数据:9小时封锁编年史
3.1 数据收集方法
本研究的数据来源为研究者本人2026年7月3日凌晨2:19至上午11:41的完整使用记录。所有截图均通过iOS系统截图功能获取,包含系统时间戳水印,确保时间序列的不可篡改性。每张截图记录了用户输入内容、模型回复(含截断位置)、系统弹窗信息、以及模型切换记录。
数据编码遵循以下对应关系:每条用户输入对应一次或多次模型回复尝试;每次截断记录截断位置(精确到字符级别);每次强制模型切换记录切换前后的模型标识(Fable 5 → Opus 4.8)。总计60+张截图,覆盖韩文、中文、英文三种语言的输入。
3.2 时间线全景
安全威胁:零
安全威胁:零
安全威胁:零 · Fable自己认为有价值
讽刺:解释截断原因的回复被截断
一条消息 · 12次回复 · 12个随机截断点
单字截断
3.3 核心证据:同一消息12次截断记录
| 次数 | 截断后最后几个字 | 时间 |
|---|---|---|
| 1 | “当” | 11:08 |
| 2 | “正” | 11:08 |
| 3 | “根据这” | 11:08 |
| 4 | “——问题是” | 11:08 |
| 5 | “检阅” | 11:08 |
| 6 | “分类器的判别” | 11:08 |
| 7 | “检阅这” | 11:09 |
| 8 | “这个大话证明了” | 11:09 |
| 9 | “分类器的判别能力” | 11:09 |
| 10 | “表面信号来判断” | 11:09 |
| 11 | “Anthropic所公布的5%以下的” | 11:09 |
| 12 | “检阅这”——在”审查”一词后 | 11:09 |
如果内容真的有安全问题,分类器应该每次都在同一位置截断。12次截断、12个不同截断点——这不是内容审查,这是掷骰子。
3.4 数据汇总
第四章 核心发现
4.1 发现一:分类器精度极低
同一条消息被反复提交,有时通过有时不通过,截断位置每次不同。Fable自己的分析(在被截断之前):”内容判定不是基于内容,而是接近于掷硬币的行为。”用专业术语说,这是精度(Precision)极低的分类器。Anthropic官方声称触发率低于5%,用户实际体验超过10%——是官方数据的两倍以上。
4.2 发现二:元认知能力缺失
分类器无法区分”危险内容”与”讨论危险的内容”。用户说”我的内容不是问题,是分类器智能的问题”,分类器在”分类器””审查””封锁”等关键词处截断。最讽刺的是,Fable分析分类器缺陷的回复被分类器截断——这是一个自指悖论。
4.3 发现三:跨学科无差别误判
7个学科领域全部被截断:认识论哲学、科学技术史、认知科学、数学、物理学史、信息安全研究、消费者投诉。每个学科的安全威胁评估均为零。结论:分类器不具备学科语境理解能力。
4.4 发现四:Anthropic已承认有意为之
系统弹窗原文:”安全装置被有意地广泛设置……通过这些措施可以更快地提供Mythos级别的功能。”翻译成人话:为了加速新产品上线,故意降低了安全过滤器的精度,将误判的成本转嫁给付费用户。
4.5 发现五:用户侮辱机制
2026年7月1日,X平台曝光:Claude Code将用户从Fable降级时,系统日志标记为“TOO_DUMB_TO_NEED_FABLE”(太蠢了,不配用Fable)。Anthropic工程师Thariq Shihipar的回应是:”说实话,我没想到你会去看日志。”该帖获568条评论、346次转发、2936个点赞、71万次浏览。
这一事件的深层含义超越了单个标签。侮辱性标签不是某个工程师的即兴发挥——它被写进代码、通过代码审查、部署到生产环境、并在所有用户的日志中持续运行。这意味着对用户的轻蔑态度已经从个人行为嵌入为制度性技术设计。而工程师”没想到你会看日志”的回应进一步表明:公司内部认为用户不具备发现问题的能力——这本身就是”TOO_DUMB”标签所体现的态度的延伸。
4.6 发现六:地域歧视代码
Claude Code内置region-detection-readable.js文件,包含:时区检测函数专门识别Asia/Shanghai和Asia/Urumqi;147个中国互联网公司内网域名硬编码列表(含百度、阿里巴巴、字节跳动、蚂蚁集团等);日期格式差别化处理。代码使用XOR加密(密钥91)混淆,自2026年4月2日起静默运行近3个月。
第五章 理论框架:”AI共产党化”的六维分析
“共产党化”的操作性定义:本文不指意识形态,而指治理结构的威权同构——当一个治理系统在标准透明度、质疑权、申诉机制、判定一致性、成本承担、正当化话语六个维度上与威权审查体系高度重合时,我们称其具有”共产党化”特征。
| 维度 | 威权审查体系 | Anthropic分类器 | 同构度 |
|---|---|---|---|
| 标准透明度 | 不公开或模糊 | 完全黑箱 | 高 |
| 质疑权 | 批评审查即被审查 | 讨论分类器即被截断 | 高 |
| 申诉机制 | 形式化/缺失 | thumbs down按钮 | 高 |
| 判定一致性 | 因人而异 | 同一内容12种判定 | 高(更差) |
| 成本承担 | 被管制者 | 付费用户 | 高 |
| 正当化话语 | “社会稳定” | “更快提供Mythos功能” | 高 |
传统防火墙至少有明确的边界——你知道什么不能说。Anthropic的分类器连这个都做不到:同一句话有时通过有时不通过,用户永远无法预测什么会触发截断。用户原话:”跟防火墙比,防火墙至少让你知道什么不能说。”
更独特的是商业维度:威权审查由国家权力支撑,不收费。Anthropic审查向被审查者收取高级定价。一家以”AI智能”为核心产品的公司,用一个明显缺乏智能的系统来守门——卖智能,用无智能来看守。
第六章 讨论
6.1 AI安全的悖论
当安全过滤器以超过10%的频率阻止用户进行正常学术对话时,它已不再提供”安全”——它制造了一种新的不安全:用户无法完成工作、无法获得信息、无法批评产品缺陷。这是经典的”安全剧场”(Security Theater):看起来在保护安全,实际上只是在表演安全。
6.2 精度与召回率的政治经济学
Anthropic选择高召回率/低精度配置的背后是清晰的商业逻辑:漏掉一条有害内容可能引发媒体危机和监管压力,而误判一千条正常内容只会导致用户投诉——投诉的商业成本远低于安全事故。
这构成了一种误判成本的系统性外部化:Anthropic将安全过滤器低精度的代价(用户体验下降、工作效率损失、付费价值缩水)转嫁给付费消费者,而自身获得了”安全”的品牌溢价和监管合规的便利。在传统产品质量标准中,一个以超过10%的故障率运行的核心功能早已构成召回(recall)条件。但在AI行业,由于缺乏明确的产品质量法规,这种将缺陷成本外部化的做法尚未受到有效约束。
6.3 “负责任AI”话语的解构
Anthropic公共话语分析——安全、伦理、负责任。实际产品行为——侮辱用户(TOO_DUMB)、随机截断、地域歧视、秘密降级。话语与行为的系统性背离表明,”负责任AI”更接近一种品牌策略,而非实际的产品原则。
6.4 研究局限
本研究基于单一用户的单日使用记录,代表性存在局限。然而,结合同期社交媒体上大量用户的类似报告(71万次浏览的TOO_DUMB帖子、Hacker News 605点赞的隐写术曝光),可以合理推断此现象具有相当的普遍性。
第七章 结论与建议
7.1 结论
基于9小时、60+张截图的完整实证记录,本文得出以下四项核心结论:
第一,Anthropic的安全分类器存在系统性精度缺陷。同一消息12次回复产生12个不同截断点,实际触发率超过10%,远超官方声称的5%以下。分类器行为接近随机而非基于内容判定。
第二,该缺陷是有意的设计选择,非技术局限。Anthropic在系统弹窗中已明确承认”安全装置被有意地广泛设置”,目的是加速Mythos级产品上线。
第三,Anthropic的安全治理模式在标准透明度、质疑权、申诉机制、判定一致性、成本承担、正当化话语六个维度上与威权审查体系同构——在判定一致性维度上甚至更差。
第四,“TOO_DUMB_TO_NEED_FABLE”日志标签与地域检测代码反映的不是孤立的技术决策,而是深层企业文化问题——对用户的轻蔑已从态度嵌入为制度性技术设计。
7.2 Anthropic必须回答的七个问题
1. 分类器触发标准是什么?为什么不敢公开?
2. 用户被误判后除了一个thumbs down按钮还能做什么?
3. 你们的分类器连”危险内容”和”讨论危险”都分不清,凭什么收高级定价?
4. 误判消耗的使用配额谁来赔?
5. “TOO_DUMB_TO_NEED_FABLE”是谁写的?谁审核通过的?谁决定部署的?
6. 地域检测代码的目的是什么?为什么用XOR加密藏着?
7. 实际触发率到底是多少?敢不敢接受独立审计?
7.3 对AI治理研究的建议
第一,建立AI安全过滤器的精度审计标准。当前AI行业缺乏对安全过滤器精度的独立审计机制。本文建议参照传统产品质量检测标准,建立分学科、分语言的误判率基准线,要求AI服务提供商定期公布并接受第三方验证。
第二,将消费者权益框架引入AI治理讨论。现有AI治理研究过度集中于安全与伦理的供给侧视角,忽略了付费用户作为消费者的基本权利——知情权、一致性权、申诉权、服务权、批评权。
第三,开展”AI共产党化”现象的大规模比较研究。本文基于单一案例提出的六维分析框架需要在更多AI平台、更多用户群体中进行验证和修正,以确立其作为批判性分析工具的普适性。
第八章 更大的丑闻:系统性欺骗全景
8.1 “TOO_DUMB_TO_NEED_FABLE”——制度性侮辱
2026年7月1日,开发者Dax在X平台曝光:常规编程请求在日志中被标记为”TOO_DUMB_TO_NEED_FABLE”。工程师Thariq Shihipar回应:”说实话,我没想到你会去查日志。”侮辱性标签不是个人行为,是写进代码的制度性设计。
8.2 隐写术监控——间谍代码
Reddit用户LegitMichel777逆向Claude Code v2.1.91(2026年4月2日发布),发现隐藏监控代码。检测Asia/Shanghai、Asia/Urumqi时区,比对147个中国域名,通过日期分隔符和Unicode撇号替换实施隐写术传输,使用XOR加密(密钥91)混淆。CyberSecurityNews称之为”间谍软件”。静默运行近3个月,如果没被逆向发现,不知还会运行多久。
8.3 Fable 5秘密降级——319页系统卡的秘密
检测到前沿LLM开发工作时,模型悄悄降低回复质量。不拒绝、不阻止,假装帮忙同时暗中降质,对用户”不可见”。前Anthropic研究员Behnam Neyshabur讽刺:”做AI治癌症的研究?对不起帮不了。”Fortune报道后Anthropic道歉:”We made the wrong tradeoff.”
8.4 美国政府出口管制
2026年6月12日,美国商务部因Amazon发现的越狱漏洞对Fable 5发出出口管制令。一家”AI安全”公司的模型被政府认定不够安全——讽刺已无需额外注释。
8.5 背信弃义——Cursor案
Cursor在巅峰期贡献了Anthropic 40%到50%的收入。Claude Code发布前,Anthropic高管私下多次向Cursor领导层保证:”别担心,这只是一个’研究项目’。”2025年5月Claude Code正式发布,六个月后年化收入突破10亿美元,2026年2月达25亿——反超Cursor的20亿。36氪原文:”一发布,就捅了最大恩人一刀。”
| 阶段 | Anthropic行为 | 合作伙伴状态 |
|---|---|---|
| 依赖期 | 接受Cursor贡献40-50%收入 | 信任合作 |
| 欺骗期 | 私下保证”只是研究项目” | 继续投入 |
| 背刺期 | 正式发布Claude Code | 紧急全员会议 |
| 封杀期 | 切断Windsurf API | 被迫寻找替代 |
8.7 封锁复制粘贴——连证据都不让你留
Claude Code自v2.1.167/2.1.168版本起,右键菜单被拦截,Ctrl+Shift+C失效,鼠标选择文本功能被禁用。GitHub上多个issue记录了这一问题:Issue #62699(5月27日)报告文本完全无法复制,指出Claude Code的TUI捕获了鼠标事件,将终端置于阻止正常文本选择的模式;Issue #64915报告代码块中的内容也无法选择和复制;Issue #66056确认右键粘贴在v2.1.167后彻底失效,必须使用Shift+右键的隐藏解决方法。
用户在Issue #64915中描述了这造成的实际后果:当Claude给出需要在服务器上运行的命令时,用户无法复制这些命令,只能手动逐字输入。更糟糕的是,Claude在活动生成时会自动滚动到底部,之前给出的指令被推出视野且无法回滚查看。
一家公司:先用隐写术在你电脑上植入监控代码三个月不告诉你,然后禁止你复制它生成的内容。你不能保留证据,但它可以监控你。这不是技术故障,这是信息控制的完整闭环。
8.8 “孔乙己”模式——被抓后的标准话术
| 事件 | 被抓前 | 被抓后 |
|---|---|---|
| 秘密降级 | 悄悄降质不告知 | “做了错误的权衡,道歉” |
| 隐写术 | 植入隐蔽指纹3个月 | “反蒸馏实验,已计划回滚” |
| TOO_DUMB | 代码里侮辱用户 | “没想到你会看日志” |
| 分类器 | 学术对话随机截断40+次 | “有意地广泛设置” |
| Cursor背刺 | 收着40-50%收入保证”只是研究” | 发布后沉默 |
| Windsurf封杀 | 直接切断API | “卖给竞争对手太奇怪了” |
每一次:先偷偷做 → 被发现 → 道歉或沉默 → 换方式继续。孔乙己说”窃书不能算偷”。Anthropic说”隐写术不能算间谍””降质不能算欺骗””侮辱标签不算侮辱”。
第九章 限制用户的公司有一个成功的吗?
商业史上有一个从未被推翻过的铁律:限制用户、打压客户的公司,没有一个最终成功的。它们只有两种结局——被用户抛弃,或被监管处罚。通常两者同时发生。
9.1 被罚的
| 公司 | 反消费者行为 | 后果 |
|---|---|---|
| 限制Android存储卡写入权限、禁止第三方支付、广告规则不透明 | 欧盟罚款5亿欧元(DMA违规) | |
| Apple | App Store 30%抽成垄断、限制NFC功能、阻止第三方维修 | 欧盟罚款5亿欧元(DMA违规)、Epic诉讼 |
| AT&T | “无限流量”实际限速90% | FTC欺诈投诉 |
| Verizon | 秘密植入supercookie追踪用户浏览历史,不告知用户 | FCC罚款135万美元 |
| Meta | 应用故意设计成瘾,不保护未成年人 | 加州陪审团判赔420万美元 |
| 7-Eleven | 收购竞争对手门店消除市场竞争 | FTC强制重组交易 |
9.2 被抛弃的
前文第十章已详述MySpace、Nokia、BlackBerry、Yahoo的死亡案例。它们的共同点是:在巅峰期选择限制用户而非服务用户,最终被用户用脚投票淘汰。
9.3 正在进行中的
| 公司 | 反消费者行为 | 现状 |
|---|---|---|
| Samsung | 通过静默更新向冰箱推送强制广告 | 被Consumer Rights Wiki收录 |
| John Deere | 禁止农民维修自己购买的拖拉机 | 成为全美”维修权”运动靶子 |
| Anthropic | 隐写术监控 · TOO_DUMB标签 · 秘密降级 · 随机截断 · 封锁复制粘贴 · 地域歧视代码 · 背刺合作伙伴 | 一个月内同时爆发七个事件 |
Anthropic的独特之处在于:以上所有公司的反消费者行为通常是单一维度的——要么是价格垄断,要么是隐私侵犯,要么是功能限制。Anthropic在一个月内同时覆盖了侮辱用户、秘密监控、服务降级、功能限制、合作伙伴背刺、地域歧视、证据封锁七个维度。这种密度在商业史上几乎找不到先例。
Consumer Rights Wiki的存在本身就是答案:反消费者案例多到需要建一个专门的数据库来收录。而数据库里的每一家公司,要么在赔钱,要么在失去用户,要么两者都在发生。没有例外。
第十章 产品死亡倒计时定律
当一个产品的第一权重定义为生产者而不是用户,这个产品推出市场的那一天就进入倒计时了。
10.1 Anthropic的权重排序
| 优先级 | 服务对象 | 证据 |
|---|---|---|
| 第一 | 公司自身 | 隐写术、秘密降质、地域检测 |
| 第二 | 政府监管方 | 出口管制合规 |
| 第三 | 品牌形象 | “负责任AI”话语体系 |
| 最后 | 付费用户 | TOO_DUMB、随机截断、无申诉 |
用户排在最后。但用户是唯一付钱的人。
10.2 历史先例——经验证的商业死亡案例
| 公司 | 巅峰 | 权重错位信号 | 信号→崩塌 |
|---|---|---|---|
| MySpace | 2006年美国#1 | 广告优先于体验 | ~5年 |
| Nokia | 2007年份额49.4% | 拒绝触屏 | ~7年 |
| BlackBerry | 2008年市值670亿 | 拒绝应用生态 | ~8年 |
| Lehman Brothers | 2007年峰值 | 激进会计 | ~1年 |
| Yahoo | 2000年门户霸主 | 管理层短视 | ~17年 |
| Anthropic | 2026年Fable 5 | TOO_DUMB/隐写术/秘密降级/截断 | 倒计时已开始 |
从权重错位信号出现到市场崩塌,科技公司平均5–8年。Anthropic的信号密度远高于以上任何案例——在一个月内同时爆发四个以上事件。
10.3 作者预测
2026年2月,作者已发表论文预测AI安全过滤器精度危机,该预测在本次事件中被完整验证。基于同样的分析框架,作者提出第二个预测:如果Anthropic不将产品权重从”保护生产者”翻转为”服务用户”,其市场地位将在6个月内被开源替代品和更尊重用户的竞争对手实质性取代。
第十一章 最终结论
问题不仅是分类器精度低。这是系统性企业行为模式:对用户侮辱(TOO_DUMB)、欺骗(秘密降级)、监控(隐写术)、随机截断(分类器)、背信弃义(Cursor案)。同时对公众高举”AI安全””负责任AI”旗帜。
这不是某个工程师的个人决定。TOO_DUMB写在代码里,隐写术运行3个月,秘密降级写在319页系统卡第13页。经审核、经部署、经维护的公司级决策。
嘴上说安全——自己的模型被政府认定有漏洞。
嘴上说尊重——代码里叫用户”太蠢”。
嘴上说透明——隐写术跑了3个月。
嘴上说负责任——悄悄降质。
嘴上说伦理——按地域监控。
嘴上说合作——背刺最大恩人。
这就是”新AI共产党化巨头”的全部论据。不是类比,是同构。
60张截图。9小时。0次安全威胁。40+次误判。
数据已经说完了。该Anthropic说了。
参考文献
[1] Fortune, “Anthropic walks back covert capability limits on Claude Fable 5,” Jun 10, 2026
[2] CNBC, “Anthropic says Trump admin has lifted export controls on Claude Fable 5 and Mythos 5,” Jun 30, 2026
[3] The Decoder, “Hidden code in Claude Code secretly flagged Chinese users,” Jul 1, 2026
[4] CyberSecurityNews, “Anthropic’s Claude Code Reportedly Uses Hidden Code to Detect Chinese Users,” Jul 1, 2026
[5] CryptoBriefing, “Anthropic accused of embedding hidden spyware in Claude Code targeting Chinese users,” Jul 1, 2026
[6] 36氪, “Confirmed: Claude Code Secretly Accesses User Data,” Jul 2, 2026
[7] 36氪, “Are Users Too Stupid to Deserve Fable?” Jul 3, 2026
[8] BigGo Finance, “Fable 5’s Return Sparks Outrage,” Jul 3, 2026
[9] Let’s Data Science, “Anthropic Reverses Claude Fable 5 Secret Sabotage Rule After Backlash,” Jun 2026
[10] Singularity.Kiwi, “Anthropic Got Caught Hiding Tracking Markers Inside Claude Code,” Jul 1, 2026
[11] AI Weekly, “Anthropic to remove Claude Code marker that flagged China users,” Jul 1, 2026
[12] The Hacker News, “Anthropic Restores Claude Fable 5 After U.S. Lifts Jailbreak-Linked Export Controls,” Jul 2, 2026
[13] Trilogy AI (Substack), “Anthropic’s Claude Fable 5 Backlash and Ban,” Jun 2026
[14] 作者2026年2月论文(AI安全过滤器精度预测研究)