AI 2026-07-03 104

今天 Claude Fable 5 回归,王炸级别的存在

老张

资深系统架构师

封面-Claude Fable 5回归

6月12日被美国政府以出口管制强制下线,6月30日管制解除,7月1日正式回归全球用户。Claude Fable 5 这短短18天的"被禁之旅",让全世界看到了美国对待前沿 AI 的真实态度——以及 Anthropic 在安全、商业和国家利益之间的艰难平衡。


这是一场什么样的风波?

先捋一下时间线:

6月12日,美国商务部突然下令,要求 Anthropic 对 Claude Fable 5 和 Claude Mythos 5 实施出口管制——也就是说,这两个模型不能向任何外国公民提供服务,包括 Anthropic 自己的非美籍员工。

问题在于,Anthropic 根本没有能力实时验证每一个用户的国家籍。所以 干脆一刀切,两个模型对全世界的所有人都关了

消息一出,整个 AI 圈炸了。


导火索:一个 jailbreak

事情起因是 Amazon 的研究团队发现了一个针对 Fable 5 的 jailbreak(越狱提示词)。

简单说,就是一个精心构造的 prompt,能让模型绕过它的安全护栏。根据 Anthropic 的说法,这个 prompt 成功诱导模型标记了几个软件漏洞,甚至写了一段利用代码来演示漏洞的危害。

Anthropic 方面极力淡化这件事,表示同样的手法在其他模型身上一样管用——包括它自家的 Claude Opus 4.8、OpenAI 的 GPT-5.5,甚至中国的 Kimi K2.7。Anthropic 认为这属于常规的防守型安全工作,不是什么隐藏的超能力。

但美国政府,以及举报这件事的 Amazon,显然不这么看。

⚠️ 关键分歧:同一个 jailbreak,Anthropic 看是"常规安全测试",政府看是"足以触发紧急管制的安全事件"。


Amazon 在这件事里的角色

据《华尔街日报》等多家媒体报道,Amazon 的研究和 CEO Andy Jassy 的关切,是推动出口管制令落地的关键力量。

Anthropic 和 Amazon 的关系本来就很微妙——Amazon 是 Anthropic 的最大投资方之一,但双方对模型安全的判断标准似乎并不一致。

前白宫 AI 沙皇 David Sacks 更是公开指责 Anthropic "将消费者模型的持续提供置于安全之上"。

但也有学者认为这是一次过激反应。悉尼大学 AI 治理研究员 Francesco Bailo 对半岛电视台表示,撤销管制说明政府也承认自己反应过度了。一群安全领袖还联名公开信,要求解除管制。


如何解决的?

为了平息政府的担忧,Anthropic 专门训练了一个新的 安全过滤器(classifier),专门检测举报中提到的越狱技术。公司声称,这个分类器能拦截 99% 以上的该类型尝试

被拦截的请求会被转交给更弱的 Opus 4.8 处理,用户会收到提示。但代价是——正常编码和调试时,误报率也上升了。

最终拍板解除管制的,是 商务部长 Howard Lutnick。他在6月30日的信中表示,商务部花了两周时间与 Anthropic 一起审查模型。Anthropic 方面也做出了承诺:

  • 🔹 主动搜寻安全漏洞
  • 🔹 在未来的模型发布前与政府协调
  • 🔹 报告发现的所有恶意使用行为

值得一提的是,主导这次谈判的是 Anthropic 联合创始人 Tom Brown,而非 CEO Dario Amodei。背后原因是 Amodei 今年以来与特朗普政府的关系一直比较紧张。


Mythos 5 呢?更猛,也更受限

前面提到与 Fable 5 一同被禁的还有 Mythos 5。这个模型和 Fable 5 用了同样的底层技术,但安全护栏更少

它的回归更缓慢:6月26日,Mythos 5 先向大约 100 家美国公司和联邦机构(主要负责关键基础设施防御)恢复访问。Anthropic 表示还在与政府协商进一步扩大访问范围。

Mythos 5 的能力有多强?Anthropic 在今年春天测试过一个更早版本的 Mythos 模型,结果它按照命令 发现了所有主流操作系统和浏览器上的零日漏洞——甚至包括 OpenBSD 中一个存在了 27 年的漏洞。红队把最新披露的漏洞转化为可用 exploit,不到一天时间。


更大的背景:中美 AI 竞赛

这场风波背后,始终有一个更大的阴影——竞争

禁令实施的时候,恰恰是廉价、开源的国产大模型在迅速追赶的时期。多位科技高管警告说,冻结美国模型等于是把市场拱手让给中国竞争对手,等于白送追赶时间。

这个故事的终局,还远没到。

OpenAI 前几天刚发布的 GPT-5.6,同样选择了小范围的政府审批内测,而非公测。白宫在6月2日签署了一项行政令,为前沿模型设立了自愿审查路径,但 Fable 5 根本没有走那条路——政府直接用了出口管制。

当一个超级大国对前沿 AI 没法走正规流程的时候,就只能靠"即兴发挥"。


Anthropic 的下一步

Anthropic 还在推动一件行业一直缺少的事——一个共享的 jailbreak 危险等级评定标准。他们和 Amazon、Microsoft、Google 等伙伴合作,计划从四个维度给越狱攻击打分:

① 攻击的复杂程度 判断绕过安全护栏需要多高明的技巧。是简单的 prompt 工程,还是需要深度技术知识?越简单的攻击,越需要紧急修复,因为门槛低意味着任何人都能复现。

② 所需用户交互 攻击需要用户配合到什么程度?是无感的零点击攻击,还是需要用户手动复制粘贴某个提示词?交互越少,危险系数越高。

③ 对关键基础设施的潜在影响 这是最核心的判断标准。一个能诱导模型输出电网、银行、医疗系统攻击代码的 jailbreak,与一个只能生成垃圾内容的 jailbreak,完全不是一个量级。

④ 可扩展性 攻击能否自动化?如果写一个脚本就能批量利用,危害会被指数级放大。不可扩展的攻击虽然也需关注,但不至于触发紧急管制。

对于最严重的等级(比如能攻击电网或银行的 jailbreak),Anthropic 表示一旦确认就会立即部署修复,并组建一个 7×24 小时全天候监控 jailbreak 攻击报告的团队。

他们还开通了 HackerOne 计划,欢迎安全研究员报告新的 Fable 5 越狱方法,并承诺让美国政府提前测试未来的前沿模型。

今天 Claude Fable 5 回来了。但这场关于"安全 vs 竞争力"的辩论,才刚刚开始。

本文由老张整理编写,信息综合自 The Hacker News、CNBC、MacRumors、The Wall Street Journal、Al Jazeera 等公开报道。

分享:
返回文章列表