当最强 AI "泄密":Claude Mythos 在安全框架下被谁塑造、被谁恐惧?
我关注 Anthropic 的产品动态已经两年多了,从 Claude 2 到现在的 Opus 4,每次迭代都有值得讨论的技术细节。但这次不一样——一篇被意外公开的内部博文草稿,把一个从未宣布的模型名字推到了聚光灯下:Claude Mythos。
我花了两天时间追踪这件事的信息源,读了几十篇中英文报道和技术讨论。说实话,到目前为止能确认的事实比想象中少,但有一些判断是可以做出的。
发生了什么
据《财富》杂志和多家媒体的报道,Anthropic 的内容管理系统(CMS)出现了配置错误,大约 3000 份与官网博客相关的内部资产被短暂暴露在公网上。其中包括一篇未发布的博文草稿,里面第一次提到了"Claude Mythos"这个名字。
剑桥大学和 LayerX Security 的安全研究者在例行扫描中发现了这些公开缓存,随后向 Anthropic 披露。访问权限被很快收回,Anthropic 方面将此事归因于"人为配置错误"。
Anthropic 后来的公开回应承认确有一批"早期草稿"被误公开,但强调这些文稿"不代表最终产品或对外表述"。 同时,LinkedIn 上有业内人士确认 Anthropic 内部正在测试一个名为 Claude Mythos 的新模型,但尚未正式发布。
这意味着什么?泄漏事件本身是真实的,涉及的模型名称和定位也确实存在于 Anthropic 内部文档中。至于那些草稿里的具体数字和措辞,要打个折扣来看——毕竟 Anthropic 自己也说了,那些是早期版本。
草稿里写了些什么
根据目前能追溯到的泄漏文本和多家媒体的交叉报道,大致可以整理出以下信息:
名称和代号。 对外叫 Claude Mythos,内部代号是 Capybara。多个信源确认了这一点。值得注意的是,草稿把它描述为一个全新的"层级",而不是 Opus 的迭代版本——这和 Anthropic 过去用 Sonnet/Opus/Haiku 划分产品线的做法有区别。
定位。 Mythos 在推理、代码生成和学术基准测试上"明显超过" Claude Opus 4.x。几家技术分析把它类比为跨代跃迁,类似于当年 GPT-3 到 GPT-4 那种幅度,而不是同一代里的性能调优。
能力方向。 草稿花了大量篇幅讨论网络安全。模型在漏洞发现、利用代码生成、攻击路径模拟方面的能力远超现有模型。这直接导致了下一项——
为什么没发布。 泄漏资料显示 Mythos 处于封闭测试阶段,初期只面向少数企业和机构客户,重点场景包括链上资产防护、企业安全运营、复杂系统审计。草稿中还提到一场在欧洲举办的邀请制 CEO 闭门峰会,用来向大客户推介。
参数规模:10T 的说法靠不靠谱
这是我认为最需要谨慎对待的部分。
一篇中文技术文章声称 Claude Mythos "拥有 10T 参数规模",并据此推算训练和推理成本。但这篇文章没有提供原始文档截图或可验证的引用,属于推断性质的二手信息。
其他媒体(包括《财富》的转述)更保守,只说"规模和能力都显著高于 Opus",没有给出具体数字。
根据我对 Claude 3.x/3.5/3.7 系列的跟踪,业界普遍猜测主力模型参数在 100B 级别以上,但这些数字本身就是基于推理时间和硬件成本的估算,不是官方数据。
所以我的判断是:
Mythos 的参数规模确实大于 Opus,这一点有多个信源交叉支持。但"10T"这个具体数字,目前没有可靠来源。它更像是社区的猜测,可能对了,也可能差了一个数量级——在没有更多信息之前,我倾向于把它当作一种量级猜想,而不是事实。
能力画像:从泄漏文本能推断出什么
在承认信息有限的前提下,结合 Anthropic 现有模型的技术路线,我认为以下几个方向是合理的推测:
推理与多步规划。 草稿强调 Mythos 在长链条推理、跨文档整合和工具调用任务上优于 Opus。如果这一点属实,它会在大型代码库分析和长周期代理任务上有明显提升。当前 Claude 系列已支持 200k tokens 上下文(部分支持 1M),新一代很可能继续强化这一优势。
代码与安全能力。 这是最受关注的部分。多个信源一致提到,Mythos 在漏洞利用思路、渗透测试和安全审计方面的能力"过于强大",这是 Anthropic 内部将其评估为高风险的核心原因。如果模型能系统性地理解框架和协议栈弱点,并自动组合利用链,那对现有安全基线确实构成压力。
安全对齐的边界。 草稿提到,现有安全防护和对齐技术在 Mythos 上暴露了更多边缘案例和潜在绕过路径。这也是为什么 Anthropic 选择在封闭环境内测试,而不是直接开放公测。
概括来说:Mythos 大概率是在现有 Claude 系列的长上下文、工具调度能力基础上,进一步强化了安全分析和复杂系统理解。它既是生产力工具,也是潜在的安全风险放大器。
"太危险所以不发布"——这话能信吗
这个问题我反复想了很久。
从泄漏文本的语气看,Anthropic 确实把网络安全风险放在了核心位置。"可能被用于高级网络攻击""显著降低攻击门槛"这样的措辞反复出现。 但同时,这种"太危险所以暂不公开"的叙事,和 Anthropic 一贯的"安全优先"品牌定位高度吻合——说难听点,它天然具有营销效果。
不过,把它简单归为营销噱头也不公平。原因有两点:
第一,模型能力越强,在攻击和防御两侧的增益确实都会放大。GPT-4 级别的模型已经能写 exploit POC、自动挖简单漏洞了,更强的模型在这方面需要重新评估风险,这不是空话。
第二,这次泄漏是通过 CMS 配置错误被动发生的,不是精心投放的"神秘物料"。暴露的内容不只有 Mythos 文稿,还有 CEO 峰会安排等商务信息。一家主打安全的公司主动泄露客户和商务信息来做营销?逻辑上说不通。
我更倾向于这样理解:底层是一次真实的运营失误。事件被曝光后,Anthropic 和媒体自然会围绕"能力很强但存在风险"这个框架进行叙事,客观上确实起到了品牌传播效果。但这和策划一场"假泄漏"是两码事。
对行业的实际影响
抛开舆论喧嚣,我认为以下几点值得关注:
能力标杆在移动。 如果 Mythos 在推理和安全任务上的表现属实,它会把"顶级模型"的能力线上移,竞争对手不得不在安全风控和评估基准上跟进。这对整个行业的技术标准有实际推动。
安全社区需要加速适应。 大模型正在成为攻防两端都不可忽视的工具。防御方需要把它纳入安全审计的核心工具链,攻击方也在学习利用它。双方的策略和制度都需要适配这个现实。
企业客户先吃到红利。 从泄漏文件看,Mythos 第一波面向的是高价值企业场景,不是普通开发者。这意味着顶尖能力会经历一段"企业内测先行、公众产品滞后"的阶段。
怎么理性跟进这件事
如果你和我一样在关注这个话题,建议注意以下几点:
"Claude Mythos 这个模型存在并且在内部测试中"——这一点可信度很高,有官方承认的泄漏和多源交叉验证。
具体参数量、基准测试分数——目前都是间接信息,不能当作规格书。10T 参数的说法尤其需要保留判断。
"太危险所以不发布"——既有真实的安全考量,也有品牌叙事的成分。既不要全信,也不要全否定。
真正会影响开发者的是接入方式:什么时候、通过什么渠道开放 API,是否通过 AWS Bedrock 等云服务提供,有没有安全审计的专用工具链。这些目前都没有正式公布。
后续值得跟踪的信号:Anthropic 官方博客是否出现 Mythos 相关更新;AWS Bedrock 的模型列表和路线图变化;安全社区关于 AI 辅助攻防的标准讨论和监管动向。
参考文献
: Economic Times. "Claude Mythos leak spills details on Anthropic's new AI model, its most powerful yet." 链接
: Firstpost. "Anthropic's Claude Mythos leak reveals powerful new AI model with serious cyber risks." 链接
: 火星财经. "Claude Mythos 相关报道." 链接
: 搜狐. "Claude Mythos 报道." 链接
: KuCoin. "Anthropic accidentally leaks upcoming Claude Mythos model, outperforms Opus in cybersecurity." 链接
: 掘金. "Claude Mythos 技术分析." 链接
: X/Twitter. Sino_Market 相关推文. 链接
: LinkedIn. Boucetta Abderahmane 关于 Anthropic 测试 Mythos 的帖子. 链接
: Smythos. "Claude 3.7 Sonnet: An in-depth analysis." 链接
: AWS. "Amazon Bedrock — Anthropic." 链接
















