---
title: 'Dario 的开放权重立场：安全原则，还是 Anthropic 的利益叙事？'
description: '从开放权重风险、芯片管制、模型蒸馏、军事合作与监管成本五条证据链，分析 Dario Amodei 的政策主张、对华偏见和双重标准争议。'
pubDate: 2026-07-29
slug: dario-open-weights-safety-interest-china-bias
tags: [ai, anthropic, 开放权重, AI治理]
lang: zh-CN
draft: false
featured: false
showCTA: true
showComments: true
---

一家经营封闭模型的公司告诉你：高能力开放权重模型可能带来不可逆的安全风险，因此需要更严格的测试和限制。

这句话可能是真的，也可能刚好对这家公司的商业模式有利。更麻烦的是，两件事完全可以同时成立。

Dario Amodei 在 [《Our position on open-weights models》](https://www.anthropic.com/news/position-open-weights-models)中回应了外界对 Anthropic 的质疑。他否认主张全面禁止开放权重模型，却支持限制中国获得先进芯片、打击大规模违规蒸馏，并要求足够强的开放与封闭模型接受强制安全测试。

问题因此不只是“开放还是封闭”，而是三个更难的问题：

- 文章中的安全判断有多少证据？
- Anthropic 是否对自己和竞争者使用了不同标准？
- 它对中国的描述是在分析风险，还是先有威胁预设，再选择证据？

## 先说结论：安全担忧成立，利益中立不成立

我的判断是：

> Dario 提出的开放权重不可逆风险和按能力分级测试，方向上有合理性；但整篇文章不是中立的安全研究，而是一份将 AI 风险、美国国家安全和 Anthropic 商业利益绑在一起的政策文本。

这不等于已经证明 Dario 撒谎，也不等于 Anthropic 暗中做了自己禁止别人做的所有事情。当前证据能够支持的批评更具体：

1. Anthropic 把美国保持前沿 AI 优势当作安全前提，对中美军事和国家安全用途采用了明显不对称的风险基线。
2. 它把部分中国公司的可疑访问归因，进一步连接到中国政府支持和国家竞争，但公开证据不足以完整证明这条指挥链。
3. 它主张的评测、访问控制和受控部署，与 Anthropic 已经拥有的组织能力和封闭 API 模式高度兼容，存在把安全规范变成竞争壁垒的结构性风险。
4. 没有公开证据证明 Anthropic 秘密违规蒸馏竞争对手，也没有足够证据把这篇文章定性为操纵上市估值。

> **数据快照**
>
> - 最后核验：2026-07-29
> - Dario 原文：2026-07-27 发布，2026-07-28 编辑
> - Anthropic Responsible Scaling Policy：当前页面列出的最新版为 3.4，2026-07-08 生效
> - 证据范围：公开政策、服务条款、官方项目说明、行业公开信与英国 AISI 研究
> - 证据限制：无法从公开材料判断管理层的私人动机，也无法独立复核 Anthropic 未公开的蒸馏检测日志

## 先别把开放权重和开源混成一锅

Dario 使用的是 **open-weight models**，即开放权重模型，而不是严格意义上的开源 AI。

开放权重通常意味着模型参数可以下载、本地运行和修改，但训练数据、数据处理流程、完整训练代码和许可证未必同时公开。[Open Source Initiative 的 Open Source AI Definition 1.0](https://opensource.org/ai/open-source-ai-definition)要求的不只是权重，还包括足以理解和修改系统的数据说明与训练代码。

这个区别很重要。文章讨论的主要问题是：

> 当危险能力以可下载参数的形式扩散以后，部署者还能否持续监控、修补和撤回？

它并不是在完整讨论开源开发、数据透明、许可证自由和社区治理。

## Dario 真正提出了什么

文章并没有要求把开放权重模型一刀切掉。相反，Dario 明确说，不具备危险能力的开放权重模型是一种公共利益；禁止美国企业使用中国开放模型，也阻止不了真正的恶意使用者，反而更像是在保护美国 AI 公司。

他的政策方案可以压缩成三条：

1. 限制中国获得先进芯片和芯片制造设备；
2. 打击使用虚假账户、代理服务和大规模调用进行的违规蒸馏；
3. 对达到危险能力门槛的所有模型强制测试，不区分开放或封闭、美国或中国。

这比“Anthropic 反对开源”的标签更克制。真正的分歧不在文章有没有承认开放模型的价值，而在于它怎样定义危险、怎样解释中国的技术进步，以及谁来制定测试门槛。

## 开放权重的不可逆风险，不是 Anthropic 凭空发明的

开放权重确实带来封闭 API 很难提供的价值：私有部署、避免供应商锁定、更低成本、自由微调，以及必须接触权重才能开展的安全研究。由 NVIDIA、Meta、Microsoft、Mistral、Mozilla 等机构签署的[开放权重行业公开信](https://images.nvidia.com/pdf/Open-Weights-and-American-AI-Leadership.pdf)还强调，开放生态能够扩大竞争，让更多团队参与审计和防御。

但公开信也承认，权重发布后会离开原开发者控制，修改版本难以追踪和撤回。

英国 AI Security Institute 的[开放权重网络能力研究](https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber)给出了更直接的边界：开放模型可以被私有运行和修改，发布方却不能再统一封禁用户、升级分类器或撤回旧版本。研究同时发现，2026 年受测领先开放模型在网络能力上只落后此前沿封闭模型约 4 到 7 个月，但报告明确提醒，这个结果只覆盖其网络评测，不能外推到生物或其他风险。

因此，文章最扎实的结论是：

> 同样的危险能力，以开放权重形式发布后更难补救。

这句话不等于“开放模型一定更危险”。开放也可能让更多防御者获得能力。攻击方还是防御方获益更多，要看具体领域、实际能力和部署方式，不能靠“开放天然安全”或“封闭天然安全”提前作答。

## “没有美国芯片就无法超过美国”跨过了证据边界

Dario 把芯片管制描述成应对国家级 AI 竞争最直接的手段，这个方向不难理解：训练前沿模型需要大量计算资源，限制高性能芯片和制造设备会增加训练成本、集群建设难度与迭代时间。

问题出在文章使用了更绝对的推论：因为中国国内产能有限，加上 scaling laws，中国没有美国芯片就无法训练出比美国更强的模型。

文章链接的经典 [Scaling Laws for Neural Language Models](https://arxiv.org/abs/2001.08361)证明的是，在论文研究范围内，语言模型损失与模型规模、数据量和训练计算量呈稳定关系。它没有证明：

- 有效计算只能由美国品牌芯片提供；
- 算法、数据和训练效率无法部分抵消硬件差距；
- 更多低性能芯片不能通过工程投入组成可用集群；
- 蒸馏、强化学习、推理时计算和专用模型不会改变竞争路径；
- 出口管制能够永久决定另一个国家的模型能力上限。

所以，更稳妥的结论应是：

> 芯片管制能够提高成本、限制规模并延缓追赶，但 scaling laws 本身不能证明美国可以永久决定中国模型能力的上限。

文章把一个程度问题写成了接近必然性的判断。技术论文在这里提供了“算力重要”的证据，却没有提供“只有美国芯片才行”的证据。

## 蒸馏争议里，技术、违约和国家行为被叠在了一起

蒸馏本身是一种普通训练方法：让较小模型学习较强模型的输出。Anthropic 自己也在[蒸馏攻击报告](https://www.anthropic.com/news/detecting-and-preventing-distillation-attacks)中承认，前沿实验室会合法地蒸馏自家模型。

Anthropic 反对的是另一类行为。它声称 DeepSeek、Moonshot 和 MiniMax 通过约 2.4 万个欺诈账户，与 Claude 产生超过 1600 万次交互，违反服务条款和区域限制，并针对推理、工具使用与编码能力进行提取。报告称归因依据包括 IP、请求元数据、基础设施特征和部分合作方信息。

这些材料能够证明什么？

- 它们证明 Anthropic 公开提出了具体、可检验的公司级指控，而不是只说“我们怀疑有人蒸馏”。
- [Anthropic 当前商业条款](https://www.anthropic.com/legal/commercial-terms)确实禁止客户使用服务训练竞争模型，使用虚假账户和绕过区域限制也属于不同于“蒸馏技术本身”的行为。
- 但原始日志、归因规则和完整第三方复核没有公开，外部读者无法独立重放这次调查。
- 公司员工、代理基础设施或合作方的行为，也不能自动证明具体项目由中国政府下令、资助或协调。

Dario 的文章却从“中国公司进行了工业级违规蒸馏”，走到“这些行动得到一个试图超越美国的威权国家支持”。这一步可能有额外情报，但公开页面没有展示足以让读者复核的完整证据链。

因此，博客里最容易写错的一句话是：“中国公司靠偷 Claude 才追上美国。”现有公开材料最多支持：

> Anthropic 指控三家中国实验室以违规访问方式大规模提取 Claude 能力；该指控细节具体，但关键证据仍主要掌握在 Anthropic 手中，不能据此解释中国模型进步的全部来源。

## Dario 是否双标，要拆成五个不同问题

“双标”很有传播力，却容易把事实、推断和动机揉成一团。把问题拆开以后，证据强弱会清楚很多。

**表 1：截至 2026-07-29，五类双标质疑的公开证据与结论边界**

| 质疑                                    | 可以核验的事实                                                               | 当前能支持的判断                                             |
| --------------------------------------- | ---------------------------------------------------------------------------- | ------------------------------------------------------------ |
| Anthropic 暗中违规蒸馏竞品              | 本文核验的公开材料没有显示欺诈账户、绕过访问控制或未经授权提取竞品能力的证据 | 目前无充分证据，不能写成事实                                 |
| Anthropic 限制竞争者利用 Claude         | 商业条款禁止用 Claude 构建竞争产品或训练竞争模型                             | 限制确实存在；是否合法、合理要按合同、访问方式和具体行为判断 |
| Anthropic 一边反对军事 AI，一边服务美军 | Anthropic 从未普遍反对军事 AI；它公开为美国国家安全客户开发 Claude Gov       | 不是“嘴上反军事、暗地做军事”，而是公开的阵营化安全立场       |
| 强制评测会巩固 Anthropic 地位           | Anthropic 已有 RSP、评测、安全与政策团队，固定合规成本更容易由大公司承担     | 存在监管俘获和竞争壁垒风险，但不能据此证明垄断是唯一动机     |
| 文章是为了 IPO 或估值                   | 安全品牌和政策影响力客观上具有商业价值                                       | 缺少内部文件和因果证据，不能定性为估值操纵                   |

这里最值得警惕的不是一条尚未证实的“偷着干”故事，而是一套稳定的自我正当化结构：

> Anthropic 的扩张被解释成负责任地保持前沿；竞争者的扩张则更容易被解释成能力扩散、国家威胁或监管缺口。

这种结构不要求 Dario 主观上撒谎。一个人可以真诚相信 AI 风险，同时真诚相信“只有我的公司保持领先，才有能力解决风险”。问题在于，一旦公司利益和公共安全被这样绑定，外界就很难知道某项限制究竟减少了多少风险，又替既有企业增加了多少护城河。

## 对华偏见不在民族仇视，而在风险基线不对称

把文章说成针对中国人或中国文化的仇恨文本，并不准确。它反对全面禁止中国开放模型，承认低风险开放权重的公共价值，也主张测试规则原则上覆盖不同国家的开放和封闭模型。

但文章存在很强的美国国家安全预设。Dario 直接把中国共产党称为最有能力的威权威胁，担心中国模型带来永久军事优势和深度社会压制。[Anthropic 当前政策页](https://www.anthropic.com/policy)也明确表示，最强模型应继续由美国及盟友民主国家掌握，并支持通过芯片出口管制和反蒸馏措施维持这种领先。

与此同时，Anthropic 并不反对 AI 进入军事和情报系统：

- [Claude Gov](https://www.anthropic.com/news/claude-gov-models-for-u-s-national-security-customers)面向美国国家安全客户，覆盖战略规划、行动支持、情报分析和威胁评估，并降低模型处理机密材料时的拒答。
- Anthropic 与美国国防部的[两年期合作协议](https://www.anthropic.com/news/anthropic-and-the-department-of-defense-to-advance-responsible-ai-in-defense-operations)上限为 2 亿美元，包括在国防数据上开发原型，以及把 Claude 接入机密网络中的任务流程。

所以，Dario 的原则不是“军事和情报 AI 本身危险”，而更接近：

> 民主国家在制度约束下发展军事 AI 是安全保障；威权国家获得同等级能力则是全球威胁。

这是一种可以公开辩论的政治立场，但不是中性的技术结论。文章没有对称分析美国军事和情报系统误用 AI、扩大监控或改变国际权力平衡的风险，也没有展示为什么同类能力在美国制度中就足以受到控制。

因此，更准确的定性是：文章没有充分证据表明其仇视中国人，却明显带有对中国政府和中国 AI 产业的威胁预设。它倾向把中国企业、国家产业政策、政治制度与军事竞争放进同一条因果链，同时把美国领先视为默认更安全的状态。

## 安全监管怎样避免变成大公司的梯子

Dario 提出的“按能力测试，而不是按开闭源或国籍划线”值得保留。真正需要补上的，是防止规则只对后来者昂贵、只由前沿公司定义。

一个更对称的框架至少需要五层约束：

1. **同能力同规则。** 开放权重、封闭 API、美国模型和中国模型达到同一危险能力门槛时，接受相同等级的评测。
2. **模型与系统分开测。** 裸模型、工具调用、Agent 脚手架和安全措施移除后的能力不能混成一个分数。
3. **第三方参与制定门槛。** 评测机构、学术界、开放模型社区和中小企业共同参与，避免一家公司的内部 RSP 直接变成全行业准入证。
4. **给小团队低成本通道。** 政府或公共机构承担基础评测成本，并公开豁免、申诉、复测和规则失效机制。
5. **按行为治理蒸馏。** 区分自家模型压缩、授权使用、普通输出学习、虚假账户、绕过访问控制、合同违约与可证明的知识产权侵害。

开放权重也可以采用分阶段发布：先让独立评测机构和受约束研究者访问，再依据实际能力、可移除的安全措施和领域风险决定是否全面发布。这个方案未必适用于所有模型，但比“开放天然安全”和“权重永远不能放出”更接近可验证的治理。

## 最终判断：不要猜动机，先检查标准是否对称

Dario 的文章最有价值的地方，是把开放权重风险从许可证争论拉回到能力、部署和不可逆性。它最薄弱的地方，则是把美国领先、中国威胁和 Anthropic 的受控部署模式写成近乎同一套安全结论。

判断这类公司政策文，不必先猜 CEO 心里到底想什么。可以先问四个更可验证的问题：

- 同一种能力，落在开放和封闭模型上是否使用同一门槛？
- 同一种军事或情报用途，发生在美国和中国时是否使用同一风险标准？
- 同一种利用他人模型输出的行为，是否按访问方式、授权和证据判断？
- 一项安全规则的固定成本，是否会把现有大公司的内部能力变成行业门票？

如果四个问题都能对称回答，安全主张才更接近公共规则；如果答案总是“Anthropic 可以继续做，但竞争者需要先被限制”，那么即使每一条风险都不是虚构，整套制度仍可能把安全变成一架只允许少数公司使用的梯子。

这也是本文对 Dario 最终的判断：他很可能真诚相信前沿 AI 风险，但他的风险观、美国国家安全立场和 Anthropic 商业利益高度同向。我们不需要把他想象成一个秘密策划所有事情的反派，也应该对这种三者同向保持足够警惕。

## 参考资料

- [Dario Amodei：Our position on open-weights models，2026-07-27](https://www.anthropic.com/news/position-open-weights-models)
- [Anthropic：Detecting and preventing distillation attacks，2026-02-23](https://www.anthropic.com/news/detecting-and-preventing-distillation-attacks)
- [Anthropic Commercial Terms of Service，2025-06-17 生效](https://www.anthropic.com/legal/commercial-terms)
- [Anthropic Responsible Scaling Policy，最后核验 2026-07-29](https://www.anthropic.com/responsible-scaling-policy)
- [Anthropic AI policy，最后核验 2026-07-29](https://www.anthropic.com/policy)
- [Anthropic：Claude Gov models for U.S. national security customers，2025-06-06](https://www.anthropic.com/news/claude-gov-models-for-u-s-national-security-customers)
- [Anthropic 与美国国防部合作说明，2025-07-14](https://www.anthropic.com/news/anthropic-and-the-department-of-defense-to-advance-responsible-ai-in-defense-operations)
- [Open Weights and American AI Leadership，2026-07-24](https://images.nvidia.com/pdf/Open-Weights-and-American-AI-Leadership.pdf)
- [UK AISI：How Far Behind the Frontier are Leading Open Weight Models on Cyber?](https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber)
- [Open Source AI Definition 1.0](https://opensource.org/ai/open-source-ai-definition)
- [Scaling Laws for Neural Language Models，arXiv:2001.08361](https://arxiv.org/abs/2001.08361)
