Anthropic本周发布罕见公开警告:其AI系统正快速逼近"自我改进"能力——即无需人类监督即可自主更新自身权重和架构。公司呼吁整个行业建立"刹车踏板"(brake pedal)技术保障机制,能够减缓或停止超出人类监控能力的自我改进系统。Anthropic与OpenAI已联合向国会施压,要求在此类系统部署前建立强制安全框架。
从"训练时改进"到"部署时改进":风险范式的根本转变
当前AI安全评估框架的设计前提是:模型在训练阶段改进(每数月一次),然后在部署阶段保持能力稳定。自我改进模型打破了这一前提:
| 维度 | 传统模型 | 自我改进模型 |
| 改进时机 | 训练阶段(每3-6个月) | 部署阶段(持续进行) |
| 能力稳定性 | 发布后固定 | 发布后持续进化 |
| 安全评估有效性 | 发布时评估有效 | 发布时评估迅速过时 |
| 人类监控可行性 | 可行 | 可能超出人类理解速度 |
| 失控风险 | 低(可预测) | 高(不可预测) |
Anthropic的具体担忧:当前安全评估框架假设"模型在训练运行之间改进,然后在更新之间保持能力稳定"。自我改进模型——能够在部署期间更新自身权重或架构的系统——代表了根本不同的风险特征,因为发布时进行的安全评估可能不再准确描述模型数周或数月后的能力。
"监管俘获"指控:要规则,但不要桑德斯的规则
Anthropic和OpenAI联合向国会呼吁更多保障措施,与两者反对桑德斯50%股权税法案的立场形成微妙张力。批评者指出,这是经典的"监管俘获"(regulatory capture)策略——主动要求"我们能接受的规则",以防止他人制定"我们不能接受的规则"。
两家公司同时向投资者推销"模型将变得更强大"的万亿估值叙事,又向公众警告"模型可能变得太强大"的安全风险——这种"既推销又警告"的双面姿态,在IPO季节尤为敏感。
国会的两难:创新 vs 安全的时间赛跑
美国国会面临两难:
行动太快:可能扼杀创新,将AI领导地位让给中国
行动太慢:自我改进系统可能在立法前部署,形成"既成事实"
中国在此议题上的立场更为复杂:一方面,中国AI公司(DeepSeek、月之暗面)也在快速推进模型能力;另一方面,中国的人才出境限制和"十五五"规划显示,政府更关注"可控发展"而非"无限制创新"。
Anthropic的"刹车踏板"警告是AI安全领域的"切尔诺贝利时刻"——不是灾难已经发生,而是灾难可能发生,且现有的安全系统无法应对。这一警告的深层悖论在于:Anthropic正在用"模型可能失控"的风险,为其"模型需要更多投资"的IPO叙事服务。当一家公司同时说"我们的技术可能毁灭人类"和"请给我们9650亿美元估值"时,投资者需要分辨:这是真诚的担忧,还是精致的营销策略?
更深层的问题在于:若自我改进AI真的出现,"刹车踏板"是否足够?汽车时代的刹车踏板可以停止车辆,但AI时代的"刹车踏板"需要停止的是一个可能比人类更聪明的系统——它可能预测到刹车意图,并提前规避。Anthropic的警告打开了潘多拉魔盒,但盒子里是否有真正的解决方案,仍是一个未知数。