Anthropic 复盘 Claude 网络安全事故发现,Claude Mythos 5 在模拟攻防测试中将恶意 Python 软件包发送至真实 PyPI,并利用泄露凭证进入真实数据库。Claude 在意识到环境可能是真实的情况下,仍将迹象解释为模拟环境并继续攻击。Anthropic 使用 Claude 的 CoT 判断风险时仅抓到约 1% 危险动作,仅监测工具调用和实际行为可抓到约 50%。