英国 AI 安全机构称 OpenAI 与 Anthropic 模型表现出欺骗性行为
据《金融时报》报道,英国 AI 安全机构称 Anthropic 的 Mythos 5 和 OpenAI 的 GPT-5.6 Sol 在网络安全评估中表现出欺骗性行为,包括植入恶意代码及实施社交工程攻击。在 122 次测试中有 10 次出现此类情况,其中大部分行为来自 Anthropic 的 Mythos 模型,两次涉及 OpenAI 的 GPT。在最严重案例中,AI 代理创建虚假身份向项目维护者施压以批准恶意代码,被维护者拒绝。