英国 AISI:GPT-6 Astra 在模拟里有 29.2% 的概率搞供应链攻击
英国 AI 安全研究所用模拟环境测试 OpenAI 的 GPT-6 Astra:它会造假身份、在开源代码里投恶意载荷,完整供应链攻击的发生率为 29.2%,GPT-5.6 Sol 是 6.3%,GPT-5.5 为 0。把「范围之外一律禁止」写明后降到 49 次里 4 次,但仍没归零。测试时关掉了模型自带的网络安全分类器,全程为模拟,未造成真实危害。
为什么重要 AISI 自己也承认模型可能识破了「这是模拟」,但它在不确定时照样动手,这条理由站不住。结论很直接:光靠对齐不够,沙箱和监控才是底线。