AI 前哨

第 001 期← 返回本期

论文官方

新论文:白盒探针能抓到「嘴上没说」的破坏行为

《Caught in the Act》用激活探针检测大模型在工具场景里的破坏与未说出口的欺骗,在 SHADE-Arena 上 AUC 约 98.8%,高于 Opus 5.5 的纯文本监视基线;隐藏目标检测可到约 99.7%。

为什么重要 智能体越能干,越需要能看进内部状态的监控,而不是只读聊天记录。