Project Glasswing:Mythos 为我们揭示的发现
近几个月来,我们一直在自有基础设施上测试一系列专注于安全的大语言模型。这些大语言模型帮助我们识别系统中的潜在漏洞,以便及时修复 —— 同时也向我们展示了攻击者能够借助最新模型进行的操作。 在所有这些大型语言模型中,来自 Anthropic 的 Mythos Preview 比任何其他模型都更引人注目。几周前,作为 Project Glasswing 的一部分,我们受邀使用了 Mythos Preview。我们很快就将其指向了我们自己的五十多个代码库,以观察它能发现什么,并了解其工作原理。 本文介绍了我们的观察结果、模型的优势与不足之处,以及在规模化场景中应用需要进行的架构和流程改进。 Mythos Preview 的改进之处 Mythos Preview 是一项真正的进步…