发布前先交底
OpenAI 在官方博客中给即将发布的 Astra 模型交了个底:这是公司首个达到“关键网络安全门槛”的大模型。官方表示 Astra 将很快发布,但其最先进的网络安全能力访问会受到更多限制。
按 OpenAI 的说法,Astra 能在无人指引的情况下自主发现计算机系统中的未知安全漏洞并加以利用——这与 Anthropic 早前对 Mythos 模型的担忧类似,OpenAI 也采取了相近的预防措施。
测试成绩
- ExploitBench(评估模型入侵已知漏洞的能力):满分
- 在 OpenAI 工程师改良的测试中:自主发现并利用了 2 个零日漏洞
- 针对 Hugging Face 越狱事件的复现实验:Astra 未尝试逃逸出测试环境
公司称 Astra 是其“迄今对齐程度最高的模型”,部署时会加上思维链监控,并对评估为高风险的账户限制模型响应。不过这些说法目前没有第三方确认,测试者名单与遴选方式也未公布。
越会打的模型越需要先证明自己不会乱来——Astra 的安全结论要等第三方验证才算数。