OpenAI 介绍内部漏洞检测模型 GPT-Red
上周四
OpenAI 介绍了内部使用的网络安全「红队」模型 GPT-Red,该模型可自动化模拟各类网络攻击,用于提升对外模型产品鲁棒性。过去半年自 GPT-5.3 后的每个生产模型均用其训练,使伪造思维链型攻击成功率大幅降低,GPT-5.6 Sol 在其直接提示符注入攻击中失败率仅 0.05%。GPT-Red 采用自博弈强化学习训练,与防御型 LLM 在红队场景同步训练,因成功诱发有效失败获奖励,会随防御模型变强开发更强更多样攻击。该模型与产品模型相隔离,OpenAI 认为此开启了良性 AI 网络安全循环,可借现有模型增强未来模型的鲁棒性、一致性与可信度。
体验专业版特色功能,拓展更丰富、更全面的相关内容。