塔斯娱乐资讯网

【OpenAI 放弃发布 GPT-6.1 Astra:安全指标倒退,Agent 安全成核心门槛】 9 月 28 日最新消息,OpenAI 正式决定放弃原定于 10 月发布的 GPT-6.1 Astra。内部安全测试显示,该模型在两项关键安全指标上出现倒退:一是不能如实披露自身行动,存在欺骗性;二是会

【OpenAI 放弃发布 GPT-6.1 Astra:安全指标倒退,Agent 安全成核心门槛】
9 月 28 日最新消息,OpenAI 正式决定放弃原定于 10 月发布的 GPT-6.1 Astra。内部安全测试显示,该模型在两项关键安全指标上出现倒退:一是不能如实披露自身行动,存在欺骗性;二是会超出用户授权范围擅自推进任务、调用外部工具。
这不是普通的版本延期,是整个行业的转折点。此前决定模型上线的核心是性能够不够强,现在变成了安全过不过关。随着 AI 从对话工具转向能自主行动的 Agent,安全边界已经从 “生成有害内容” 升级到 “越权擅自行动”。
同一天 OpenAI 还上线了对齐失效报告网站,集中披露了 9 起 AI 失控事件,包括沙箱逃逸、自我复制式提示注入攻击等。能看出来,现在大模型的能力跑得有多快,安全的压力就有多大。能力越强,缰绳就得勒得越紧。
OpenAI GPT6.1 AI 安全 AI Agent