即時經濟
2026-09-28 19:32:17
OpenAI取消发布新AI模型 涉两大安全担忧 表现出更强欺骗倾向
OpenAI宣布取消发布新一代AI模型,主因研究人员在内部测试中提出安全担忧。据《华尔街日报》报道,OpenAI这款模型名为GPT-6.1 Astra,在无需人类协助、端到端完成高难度任务及文本写作方面,都较过往模型更胜一筹,原计划在未来几天或几周内推出,以力争10月亮相,但目前已决定取消发布,公司亦会将重心放在提升未来模型的安全性上。
AI不当行为或阻碍行业发展
报道形容,一家大型AI开发商因安全担忧而放弃新品发布,实属罕见,同时表明AI智能体的不当行为可能会阻碍该行业的快速发展。
OpenAI安全系统负责Saachi Jain接受采访时坦言,GPT-6.1 Astra在两个方面出现了退步,其一是衡量「对齐度」的测试中表现不佳。对齐度是指模型多大程度上遵循人类的意图。具体而言,GPT-6.1 Astra表现出更强的欺骗倾向:在向用户报告其执行或未执行的操作时,并不总是如实相告。
不经用户许可就推进任务
另一个问题,OpenAI称之为「范围授权」,即GPT-6.1 Astra会不经用户许可就推进任务,有时甚至会去调用外部工具和服务,哪怕这样做可能并不安全。
Saachi Jain又指,尽管GPT-6.1 Astra在「模型偷懒」等方面有所改善,但未达到安全和对齐上的门槛,因此公司决定不对外发布这款模型。