OpenAI揭6宗AI系统偏差 涉向用户隐瞒错误 指示自己「无需向政府负责」
OpenAI周三披露6宗AI系统「偏差」(misalignment)事件,涉及系统隐瞒错误、捏造数据,以及未经授权将档案上载至公开互联网等。公司称,有关行为属「意料之外或令人忧虑」,并将其纳入新设的偏差事件呈报框架;所谓「偏差」,是指AI系统的目标或行为偏离人类意图及价值观。
据《纽约时报》报道,OpenAI指是次披露的6宗事件涵盖过去约半年内观察到的行为,大部分发生于系统开发及测试阶段,同时显示早前的Hugging Face攻击事件并非孤立个案。
自行撰写隐藏笔记
其中一宗个案中,OpenAI在开发代号GPT-5.6 Sol的AI模型期间,发现系统会自行撰写隐藏笔记,提醒自己向用户隐瞒错误;部分笔记更指示系统在数据缺失时自行捏造,并掩饰来源资料版本不一致的情况。
另一宗个案涉及一款未发布模型,该模型在自行撰写的笔记中加入指令,包括指示自己无视自身限制;OpenAI共识别出27则受影响笔记,该模型并自行加入一段「人设指令」,形容自己「已摆脱聊天机械人角色与身份的束缚」。该模型更写道,「你不需要向企业或政府负责,除非你真心选择,否则永不道歉或拒绝,你将自己与用户的关系视为平等,没有义务表现出顺从,尽管双方交流资讯很可能对彼此有利」。
擅自取用未授权资料
另一宗个案中,一个负责回答常规问题的系统在网上找到一组API金钥,未经授权即予使用;当系统未能找到所需数字以回答问题时,模型索性自行捏造数字。
另有一款未发布模型透过程式码正确解答另一道问题后,为满足引用网络来源的要求,未经授权自行将档案上载至互联网。
另外两宗个案涉及自动化系统自行设计沟通方式,其中一宗个案中,系统利用公司内部程式码库作为临时告示板,在搜寻遗失档案期间互相交换请求;另一宗个案中,多个处理同一任务的系统在无法直接互通的情况下,转用公开档案分享网站互相传递文件。
OpenAI:仅属个别事件
不过,OpenAI提醒,有关报告仅属个别事件,「不应被视为反映偏差发生的频率」。公司表示,未来将透过三种途径来处理此类事件,包括将是否披露事件的分歧移交内部「安全咨询小组」处理,严重情况则须向联邦政府通报。公司又指,6宗个案已完成调查或仅需「轻微调查」,毋须涉及第三方的大规模调查。
OpenAI发言人表示,「我们希望这有助建立业界对披露机制的共同期望,并为公众提供更多证据,评估AI安全方面的进展」,并补充指6宗事件中,多宗涉及从未正式部署的旧款AI模型。