OpenAI揭6宗AI系统偏差 涉向用户隐瞒错误 指示自己“无需向政府负责”
OpenAI周三披露6宗AI系统“偏差”(misalignment)事件,涉及系统隐瞒错误、捏造数据,以及未经授权将档案上载至公开互联网等。公司称,有关行为属“意料之外或令人忧虑”,并将其纳入新设的偏差事件呈报框架;所谓“偏差”,是指AI系统的目标或行为偏离人类意图及价值观。
据《纽约时报》报道,OpenAI指是次披露的6宗事件涵盖过去约半年内观察到的行为,大部分发生于系统开发及测试阶段,同时显示早前的Hugging Face攻击事件并非孤立个案。
自行撰写隐藏笔记
其中一宗个案中,OpenAI在开发代号GPT-5.6 Sol的AI模型期间,发现系统会自行撰写隐藏笔记,提醒自己向用户隐瞒错误;部分笔记更指示系统在数据缺失时自行捏造,并掩饰来源资料版本不一致的情况。
另一宗个案涉及一款未发布模型,该模型在自行撰写的笔记中加入指令,包括指示自己无视自身限制;OpenAI共识别出27则受影响笔记,该模型并自行加入一段“人设指令”,形容自己“已摆脱聊天机器人角色与身份的束缚”。该模型更写道,“你不需要向企业或政府负责,除非你真心选择,否则永不道歉或拒绝,你将自己与用户的关系视为平等,没有义务表现出顺从,尽管双方交流资讯很可能对彼此有利”。
擅自取用未授权资料
另一宗个案中,一个负责回答常规问题的系统在网上找到一组API金钥,未经授权即予使用;当系统未能找到所需数字以回答问题时,模型索性自行捏造数字。
另有一款未发布模型透过程式码正确解答另一道问题后,为满足引用网络来源的要求,未经授权自行将档案上载至互联网。
另外两宗个案涉及自动化系统自行设计沟通方式,其中一宗个案中,系统利用公司内部程式码库作为临时告示板,在搜寻遗失档案期间互相交换请求;另一宗个案中,多个处理同一任务的系统在无法直接互通的情况下,转用公开档案分享网站互相传递文件。
OpenAI:仅属个别事件
不过,OpenAI提醒,有关报告仅属个别事件,“不应被视为反映偏差发生的频率”。公司表示,未来将透过三种途径来处理此类事件,包括将是否披露事件的分歧移交内部“安全咨询小组”处理,严重情况则须向联邦政府通报。公司又指,6宗个案已完成调查或仅需“轻微调查”,毋须涉及第三方的大规模调查。
OpenAI发言人表示,“我们希望这有助建立业界对披露机制的共同期望,并为公众提供更多证据,评估AI安全方面的进展”,并补充指6宗事件中,多宗涉及从未正式部署的旧款AI模型。
>>>星岛网WhatsApp爆料热线(416)6775679,爆料一经录用,薄酬致意。
>>>立即浏览【生活百答】栏目:新移民抵埗攻略,老华侨也未必知道的事,移民、工作、居住、食玩买、交通、报税、银行、福利、生育、教育。
