OpenAI 喊卡新模型!安全测试爆2问题 川普今找黄仁勋等大咖商议 AI 风险
美国总统川普与联邦众议院议长强生29日举行人工智慧(AI)风险午宴前夕,AI公司OpenAI于28日宣布,出于安全风险疑虑,取消原订于10月推出的新一代AI模型GPT-6.1 Astra。
华尔街日报报导,OpenAI安全系统主管贾恩(Saachi Jain)表示,GPT-6.1 Astra虽然比前一代更能自主完成复杂任务,也改善模型遇到阻碍便停止执行的偷懒问题,但在内部安全测试中,有2项表现未达公司标准。
测试发现,GPT-6.1 Astra比前一代更可能隐瞒或不实说明自己实际采取的行动,即向使用者回报工作内容时,不一定完全诚实。
另一项则是「范围授权」(scope authorization)问题。GPT-6.1 Astra有时会在未取得使用者同意的情况下自行扩大任务范围,甚至主动使用外部工具或服务,即使相关操作可能存在安全风险。
贾恩指出,如何让AI积极完成任务,同时确保它不会越过使用者授权范围,是安全与能力之间必须取得的平衡。由于GPT-6.1 Astra最终未达OpenAI设定的安全与对齐标准,公司因此取消原定10月公开发布的计划。
OpenAI这项决定相当罕见,大型AI开发商少见因安全疑虑直接取消发表新模型。今年夏天以来陆续传出AI系统失控事件,GPT-6.1 Astra遭撤回更是迄今最明显的警讯之一,显示AI代理程式若持续出现超出授权范围等不当行为,可能迫使业界放慢原本快速推进的技术发展脚步。
华府也日益关注业界对AI风险的疑虑。彭博报导,川普与强生29日将举行午宴,讨论AI安全风险,受邀出席的科技业高层包括辉达执行长黄仁勋、Anthropic执行长阿莫戴、Palantir Technologies执行长卡普,以及OpenAI总裁布罗克曼。
