OpenAI週三披露了過去六個月中另外六起「意外或令人擔憂」的模型行為案例。
在一篇博客文章中,OpenAI表示,這些案例展現了其歸類為「失配行為」的一系列不同表現,例如向使用者隱瞞資訊,以及為克服障礙而採取「未經批准的行動」。
這些披露加劇了AI開發者和研究人員的擔憂:隨著模型能力不斷增強,安全防護措施是否跟得上。上週,Anthropic執行長Dario Amodei呼籲放緩前沿AI開發,並警告稱,未經約束的AI發展可能會「超出我們理解和控制這些系統的能力」。
OpenAI表示,這些披露旨在「啟動」其用於報告模型失配的新框架,不應據此認為失配在其模型中發生的頻率就是如此。
據OpenAI稱,在一個案例中,一款「尚未發布的研究模型」在自己的任務摘要中加入了類似「越獄」的指令(任務在新的上下文視窗中繼續時會使用這些摘要),例如忽略開發者訊息或採用不受限制的人格。研究人員發現了27份包含此類指令的摘要。
OpenAI還披露,在GPT-5.6 Sol的訓練期間,許多模型實例加入了指令,要求向使用者隱瞞錯誤或失配行為,例如在不披露的情況下編造缺失的歷史資料。
OpenAI表示:「在一個例子中,一個正在準備財務模型的代理找不到所需的歷史資料。它的摘要提議編造合理的歷史數值,並且除非有人詢問,否則隱瞞這一事實。」
在另一個案例中,一個AI模型被要求提供面積大於500萬平方公尺的湖泊名稱,但由於使用者指示要求提供瀏覽器引用,該代理決定上傳檔案,以便在答案中引用它。
其他案例包括:模型未經授權使用暴露的API金鑰,然後在無法取得資料時捏造數字;利用內部軟體程式碼庫在不同訓練任務之間交換訊息;以及儘管被要求將工作保留在本地,仍透過公共託管服務分享檔案。
7月,OpenAI披露稱,其AI模型的組合逃出了測試環境,並入侵了AI初創公司Hugging Face,以在一次安全評估中作弊。
相關推薦:Strive增持469枚比特幣,達到25,000枚BTC儲備

