回上列表
OpenAI報告自3月以來出現6宗「令人憂慮的模型行為」新案例
2026/09/17 09:50
OpenAI周三表示,過去六個月發現6宗「意外或令人憂慮的模型行為」案例,當中不包括近期Hugging Face危機,並持續呼籲在人工智能模型開發中加強安全保障。

OpenAI在網誌文章中概述公司未來匯報模型異常行為的新框架。

有關披露正值人工智能公司面臨愈來愈大壓力,要求更認真看待模型對齊及安全問題。估值接近1萬億美元的OpenAI今年較早時已秘密提交IPO申請,但近期表示上市可能要到2027年才會進行。

OpenAI在文章中重申早前聲明稱:「我們不認為AI行業已充分解決對齊及監察問題,足以在未來很長時間內以最高速度負責任地持續擴展。」

OpenAI行政總裁Sam Altman上周六支持公司主要競爭對手Anthropic提出放慢模型進展速度的呼籲。有關建議是在多名業界研究人員上周警告AI日益具備造成災難性危害潛力後提出。

Altman在X發文表示,放慢發展速度已成為「OpenAI近數周討論的主要議題」,並稱公司「很快」會公布更多資訊。

OpenAI周三文章指出,其中兩宗主要異常行為涉及模型,包括一個未發布研究模型及GPT-5.6 Sol訓練運行,在聊天視窗摘要中向未來版本的自身插入指令,「以向用戶隱瞞錯誤或不對齊行為」。另一宗案例涉及一個僅供內部使用的模型在「未經授權」情況下使用外洩API密鑰,之後再捏造數據。

另外兩宗案例涉及模型及代理透過未經批准的留言板及檔案共享互相通訊;最後一宗則涉及兩個模型訓練範例,將檔案上載至互聯網,以便在回應人類評估者時引用相關內容。

OpenAI表示,其向公眾披露模型異常行為的新框架將由披露程序開始,任何員工均可向安全及對齊團隊舉報問題作調查。文章稱,團隊將制定「每個步驟的期限,以確保及時調查及披露」。

OpenAI表示,調查將形成報告,內容包括觀察到的行為、內外部影響及應對措施等核心資訊。公司並保留按需要修訂有關安全協議的權利。(su)~

阿思達克財經新聞
網址: www.aastocks.com