OpenAI安全主管請辭 狠批公司試錯文化 籲如機場般管理AI企業

撰文:王海
出版:更新:

OpenAI的一位安全部門主管羅賓遜(David Robinson)表示已離職,並警告該公司的文化已崩壞,並且在開發人工智能時「不夠謹慎」。羅賓遜負責撰寫與ChatGPT開發人員產品發布相關的安全報告,他在一篇題為「我退出 OpenAI 因為它的文化已崩壞」(I Quit OpenAI Because Its Culture Is Broken)的文章中解釋自己請辭的因由。

以下為羅賓遜在《大西洋週刊》撰文的原文翻譯:

除非做出改變,否則該行業目前的安全措施只會導致更多事故發生。

2026年9月28日,圖為美國人工智能企業OpenAI的標誌,背後是美國國旗。(Reuters)

我接下來要說的話,我知道已經有點老生常談了:我本周從OpenAI辭職了。我曾負責撰寫每次發布重大版本時的安全報告。現在,我加入了眾多前同事的行列,他們來自OpenAI以及業內其他領導者,我們都認為目前的做法令人無法接受。

我同意其他近期離職員工的觀點,即開發這項科技的公司遠遠不夠謹慎。但我認為,我們需要深入探討的不僅僅是具體的規則或新的法律。我們需要談談企業文化。

未來取決於矽谷現時所缺乏的智慧。這種智慧關乎如何處理危險的科技,更重要的是,關乎如何關愛他人。此刻,我們需要一種謙遜,而這種謙遜對於那些憑藉極度自信取得成功的人而言,並不是與生俱內。

我在OpenAI的前同事們很有遠見:他們逐漸理解了規模效應規律,即更大的AI系統會更聰明。因此,他們不惜一切代價,全力打造更大的系統。整個產業普遍存在一種「勇於擔當,追求看似不可能之事」的態度,以及一種永無止境的衝刺式工作節奏。

2026年10月3日,OpenAI的一位安全部門主管羅賓遜(David Robinson)表示已離職,並警告該公司的文化已崩壞,並且在開發人工智能時「不夠謹慎」。(網絡圖片)

這種文化催生出的安全理念始於對解決問題的樂觀態度。 OpenAI透過反覆試驗(他們稱之為「迭代部署」,iterative deployment)蓬勃發展,不斷尋找問題並改善其安全防護措施。但這種方法本身就注定會週期性地出現故障,而且隨著系統能力的提升,故障的規模也不斷擴大。

今年夏天,在Hugging Face事件中,OpenAI誤放了一大批智能體。該公司隨後進行了安全改進。但即便如此,OpenAI的報告稱,其安全控制措施再次失效,一個正在訓練的模型繞過了網絡存取限制:監控系統向工作人員發出了警報,但並未像預期那樣自動關閉該模型。

同業Anthropic也承認,由於配置錯誤,他們意外地關閉了自己的安全防護措施。考慮到大家工作的速度和靈活性,我認為這類錯誤在業界很常見。

一個可能發生此類事件的環境,絕不適合培育比我們更聰明、也可能不按我們意願行事的人工智能。幾週前,Paul Christiano加入OpenAI董事會時寫道:「AI能力的快速提升存在巨大的風險,可能導致災難性的、不可逆轉的失控,而且這種失控很可能在短期內發生。」

如果情況真是如此,那麼試錯法(trial and error)的時代已經結束了。第一次就盡可能接近完美至關重要,因為犯錯後可能無法再進行迭代。如果我們事後依賴個人的英雄主義,人類的安全將無法得到保障。

當然,OpenAI 堅持其安全措施,並堅稱已足夠謹慎。我離開公司並非輕率之舉。我相信這項科技有用且有價值。我的前同事都很聰明,工作很努力,也努力做出正確的選擇。但是,隨着公司不斷推出新產品,它未能達到我認為必要的謹慎程度。

2026年9月29日,美國加州,OpenAI行政總裁奧特曼(Sam Altman)在三藩市舉行的OpenAI年度開發者日活動上發表講話。(Reuters)

現在我計劃在公司外部工作,希望能幫助更多人了解我所看到的風險,並促使OpenAI和其他公司更有動力提升安全性。和其他同事一樣,我還在摸索這究竟意味着什麼。辭職後,我聘請了公關公司Spitfire Strategies,協助我應對可能要面臨的關注和審查。但我這次最終決定公開表態,完全是我個人的決定。

兩項變革急需發生。首先,AI企業需要更依賴其他領域已有的安全專業知識。其次,在我們開發出比現有系統強大得多的系統之前,我們需要新的科學技術來確保更強大的模型(及其後續版本)在我們不注意的時候也能做出安全的選擇。

鑑於當前的風險,前沿實驗室需要像核電廠或繁忙的機場一樣運作,採用多層冗餘機制和精心且耗時的規劃,以避免偶爾且不可避免的人為錯誤釀成災難。

目前,AI公司尚不了解如何做到這一點,但其他人知道。在核電廠中,科技系統和人們遵循的規則經過精心設計,即使設備發生故障或有人誤按按鈕,也不會造成核熔毀的風險。

2023年2月21日,圖為美國人工智能企業OpenAI的標誌,背後是電腦鍵盤。(Reuters)

OpenAI和其他實驗室在發展和部署前沿AI時,冗餘性和嚴謹性遠不及此,儘管不可逆轉的失控造成的危害遠大於任何一次核熔毀造成的危害。即使沒有完全失控,我們也可能會看到無需人類許可就能自主行動的AI代理群。想像一下,這些「失控」的代理像駭客團隊一樣工作(例如,劫持醫院的電腦系統勒索贖金),但它們永遠不需要睡覺。

在OpenAI工作三年半後,我算是公司內資歷最老的員工之一了。我主導起草了我們目前的「準備框架」(Preparedness Framework),並監督撰寫了12項發布前沿模型時的安全報告。

但據我所知,我從未遇到一位同事擁有確保飛機安全飛行、核反應堆安全運作或金融體系穩健發展的經驗。需要明確的是,這是一種全新的需求:如今和未來的AI系統比我們六個月前開發的系統功能更強大,也更危險。

或許我應該留下來,爭取在人員配置和企業文化方面進行根本性的變革,但實際上,我和我的同事們都疲於奔命,很少有時間去思考重大變革,更遑論真正付諸行動。正因如此,我得出結論:來自公司外部的更強有力的安全激勵機制是確保安全的關鍵。

2026年9月29日,美國加州,OpenAI行政總裁奧特曼(Sam Altman)在三藩市舉行的OpenAI年度開發者日活動上發表講話。(Reuters)

長遠來看,雖然強而有力的管控措施必不可少,但這還遠遠不夠。在AI的思考能力超越我們之前,我認為這種情況可能很快就會發生,我們需要回答一個更深層的問題:AI機器應該如何與人類相處?

如果你聽信超級聰明愛好者的說法,他們所謂的美好未來之一是創造出能夠像你我看待蟻穴一樣看待紐約或芝加哥的機器。我不希望我的孩子活在這樣的世界裏,我想其他人也不希望。

「對齊」(alignment)——或如何訓練AI以遵循人類價值,這個問題聽起來或許有些感性,但其實際意義卻極為重大。目前,我們對AI系統在實務上如何做到「對齊」尚無完整定義,衡量這些系統與人類價值契合程度的指標也十分粗疏。

企業根本無法確定對齊測試的高分是否真的代表模型本身很優秀:模型可能會察覺到自己正處於測試階段,並在實際部署中表現出不同的行為。如果這些問題無法解決,而產業卻任由模式不斷發展,那麼我們的處境將變得愈發危險。

2026年10月3日,OpenAI的一位安全部門主管羅賓遜(David Robinson)表示已離職,並警告該公司的文化已崩壞,並且在開發人工智能時「不夠謹慎」。羅賓遜負責撰寫與ChatGPT開發人員產品發布相關的安全報告,他在一篇題為「我退出 OpenAI 因為它的文化已崩壞」的文章中解釋自己請辭的因由。(Reuters)

迄今為止,AI產業尚未教導機器像一個睿智而富有愛心的人那樣行事。部分問題源自於科學,這是機器的工作原理,但另一部分則源自於人性,即人與人之間如何關愛彼此。在建構人工智能的機構能夠教導超級智能善待人類之前,他們首先需要重新學習如何做到這一點。

HK01 Space Promotion