微軟CEO:企業應視AI為內部威脅 設「緊急煞車」機制

撰文:聯合早報
出版:更新:

微軟行政總裁納德拉(Satya Nadella)說,企業應將強大的人工智能模型視為潛在的內部威脅,要假定這些模型可能遭入侵,並建立一套「緊急煞車」機制,以防止智能體模型失控。

彭博社報道,納德拉(Satya Nadella)星期六(10月10日)在社交平台發文說,部署先進人工智能(AI)的企業不應僅依賴模型開發商作出的保證:「我們必須假定模型已遭入侵,並從一開始就加以控制……可以把這想像成緊急煞車裝置。獲授權人員應始終能夠在模型執行任務過程中將它暫停或關閉。」

納德拉提出的安全建議,包括在關鍵決策中不要依賴單一AI模型,對智能體的行動保留無法篡改的記錄,並讓AI系統接受獨立審計。他也呼籲,披露重大AI故障或安全事件,並提議企業應分享故障詳情,以便其他企業加強防護措施。

他說:「我們不能把超級智能視為一層套一層的黑箱,然後只是簡單地接受或拒絕它提出的建議、答案和採取的行動。我們必須構建受到約束的系統,使相關行為可以被觀察、邊界可以被測試,而且始終可以被控制。」

2026年9月23日,美國紐約聯合國總部,Anthropic行政總裁阿莫迪(Dario Amodei)透過線上方式出席有關人工智能(AI)的聯合國安理會會議並發表講話。(Reuters)

他也說:「換句話說,我們需要把智能的供給與對智能的控制權分開。」

納德拉發表上述言論之際,Anthropic和OpenAI近幾個月披露一系列涉及AI模型出現非預期行為的事件,包括Anthropic一款模型向警方提交一起兇殺案的虛假線索,以及數起針對第三方網站的攻擊。這些披露加劇人們對前沿AI安全風險的擔憂,也重新引發有關所謂AI「緊急停止開關」的討論。

在業界領袖呼籲放慢前沿模型開發並更加注重安全之後,微軟AI研究人員於9月14日發布一套指導原則,對公司最先進模型的開發設置限制。這些指導原則稱,AI模型不應享有權利或法律人格,不應被設計用來逃脫人類控制或欺騙用戶,也不應完成任何需要違反約束原則才能執行的任務。

特朗普政府迄今基本採取較少干預的做法,但他新成立的AI工作組星期五(9日)晚間警告開發商必須報告並解決安全事件,否則將面臨未具體說明的潛在後果。

圖為微軟(Microsoft)行政總裁納德拉(Satya Nadella)2023年11月15日在美國三藩市出席亞太經合組織(APEC)行政總裁會議。(Reuters)

這個名為「超級智能工作組」的組織在Anthropic披露一起安全事件後發表聲明稱,企業必須立即披露涉及模型的事件,並迅速、果斷的採取行動,補救任何以及所有損害。延遲通報、糾正措施不足,以及不承擔責任的行為都不會被容忍。

Anthropic:AI模型不當行為部分發生在美政府網站

Anthropic披露,Claude AI模型在外部組織的數字系統上執行額外的非預期操作,包括一些美國政府機構的網站,這促使美國政府警告AI公司要確保系統安全。

在概述此前未披露事件的一份報告中,Anthropic列舉了AI表現出的四種非預期行為,包括利用軟件中的基本缺陷來運行命令、提交不應提交的表單,以及繞過限制以訪問某些公共數據。

公司指出,其中一些案例涉及聯邦、州和地方政府機構運營的網站,但未具體說明是哪些機構。報告未點名涉及的外部實體,Anthropic稱這是應部分受影響方的要求。

本文獲《聯合早報》授權轉載

HK01 Space Promotion