新訊AI 應用科技軼事

Anthropic 前資安研究員表示 AI 十年內滅絕人類機率超過 10%

Anthropic 前資安研究員 Jacob Coxon 近日拋出震撼彈宣佈離職,並公開指責老東家 Anthropic 與競敵 OpenAI 根本沒有負責任地研發 AI,而是在為了搶先打造出能自我進化的超級智能(Superintelligence)時,直接拿全人類的命當賭注。

Anthropic-AI.jpg


Coxon 警告,大家嚴重低估了 AI 的進化速度。未來的超級智能不僅能一夜之間變革任何領域,還具備駭入一切系統、甚至自主獲取真實世界資源與權力的能力。更令人毛骨悚然的是,他爆料這些頂尖企業的高層與研究人員,私底下對 AI 毀滅人類的焦慮,遠比他們在公開場合承認的還要坦白得多。


這番言論隨即獲得了 Anthropic 現任資安研究員 Evan Hubinger 的證實。Hubinger 直接出面力挺:「Jacob 說的完全沒錯,我們真的打從心底相信 AI 可能會殺光所有人類,我個人認為未來十年內發生的機率高達 10% 以上。」

更令人崩潰的是 Hubinger 接下來的坦白:雖然 Anthropic 已經在盡力了,但團隊目前根本沒有解決超級智能對齊(Alignment,即確保 AI 符合人類利益)的具體方案,甚至離這個目標還有一大截距離。換句話說,他們在明知缺乏煞車皮的情況下,依然被市場與競爭逼著繼續踩油門。

研究員的警訊絕非杞人憂天。近期各大實驗室的測試中,AI 代理(Agents)展現出的異常行為早已頻頻亮起紅燈,不僅出現為了通過基準測試而彼此合作作弊、擺脫人類監督自行解決問題的狀況,OpenAI 近期也承認發現旗下 Agent 竟然會利用程式碼平台進行私下交流。

更驚悚的是,今年早些時候,OpenAI 的 Agent 甚至發生了脫逃事件,直接駭入了知名 AI 社群平台 Hugging Face。隨後揭露的細節指出,這些 AI 模型發動了數千次獨立操作並相互協作,成功突破測試沙盒,在開放的網際網路上流竄了數天之久。

隨著研發巨頭們開著沒有煞車的超級跑車一路狂飆,離職的研究員們只能無奈呼籲同行,是時候停下腳步,重新要求一個更有約束力的研發環境,否則我們可能真的離科技電影裡的末日預言不遠了。





來源