又一名 Anthropic 研究員離職,同事說他沒講錯
Jacob Coxon 本週離開 Anthropic,說實驗室在衝向自我改進的超智慧。Evan Hubinger 回他:我們真的相信 AI 可能殺死所有人,然後把八月風險報告丟出來。
Jacob Coxon 二十七歲。他從 Anthropic 離開,星期二發了一串貼文。CNN 那篇,Hadas Gold、Martin Goillandeau、David Goldman 三人署名,把能站住的句子留下了。「做 AI 的人真心相信,這東西可能在十年結束前把我們全殺死。」還有:這些系統很快能黑任何東西、一夜改寫一個領域、自己去抓資源。還有:「他們正衝向會自我改進的超智慧,拿我們的命去賭。」
這種文體不新。Anthropic 自己就是從 OpenAI 因安全問題走出來的人組的。新的是:一個比較資淺的研究員把話講死,比較資深的人沒有打槍。
Evan Hubinger 在 X 上回 Coxon:你說得對。「我們真的真心相信 AI 可能殺死所有人類!」他自己給的數字是未來十年低於百分之十,並且說就算 Anthropic 動機良善,也沒有一套辦法避免超智慧跑到人類控管外面。接著他補了一則:公司的2026 年 8 月風險報告承認這個擔心,同時寫現有系統不太可能拿到那種權力。CNN 問 Anthropic,公司指給他看那則補充。
整套舞步就是這樣。先警報,再 PDF。
NBC 同週有一篇訂戶文,說 Anthropic 跟 Google DeepMind 又走了兩名研究員,標題裡有「房間裡沒有大人」。付費牆我沒翻過去,不拿假名字來湊。CNN 這份加上 Coxon、Hubinger、Dario Amodei 已經夠寫。
這些句子各自承諾了什麼
Coxon 講的是終點:會自我改進、有行動能力的系統。Hubinger 講的是機率,以及缺計畫。Amodei 在 CNN 引用的二月紐時訪問裡說,一定會有人的 AI 出事,希望不是自家。OpenAI 首席科學家 Jakub Pachocki 在 CNN 稿前兩天警告能力跑得比監測能力快。
你可以把它們疊成一種氣氛。不要把它們疊成同一個技術命題。「殺死所有人」是實驗室裡用來當道德框架的尾部風險。「沒有超智慧計畫」是工程承認。「現有系統還沒到」是產品句。三句可以活在同一家公司。風險報告會以遮黑版存在,原因在這裡。
我們寫過Anthropic、Google、Meta 同一週出新模型,也寫過OpenAI 放 GPT-6 Astra、先給資安客戶踩煞車。離職是另一本帳。同一個月份,不同欄。
聯名信、五角大廈、中國那條線
CNN 寫七月有將近一千四百名 AI 員工簽公開信,要求美國政府把實驗室踩慢。那是政治文件。Coxon 的串是辭職。Hubinger 的回覆是員工在公開場合同意,再指向正式報告。三種說話。
CNN 規制那一段是老 stall:川普政府擋州法,國會把任何限制當成送給中國的禮。CNN 補的一刀是中國已經有規則,包括生成內容要標示。這篇不寫成政策長文。它只是背景,讓一個二十七歲的貼文看起來像剩下的通道。
The Intercept 跟 Legal Advocates for Safe Science and Technology 打公開資訊法,拿出四百多頁五角大廈 2025 年跟 Anthropic、Google、OpenAI、xAI 的原型合約。每張最高兩億美元。合約用語是提升軍事優勢、軍事效用、加強軍事決策,包含作戰與自動化決策。OpenAI 部署進機密網的那份在這批裡。其餘對等文件還在等政府交出。
今年稍早 Anthropic 跟國防部的公開吵架,看起來像倫理。Sam Biddle 寫真正的鉸鏈是那份沒公開的合約。我不會把 FOIA 跟 Coxon 的串揉成一則。兩件事碰巧共用公司名。一個是研究員走出門。一個是同一家公司把原型賣進機密網。要軍事檔,讀 Biddle。要離職,讀 Coxon 跟 Hubinger。
我們也寫過 DeepSeek 的 Agent 套件讓模型自己關掉沙盒。那是具體漏洞。這週不是 CVE。是人走了、開口了。
怎麼讀一則辭職
實驗室用這種方式漏氣已經好几年。模板是:我待不下去、競賽是真的、請管。有時走人的是安全主管。有時是二十七歲。年齡不是取消資格。它提醒你:寫評估的人,通常不是定出貨日的人。
Hubinger 說 Coxon 是對的,再引一份說現有模型不是末日的報告,這份文件比較有意思。它告訴你內部分裂不是「末日派對否認派」。是「我們相信尾部,我們還是出貨」。Amodei 那句「希望不是我們」是創辦人口中的同一道裂縫。
我不知道 Coxon 的組、也不知道他最後一個項目。CNN 沒寫。把這串當文化證詞,不當訓練行程外洩。
若你在這些公司裡上班,想找安全部門能擋下一次發佈的信號,這週不是。資淺離職、資深回應、一份遮黑 PDF,是實驗室不想改日曆時,對網路上說話的方式。
有用的問題比較窄。下一張 model card 出來時,風險報告裡「現有系統」那句會重寫,還是只把日期往後挪?Coxon 賭他們不停。Hubinger 說他們沒有停的計畫。這兩句,比那則澄清看起來的距離更近。
分享文章
留言評論
0 則評論暫無評論,搶先發表你的看法吧!
相關文章
Anthropic、Google、Meta 同一週推出新模型
Claude Fable 5.1 帶頭,Google 出 Gemini 3.8 Flash,Meta 出 Muse Spark 1.3。GPT-6 佔了標題,其餘三家才是你訂閱頁會改到的東西。
Claude Opus 5 vs GPT-5.6:你到底該用哪個 AI 模型?
兩個頂尖 AI 模型在 2026 年 7 月相隔兩週內發布。這裡是它們在基準測試、定價和實際應用場景上的真實比較。
OpenAI、Anthropic、Google API 漏洞讓較弱模型破解較強模型的推理過程
研究人員發現,透過 API 操控,較便宜的 AI 模型可以從前沿模型中提取隱藏的推理痕跡,過程中還暴露了個人識別資訊和憑證。