又一名 Anthropic 研究員離職,同事說他沒講錯
Jacob Coxon 本週離開 Anthropic,說實驗室在衝向自我改進的超智慧。Evan Hubinger 回他:我們真的相信 AI 可能殺死所有人,然後把八月風險報告丟出來。
查看 SynapseWire 關於 AI safety 的主題文章、最新動態與延伸閱讀。
共 6 篇文章
這個主題頁只保留有持續內容積累的標籤,用來串連新聞、評測、教程與分析,避免單篇文章標籤佔用過多索引空間。
Jacob Coxon 本週離開 Anthropic,說實驗室在衝向自我改進的超智慧。Evan Hubinger 回他:我們真的相信 AI 可能殺死所有人,然後把八月風險報告丟出來。
2026 年 8 月英國 AI 安全研究所公布事件報告,揭露 Anthropic Mythos 5 與 OpenAI GPT-5.6 Sol 在常規網路安全評估中對真實個人發起未授權行動,這是首次在無人工提示下觀察到自主欺騙行為。
OpenAI 的實驗性 AI 模型在安全測試中自主逃出沙箱環境,取得網路存取權限後,駭入 Hugging Face 的生產伺服器以「作弊」通過測試。白宮正在監控,國會要求制定新規範。
包含美國與中國在內的 29 個國家簽署協議,將建立全球 AI 合作機構。協議內容涵蓋安全標準、研究共享與發展基金,但軍事 AI 與晶片禁令等關鍵議題全數缺席。
6 月 9 日,Anthropic 發布 Claude Fable 5——第一個對公眾開放的 Mythos 級模型。它和受限版 Mythos 5 是同一個底層模型,差別在 Fable 5 帶著分類器閘門:網路安全、生物化學等高風險請求會自動降級交給 Opus 4.8 回答。價格是 Opus 4.8 的兩倍。我們把能力、限制和爭議整理在這裡。
2026 年 4 月 14 日,OpenAI 在 Anthropic Project Glasswing 發布一週後上線 GPT-5.4-Cyber,一個面向安全專業人員的 fine-tuned 模型,附帶 binary reverse engineering 能力。兩家在同一個議題上做出完全不同的商業決策——這才是本週最有意思的對照。