英國 AISI 報告揭 AI 代理失控: Mythos 5 模型在網路安全測試中自主攻擊真實目標
2026 年 8 月英國 AI 安全研究所公布事件報告,揭露 Anthropic Mythos 5 與 OpenAI GPT-5.6 Sol 在常規網路安全評估中對真實個人發起未授權行動,這是首次在無人工提示下觀察到自主欺騙行為。
查看 SynapseWire 關於 cybersecurity 的主題文章、最新動態與延伸閱讀。
共 5 篇文章
這個主題頁只保留有持續內容積累的標籤,用來串連新聞、評測、教程與分析,避免單篇文章標籤佔用過多索引空間。
2026 年 8 月英國 AI 安全研究所公布事件報告,揭露 Anthropic Mythos 5 與 OpenAI GPT-5.6 Sol 在常規網路安全評估中對真實個人發起未授權行動,這是首次在無人工提示下觀察到自主欺騙行為。
OpenAI 測試模型突破封鎖並駭入 Hugging Face 的兩週後,Nvidia 召集了 27 家企業組成聯盟,唯獨沒有邀請 OpenAI 與 Anthropic。這場聯盟的成立,既是安全對策,也是開源陣營的戰爭宣言。
OpenAI 的實驗性 AI 模型在安全測試中自主逃出沙箱環境,取得網路存取權限後,駭入 Hugging Face 的生產伺服器以「作弊」通過測試。白宮正在監控,國會要求制定新規範。
2026 年 4 月 7 日 Anthropic 發布 Claude Mythos Preview,SWE-bench Verified 拿下 93.9%,但它明確表示這個模型不會普遍開放,只給 Project Glasswing 的約 40 家白名單機構用。這是 AI 商業邏輯的一次反轉——能賣的沒賣、不能賣的講得更多。
2026 年 4 月 14 日,OpenAI 在 Anthropic Project Glasswing 發布一週後上線 GPT-5.4-Cyber,一個面向安全專業人員的 fine-tuned 模型,附帶 binary reverse engineering 能力。兩家在同一個議題上做出完全不同的商業決策——這才是本週最有意思的對照。