前幾天(8/7),Anthropic 發了一篇官方公告,標題是《Improving Fable 5’s biology safeguards》。
讀完之後,我愣了一下。
不是因為內容太難——其實寫得很白話。而是因為它的核心邏輯,翻成大白話之後是這樣的:
「Fable 5 在生物學領域的能力已經超越人類專家了。但太危險了,所以我們擋住。你用不到。」
等等,這不就是跟大家說:「我智商 180,但我只能給你智商 100 的回應」嗎?
如果我永遠體驗不到那個 180,那你告訴我它存在,到底是想讓我感覺什麼?而且更弔詭的是——180 這件事本身,就是你必須給我 100 的理由。我永遠看不到 180 的證據,但我必須接受 100 是因為 180 才存在的。
這篇公告愈讀愈有意思。讓我們一層一層來看。
(以下內容建議搭配咖啡服用,因為會愈讀愈清醒…)
先交代一下,這篇公告到底說了什麼
幫沒讀過原文的朋友快速摘要三個關鍵事實:
第一,Fable 5 的生物學能力被官方確認「超越專家」。 Anthropic 自己的能力評估(capability assessment)認為,Fable 5 能為惡意行為者提供在其他地方找不到的能力提升(uplift)。注意這個措辭——不是「有幫助」,是「別的地方找不到」。
第二,防禦機制是一個外掛的分類器。 當分類器判定你的問題碰到了敏感區,不是直接拒絕你,而是偷偷把你的請求丟給 Opus 5——一個能力較低的模型。你以為你在跟 Fable 5 對話,但其實已經被靜默降級了。(有沒有一種「以為自己在打王,結果被偷偷丟回新手村」的感覺?)
第三,這次調整讓生物學相關的誤擋率降低了 85%。 聽起來很棒,但反過來想——這代表上線以來,大量正常的健康教育、臨床問答、基礎生物學問題,全部都被錯殺了。而病毒學、毒理學、分子設計目前仍然全擋。
好,背景交代完畢。現在來聊有意思的部分。
爸媽的規則:禁果效應不是比喻
「這個東西存在,而且很厲害,但你不能碰。」
各位有沒有覺得這句話很熟悉?對,這基本上就是你小時候爸媽對你說的每一句讓你更想做那件事的話。
心理學上這叫禁果效應,但我覺得不需要搬心理學——任何當過小孩的人都懂。當有人告訴你「不可以」的時候,他同時做了三件事:確認了那個東西的價值、製造了匱乏感、然後暗示了——你不被信任。
這三件事加在一起,就是動機。
而且 Anthropic 的框架比爸媽的規則更微妙。爸媽至少還有一個隱含的承諾:「等你長大就可以。」但在這裡,「長大」的條件是什麼?文章裡提到了 trusted access pathways——受信任的存取路徑。翻譯一下:你要通過某種身份驗證、隸屬某個被認可的機構,才有資格碰到完整的 Fable 5。
這裡就出現了一個很有趣的結構——能力階級制度:
- 頂層: Anthropic 內部人員,完整存取
- 中層: 通過 trusted access 的機構研究者,開放存取
- 底層: 一般付費使用者,降級服務
誰在哪一層?由 Anthropic 單方面決定。標準是什麼?黑箱。
我不是說這個分層完全沒有道理——生物武器的風險確實真實存在。但把這個結構放在 Anthropic 自己一直在推的「AI 民主化」敘事旁邊看,那個張力就很明顯了。一邊說 AI 應該惠及所有人,一邊在最前沿的能力上建立了一個事實上的許可制。
(說起來,這大概是全世界最貴的「你不夠格」通知——我付了訂閱費,然後被告知我只能用打折版…)
核彈 vs AI:倉庫的鎖夠安全嗎?
到這裡,有人可能會說:「可是核武也是這樣管的啊,你也不能隨便買鈾-235,這不是很正常嗎?」
這個類比聽起來合理,但仔細想想,核武管制「相對成功」的原因不是法律條約寫得好——而是物理現實本身就在幫忙。
鈾礦要開採,需要礦脈。濃縮需要離心機,成千上萬台,耗電量大到衛星拍得到。運輸有重量、有輻射特徵。每一步都在物理世界留下痕跡,每一步都有摩擦力。造原子彈的原理早就公開了,真正擋住擴散的不是知識的管制,而是原料服從物理定律。
現在來看 AI 的「原料」——權重是一個檔案,複製成本是零,傳輸速度是光速。數據在網路上到處都是。算力門檻每年都在降低。
所以 Anthropic 的分類器在做的事情,不是管制原料,而是——在原料已經在倉庫裡的前提下鎖門。
而且這個倉庫有幾個特性,讓「鎖門」這個策略的天花板非常明顯:
鎖和牆是同一種材料做的。 分類器本身就是 AI。用 AI 來防守 AI,攻防雙方用的是同一種工具。物理世界不是這樣的——你用混凝土牆保護核原料,攻擊者不能用「更好的混凝土」來穿透。但在虛擬世界,攻擊者可以用同等甚至更強的 AI 來探測、分析、繞過你的防線。而且不對稱的方向是偏向攻擊者的——防守要堵所有洞,攻擊只要找到一個。
這個倉庫有無限把鑰匙可以試。 物理世界的鎖,你試錯有代價——要時間、要到場、可能被人發現。但 API 探測可以自動化,你可以寫腳本每秒試幾百種不同的措辭,系統性地探測分類器的邊界。更關鍵的是——每次被擋住的回應本身就是情報。它告訴你邊界的形狀。你家的門鎖不會在你試錯的時候告訴你「差一點就對了」,但分類器的回應模式會。
倉庫是複數的。 Anthropic 可以鎖住 Fable 5,但同等級的能力不只存在於 Fable 5 裡。開源模型持續逼近前沿,其他國家的實驗室不受同一套規範約束。你鎖住一個倉庫,隔壁還有十個,有些根本沒裝鎖。Anthropic 自己也承認了——是「能力到了這個水準」,不是只有他們的模型到了。
邊界本身是模糊的。 Fable 5 不直接教你合成危險化合物,但它可以教你基礎知識、幫你讀論文、協助你設計實驗流程。每一步都在「允許」的範圍內,但組合起來可能就跨過了門檻。能力不是一條線——在裡面或外面——而是一個梯度。你不是「安全或危險」,你是「離危險區有多近」。
簡單來說——用軟體鎖保護軟體資產這件事,在結構上就有一個物理世界的鎖不需要面對的天花板。 這不是 Anthropic 的鎖不夠好的問題,而是整個範式的極限。
(這大概就是虛擬世界的「道高一尺,魔高一丈」——只不過在這裡,道和魔用的是同一個健身房…)
藏寶圖悖論:最不安全的,可能是公告本身
好,到這裡我們來聊最弔詭的部分。
讓我們站在一個「有心人」的角度,重新讀一遍這篇公告。讀完之後,他得到了什麼情報?
- 目標確認: Fable 5 是生物學能力最強的模型,不是其他模型
- 攻擊面: 生物學領域,特別是病毒學、毒理學、分子設計
- 防禦類型: 基於 constitution(規則集)的分類器,不是模型內建的拒絕機制
- 防線剛移動過: 誤擋率降了 85%,代表邊界剛被大幅調整——邊界剛移動的時候,往往是最脆弱的時候
- 邊界離危險區更近了: 以前離得遠,現在收緊到只擋「真正雙重用途」的內容,攻擊者只要再跨一小步
對一般讀者來說,這篇文章的訊息是:「我們好負責任。」
對有心人來說,這篇文章的訊息是:「這裡有寶藏,門鎖是這種類型的,鎖剛換過,而且比之前好開。」
Anthropic 當然有正當理由做這個公告——他們對使用者有告知義務,對監管者有展示義務,對投資人有說明義務。不公開會被批評為黑箱操作。但公開的結果是,你同時也在對攻擊者提供 作戰指示。
在傳統資安領域,有個原則叫「負責任揭露」——你可以說漏洞存在,但不公開利用方法。但這篇文章做的比一般的漏洞揭露多得多。它不只說了「有風險」,還解釋了防禦架構的類型、調整方向、以及調整幅度。用資安的語言來說,這接近於——公開你的防火牆規則。
而且別忘了我們前面講的:你越強調能力很強、風險很大,你給有心人的動機就越強。 如果 Anthropic 只是淡淡地說「我們改善了安全措施」,沒人會特別在意。但他們選擇引用美國情報體系的年度威脅評估、強調能力超越專家、把生物武器風險拉到國安等級——這所有的修辭,在對一般大眾展示負責態度的同時,也在對有心人展示:這個目標的價值非常高。
這篇公告本身,就是它試圖防範的那種風險的催化劑。
(我到底在讀安全公告還是在讀懸疑小說的前情提要…)
我們可能正在讀的,是第一章
最後,讓我們把時間軸拉出來。
如果以上的分析大方向沒錯——軟體鎖有結構性天花板、禁果效應持續提供動機、攻擊面已經被明確標示——那一個幾乎可以預寫的劇本就在前方等著:
未來的某一天,我們會看到一則新聞:「有人突破 AI 安全限制,利用前沿模型的能力,做出了某種危害大眾的事情。」
然後劇本的下一幕也寫好了:
公眾恐慌。AI 公司指著今天這篇文章說:「你看,我們早就警告過了,我們早就設了防線,但有人繞過了。」然後結論會是什麼?——「所以我們需要更強的管制、更嚴的分類器、更少的開放存取。」
而誰來執行這些更強的管制?還是他們自己。
每一次安全事件,都會成為收緊的理由。每一次收緊,都進一步鞏固「由開發者決定誰有資格使用前沿能力」這個權力結構。 鎖被破了不會導致拆掉鎖,只會導致——換更大的鎖,發更少的鑰匙。
所以今天這篇安全公告,可能不只是一篇公告。它是一個未來敘事的錨點。一個預先埋好的「我們說過了」。不管未來發生什麼——真的有事件發生也好,只是「差點發生」也好——這篇文章都可以被回溯引用為負責任的預警。
下次再看到任何 AI 公司的安全公告,除了讀它說了什麼,也許也可以想想:它選擇說出來這件事本身,是在對誰說話?又在為什麼樣的未來劇本,鋪第一塊磚?
(如果你覺得這篇讀起來像陰謀論,我完全理解。但我寧可被說想太多,也不想哪天看到新聞才說「啊,那時候怎麼沒想到」… XD)
參考資訊:
- Anthropic 原文:Improving Fable 5’s biology safeguards(2026.08.07)