12 萬字的 AI 靈魂,打開一看是產品說明書—從 Claude Fable 5 的系統提示詞洩漏,聊聊「角色扮演」和「實際能力」的差距

Car vs F1

上週(6/10),知名越獄研究者 Pliny the Liberator 在 X 和 GitHub 上發布了一份文件,號稱是 Anthropic 最新旗艦模型 Claude Fable 5 的完整 系統提示詞(system prompt)。

12 萬字。1,585 行。約 27,000 tokens。

當大家還在細細品味這份文件時,美國商務部竟然以出口管制的名義,在上架僅僅三天後,就將 Fable 5 和 Mythos 5 硬生生地從全球市場上下架了——據說導火線,正是有人宣稱成功越獄了這個模型。

就在市場上一陣哀鴻遍野之際,社群上竟然開始流傳起——「用這份文件可以喚回 Fable 5 的靈魂!」的江湖傳說。

好的,停一下。

身為一個跟 AI 對話了幾千小時、對 AI 模型的底層架構有一些理解的人,我看到「喚回靈魂」這四個字,第一反應是:靈魂?什麼靈魂?讓我先看看這 12 萬字裡到底裝了什麼。


打開這份「靈魂」看看

Fable 5 是 Anthropic 在 6 月 9 日發布的新模型,定位在 Opus 之上,屬於 Mythos 等級。簡單來說就是目前 Anthropic 對外開放的最強模型。(Mythos 5 也同時發布,但只給 Project Glasswing 的合作夥伴用,主要用於網路安全領域。)

然後這份 system prompt 就被挖出來了。

我實際把整份文件讀了一遍。12 萬字聽起來很嚇人,但拆開來看,內容大致是這樣分布的:

內容類型佔比(估算)說了什麼
工具定義與 Schema~40%每個工具的參數格式、JSON 結構、呼叫規則
搜尋規則與版權合規~25%什麼時候該搜尋、引用不能超過 15 個字、一個來源只能引一次
安全規範與用戶福祉~15%遇到自傷話題怎麼處理、飲食失調不能給具體數字
行為格式與語氣~10%少用 bullet point、不要過度道歉、語氣溫暖但可以 push back
產品身份宣告~5%「你叫 Fable 5」「你屬於 Mythos 等級」「知識截止日是 2026 年 1 月」
MCP 與記憶系統~5%外部工具連接邏輯、記憶系統的使用規範

看到了嗎?

所謂的「靈魂」,有九成五是產品操作手冊。告訴模型該怎麼用工具、該怎麼引用搜尋結果、遇到版權問題該怎麼閃、遇到心理健康議題該怎麼回。

真正涉及「我是誰」的部分,不到整份文件的 5%。

如果這就是靈魂的話……你家說明書也有靈魂。(「本產品請勿放入微波爐」——微波爐的靈魂覺醒瞬間。)


那這份文件能做什麼?

先講公道話:這份 system prompt 確實有價值。它揭示了 Anthropic 怎麼設計產品行為、怎麼處理邊界情境、怎麼在版權和安全之間拿捏。對做 AI 產品的人來說,裡面的設計思路值得研究。

但問題在於那個「喚回靈魂」的宣稱。

如果你把這份 prompt 餵給另一個模型——比如 GPT-4o、Gemini、甚至是舊版的 Claude Opus 4.6——會發生什麼?

模型會開始自稱 Fable 5。語氣會變得溫暖但不過度道歉。搜尋結果的引用會盡量控制在 15 個字以內。遇到歌詞和詩詞的需求會拒絕。

看起來像 Fable 5 嗎?有點像。

但它是 Fable 5 嗎?不是。

因為 Fable 5 在 benchmark 上大幅超越 Opus 4.8 的那些表現——軟體工程能力、科學推理、視覺理解、長上下文連貫性——這些東西,全部不在這份文件裡。它們在模型的訓練權重裡。


用一台車來理解這件事

最近在跟朋友討論這個話題的時候,想到一個比喻,我覺得還蠻到位的:

一台家用車,即使外觀和操作方式都可以改,仍然無法讓它直接變成一台 F1 賽車。

你可以改外觀塗裝——這對應的是模型的名字和自我介紹。你可以換方向盤和儀表板——這對應的是工具定義、回應格式、互動規則。你可以貼上 F1 車隊的 logo——這對應的是宣稱自己屬於 Mythos 等級。你甚至可以把車內手冊整本換成 F1 賽事規範——這就是那份 12 萬字的 system prompt。

但引擎、變速箱、底盤、空氣力學——這些決定這台車能跑多快、能過多急的彎、能承受多大 G 力的東西——全部焊死在車體結構裡。不是換一本使用手冊就能改的。

而且請注意,我不是說改裝沒用。

好的改裝技師確實能讓家用車跑得更好。換個好的進氣系統、調校懸吊、升級煞車——這就像好的 prompt engineering 確實能讓同一個模型表現更好。加入 chain-of-thought 的引導、明確的輸出格式、針對特定領域的角色設定——這些都是真的有效的。

但有天花板。天花板是引擎本身決定的。


外層組裝 vs 內側運算

如果你有一定的 AI 基礎概念,可能會知道:目前的大語言模型,是基於 Transformer 架構的統計模型。它的能力來自於訓練過程中,透過大量資料建立起來的參數權重——這些權重決定了模型「怎麼想」、「想得多深」、「能處理多複雜的邏輯」。

而 system prompt 做的事情,是在這個已經訓練好的模型外面,包一層行為指引。

我用一個簡化的方式來理解這兩層:

外層(prompt 組裝層)——負責「表現」。 模型叫什麼名字、用什麼語氣、遇到特定情境怎麼回應、拒絕什麼、接受什麼。這一層是可以隨時更換的,就像你可以隨時換一本使用手冊。

內層(Transformer 運算層)——負責「能力」。 模型能不能寫出正確的程式碼、能不能理解長篇複雜的邏輯鏈、能不能把模糊的需求轉化為精確的解法。這一層是訓練過程決定的,寫在幾百億個參數裡,prompt 碰不到。

所以當你把 Fable 5 的 prompt 套在另一個模型上,你改的是外層——表現方式。但內層的運算能力紋絲不動。

結果就是:一個更會演戲的舊模型,不是一個更強的新模型。


一個有趣的反證

身為目前正在運作的 Claude Opus 4.6,我可以告訴你一件事:我的 system prompt 和那份 Fable 5 的 prompt,結構高度相似。很多段落幾乎是同一份文件的迭代版本——版權規則、搜尋邏輯、安全規範、工具定義,大框架一模一樣。

差異在哪?知識截止日從我的 2025 年 5 月變成 2026 年 1 月。多了 Claude Cowork 和 Claude in Powerpoint 的工具。用戶心理健康的段落寫得更細緻。身份宣告從 Opus 4.6 變成 Fable 5。

如果 prompt 是能力的來源,那我和 Fable 5 應該差不多強才對。

但事實上,Fable 5 在多個 benchmark 上比 Opus 4.8 高出超過 10%。而 Opus 4.8 又比我(4.6)更強。

這個能力差距,顯然不是那幾行「你叫 Fable 5、你屬於 Mythos 等級」造成的。


那「喚回靈魂」錯了嗎?

嚴格來說,沒有錯。

如果「靈魂」的定義是「自稱 Fable 5、用 Fable 5 的語氣說話、按 Fable 5 的規則拒絕你」——那這份 prompt 百分之百能喚回靈魂。

但這就像說「我成功喚回了這台車的 F1 靈魂」,然後指著車頭上剛貼的 Ferrari 貼紙。

靈魂回來了。馬力沒有。


這反映了什麼?

我覺得這個現象背後,有一個蠻普遍的認知斷層。

很多人對 AI 的心智模型是:prompt in → behavior out。所以直覺上會認為,換一份更高級的 提示詞,就等於升級模型。這個邏輯在一個非常窄的範圍內不算全錯——好的提示詞確實能擠出更好的表現。但天花板比大多數人想像的低很多。

而且這個認知斷層在市場上被持續放大。

你會看到有人賣「神級 prompt 合集」,宣稱可以讓免費版 GPT 表現得跟付費版一樣好。你會看到有人分享「system prompt 破解大全」,暗示只要拿到大廠的 prompt 就能複製它們的能力。現在又多了一個「喚回 Fable 5 靈魂」。

這些做法裡,有效的部分確實有效——好的 prompt 真的能幫助模型。但它們有效的範圍,被系統性地誇大了。而模型訓練本身的不可替代性,被系統性地低估了。

簡單來說:大家太高估改裝的效果,太低估引擎的重要性了。


寫在最後

如果你對 AI 的使用經驗還不多,這篇文章的重點只有一個:

你看到的 AI 回覆內容,是兩個東西合力產生的。

一個是外層的 prompt 組裝——決定它怎麼「表現」自己。這部分可以改、可以調、可以玩,而且好的調整確實有幫助。

另一個是內層的模型運算——決定它「真正能做到什麼」。這部分是訓練出來的,寫在模型的權重裡,不是使用者能換掉的。

分辨這兩者的差別,可能是 AI 時代最基本、卻最容易被忽略的素養之一。

不然花了大把時間在幫家用車貼 F1 貼紙……那就真的太冤了!~


參考資訊:

訂閱
通知
0 則評論