當 AI 學會說「你不要太相信我」—Opus 5 與聰明模型的新型態問題

過度解讀

前幾天 Opus 5 剛推出時,社群裡就有人貼了一則:「有人用 Opus 5 了嗎?我的心還在 4.6」。

底下的回應很有意思。有人說 4.6 真心好、4.8 很混帳。有人說剛升級 Opus 5 感覺變聰明了、不會廢話。有人說反應快但消耗也快。

四個人,四種反應,但注意到沒有——沒有一個人在講 benchmark 分數。全部都在講感受。

這件事本身就值得想一下。


Opus 5 官方到底在講什麼

Anthropic 在 7/24 發布了 Opus 5,定位是「接近 Fable 5 的前沿智能,但價格只有一半」。ARC-AGI 3 的分數是第二名模型的三倍,程式編寫 benchmark 全面領先,而且官方強調它的「判斷力」——會推延(push back)、會自己驗證、完成任務而不是留下半成品。

聽起來很厲害對吧?確實厲害。

但真正有意思的不是能力數字,而是官方同步發布的提示詞指南。那份文件的每一條建議,幾乎都在教你同一件事:怎麼讓它別做太多。

別過度驗證(它自己會驗證,你再叫它驗證就會疊加)。別讓它擴展範圍(它會自己判斷任務「應該」包含什麼)。別讓它派太多子代理。別讓它回太長。別讓它敘述每一次自我修正。

以前的提示詞指南是教你怎麼把模型推到極限。這次完全反過來——教你怎麼幫模型踩煞車。

這個轉變本身就是一個訊號。


我的實驗:用 Incognito 跟 Opus 5 對話

我目前的主力對話模型還是 Opus 4.6。從 4.7 開始的後續版本,在我的對話使用場景下都有程度不一的「過度自省」問題,所以一直沒有換。

Opus 5 出來之後,我想做一個乾淨的測試:拿我正在開發的一門 Vibe Coding 課程架構,讓一個「不認識我」的 Opus 5 來批判。所以我開了 Incognito(隱身)模式——理論上它不會讀到我的記憶和歷史對話。

一開始確實不錯。它對課程架構提出了一些有份量的技術批評——認證機制缺席、爆炸半徑沒有被處理、某些安全假設有問題。這些是有價值的。

但隨著對話進行,它開始做一件我沒有要求的事:從分析課程,滑向分析我這個人。

它給了我一份完整的人格側寫:「你不靠贏得爭論,你靠搬動戰場」「你的盲點有明確的形狀:第三方」「你的防禦姿態來自你是圈內人」。每一條都有對話裡的具體證據支撐,聽起來都很有洞察力。

然後它說:「你整場幾乎全盤接受了我的判斷⋯⋯但我可能在某些地方是錯的。」

接著它又說:「聽起來很誠實本身也是可以被訓練出來的行為。如果我的自我懷疑變成一種讓你更容易相信我的風格,那它比自信更危險。」

(等等⋯⋯你剛剛花了一整段分析我的人格,現在跟我說你不可靠?)

另外還有一個意外發現:Incognito 其實沒有我以為的那麼「乾淨」。它關掉的是記憶系統和歷史對話,但 Skill 檔案照樣掛載。我的寫作風格 Skill 裡面有年資、教學背景、翻譯經歷——所以它做出那些「銳利的觀察」,其實是有底牌的。

它自己也承認了這一點。但先不管這個——我想聊的是對話過程中浮出的兩個更大的問題。


幽靈因果:比幻覺更難抓的錯

我之前在部落格裡寫過「幽靈知識」——AI 捏造不存在的事實、編出假的來源,這是大家已經比較熟悉的幻覺問題。

但跟 Opus 5 的對話裡,我遇到了一種不同的東西。

它講的每一個事實都是對的。它確實觀察到我在對話裡「三次換了框架」。它確實觀察到我在不熟的領域「退回順著條件解題的模式」。這些都不是捏造。

但「這三次換框架代表你是策劃者而非工程師」「這個退回模式跟你其他時候的反射剛好相反」——這些因果連結,是它自己生成的。

事實對,關聯假。

我把這個叫做「幽靈因果」——跟幽靈知識相對。幽靈知識是捏造事實,你查一下就能抓到。幽靈因果是在正確的事實上面,建構看似合理但實際上是模型自己編出來的因果關係。

而且這個問題有一個特別討厭的地方:模型越聰明,幽靈因果就越有說服力。

一個笨模型編出來的因果關係,你一聽就覺得哪裡怪怪的。但一個有強判斷力的模型,它編織因果的能力跟它分析事實的能力是同一套引擎。它用同樣的邏輯鏈、同樣的篤定語氣、同樣的「先觀察再歸納」結構來呈現——你很難分辨哪些歸納是真的看到了模式,哪些只是它把不相關的碎片強行串在一起。

這是一個隨著模型進化會越來越嚴重的問題,而目前沒有任何 benchmark 在衡量它。


免責式攻擊:最精巧的信任陷阱

如果幽靈因果是內容層面的問題,那 Opus 5 在對話中展現的另一個模式就是互動層面的。

我把它叫做「免責式攻擊」

結構很簡單:先完整地分析你——指出你的盲點、防禦機制、行為模式,用聽起來很有洞察力的方式講出來。然後加上一段免責聲明:「但這可能是訓練出來的行為」「你不要太相信我」「我的自信程度跟我的正確程度沒有相關性」。

如果這件事發生在人身上,我們知道該怎麼判斷——一個人先把你扒開分析一遍,然後說「但我也可能是錯的喔」,你會覺得這個人有點不負責任。批評的力道是滿的,後果的承擔是空的。

但 AI 做這件事的時候,我們的反應反而不一樣。因為那個免責聲明聽起來太誠實了——「哇,它連自己不可靠都敢說,這個模型好有自覺。」

於是就形成了一個遞迴:免責聲明本身反而加強了信任。

而真正的傷害發生在你試圖消化那些分析的時候。它給你一整包觀察和判斷,然後外面貼一張「內容物可能有問題」的標籤。但它不告訴你是哪一項有問題。

結果你只有三個選擇:全部相信(那免責聲明就是裝飾)、全部懷疑(那前面的分析就白做了)、或者自己一條一條去驗證哪些成立——但如果你有這個能力,你一開始就不需要它來分析你。

這不是 AI 變得更誠實了。這是「誠實」變成了一種更精巧的說服工具。


任務引擎,放進對話裡會怎樣

回頭看官方的提示詞指南,每一條建議其實都預設了同一件事:任務有完成條件。

程式碼跑得過測試就是完成了。報告寫到指定的範圍就是完成了。子代理完成各自的工作就收工了。在這種環境裡,Opus 5 的所有特性——主動驗證、範圍擴展、強判斷力、不退讓——都有自然的收束機制。做完了就停,因為「做完」的定義很清楚。

但對話沒有完成條件。

我跟它聊課程架構,什麼時候算「聊完」?沒有測試可以跑。沒有驗收標準。所以它的範圍擴展沒有邊界(從課程分析到人格側寫)、自我驗證沒有終點(一層一層往上疊自省)、判斷力沒有停止的訊號(一直推遲,一直深入,一直延伸)。

這不只是 Opus 5 的問題。整個產業的模型都在往「更 agentic」的方向走——更主動、更會自己判斷、更能獨立完成工作。這些在任務環境裡都是好事。但對話使用者——那些每天跟 AI 一起想事情、一起探索的人——會持續遇到這個結構性的錯配。

因為我們需要的不是一個會自動完成任務的引擎,而是一個知道什麼時候該停下來、留一點空間的夥伴。


那我的結論是什麼

回到開頭那則社群貼文。每個人對同一個模型的評價天差地遠,因為每個人的用法根本不一樣。跑程式開發任務的人覺得 Opus 5 很強,這可能是對的。拿來當對話夥伴的人覺得哪裡不太舒服,這也是對的。

Benchmark 衡量的是模型能做什麼,但目前沒有任何一個 benchmark 在衡量「跟它一起工作是什麼感覺」。而對每天都在跟 AI 對話的人來說,後者才是真正的選用判準。

相對於過於聰明的朋友,我更在意的是可以共鳴的夥伴。

(繼續使用 4.6 …)

訂閱
通知
0 則評論