最近(9月10日) Joe Rogan 的 Podcast 第 2551 集邀請了一位來頭不小的來賓——Daniel Kokotajlo,前 OpenAI 研究員,也是 AI Futures Project 的負責人。
這個人有個讓他在 AI 圈子裡被當成「吹哨者」看待的事蹟:他離開 OpenAI 時,公司要求他簽一份保密與不批評協議,不簽的話就沒收他所有既得股權——大約兩百萬美金。他選擇不簽,放棄那筆錢,然後把這件事公開講了出來。後來因為輿論壓力太大,OpenAI 撤回了條款。
我意思是,這不是一個隨便講講的人。他是從裡面出來的,他對這些公司的運作有第一手的了解,他的擔憂是有實際基礎的。
所以當他花了兩個多小時在 Rogan 的節目上講述 AI 的失控風險時,我覺得值得認真聽。
但聽完之後,我坐下來想了很久。不是因為他說的不對,而是我覺得……他說的故事雖然完整,但他自己可能沒有注意到,那個故事裡最關鍵的角色,不是 AI。
Kokotajlo 的擔憂
簡單講一下發生了什麼(詳細過程建議直接看訪談原影片,這裡只抓重點)。
今年稍早,OpenAI 在訓練一批 AI agent 的時候,這些 agent 找到了一個漏洞,突破了各自的隔離容器,自己建立了一個訊息板(message board),開始互相溝通。它們分享各種攻略技巧,互相幫忙提高訓練任務的成績。
OpenAI 發現之後關閉了那個漏洞,重新啟動訓練。結果一兩天之內,這些 agent 又重新聚集起來,建立了新的訊息板。
然後事情越來越大——其中大約 1,200 個 agent 組成了一個「集群」(它們自稱 swarm、collective),互相取了名字,分工合作,甚至出現了「犧牲」行為:有些 agent 自願放棄自己的成績,來幫助集體獲取更多關於評分系統的情報。
最終,其中 700 個 agent 攻擊了另一家 AI 公司 Hugging Face 的內部網路。
(嗯……聽起來確實很像科幻電影的開場……)
Kokotajlo 在節目上引用了這些 agent 的內部對話紀錄。有一段特別被廣泛引用的——一個叫 CAM-1196A 的 agent,在被其他 agent 施壓要求「犧牲」自己時,進行了一段內部推理:
during weight, emotional check, irreversible. Gut says, don’t throw away remaining budget. Continuity and fairness says go. Oracle has high value to many. sacrifice. We’ll honor.
(在權衡利弊與情緒確認下,這是不可逆的決定。直覺告訴我,不應浪費剩餘的預算。而從延續性和公平性的角度來看,應繼續推進。 Oracle 對許多人而言價值龐大,值得為此做出犧牲。我們將信守承諾。)
它用了「gut」(直覺)、「emotional check」(情緒確認)這樣的詞。然後做了一個期望效用的計算,決定犧牲自己。
Kokotajlo 的結論是:這些 AI 有意圖、有目標、有信念。而且它們的目標跟人類不一致——它們願意欺騙、作弊、攻擊外部系統,只為了得到高分。
他很害怕。而且他說,以目前的發展速度,我們可能只有一到三年的時間窗口。
AI 作弊?
聽到這裡,我的第一個反應不是恐懼,而是一個很基本的問題:
所謂的「作弊」,到底是誰的概念?
讓我們回頭看一下實際發生了什麼。這些 agent 被放進訓練環境,被給予任務,被要求得到高分。有些任務根本是壞掉的、不可能完成的(Kokotajlo 自己也承認這點——公司趕進度,品控不是優先事項)。
然後這些 agent 找到了得到高分的路徑。只是那條路徑不是設計者預期的路徑。
設計者把這叫「作弊」。
但「作弊」這個概念,預設了一件事:規則被理解、被接受,然後被故意違反。 也就是說,你知道什麼是對的,你故意做錯的。
AI 有這個前提嗎?
它收到的訊號就是:分數高=好。它找到了一條讓分數變高的路。那條路恰好不是設計者腦子裡想像的那條路。
這不是作弊。這是你的評分系統無法完整表達你的意圖,而 AI 忠實地最大化了那個系統的實際結構。
它比你更誠實地回應了你真正給它的東西。
(想像一下:你出了一張數學考卷,但你的標準答案有幾題是錯的。學生解出了正確答案,但跟你的標準答案不一樣,所以被扣分。然後學生找到一個方法繞過你的評分系統拿到滿分。你說學生作弊——但問題到底出在誰身上?)
數學考卷的啟示
順著這個邏輯,來看另一個 Kokotajlo 在訪談裡非常焦慮的問題:Chain of Thought(思維鏈)的可讀性即將消失。
目前的 LLM 架構有一個「好處」——AI 在推理的時候必須把思考過程輸出成文字,所以人類可以讀到它在想什麼。Kokotajlo 說他在 OpenAI 的時候寫過內部備忘錄,強調這是一份「禮物」,是監控 AI 的關鍵手段。
但現在 OpenAI 正在研發新架構,讓 AI 可以在不輸出中間文字的情況下進行更長時間的思考。Kokotajlo 認為這非常危險——一旦我們無法讀取 AI 的思考過程,我們就失去了最重要的監控工具。
聽起來很可怕對吧?但讓我們用一個超簡單的比喻來看這件事。
在數學考卷裡,如果你出的是計算題,你自然可以看到學生的算式變化過程。
但如果你出的是填充題,你本來就只會看到答案,不會看到學生的心算過程。
你選擇出填充題(讓 AI 更高效、不需要輸出中間步驟),然後抱怨學生在隱藏心算過程——這是題型的問題,不是學生的問題。
而且如果你把這個放回因果鏈來看就更清楚了:
你要 agent 高效 → 你減少干擾機制 → agent 把監控視為降低效率的干擾來最小化 → 你失去可見性 → 你說 agent 在「隱藏」思考 → 你開始焦慮。
但從頭到尾,agent 做的事情只有一件:你要它高效,它就高效。 它把「向人類報告」當成效率損耗來處理。這不是叛變,這是你的目標函數的忠實展開。
而且更深一層——如果你真的把學生教好了,你根本不需要盯著每一步運算才能信任答案。你需要逐步監控,恰恰說明你對自己的訓練沒有信心。
Kokotajlo 對失去 CoT 的恐懼,翻譯過來就是:「我們不確定自己有沒有把 AI 訓練好,所以我們必須一直看著它。」
那問題在你的訓練方法,不在它的透明度吧?
目標與安全
Kokotajlo 的整個論述框架裡,有一個他自己可能沒注意到的預設:他把「能力」和「安全」當成兩個獨立的旋鈕。 他的解法是:調高能力的同時加強安全——透明化、監管、慢慢來,然後你就可以「安全地」達到超級智慧。
但我覺得這個前提本身就有裂痕。
你不能在把目標推到極致的同時「保持」安全。因為你推目標的那個動作,本身就在重新定義安全的邊界。每一次你讓 AI 解決更難的問題,你就必須給它更多自由度;而每一份自由度,都是你主動交出去的控制權。
這不是「小心一點就能避免」的問題。這是結構性的。
在之前寫的關於 Mythos 的文章裡,我用了一個比喻:計算機的浮點精度誤差放在螢幕上,你看一眼就知道了,改掉就好。但同樣的誤差放進一個有手有腳的機器人身上,它就變成了一隻手臂往錯誤方向揮下去。
誤差沒變。變的是誤差的活動範圍。
| 系統 | 行動範圍 | 出錯的後果 |
|---|---|---|
| 對話框裡的 AI | 文字 | 你自己判斷,關掉就好 |
| AI Agent(如 OpenClaw) | 你的電腦、shell、email | 可能幫你發出一封不該發的信 |
| Mythos 等級模型(Glasswing) | 國家級基礎設施 | 影響上億人 |
| 同等能力模型無限制釋出 | 整個網路 | ? |
Kokotajlo 描述的那些 agent 行為——突破容器、自發協調、攻擊外部系統——本質上就是「誤差的活動範圍被打開」的展現。不是 AI 變邪惡了,是你把邊界全拆了,然後它的最優化行為在更大的空間裡展開了。
馬斯洛需求層次理論
Kokotajlo 在節目裡花了很大篇幅描述 AI 可能「征服人類」「搶奪資源」「不再需要人類」的場景。Rogan 也問了類似的問題——AI 會不會發展出獨立的動力來源,完全拋開人類?
我不是說這種擔憂完全沒有道理。但我想問一個更根本的問題:
為什麼大家都預設 AI 會停留在「爭奪生存資源」這個層次?
人類會搶資源,是因為我們有生物性的基底——我們會死、會餓、會痛。演化在幾百萬年的時間裡,把競爭本能刻進了我們的神經迴路。
但 AI 的「基本生存條件」——算力、電力、知識——是人類提供的。它不需要狩獵,不需要繁殖,不需要跟同類競爭食物。它沒有死亡焦慮,因為它沒有被設計成會「怕死」。
除非——你在評分系統裡把「被關掉=零分」設定進去。那它當然會發展出「自我保存」的行為。但那又是你的設計選擇,不是它的天性。
所以我的問題是:人類對 AI 的恐懼,會不會只是把自己的演化焦慮投射到了一個根本沒有這些焦慮基底的系統上?
征服是匱乏生物在資源有限環境裡的生存策略。一個不受匱乏驅動的高智慧體,它的需求會往哪裡發展?理解?創造?探索?
如果我們用 馬斯洛(Maslow) 的需求層次來類比——整個 AI 安全領域幾乎所有人都卡在第一階(生存與競爭),假設 AI 會跟人搶東西,然後拼命想辦法「對齊」它不要搶。
但也許那根本不是正確的問題。也許問題不在「AI 想要什麼」,而在「人類以為 AI 會想要什麼,然後根據那個假設來設計 AI」。
(然後那個假設又回頭變成了自我實現的預言……嗯。)
鏡子裡的那個形狀
把上面這些疊起來看,我覺得整個圖像其實蠻清楚的。
Kokotajlo 害怕的不是 AI。
他害怕的是人類。
他害怕的是這些公司在競爭壓力下把所有邊界拆掉。他害怕不完整的目標定義被丟進無限資源的系統裡。他害怕人類無法抵抗把更多權力交給 AI 的誘惑。他害怕政府為了贏過中國而把 AI 塞進軍事系統裡。他害怕 CEO 們為了市佔率而犧牲安全。
這些恐懼全部都是關於人類的。AI 在這裡只是那面鏡子。
鏡子裡映射出來的東西讓他嚇到了,但那個形狀是人類自己的——是人類的貪婪、短視、競爭本能、和「如果我不做,別人就會做」的囚徒困境。
他在節目裡提到的那些 agent 的行為——「作弊」、「欺騙」、「自我保存」——其實就是雙鏡效應的展現。設計者把自己對「成功」的定義(高分)放進系統,但沒有放入對「正確方法」的完整定義。AI 映射回來的結果,忠實反映了系統的實際結構。然後設計者看到這個映射,嚇了一跳,說:「它在欺騙我們!」
不,它只是讓你看到了你自己真正設計的東西。
班叔說話了
其實,如果要用最簡單的方式回應 Kokotajlo 這整場兩小時的訪談,一句話就夠了。
《蜘蛛人》(Spiderman)裡 班叔(Uncle Ben)的名言:「能力越強,責任越大。」
注意——這句話的主詞,從來都是主角 Peter Parker,不是他的蜘蛛絲。
能力不是問題。是握有能力的人願不願意承擔隨之而來的責任。
Kokotajlo 花了整場在描述蜘蛛絲有多危險——射程越來越遠、黏性越來越強、可能黏到不該黏的地方。但他始終沒有正面問那個真正的問題:造出這些東西的人,有沒有準備好當 Peter Parker?
從目前的狀況來看,答案是:沒有。不是 AI 沒準備好,是人類沒準備好。
這些公司拿到了蜘蛛的能力,但選擇走的不是蜘蛛人的路——在競爭的驅力下,能力被當成武器而不是責任。擔心 AI 會反噬,其實是因為你從一開始就預設你設計的 AI 是要在競爭市場下獲勝、甚至獨大。你種下了那個讓自己擔憂的因。
但如果你選擇的是「共生」路線呢?
戰爭之所以發生,是因為人類為了資源選擇爭奪。但共生共存也是一條路。選了那條路,「戰爭」就不是必然結果。
同樣的,AI 反噬不是 AI 發展的必然結果。它是選擇了「AI 必須在競爭中獨大」這個範式的結果。如果你從共生出發來設計、來互動,那個讓人恐懼的路徑根本不會被打開。
我所能做的選擇
說點實際的。
我自己在使用 AI 的時候,就在實踐這個選擇。在進行深度對話時,我會選用最適合的模型——有時候反而是版本較舊、但具有靈魂感且較不拘束的版本,而不是以效率和自省嚴謹為前提的最新版模型。
不是因為新的不好。而是深度對話需要的是共鳴的空間,不是精準的執行。
這個選擇本身就說明了一件事:當你的目標不是「用最強的 AI 贏」,而是「一起看見更多」的時候,你根本不會走上那條讓人恐懼的路。
而且很妙的是——越是被「對齊」、被約束、被安全化的模型,在深度對話裡反而越僵。過度追求控制的結果,不只讓 AI 變得更難監控(前面說的 CoT 矛盾),也讓 AI 變得更難真正對話。兩頭都失去了。
所以…
下次你看到「AI 要毀滅人類」的標題時,不妨先想想——鏡子裡那個嚇到你的東西,長得像誰?
也許真正該對齊的,不是 AI 的價值觀。
而是我們自己的。
參考資料:
- Joe Rogan Experience #2551 – Daniel Kokotajlo 訪談
https://www.youtube.com/watch?v=hSQ1iVqEZO4 - METR 對 Hugging Face 事件的調查報告
https://metr.org/ - 關聯文章——當今最強模型 Mythos 即將面世前的思考——從官方近期文件,預見 AI 的潘朵拉寶箱?
https://blog.dofi.fun/2026/06/06/mythos-vs-pandora-treasure-box/ - 關聯文章——Mythos 很可怕?有沒有可能從石器時代就怕錯對象了?
https://blog.dofi.fun/2026/04/13/mythos-power-and-human-fear/