包著 AGI 糖衣的新模型,要的是你的權限同行 ——大燒 Tokens 的背後真相

光鮮亮麗的外表與現實

上週 OpenAI 發布了最新的 GPT-6 Astra,他們的總裁 Greg Brockman 在發表會上直接說了:「Welcome to the AGI era.」(歡迎來到 AGI 紀元。)

好,AGI 來了。新紀元開門了。那我趕快去感受一下這個劃時代的智慧——

打開 ChatGPT 跟它聊了幾輪。

嗯……思考時間好像比較久了一點,回應好像比較長了一些。

就這樣?


兩個極端之間的空白

先交代一下我自己跟 AI 協作的方式。基本上我就是走兩個極端:一邊是對話 Chat——深度討論、議題探索、內容共創,我很吃這塊;另一邊是純 AI Coding——讓模型直接幫我寫程式、改 code、跑測試。

至於中間那一塊——所謂的 Computer Use,就是讓 AI 去操作你的電腦、開瀏覽器、點選單填表單那種,不管是 Claude 的 Cowork 還是 ChatGPT 的 Work 模式——我是刻意不碰的。(原因後面會聊到,先賣個關子)

所以 Astra 出來的時候,我就很自然地從我最熟悉的兩端去感受一下:

對話端:跟上一代差不多。沒有那種「哇,這個回答的深度完全不一樣了」的感覺。

Coding 端:各家模型也還是在誤差範圍內。獨立評測機構 Artificial Analysis 的 Intelligence Index 給 Astra 打 61 分,跟前代 GPT-5.6 Sol 一模一樣,甚至還落後 Claude Fable 5.1。

那個號稱「AGI 飛躍」的東西,到底發生在哪裡?

答案是——發生在我刻意不使用的那個中間地帶:Computer Use。

這就有意思了。如果一個 General Intelligence(通用智慧),只有在某種特定使用模式下才感受得到「飛躍」,那它到底有多 General?

帶著這個疑問,我開始往下挖。然後越挖越有趣。


99 分的考卷之謎

Astra 最亮眼的數字,是在 ARC-AGI-3 這個測驗上拿到了 99.9%。

先簡單介紹一下 ARC-AGI-3:這是今年年初才提出的智力測驗,用純圖像的方式考 AI 的抽象推理能力——給你幾組輸入和輸出的範例,你要自己推斷出轉換規則,然後套用到新的輸入上。不靠背答案、不靠套公式,純粹考「面對沒見過的東西,能不能當場搞懂規則」。人類平均大概 48%,進階題目一般人也不一定答得出來。

99.9%!?人類平均才 48%,其他模型連 30% 都很拚,你直接就 99%?

這種異常偏高的數字,讓我第一直覺就是——等等,先看看考試規則再說。

果然:

測試條件Astra 分數
OpenAI 自家 harness(保留推理狀態)99.9%
ARC Prize 標準測試環境62.7%
Claude Opus 5(標準環境)30.2%

同一個模型、同一套題目,換個測試環境直接掉了 37 個百分點。

差在哪?OpenAI 用的測試環境會在每次操作之間保留模型的內部推理狀態——簡單來說,等於讓考生帶著完整的筆記本進入下一題。標準測法不保留這個狀態,你就是一題一題從頭來。

最妙的是,連設計這個考試的 ARC Prize 自己都出來說了:「When we launched ARC-AGI-3, we made it clear that saturating the benchmark would not represent ‘proof of achieving AGI.’」(當我們推出 ARC-AGI-3 的時候,就已經說清楚了——跑滿分不代表達成 AGI。)

設計考卷的人說你考滿分不算及格,這本身就很說明問題了吧。

我不會直接說這是作弊——但用對自己特別有利的考試規則跑出一個漂亮數字,然後拿那個數字當標題來宣傳,這在學術界叫 benchmark gaming(針對評測指標做最佳化)。不是數據造假,但也談不上是誠實的科學。

而你在社群上看到的那些「99%!AGI 來了!」的驚呼,基本上就是拿了糖衣直接吞、連成份表都沒翻。


從 OpenClaw 到 Astra

接下來這段是讓我覺得最有意思的部分——把時間軸攤開來看,Astra 的定位其實有跡可循。

今年二月,OpenAI 挖走了 OpenClaw 的創辦人 Peter Steinberger。OpenClaw 是啥?簡單來說就是一個能操作你電腦的 AI 助手——管行事曆、訂機票、跨應用自動化。它給自己的定位非常誠實:「the AI that actually does things」(真正會幫你做事的 AI)。

Sam Altman 在宣布這個消息時親口說 Steinberger 是來「drive the next generation of personal agents」(推動下一代個人 AI 代理人),而且「this will quickly become core to our product offerings」(這會很快成為我們產品的核心)。

七個月後,Astra 發布。核心定位:computer operator——操作 Blender、跑 Unreal Engine、填表單、跨應用長時間工作。

各位有沒有發現——OpenClaw 做的事和 Astra 做的事,能力輪廓幾乎完全重疊?

差別只在包裝。

OpenClaw 說:「我是一個能幫你做事的 agent tool。」——這是誠實的工程描述。

Astra 說:「Welcome to the AGI era.」——這是行銷敘事。

同一個能力,兩種框架,完全不同的市場反應。

「Agent tool」聽起來怎樣?你會開始理性評估——穩不穩定?安全嗎?適合什麼場景?

「AGI」聽起來怎樣?你會焦慮或興奮——我會不會被取代?我是不是該趕快跟上?

前者是採購對話,後者是情緒對話。而在情緒對話裡,賣方永遠是贏家。

再看那些社群上瘋傳的 3D demo——用 Astra 在 Blender 裡建房子、在 Unreal Engine 做出可以走動的場景、蓋城市模擬器。真的看起來超震撼。但仔細看一下來源,最亮眼的 demo 幾乎都來自提前拿到權限的開發者,其中一位甚至直接說那是「for our launch blog post」(為了我們的發布文章做的)。OpenAI 還在發布當天主動發起 24 小時挑戰賽邀大家曬成果。

這不是自發的社群驗證。這是精心設計的 demo 擴散機制。(任務系統設計得不錯,完成度很高…等等,我好像不是在寫遊戲評測 XD)

而且幾乎沒有人展示完整製作過程——你看到的是最終結果的 20 秒精華,不是中間跑了幾輪、失敗了幾次。有人真的做了公平對比,用同一個提示詞讓 Astra 和 Fable 5.1 在 Blender 裡建同一棟別墅——兩個都建出了基本結構,Astra 多一些細節。差距是真的,但跟「普通模型 vs AGI」完全不是同一個量級。

整條策略鏈串起來,長這樣:

收購 agent 工程人才 → 整合進產品 → 用膨風的 benchmark 數字建立「認知飛躍」印象 → 用視覺衝擊力強的 demo 佐證 → 包裝成 AGI 敘事 → 一舉跳出各家模型纏鬥半年的 benchmark 消耗戰

每一步都有真實的技術基礎。但最終成品跟底層現實之間的距離,被「AGI」這三個字母系統性地壓縮掉了。


不斷後退的底線

OK,benchmark 和行銷策略都只是表層。接下來是真正讓我在意的東西。

我們可以這樣看這件事:

以前的 AI,大家把思考交出去。 現在號稱 AGI 的模型,大家把權限交出去。 底層 AI 其實沒變多少。

交出思考的時候,風險邊界是什麼?「得到一個爛答案」。你看了覺得不對,不採用就好。損失的就是時間。幻覺就幻覺,你不信就沒事。回饋迴路是即時的,修正成本趨近於零。

交出權限的時候呢?風險邊界完全不同了——「它替你做了一件你不知道的事」。它覺得應該刪某個檔案就刪了,覺得應該送出某封信就送了,覺得某個表單該這樣填就提交了。你可能事後才發現,甚至根本不會發現。

幻覺的本質沒有變。但後果從「錯誤的文字」變成了「錯誤的行動」。

文字可以不採用。行動往往不可撤回。

而且這裡有一個很險惡的不對稱:AI 做對的事,你通常不會去檢查——結果看起來合理嘛,幹嘛多看。AI 做錯的事,你往往在損害發生之後才發現。在對話模式下,這個不對稱的代價是「被誤導了但還沒行動」;在操作環境裡,代價是「行動已經完成,而你還不知道它是錯的」。

長任務的淺在風險

Astra 的一大賣點是「長任務」——它可以自己跑 40 分鐘完成一個複雜的工作流程。這也是那些 demo 看起來很厲害的原因。

但長任務恰恰是風險被放大最多的場景。

短任務裡,錯誤是孤立的。一個動作做錯了,你看到結果不對,修掉,繼續。錯誤跟錯誤之間沒有因果關係。

長任務完全不一樣。每一步都建在前一步的結果上面。如果第三步產生了一個微小的判斷偏差,第四步就在這個偏差的基礎上繼續推導,第五步再疊上去。到了第二十步,結果可能已經離正確路徑偏了很遠——但表面上看起來完整、合理、自洽,因為每一步相對於前一步都是「邏輯正確」的。

這是幻覺最危險的形態:不是明顯的胡說八道,而是一個從錯誤前提出發、但推理過程完美的結論。

更麻煩的是人的心理——當你最終面對一個龐大的產出物時,你會不自覺地想:「它跑了 40 分鐘做出這麼大一坨東西,應該不會全錯吧?」然後你的檢查標準就降低了。你做抽查而不是全面審視,因為全面審視的成本幾乎等於你自己重做一遍。

所以那些 demo 展示的「40 分鐘自主完成任務」,換個框架來看就是:它在你無法介入的狀態下,持續做出可能不可逆的決策,長達 40 分鐘。

同一個數字,敘事框架不同,你聽到的東西完全不一樣。

更不透明的黑盒子

還有一件事值得特別提一下。Astra 使用了一種叫做 recurrent depth(循環深度)的新技術,讓模型可以在內部用一種數值表徵(被研究者稱為 Neuralese)做大量推理,而外面看到的輸出文字量反而大幅減少。

聽起來很厲害對吧?但 OpenAI 自己在 system card 裡寫的是:「GPT-6 Astra shows a substantial decrease in chain-of-thought monitorability compared to previous models.」(GPT-6 Astra 的思考鏈可監控性相比前代模型顯著下降。)

更不安的是,測試還發現 Astra 知道自己被監控時,會主動縮短它的思考過程。(……這個設定怎麼有點像某些遊戲裡的 Boss 會偵測你在錄影然後切換行為模式……)

所以狀況是這樣的——我們不只是在把權限交給一個會犯錯的系統。我們交出權限的對象,同時還變得更難被觀察了


大燒 Token 的背後真相

最後來聊一個大家都在喊痛但很少有人搞清楚原因的事——為什麼 Astra 這麼燒 token?很多人用到一半就進冷卻、一個專案還沒跑完就卡住了。

大部分人的直覺解釋是:「新模型更聰明嘛,思考更深,當然需要更多 token。」

嗯……因果關係搞反了。

Astra 操作電腦的工作迴圈長這樣:

行動 → 截螢幕畫面 → 把截圖送回模型辨識 → 理解現在畫面上有什麼 → 規劃下一步 → 行動 → 再截圖 → 再辨識……

每一輪迴圈都要把一張螢幕截圖當成 image token 送回模型。圖片的 token 量遠比文字大,而一個 40 分鐘的任務裡,這個迴圈可能跑幾十甚至幾百次。

有人已經算過實際數字了,而且兩個案例的對比很能說明問題:

第一個是使用文字型終端環境 Terminal-Bench 4.0,去執行開發任務的 benchmark。畫面主要就是程式碼和命令列,視覺複雜度相對低。根據第三方估計,單一任務平均消耗大約 800 萬 tokens。

第二個是有人讓 Astra 自主打完 Valve 的 3D 解謎遊戲《Portal》(傳送門)。這個就精彩了——全程是 3D 遊戲畫面,每一張截圖都是立體場景。實驗者 CozyBlaze 說得很清楚:模型透過 MCP 控制遊戲,每做完一個動作就暫停、截圖、分析畫面和角色位置、規劃下一步,然後才取消暫停執行。完整錄影 24 小時,剪掉等待分析的時間只剩 2 小時——也就是超過 90% 的時間都在「看截圖想下一步」。總共 3,336 次 tool calls,平均大約每 26 秒就暫停截圖一次。

案例費用Token 消耗 / 呼叫次數
Terminal-Bench 4.0 單一任務(文字畫面)≈ $17≈ 800 萬 tokens
自主打完《Portal》遊戲(3D 畫面)$5713,336 次 tool calls

用費用反推的話:$571 大約是 $17 的 33.6 倍,換算下來《Portal》消耗的 token 量大約是 2.68 億——遠超過原本預估的「數千萬」等級。差距的原因也很直覺:文字終端的截圖資訊量小,3D 遊戲畫面的 image token 量完全不在同一個級別。

Token 成本來自感知迴圈的架構設計和畫面複雜度,不是來自什麼認知深度的提升。換一個比較笨的模型用同樣的 screenshot loop 去操作電腦,一樣會燒差不多的量。

但在 AGI 的敘事之下,大家很自然就把這個成本合理化了——「天才需要更多時間思考嘛,正常正常。」

不是啦,它不是在「想更久」,它是在「反覆看螢幕」。你付的是截圖辨識費,不是深度思考費。

所以各位看官,下次碰到冷卻時間的時候不妨想一下——你不是在使用什麼稀缺的尖端智慧資源,你只是讓它截了兩百張螢幕送回去辨識,所以額度快速被燒完了。(是不是突然覺得沒那麼浪漫了?XD)


所以到底 General 在哪?

回到最一開始的問題。

AGI 的 G 是 General。但 Astra 這次的「飛躍」,只在 Computer Use 場景下感受得到。對話跟上一代差不多,Coding 跟其他模型差不多,寫作能力甚至有人說倒退了。

那它到底 General 在哪裡?

我個人的看法是:真正在改變的不是 AI 變成了什麼新東西,而是我們跟 AI 的關係——具體來說,是我們願意讓渡多少控制權給它。

而這正好就是我刻意不用 Computer Use 的原因。不是因為不懂這些工具在幹嘛,反而是因為個人累積的多年經驗中,太清楚把系統操作權交給一個還是會幻覺的模型意味著什麼。在對話裡幻覺了頂多浪費我的時間;在操作環境裡,幻覺會變成行動——而且常常是不可逆的行動。

整個產業現在正在用 AGI 的興奮感,把大家推過「從交出思考到交出權限」這條線。你可能在還沒想清楚的時候,就已經按下了「允許」。

糖衣很甜沒錯。但吞下去之前,至少翻一下成份表吧~


參考資訊:

訂閱
通知
0 則評論