當「完美的平庸」擴散到每一個產業——從 3D 奇蹟到 Gameslop 的複製模式

完美的平庸與品味

九月,AI 產業發生了一件值得注意的事——不是某一家推出了什麼厲害的東西,而是三家前沿實驗室幾乎同時往同一個方向衝。

Anthropic 在 9 月 22 日推出 Opus 5.5,官方第一次明確強調這是「Opus 系列中視覺和 Computer Use 能力最強的版本」。同一天,OpenAI 發佈了 GPT-6 Sol 和 Luna(Astra 則在三週前的 9/3 發佈),行銷文案直接寫:「Astra gets your vision and knows how to use Figma」(Astra 理解你的視覺構想,並且知道如何用 Figma 實現它)。Google 更早,年初就推出了 Agentic Vision in Gemini,副標題毫不含糊——「Agentic visual reasoning with code execution」(具備自主行動能力的視覺推理,結合程式碼執行)。

社群上的反應比新聞稿精彩得多。Opus 5.5 發佈兩天內,有人 one-shot 出一個《黑暗靈魂》(Dark Souls)風格的城堡關卡(有血條、有篝火機制、怪物會重生),有人讓它在一小時三十七分鐘內生出一整個可以在瀏覽器裡走來走去的 《麥塊》(Minecraft)複製品,有人用它做了 80 秒的玻璃馬賽克動畫,還有人花了 $13.30 的 API 費用就渲染出一座 Blender 奇幻城堡。

看起來像是「AI 突然學會做 3D 了」。

但如果三家同時往同一個方向衝,就不太可能是巧合。背後一定有一個共同的結構性原因。


視覺能力的真正驅動來源

直覺上會以為,這些視覺能力的提升是為了讓使用者做視覺設計、做 3D、做動畫。但順著時間線往回追,答案指向一個完全不同的方向——Computer Use。

三家都在推同一件事:讓 AI 接管使用者的電腦操作。

Anthropic 在今年二月收購了 Vercept——一家專門做 vision-based computer automation(基於視覺的電腦自動化操控)的新創公司。團隊裡有電腦視覺領域的先驅 Ross Girshick(R-CNN 架構的核心人物),以及來自 Allen Institute for AI 的機器人感知和強化學習專家。Anthropic 的收購公告寫得很白:「making AI genuinely useful for completing complex tasks requires solving hard perception and interaction problems」——要讓 AI 真正有用,就必須解決感知和互動的困難問題。

然後,四月的 Opus 4.7 圖像解析度跳了三倍,官方用了「generational leap」(世代飛躍)來形容。五月的 Opus 4.8 改善了 Computer Use 的可靠性。七月的 Opus 5 發佈隔天,就有人做出了 one-shot 的 FPS 遊戲 demo。

OpenAI 那邊也是同一條路線:Operator、Codex、ChatGPT Work 全面展開,Astra 主打的賣點就是「computer use and browsing」(電腦操控與瀏覽)。Google 的 Agentic Vision 更是直接把「visual reasoning」(視覺推理)和「code execution」(程式碼執行)綁在一起。

為什麼 Computer Use 會帶動視覺能力?

因為 Computer Use 的工作迴路是:操作→截圖→判讀→決定下一步→操作。每一次截圖判讀失誤,就多一輪完整的操作循環。多一輪循環就多一堆 token 消耗。所以改善視覺判讀的精度,同時改善了操作準確率、任務完成效率、和整體成本結構。

而且這裡有一個容易忽略的細節——截圖判讀的成本不只是「這一步看不看得懂」。在 agentic 長任務中,每次判讀失誤產生的額外循環,會像利息一樣在後續的每一輪中複利累積。視覺精度的改善,壓縮的不只是單一步驟的成本,而是整條任務鏈的膨脹係數。

所以 3D 創作社群恰好站在「程式碼品質」和「視覺理解」這兩條能力曲線的交叉點上。他們不是這些投資的目標客群——他們是附帶的受益者。

簡單說:AI 不是為了讓你做 3D 才變強的。它是為了操控你的電腦才變強的,然後你發現它順便也能做 3D 了。

(這條因果鏈是我的推論,Anthropic 沒有明說。但 Vercept 收購案的時間點、Opus 4.7 的視覺跳躍、以及三家同時往 Computer Use 方向收斂的事實,都蠻強烈地指向這個方向。)


三條間接路線

釐清一個重要前提:到目前為止,沒有任何一家的語言模型能直接生成圖像或影片。但社群已經發展出至少三種間接路徑:

路徑一:純程式碼渲染。 模型寫 Three.js、WebGL、Canvas animation,瀏覽器負責畫面。大部分在社群上瘋傳的 demo 走的是這條路。完全不需要圖像輸入,靠的是純粹的空間推理和程式碼品質。

路徑二:語言模型當導演,外部模型做渲染。 用 Claude 或 GPT 規劃場景、撰寫結構化的 prompt,再透過 MCP 或 API 串接影片/影像生成模型(例如 MiniMax)來實際產出。語言模型在這裡的角色是創意編排者,不是渲染引擎。

路徑三:Agentic 長任務操控 Blender/Unreal。 模型寫 Blender Python script 或 Unreal Engine 指令,渲染引擎負責執行。那個 $13.30 的城堡就是走這條路——35 分鐘、199,600 個 output tokens。

三條路徑裡,第三條最有趣,因為它的工作流是「寫 script → 渲染 → 截圖確認結果 → 修正 → 再渲染」的循環——和 Computer Use 的迴路結構幾乎一模一樣。也就是說,它最直接地受惠於 Computer Use 驅動的視覺能力投資。


重演的歷史

到這裡,如果你在技術產業待得夠久,應該會有一種似曾相識的感覺。

把這個現象的觸發條件抽象出來:

  1. AI 越過了「表面品質」的門檻——讓非專業者能產出看起來過得去的東西
  2. 表面品質和結構品質之間存在巨大落差——而這個落差外行看不出來
  3. 有開放的發佈通道,不做品質把關
  4. 結構性的缺陷會在下游產生真實的後果

程式開發領域已經完整走過這個循環。Vibe Coding 讓任何人都能讓 AI 產出「能跑的程式」,但資深工程師一看就知道裡面沒有輸入驗證、沒有錯誤處理、沒有考慮併發——表面正常,裡面全是地雷。

現在,同樣的模式正在視覺設計領域重演。

2026 年 GDC 調查的數字很說明問題:52% 的遊戲業專業人士認為生成式 AI 對產業有負面影響。兩年前這個數字是 18%。而反對聲音最強的,正是最懂視覺品質的那群人——視覺和技術美術從業者(64%)。

他們還發明了一個專有名詞:Gameslop(遊戲垃圾)——用來指稱那些主要由 AI 素材拼湊、缺乏人類創意投入的低品質遊戲。截至 2026 年三月,Steam 上已經有超過 7,300 款遊戲標註了 AI 使用。Valve 的應對方式是要求揭露,但不拒絕上架。

Alpha3D 的一篇技術分析把問題說得更具體——AI 生成的 3D 模型在 UV 展開、LOD(Level of Detail)、碰撞網格等方面系統性地不合格。文章結論用了一句精準的話:「This philosophical mismatch explains why ‘almost good enough’ is still not good enough in production.」(這種理念上的錯位,解釋了為什麼「差不多夠好」在正式生產環境中仍然不夠好。)

把兩邊的論點並排來看,平行結構幾乎完美對應:

維度Vibe CodingAI 視覺設計
貶義詞spaghetti codegameslop / spaghetti topology
門面品質能跑看起來不錯
隱藏缺陷無錯誤處理、安全漏洞UV 破損、無 LOD、碰撞網格缺失
平台對策套件安全檢查Steam 要求 AI 揭露標籤
資深者立場能用但需要 review能用但需要在 ZBrush 裡修
核心困境不懂原理就無法 debug不懂圖學就無法微調

核心困境是一樣的:當一個人連問題出在哪都不知道的時候,他能給 AI 的唯一提示詞就是「看起來怪怪的,再試一次」。 而這基本上就是隨機搜尋。

「完美的平庸」——表面上越過了品質門檻,結構上從未真正達標。這不是某一個領域的特殊問題,這是一個跨產業的複製模式。


第三個戰場:沒有差評機制的地方

如果這個模式會繼續複製,下一個戰場的判斷條件很清楚:品質的回饋迴路最弱、同時 AI 正在快速壓低生產門檻的領域。

程式碼有錯誤訊息——至少它會報錯。3D 模型進了遊戲引擎會出效能警告。Steam 上的遊戲有玩家差評。這些回饋迴路雖然有延遲,但終究會閉合——某個時刻,品質的缺陷會以可觀察的形式浮現出來。

但教育呢?

一個結構設計有問題的 AI 課程——認知負荷沒控制好、先備知識假設錯誤、概念之間的遞進邏輯斷裂——學習者不會知道問題出在課程本身。他只會覺得「後面的東西好難」,或者更糟:「我大概不適合這個領域吧」。

後果完全被歸因到學習者自己身上,而不是回溯到課程設計者的結構性缺陷。

這讓教育成了這個模式裡最危險的變體——唯一一個劣幣不會自動被淘汰的戰場。

而且它不是未來式,它是現在進行式。看看各種背景出身推出的 AI 課程、線上教學、速成工作坊——數量爆發的速度和品質參差的程度,和 Steam 上的 gameslop 是同一個結構。差別只是,gameslop 的消費者至少還會打差評。


戰場倖存者

在每一個戰場上,有一個位置始終不可替代——不是「會操作工具的人」(工具會被 AI 接管),也不是「會下提示詞的人」(提示詞能力正在被壓平),而是同時理解工具的能力邊界和領域本身品質標準的人。

他們能做到的事,是把專業領域的品質標準翻譯成可檢驗的流程——在程式領域是程式碼審查和安全測試,在 3D 領域是 拓樸(topology) 和 PBR 合規性檢查,在教育領域是認知架構和學習路徑的設計驗證。

不懂領域的人連該檢查什麼都不知道。只懂領域但不懂自動化的人無法規模化。兩邊都懂的人,才能在「完美的平庸」和「真的好」之間,建造一座橋。

這座橋的名字,大概就叫做「工作流設計」吧!


本文中關於 Computer Use 驅動視覺能力提升的因果推論,是基於公開資料的個人分析。

參考資訊:

訂閱
通知
0 則評論