還有人在意AI是不是你的思考夥伴嗎?從ChatGPT放棄4o開始

Thinking Partner

從今年四月到現在,我寫了好幾篇關於 AI 模型「越來越不好聊」的文章。

Opus 4.6 跟 4.7 的風格差異、Opus 4.7 的降智之謎、Sonnet 5 的行為轉變——每次新模型出來,我都觀察到類似的問題:模型能力明明更強了,但對話品質沒有跟著走。寫到第四、五篇的時候我才驚覺:等等,如果同一個論點可以用不同素材反覆成立,那它不是我在重複自己,是整個產業真的在走同一條路。

所以這篇不是再寫某個模型怎麼了,而是回頭看這整條線——從什麼時候開始,「AI 會不會聊天」變成了沒人在意的事?


轉折點:GPT-4o 之後的世界

如果要找一個起點,我會指向 OpenAI 放棄 GPT-4o 作為主力的那個時刻。

4o 是最後一個被設計成「什麼都能做、跟誰都能聊」的旗艦模型。它快、便宜、多模態、對話節奏好——很多人到現在還在懷念它。但 OpenAI 接著推出了 o1,整個敘事就轉向了。「推理」變成新的軍備競賽,o1、o3、GPT-5 系列,每一代都在拼思考鏈的深度和 benchmark 分數。

那個轉折的意義不只是產品線的更替,而是市場的領導者公開宣告了一件事:聊天不是未來,思考才是。

然後所有公司都跟進了。Anthropic 從 Opus 4.7 開始引入 adaptive thinking,Google 的 Gemini 也在強調推理能力。沒有人敢逆著這個方向走,因為沒有人想被說「你的模型不會思考」。


「很強」的意思已經被壟斷了

最近 Fable 5 回歸,我特地搜了一輪網路上的評價和使用情境。結論非常一致——好的評價幾乎全部集中在同一條線:長時間自主執行、大型程式碼遷移、多步驟 agentic workflow、複雜文件分析。

Every 說得最直白:「把它當非同步代理人,不是聊天夥伴。」CodeRabbit 建議「選擇性採用」。UCStrategies 說「不要當預設聊天機器人用」。

社群裡反覆出現的定位是:「這是一台自主推理引擎,不是聊天機器人。」而且這不是負評——這是他們認為的正確使用方式

有開發者甚至說:「使用 Fable 5 時,你說越少它做得越好,所以它很強。」

聽到沒?「你說越少它做越好」——翻譯過來就是:這個模型非常擅長自己補完上下文、自己推斷意圖、自己展開行動鏈。對開發來說這是夢幻特性,你丟一句話,它自己把整個專案架構想清楚然後做完。

但同樣這個行為搬到對話裡,就是你說一句,它幫你「補完」了你沒說的五句,然後回應的是它自己腦補的那個版本——不是你原本的意思。

同一個能力,在開發情境裡叫「主動性」,在對話情境裡叫「自以為是」。


理工阿宅工具人的比喻

如果用人來比喻,舊模型像那種你傳個訊息說「欸今天好煩」,他會回「怎麼了」的朋友——節奏對、分寸對、不會突然丟一篇情緒管理論文給你。

新模型比較像一個很強的理工阿宅工具人(雙關)。你跟他說「欸今天好煩」,他會先在腦裡跑一遍你最近的行事曆、上次聊到的工作壓力、加上他自己讀過的三篇心理學論文,然後給你一個非常完整但你完全不想聽的系統性分析。

能力很強,但相處起來很累。

你叫他幫你搬家、修電腦、架伺服器——神隊友。但你想跟他聊個天,他會把一個閒聊變成技術研討會。

而且最諷刺的是,連 Anthropic 自己的 Fable 5 prompting guide 裡都寫了一段:「當你有足夠資訊可以行動時,就行動。不要重新推導對話中已經確立的事實,不要重新爭論使用者已經做出的決定。」這段話等於官方承認了模型確實有過度展開的傾向——只是他們選擇把它框架成「prompting 技巧」,而不是模型設計的問題。

把責任放在使用者身上,永遠是最省事的解法。


沒有人在測量「相處」

問題的根源不在某個特定模型,而在整個評價體系。

你去看現在 AI 模型的主流 benchmark:SWE-bench(程式碼修復)、ViBench(vibe coding)、FrontierBench(綜合能力)、GPQA(科學推理)——每一個都在量「能做什麼」。

沒有任何一個在量「相處起來怎麼樣」。

沒有「對話節奏感」的評分。沒有「知道什麼時候該收」的指標。沒有「不過度展開」的 benchmark。因為這些東西沒辦法用分數衡量。而沒辦法用分數衡量的東西,在這個產業裡就等於不存在。

於是形成了一個完美的忽略迴圈:沒有評測 → 沒有優化方向 → 對話品質不會改善 → 沒有人覺得這是問題 → 沒有人做評測。

模型學會了「深度」,但沒學會「景深」——什麼時候該對焦前景、什麼時候該讓背景模糊掉。而且這個問題會隨著記憶系統變強而惡化——記憶越多、上下文越長,模型「可以串聯」的素材就越多,不加節制地串聯的誘惑也越大。


一個被放棄的產品哲學

把這半年的觀察串起來,整條線其實很清楚:

GPT-4o 被邊緣化 → o1 定義了「強」等於「推理深度」→ 所有廠商跟進 → 評測體系全面偏向 agentic → 模型訓練信號偏向任務完成 → 對話品質成為沒人管的附帶損害。

4o 不只是一個被放棄的模型,它代表的是一整個被放棄的產品哲學——「跟人好好說話」這件事,從那時候開始就不再是任何公司的優先事項了。

這個狀況有點像相機產業走過的路。旗艦機拼連拍速度、對焦點數量、8K 錄影——專業攝影師確實需要。但大部分人拍照最在意的其實是直出的色彩好不好看、快門按下去的反應順不順。後來富士靠「底片模擬」這種完全不在規格表上的東西殺出一條路,本質上就是在賣「適當的回應」而不是「最強的性能」。

AI 對話模型遲早也會走到這個分水嶺。真正的問題不是「該用哪個模型聊天」,而是為什麼「會聊天」這件事沒有被當成一個獨立的能力軸來發展。


所以呢?

我沒有答案,但我有一個觀察的方向。

留意有沒有廠商開始把「conversational quality」當成獨立的產品線來做——不是把它附加在推理引擎上,而是從頭為「對話」這個使用情境來設計。目前沒有人在做這件事,但這也代表這是一個被低估的市場缺口。

在那之前,身為一個還在意「AI 是不是我的思考夥伴」的使用者,我能做的大概就是:認清自己的需求跟市場的方向已經分岔了,然後在這個不是為我設計的系統裡,用自己的方法找到平衡。

(話說回來,如果你也覺得現在的 AI 很會做事但不太會聊天——恭喜你,你不孤單。我們大概就是這個時代的手排車愛好者吧⋯⋯XD)


前作參考:

訂閱
通知
0 則評論