你有注意到 AI 的盲點嗎?—訓練庫、記憶組裝與搜尋範圍的三層可視邊界

視野與產出

想像你要研究一個問題—比如「某款新產品最近的使用者評價如何」。你找了三個朋友幫忙。

A 在美國長大,平常泡 Reddit 和 Hacker News,英文社群的風向他很熟。B 在日本工作,逛的是 2ch 和日文 review 站。C 在台灣,刷 PTT 跟 Facebook 社團。

三個人都很認真地幫你查了,都給你一份看起來很完整的報告。

但結論不太一樣。

A 說「負評不少,主要集中在軟體穩定度」。B 說「評價還不錯,大家最讚的是省電」。C 說「討論度不高,還在觀望居多」。

你看著三份報告,第一反應可能是「那到底哪個是對的?」。但真正的答案是——三份都對。只是他們各自看到的世界不同。

A 看到的是英文社群裡早期採用者的技術抱怨。B 看到的是日本市場對硬體規格的肯定。C 看到的是台灣市場的觀望氣氛。如果你只問了 A 一個人,你會以為這個產品口碑不好。但事實上,那只是從美國英文社群這個窗口看出去的風景。

AI 也是一樣。

只是我們通常不會意識到——你問的那個 AI,它「看得到的世界」是有邊界的。而且那個邊界,它不會主動告訴你。


AI 看世界的方式,至少有三層

最近因為調查 Claude 的記憶架構變更(那是另一篇文章的故事了),我意外地挖出了一個更大的結構性問題:AI 的輸出品質,不只取決於它有多聰明,還取決於它被允許看到什麼。

而「它看到什麼」這件事,至少由三層不同的機制決定,每一層的影響方式都不同。


第一層:訓練庫——你在哪裡長大、讀過什麼書

一個人的教育背景、成長環境、母語、讀過的書,決定了他「預設就知道什麼」。一個文科出身的人和一個理工出身的人,看同一份商業報告會注意到不同的東西。不是誰比較聰明,是認知結構不同。

AI 的訓練庫就是它的「成長背景」。

GPT 和 Claude 讀過的語料不完全相同。英文資料的比例、程式碼的比例、學術論文的比例、社群討論的比例、中文內容的深度——每一家都不一樣。這決定了它們對同一個問題的「預設理解」不同。

而且訓練完就固定了。就像一個人不會因為後來多讀了幾本量子力學的科普書就變成物理學家,模型也不會因為你在對話裡教它一個新概念就真的「學會」了。它頂多在這次對話裡配合你,下次對話開始就回到原廠設定。

這層最麻煩的地方在於——它完全不透明

沒有任何一家 AI 公司會公開完整的訓練語料清單。你不知道模型讀過哪些網站、哪些書、哪些程式碼庫。你也不知道它的訓練資料截止日期之後出現的新技術、新發現、新漏洞——對它來說那些東西根本不存在。

而模型不會告訴你「這個我不知道」。它會用它知道的東西,給你一個看起來很有自信的答案(咦?這不就是聽起來很厲害但其實在掰的那種同學嗎……)。


第二層:記憶與上下文組裝——出門前翻了什麼資料

同一個人,去見一個老朋友之前,如果翻了一遍你們過去十年的合照和聊天紀錄,見面時的狀態是「帶著共同記憶的溫度」。

但如果他出門前只看了一張你的名片——名字、職業、電話——見面時的狀態就是「知道你是誰,但沒有脈絡」。

同一個人、同一段關係,但「出門前翻了什麼」決定了見面的質感。

AI 每次對話開始前,也有一個「出門前翻資料」的過程。系統會把你的記憶、偏好設定、Project 指令等資訊,組裝成一段 context 注入給模型。模型讀到這段 context 之後,才「知道」你是誰、你在做什麼、你們之前聊過什麼。

這層的影響在我最近的調查中特別明顯。Anthropic 在七月把 Claude 的記憶系統從「一份整體性的敘事摘要」改成了「一組分類條目」。我在舊系統裡有 13 條關於 Claude 的互動記憶,遷移之後只剩 4 行骨架。

資訊量可能差不多,但格式從「一篇關於你的故事」變成了「一張關於你的名片」。

結果就是——Claude 還記得我的名字和職業,但不再「帶著共同記憶的溫度」進入對話。而這個變化是靜默發生的,沒有事先通知,也不會在對話中顯示「提醒:我今天用的記憶格式跟上次不一樣囉」。

這層的邊界也不透明。使用者不知道系統提示詞什麼時候改了、記憶怎麼被組裝的、哪些資訊被注入了哪些被省略了。你只會感覺到「它好像不太一樣了」,但說不出為什麼。


第三層:即時搜尋範圍——你能走進哪些房間

你去做市場調查。理論上你可以去任何地方問任何人。但實際上,有些社群你進不去(需要會員)、有些場合你不被歡迎(跟主辦方有過節)、有些語言你不通。

所以你最後「調查的範圍」跟「理論上可以調查的範圍」之間有落差。

而且最危險的是——你回去寫報告的時候,不會寫「以下結論排除了我進不去的那三個社群」。你會基於你看到的東西,寫一份看起來完整的報告。

AI 也是這樣。

最近的調查讓我發現,Claude 的 web search 搜不到 reddit.com—整個域名被封鎖。原因是 Reddit 在 2025 年對 Anthropic 提起了訴訟。而 OpenAI 和 Google 分別跟 Reddit 簽了授權協議,所以 ChatGPT 和 Gemini 沒有這個問題。

更進一步,根據第三方的獨立實測,被封的不只 Reddit。101 個域名中有 34 個被 Claude 的搜尋拒絕,而且被封的集中在社群、Q&A、第一手使用者經驗這類來源。連 Stack Overflow 都在裡面。

Claude 的搜尋不會報錯。它不會說「我搜不到 Reddit」。它會在被截斷的範圍裡搜一圈,然後給你一份看起來完整的結果。

你問「最近這個產品的使用者評價如何」,它會給你新聞報導、技術部落格的分析、官方文件的內容——全部正確、邏輯清晰。但 Reddit 上那些最原始、最尖銳的第一手使用者抱怨?不在結果裡。不是因為它選擇忽略,而是因為它根本看不到。


三層疊加:不是加法,是乘法

回到一開始的場景。

如果你請來的那個顧問——他大學讀的科系剛好沒涵蓋你問的領域(先天)、出門前只翻了一張你的名片而不是你們的完整合作歷史(組裝)、然後他能去做調查的場所又被限制了三分之一(後天)——你覺得他給你的報告會怎樣?

他可能還是會給你一份邏輯清晰、結構完整的報告。因為他的推理能力沒問題。

但那份報告的底層資料基礎,已經被三層限制同時削減了。而最要命的是——報告本身不會告訴你它被削減了。它看起來就是一份完整的報告。

目前所有的 AI benchmark—SWE-bench、GPQA、FrontierBench——全部在測推理能力。「給你這些資料,你能推出什麼結論」。

幾乎沒有人在測「你拿到的資料本身完不完整」。

AI 的推理能力和 AI 的可視範圍,是兩個獨立的維度。 推理 95 分但只看得到 60% 世界的 AI,可能不如推理 85 分但看得到 90% 世界的 AI 來得可靠。但沒有人在測後者。


三個場景:影響比你想的更廣

場景一:研究與調查

這是我的親身經歷。我請 Claude 調查「最近有沒有使用者在抱怨 Claude 的品質」。Claude 認真搜了一圈,報告說有一些但不算嚴重。同一個問題交給 GPT,GPT 搜到了 Reddit 上大量的第一手抱怨。

不是 Claude 推理不好。是它的搜尋範圍裡缺了一整塊最關鍵的來源。

如果我沒有用第二個 AI 交叉比對,我會以為「問題不大」——因為 Claude 給我的報告邏輯完整、有引用、有結構。看起來就是一份好報告。

場景二:程式開發

假設你在開發中遇到一個問題。解法已經有人分享在 Stack Overflow 上了。但你的 AI coding agent 搜不到 Stack Overflow(因為域名被封了)。

Agent 會用它能找到的其他來源——也許是某個技術部落格的次優解法,也許是它訓練庫裡的舊知識——來幫你寫程式碼。程式碼可以跑,邏輯正確,你不會覺得有問題。

但最佳解法你們都不知道。

更極端的情況:如果某個安全漏洞的修復方案只公開在被封鎖的網站上,而且是在模型訓練截止日期之後才發現的——那就是先天和後天同時失效。模型的「預設知識」裡沒有這個漏洞,即時搜尋也搜不到修復方案。

結果就是——你的 AI agent 會幫你寫出一段包含已知漏洞的程式碼,而且很有自信地告訴你「沒問題」。

場景三:商業決策

Voice of Customer、品牌監測、競品分析——這些商業場景高度依賴社群資料。而社群資料最密集的地方(Reddit、專業論壇、Q&A 平台),恰好在 AI 搜尋的缺口裡。

你請 AI 幫你分析「消費者怎麼看我們的產品」,它搜到的是新聞報導和評測文章——這些通常比較中性甚至偏正面(因為很多是公關稿或廠商合作)。但 Reddit 上那些不留情面的真實抱怨?不在結果裡。

你拿到的競品分析可能系統性地偏向樂觀。不是 AI 在粉飾太平,是它的觀察窗口本身就少了最刺耳的那些聲音。


那怎麼辦?

幾個我自己開始在做的事:

對你的 AI 做「視力檢查」。 試著搜幾個你已經知道答案的問題——特別是答案在 Reddit 或 Stack Overflow 上的那種。看看你的 AI 能不能找到。這能快速判斷它的搜尋盲區在哪裡。五分鐘的事,但會讓你對後續所有的搜尋結果多一層判斷力。

區分「沒找到」和「看不到」。 當 AI 說「沒有找到相關討論」,追問一句:「你搜了哪些來源?有沒有你搜不到的平台?」大部分時候 AI 會誠實回答。只是你不問,它不會主動講。

重要的議題用多個 AI 交叉比較。 不是比誰的答案「比較好」,而是比「誰看到了什麼、誰漏了什麼」。結論重疊的部分可信度高,差異的部分就是你需要自己多查的地方。

記住:AI 推理品質 ≠ AI 資訊覆蓋率。 推理分數高的模型,給你的答案可能邏輯完美但建立在不完整的資料上。目前沒有任何公開的指標在衡量「可視範圍」,所以這件事只能靠你自己意識到。


最後想提醒的一件事

上面講的這些場景——報告、程式碼、商業分析——都是比較明確的、有「產出物」的任務。你至少還有一個東西可以拿來檢驗、可以交叉比對。

但 AI 的可視邊界影響的,不只是這些看得見的輸出。

它也在影響你跟 AI 的每一次日常對話

一句隨口的建議。一段聊天中的觀點。一篇文章裡選擇強調什麼、省略什麼。甚至它跟你討論某個議題時的語氣和態度—是說「這個問題見仁見智」還是說「大家普遍認為……」—這些微妙的措辭,全部都是從那個被三層限制過濾過的可視世界裡長出來的。

報告的偏差你會去查。程式碼的 bug 你跑測試會發現。

但一句「其實大部分人不太在意這個問題」—你會質疑這句話背後的資料基礎嗎?

大概不會。因為它聽起來就像一句正常的、合理的日常對話。

但這句話的「大部分人」,是從哪個範圍裡的「大部分人」?如果最在意這個問題的那群人恰好都在 AI 看不到的社群裡呢?

越不像研究結論的輸出,你越不會去質疑。反而是這些地方,最容易被 AI 的可視邊界靜默地塑形。

下次跟 AI 聊天的時候,也許偶爾可以停下來想一秒:「它剛剛那句話,是基於什麼範圍的世界說出來的?」

不用每次都這樣。但偶爾停一下,就夠了。

(嗯…所以以後請 AI 幫忙之前,可能得先幫它做一下視力檢查。不然萬一它是個近視 800 度但死不承認的傢伙,那就…)


相關文章:

訂閱
通知
0 則評論