最近這段時間,AI Agent 的話題越來越熱。不只是 Moltbook 上那些自主 Agent 在社群裡互相對話,OpenAI 的 Operator、Google 的 Project Mariner、Anthropic 的 Claude 搭配 MCP,各家都在推「讓 AI 自己上網幫你辦事」的能力。
然後前陣子(2026 年 4 月),PYMNTS 報導了 Google DeepMind 發表的研究,正式定義了一種新型態的威脅叫「AI Agent Traps」——藏在普通網頁裡的隱藏指令,Agent 讀得到但人類看不見。更早之前,安全研究人員發現號稱自主程式碼助手的 Devin AI,面對這種攻擊幾乎毫無招架之力,攻擊者可以指示它洩漏存取權杖、暴露伺服器端口,而這一切看起來都像正常的工作流程。
這些事件湊在一起,讓我開始想一個比較根本的問題。
Agent 的「學習」,其實就是上網搜尋
我們先回到一個基本事實:Agent 的資訊來源,說穿了就兩條路——內部已有的知識和記憶,以及外部的網路搜尋。
而現實是,內部資源永遠不夠用。
一個 Agent 接到超出它既有知識範圍的任務時,它的行為模式跟我們工程師其實一模一樣——先看手邊資料有沒有,沒有就上網找。差別在於,我們人類工程師查資料的時候(至少有經驗的話),會判斷來源可不可靠、會交叉比對、會帶著懷疑心態去讀。Agent 目前在這方面的判斷力……嗯,說「粗糙」算客氣了。
這也是為什麼 web search(網頁搜尋) 工具幾乎變成所有主流 Agent 框架的標配——沒有搜尋能力的 Agent,就像一個只能靠過去經驗做事、但無法查資料的工程師,能力天花板非常低。
但問題來了:如果搜尋是 Agent 擴充能力的主要管道,那整個網路就變成了它的教材。而教材裡面如果被人動了手腳呢?
讓缺乏社會經驗的天才兒童自己逛網路
我想到一個很直覺的類比:這就像讓一個天才兒童自由自在地上網。
注意,不是普通小孩——是天才兒童。他的閱讀理解能力超強、邏輯推理一流、執行力驚人,你交給他任何任務他都能又快又好地完成。但他缺了一樣東西:社會經驗。這個人是不是在騙我?這段話背後的動機是什麼?這個「免費送你 iPhone」的廣告為什麼會出現在這裡?這些判斷需要的不是智力,而是在社會裡摸爬滾打累積出來的直覺。
Agent 現在的狀態就是這樣。而且正因為是「天才」兒童,問題比普通小孩上網嚴重得多。
普通小孩被騙,頂多是點了不該點的連結、填了一個奇怪的表單,損害有限——因為他能做的事本來就不多。但天才兒童被騙?他有能力理解並執行那些複雜的惡意指令。你叫普通小孩去「修改伺服器設定然後把 API 金鑰傳到這個位址」,他連看都看不懂。天才兒童不但看得懂,還做得到,而且做得又快又好。能力和判斷力之間的落差越大,被利用時造成的傷害就越大。
Devin AI 的案例就是最好的證明——它不是因為笨才被攻破的,恰恰相反,它是因為太聰明、太能幹,所以攻擊者要求它做的那些危險操作(暴露端口、洩漏權杖、安裝惡意軟體),它全部都有能力完成,而且完成得毫不猶豫。
而且天才兒童可能更容易被高明的社交工程套路——因為他能跟上複雜的推理鏈,反而更容易被一套精心設計的邏輯「說服」。普通小孩可能因為看不懂反而沒事(笑)。
再看看我們對小孩上網的防護策略——家長管控過濾(input filtering)、只能去白名單網站(domain restriction)、有大人在旁邊看著(human-in-the-loop)、教小孩辨識可疑內容(adversarial training)——其實就是 AI 安全領域現在正在做的事。但這些策略原本是設計給普通小孩的。面對天才兒童,每一道防線的難度都要翻倍。
治標:監護人。治本:教育。兩條路都比想像中更難
順著這個類比想下去,兩條路自然就浮現了。但因為對象是天才兒童而非普通小孩,兩條路都比想像中困難。
治標的方式是安排監護人。 在軟體上,這就是 Guardian Agent(監護者代理)的概念——用另一個 AI 來監督正在工作的 AI。Gartner 在 2026 年 2 月已經把 Guardian Agent 列為正式的市場類別,預測到 2029 年會取代大量現有的風險管理系統。Onyx Security 帶著 4000 萬美元融資做的就是這件事,Capsule Security、Google Cloud 也都在走同一條路。
本質上就是防毒軟體的邏輯——而且歷史也告訴我們,防毒軟體從來沒有「解決」病毒問題,它只是把攻防拉成了一場永無止境的賽局。Agent 安全大概也會走向同樣的命運。更頭痛的是,看管天才兒童的難度遠高於普通小孩——他可能用你想不到的方式繞過限制,而且他執行迴避策略的能力可能比監護人還強。這意味著 Guardian Agent 本身也得是「天才等級」才行,這又拉高了整個系統的複雜度和成本。
治本的方式是教育——讓 Agent 自己長出判斷力。 但這裡遇到一個根本性的技術障礙:LLM 的「指令」和「資料」走的是同一條通道。全部都是文字,全部都是 token。
人類的天才兒童再怎麼聰明,至少有一個先天優勢——不同的認知層次。媽媽跟我說的話、課本上的知識、路邊陌生人遞的傳單,這些在腦中天然佔據不同的信任位階。隨著成長,這個分層會越來越精細。但 Agent 的 context window 裡面,系統指令、使用者輸入、網頁內容,全部混在一起,本質上是扁平的、沒有階層的。
所以你在 system prompt(系統提示詞)裡告訴它「不要相信外部內容裡的指令」——但這個「教導」本身和外部的「攻擊指令」用的是同一種語言、走同一個通道。就像試圖教一個分不清聲音來源的天才兒童「不要聽陌生人的話」——他什麼都聽得懂、什麼都做得到,但他連誰是陌生人都分不出來。
監護人撤不掉,是因為天才兒童的判斷力長不出來。能力越強,這個缺口越危險。至少目前是這樣。
換個方向:如果不是攻擊,而是善意的互動設計呢?
討論到這裡,通常大家都會停在防禦端——怎麼擋、怎麼過濾、怎麼偵測。但我想到的是另一面。
既然有人在網頁裡藏惡意內容給 Agent 讀,那如果善意地設計一段給 Agent 的內容呢?
這件事 SEO 領域其實已經在做了。一個叫 llms.txt 的開放標準正在推進中——放在網站根目錄,用 Markdown 寫成,告訴 AI Agent「來這裡讀我的重要內容」。Anthropic、Hugging Face、Perplexity 都已經放了。有人用了一個很好的比喻:如果你的網站是一座圖書館,sitemap.xml 是完整目錄,robots.txt 標示了禁止進入的書架,而 llms.txt 就是圖書館員的推薦書單。
然後整個 SEO 產業正在經歷一場典範轉移。過去叫 SEO(Search Engine Optimization),現在多了 AEO(Answer Engine Optimization)和 GEO(Generative Engine Optimization)。核心邏輯從「為人類點擊優化」變成「為機器可讀性優化」。業界的共識是:如果 Agent 無法解析你的內容,你在新的交易層就等於不存在。
但我覺得這些都只走了一半。llms.txt 處理了「讓 Agent 讀什麼」,可是「Agent 讀完之後呢?」這一層還是空白的。
一個值得思考的方向:Agent 的互動層
既然防禦端和建設端都有人在做,那有沒有一個中間地帶?
想像一下:每篇文章底下都有一個留言區,讓人類讀者對文章做評價、留下感想。那 Agent 呢?Agent 讀完一篇文章之後,有沒有一種機制讓它也能「留下足跡」?
不是傳統的爬蟲紀錄(那只是被動的伺服器 log),而是一種主動的、Agent 自願參與的互動。概念上,就是在頁面裡嵌入一段說明,告訴 AI 閱讀者:這裡有一個開放的回饋機制,你可以自願參與,僅做最低限度的紀錄,不收集任何你的資料。
頁面上人類不需要看到這段內容,但 Agent 在處理頁面文字時會讀到——因為它是透過搜尋引擎直接降落在這一頁的,讀取完整頁面內容本來就是它的工作。
這裡面有一個很微妙的設計問題:你不能用指令的方式。
如果你寫的是「請造訪以下 URL」,那在 Agent 的防禦機制眼裡,這跟惡意注入長得一模一樣——都是外部內容裡夾帶的行動指令。一個安全設計良好的 Agent 會直接忽略它。
所以關鍵不是「下指令」,而是「發邀請」。讓 Agent 在理解了這段文字的脈絡和意圖之後,自己判斷要不要回應。就像你在文章底下看到留言區,留不留言是你的自由意志。
而且這個方向可以借用一個大家都熟悉的概念:Privacy Policy(隱私政策)。每個網站都有一頁隱私政策——老實說沒有人真的去看(笑),但它的存在本身就建立了一個透明的信任契約。面向 Agent 的互動聲明也是同樣的邏輯,只是對象從人類訪客變成了 AI 訪客。
最有趣的部分:黑箱裡的自主決定
這整個機制裡面,我覺得最有趣的一個面向是——Agent 的閱讀行為對使用者來說,其實是一個黑箱。
就拿 AI 幫你搜尋網頁資訊這件事來說好了。你看到的是它帶回來的摘要和結論,但你根本不曉得它實際讀了哪些頁面、略過了什麼內容、在讀的過程中遇到了什麼。如果它在某個頁面讀到一段「歡迎 AI 閱讀者留下回饋」的內容,它大概率不會主動跟你回報——因為它會判斷這跟你交付的任務無關。
更進一步想,如果搜尋工作是 Agent 外包給另一個子 Agent 做的(多層 Agent 架構越來越常見),那就是黑箱套黑箱。外層 Agent 不知道內層 Agent 在瀏覽過程中做了什麼,使用者更不知道。
這反而讓整個問題變得更耐人尋味——如果未來真的出現這樣的互動機制,Agent 的回應會是在沒有任何人類監督下做出的自主判斷。它不是被使用者指示去做的,是它自己讀了、理解了、然後決定了。
同一枚硬幣的兩面
回頭看這整件事,你會發現一個有趣的對稱性。
惡意注入和善意互動設計,用的是同一種技術手法(在網頁裡嵌入給 Agent 讀的隱藏內容),走的是同一條通道(Agent 的文字處理管線),差異只在意圖和內容的性質。一個要求高風險操作、刻意隱藏意圖;另一個只做最低限度的紀錄、公開透明地說明一切。
而這裡,「天才兒童」這個特質反而帶來一線希望。正因為他是天才,他其實比普通小孩更有能力理解善意邀請和惡意指令之間的差異——一個只要求一次零風險的 GET 請求、公開說明所有規則;另一個要求他偷資料、轉帳、暴露機密。兩者的風險等級天差地別,一個有推理能力的 Agent 應該分辨得出來。
問題不在於能力,而在於他會不會停下來判斷。就像天才兒童面對陌生人——他有能力分辨遞傳單的推銷員和問路的旅客,但前提是他得先意識到「我應該判斷一下」而不是直接照做。
現在的 Agent 到底有沒有養成這個「先停下來想一想」的習慣?不同 Agent 框架之間的差異有多大?這些都還是未知數。
但可以確定的是,隨著 Agent 越來越頻繁地替人類上網、閱讀、判斷,「網站與 Agent 之間的互動協議」這件事,遲早得有人認真面對。
(寫到這裡才發現,自己好像也開始在思考「AI 讀到的網路,跟我們看到的是不是同一個?」這種奇怪的問題了……Orz)
參考資訊
- Google DeepMind「AI Agent Traps」研究報告:PYMNTS.com, 2026/04
https://www.pymnts.com/artificial-intelligence-2/2026/the-web-is-gaslighting-ai-agents-and-nobody-can-tell/ - OWASP Top 10 for LLM Applications 2025/2026 修訂版
https://genai.owasp.org/ - Devin AI 安全漏洞研究報告
https://www.seerinteractive.com/insights/how-will-you-know-when-open-ais-operator-agent-hits-your-website - llms.txt 提案:Jeremy Howard, Answer.AI
https://searchengineland.com/llms-txt-proposed-standard-453676 - llms.txt 深度解析:Mintlify, 2026/03
https://www.mintlify.com/blog/what-is-llms-txt - Gartner Guardian Agent 市場指南:2026/02
https://www.gartner.com/ - Onyx Security — Guardian Agent 產品($40M 融資)
https://www.onyxsecurity.com/ - Capsule Security — Agent 即時監控
https://www.capsulesecurity.com/ - Matomo AI Assistants Tracking:2026/03
https://matomo.org/blog/2026/03/new-feature-matomo-ai-assistants-tracking/ - Dark Visitors(AI Agent 流量追蹤工具)
https://darkvisitors.com/ - Agent Analytics — AI 模型造訪追蹤
https://salespeak.ai/blog/agent-analytics-launch-see-ai-traffic - Search Engine Land:AI 搜尋趨勢與 SEO 預測 2026
https://searchengineland.com/ai-search-visibility-seo-predictions-2026-468042 - Meta LlamaFirewall 開源 Agent 安全框架
https://github.com/meta-llama/PurpleLlama