假設你對一個 AI 說:「幫我找下週三個大家都有空的時段,整理好之後建立會議。」第一種系統可能告訴你該去哪裡看行事曆、怎麼比較時間,最後再教你建立邀請;另一種系統如果已經取得適當權限,可能先讀取參與者的行事曆,找出交集,發現其中一個時段撞到假日後自己排除,再把剩下的選項交給你確認,確認後才建立會議。兩邊都能用聊天視窗跟你互動,但背後其實不是同一種工作方式。
這就是 Chatbot 和 AI Agent 最容易混在一起的地方。Chatbot 比較像一種互動形式:你輸入訊息,它回覆訊息;Agent 則比較像一套為了完成目標,能持續觀察狀態、決定下一步、使用工具,再根據結果調整行動的系統。它們不是非黑即白的兩類產品。一個 Chatbot 裡面完全可以放 Agent;一個 Agent 也不一定需要聊天視窗,它可能待在排程、後台服務或工作流程裡。
先記一句就夠:Chatbot 描述的是「怎麼跟你互動」,Agent 描述的是「拿到目標之後怎麼把事情往前推」。
Chatbot 的核心,是一來一回的對話
最單純的 Chatbot 很像一個問答介面。你送出一句話,它讀取目前能看到的內容,產生一個回答,這一輪就結束了。下一步通常還是由你決定:你再問,它再答。早期客服機器人可能只是照關鍵字回固定文字;現在的 Chatbot 可以接上大型語言模型,回答方式自然很多,但「使用者問一句,系統回一句」仍然是最容易理解的基本形態。
這並不代表 Chatbot 很弱。查資料、解釋概念、改寫文章、摘要文件、陪你整理想法,很多工作根本不需要一套會自己行動的 Agent。一個回覆品質很好的 Chatbot,常常比一個到處自動操作、卻把事情做錯的 Agent 更有用。
Agent 多了一個「接下來要做什麼」的迴圈
Agent 的差異通常出現在第一個動作之後。它不是只產生一段文字就停住,而是會看目前的目標和環境,判斷下一步需要什麼。如果缺資料,它可能先搜尋;如果需要計算,它可能呼叫程式;如果要讀行事曆,它可能使用 Calendar 工具。拿到結果之後,它不一定馬上把結果丟給你,而是先重新判斷:事情完成了嗎?如果還沒有,下一步又是什麼?
這個迴圈才是 Agent 很重要的一部分。Google 對 AI agent 的描述會提到目標、推理、規劃、記憶與一定程度的自主決策;Anthropic 在談 agentic systems 時,也把工具、檢索與記憶放在模型周圍,讓模型能自己產生查詢、選工具並決定要保留哪些資訊。不同公司對「Agent」沒有一條全世界完全一致的門檻,但共同方向很接近:系統不只回答,它還會根據中間結果繼續行動。
會用工具,不等於一定是 Agent
這裡又有一個很容易踩的坑。現在很多 Chatbot 也能搜尋網路、執行程式、查資料庫,甚至幫你建立行事曆事件。所以不能看到「會用工具」三個字,就立刻把它叫 Agent。工具只是能力,真正要看的是誰在控制流程。
如果程式早就寫死:「使用者問天氣,就呼叫天氣 API,拿到結果後回覆」,這比較像固定工作流程。模型雖然用了工具,但下一步其實早就被程式決定好了。另一種系統拿到「幫我規劃今天的戶外行程」之後,自己判斷先查天氣、再看交通時間、發現下雨後改找室內地點,最後重新整理安排,這就更接近 Agent 的工作方式。
工具不是 Agent 的證明。真正的差別通常在於:流程是不是會根據中間結果動態改變,而不是每一步都事先寫死。
Memory 也不是單純「記得你叫什麼」
Agent 常常還需要某種狀態或記憶,因為它做的事情可能不只一個步驟。假設它正在替你整理五十份文件,做到第十七份時需要知道前面處理過哪些檔案、發現過哪些例外、還剩什麼工作。這種「任務進度」本身就是狀態。如果每一步都像第一次醒來一樣,Agent 很快就會重複做事或把前面的結果忘掉。
但 memory 也不是越多越好。短期任務可能只需要保存這次工作中的狀態;長期記憶則牽涉資料正確性、過期資訊、隱私與刪除機制。把所有聊天紀錄永久塞回模型,不會自動讓 Agent 變聰明,反而可能讓它拿到更多互相衝突的資訊。
自主不代表「什麼都不問你」
「Agent 可以自主行動」很容易被理解成它應該完全自己做決定,其實不是。真正的系統還需要權限邊界。查公開資料、整理草稿和真的把一封信寄出去,風險完全不同;讀取檔案和刪除檔案也不是同一件事。一個設計得好的 Agent,應該知道哪些事情可以直接做、哪些需要額外授權,以及哪些不可逆操作最好先讓使用者確認。
所以 Agent 的價值不是「人終於可以消失」。比較合理的理解是:人不用親自指定每一個微小步驟,但仍然決定目標、權限和重要關卡。Agent 在這些邊界裡自己把中間工作串起來。
什麼時候 Chatbot 就夠了?
如果任務的主要成果就是一段回答,而且每一輪都很適合由人來決定下一步,Chatbot 通常已經足夠。問問題、讀書解釋、腦力激盪、文章潤飾、文件摘要,硬要加上一個會自己跑很多步驟的 Agent,不一定更好。Agent 會增加模型呼叫、工具呼叫、等待時間和錯誤路徑,系統也變得更難測。
反過來,如果任務天然就是多步驟,而且下一步要看前一步結果才能決定,例如研究一個主題後整理來源、比對資料再產出報告,或檢查多個系統狀態後決定要執行哪個操作,Agent 才開始有明顯價值。它省下的不是「打字」,而是人原本得一直站在中間接力、判斷下一步的工作。
所以 Chatbot 和 Agent 到底差在哪?
最穩妥的分法,不是看畫面上有沒有聊天框,也不是看它會不會呼叫 API。Chatbot 關注的是對話介面與回覆;Agent 關注的是目標、狀態、決策和行動迴圈。兩者可以完全重疊:你可以在一個聊天視窗裡指揮 Agent,也可以有一個根本不跟人聊天、只在後台執行工作的 Agent。
下次看到一個產品說自己是「AI Agent」,先不要只看它能不能聊天。真正值得問的是:它能看到什麼狀態?能用哪些工具?誰決定下一步?做完一步之後會不會根據結果重新規劃?以及什麼事情一定要回來問人?
把這幾個問題拆開,Agent 這個詞就沒有那麼神祕了。