什麼是 LLM Agent?從 Chatbot 到自主行動
從只會生成文字的 Chatbot,到能感知、規劃、行動與反思的 LLM Agent,理解這場從對話到行動的典範轉移。
什麼是 LLM Agent?從 Chatbot 到自主行動
你已經理解了大語言模型的內部運作:它如何把文字變成向量、如何用注意力理解語境、如何自回歸生成回應。
但你有沒有發現一件事——傳統的 LLM 只會「說」,不會「做」。
你問它「今天台北天氣如何」,它可能給你一段聽起來很合理的回答,但那段回答可能是幻覺。
你問它「幫我訂一張明天的高鐵票」,它只能告訴你「請自行上網訂購」。
這一篇,我們要談的是:當 LLM 不再只是聊天,而是能自主行動時,會發生什麼事?
這就是 LLM Agent 的起點。
一、Chatbot 的本質與極限
我們先回頭看看,一個標準的 Chatbot 到底在做什麼。
當你對 ChatGPT 說:「幫我寫一封信」,它會:
- 把你的文字轉成 Token
- 經過多層 Transformer 計算
- 自回歸地一個字一個字生成回應
- 把生成的 Token 轉回文字給你
整個過程,本質上就是文字接龍。
它根據你給的提示,預測最可能的下一個詞,然後接下去,直到生成完整的回答。
這個模式非常強大,但它有幾個根本限制:
1. 它只有「語言知識」,沒有「即時資訊」
模型的知識來自訓練資料,有截止日期。
它不知道今天的天氣、現在的股價、你公司內部的文件內容。
2. 它只能「生成文字」,不能「採取行動」
它不能幫你寄 email、不能查資料庫、不能呼叫 API、不能操作你的電腦。
它只能輸出一段文字,然後你自己去做。
3. 它沒有「記憶」,每次對話都是新的開始
除非你手動把之前的對話貼回去,否則模型不會記得你是誰、你喜歡什麼、你上次問過什麼。
4. 它容易「幻覺」,卻無法自我驗證
當模型不確定答案時,它可能生成一段聽起來很合理但完全錯誤的內容。
它沒有能力去查證、去計算、去實驗,只能「猜」。
這些限制,讓 Chatbot 停留在「對話工具」的層次。
而要突破這些限制,就需要 Agent。
二、Agent 是什麼?從「會說」到「會做」
LLM Agent 的核心概念是:
讓 LLM 不只是生成文字,而是能自主決定並執行一系列行動,以完成某個目標。
一個 Agent 通常包含以下幾個關鍵能力:
1. 感知(Perception)
Agent 能接收外部資訊,例如:
- 使用者的指令
- 工具回傳的結果
- 環境狀態的變化
- 之前的對話記憶
2. 推理與規劃(Reasoning & Planning)
Agent 能根據目標,決定下一步要做什麼。
例如:「我需要先查天氣,再決定要不要帶傘。」
3. 行動(Action)
Agent 能呼叫工具、執行 API、操作系統,真正「做事」。
例如:呼叫天氣 API、寄送 email、查詢資料庫。
4. 記憶(Memory)
Agent 能記住過去的互動與結果,並在後續決策中使用。
例如:「使用者上次說他住在台北。」
5. 反思(Reflection)
Agent 能檢視自己的行動是否有效,並在失敗時調整策略。
例如:「剛才的搜尋沒有找到答案,我換個關鍵字再試一次。」
用一個比喻來說:
- Chatbot 像一個博學但只能動嘴的顧問。
- Agent 像一個能動嘴、能動手的助理,會查資料、會打電話、會幫你把事情辦好。
三、Agent 的核心循環:觀察 → 思考 → 行動 → 反思
一個 Agent 的運作,通常不是一次性的輸入輸出,而是一個循環。
這個循環可以簡化為四個步驟:
步驟 1:觀察(Observe)
Agent 接收當前的狀態,包括:
- 使用者的指令
- 上一步行動的結果
- 環境的變化
- 記憶中的相關資訊
步驟 2:思考(Think)
Agent 根據觀察到的資訊,進行推理與規劃:
- 目標是什麼?
- 目前進度到哪裡?
- 下一步應該做什麼?
- 有哪些工具可以用?
步驟 3:行動(Act)
Agent 執行選擇的行動,例如:
- 呼叫某個 API
- 查詢資料庫
- 撰寫一段文字
- 發送一則訊息
步驟 4:反思(Reflect)
Agent 檢視行動的結果:
- 成功了嗎?
- 有達到預期目標嗎?
- 如果失敗,原因是什麼?
- 下一步要怎麼調整?
然後回到步驟 1,繼續循環,直到目標完成或達到終止條件。
四、一個具體的例子:從 Chatbot 到 Agent
假設你對一個 Chatbot 說:
幫我查明天台北的天氣,如果會下雨,提醒我帶傘。
傳統 Chatbot 的回應可能是:
根據一般情況,台北明天可能會有陣雨,建議您攜帶雨具。
但請注意,我無法查詢即時天氣資訊。
這段回答聽起來合理,但其實沒有解決你的問題。
它沒有查天氣、沒有判斷、沒有提醒,只是生成了一段「像答案的文字」。
Agent 的運作方式則完全不同:
- 觀察:使用者要求查明天台北天氣,並在雨天時提醒帶傘。
- 思考:我需要先查天氣,再根據結果決定是否提醒。
- 行動:呼叫天氣 API,查詢明天台北的天氣預報。
- 觀察:API 回傳「明天降雨機率 80%」。
- 思考:降雨機率高,應該提醒使用者帶傘。
- 行動:發送一則提醒訊息:「明天台北降雨機率 80%,建議攜帶雨具。」
- 反思:任務完成,使用者已收到提醒。
這就是 Agent 和 Chatbot 的根本差別:
Agent 會去查、去判斷、去行動,而不是只生成一段聽起來合理的文字。
五、Agent 需要哪些關鍵組件?
要讓 LLM 從「會說」變成「會做」,通常需要以下幾個組件:
1. 工具(Tools)
Agent 需要能呼叫外部工具,例如:
- 搜尋引擎
- 天氣 API
- 計算機
- 資料庫查詢
- 程式碼執行環境
- 檔案系統
工具讓 Agent 能接觸到模型內部沒有的資訊,也能執行模型本身做不到的操作。
2. 記憶(Memory)
Agent 需要記住過去的互動與結果,才能做出連貫的決策。
記憶可以分為:
- 短期記憶:當前對話的上下文
- 長期記憶:跨對話的使用者偏好、歷史紀錄
- 向量記憶:用嵌入向量儲存與檢索的知識庫
3. 規劃(Planning)
Agent 需要能把一個大目標拆解成多個小步驟,並決定執行順序。
例如:「寫一份報告」可以拆成「蒐集資料 → 整理大綱 → 撰寫內容 → 校對」。
4. 反思(Reflection)
Agent 需要能檢視自己的行動結果,並在失敗時調整策略。
例如:「剛才的搜尋沒有找到答案,我換個關鍵字再試一次。」
5. 護欄(Guardrails)
Agent 需要安全機制,避免做出危險或不可逆的行動。
例如:限制可呼叫的 API、設定預算上限、要求人類審核高風險操作。
六、Agent 的常見類型
根據自主程度與應用場景,Agent 可以大致分為幾種類型:
1. 工具型 Agent(Tool-Use Agent)
最常見的類型。
LLM 根據使用者需求,決定呼叫哪些工具,並整合工具回傳的結果。
例如:查天氣、查股價、寄 email、查資料庫。
2. 檢索型 Agent(RAG Agent)
專注於從外部知識庫檢索資訊,再生成回答。
適合問答系統、企業知識管理、客服機器人。
3. 規劃型 Agent(Planning Agent)
能把複雜目標拆解成多個步驟,並依序執行。
適合自動化工作流程、專案管理、研究助理。
4. 多 Agent 系統(Multi-Agent System)
多個 Agent 各自扮演不同角色,協同完成任務。
例如:一個負責規劃、一個負責寫作、一個負責審查。
5. 自主型 Agent(Autonomous Agent)
能在最小人類干預下,長時間自主運作,追求一個高階目標。
這是目前最前沿、也最具爭議的方向。
七、Agent 的挑戰與風險
Agent 很強大,但也帶來新的問題:
1. 幻覺與錯誤累積
Agent 的每一步都可能出錯,而錯誤會沿著循環累積。
如果第一步查錯了資料,後面所有推理都會跟著錯。
2. 無限迴圈與資源消耗
Agent 可能陷入「一直重試卻無法成功」的迴圈,消耗大量 API 額度與時間。
3. 工具誤用與安全風險
Agent 可能呼叫不該呼叫的工具,或執行危險操作。
例如:刪除檔案、發送未經審核的郵件、洩漏敏感資訊。
4. Prompt Injection
外部內容可能藏有惡意指令,誘導 Agent 做出非預期的行為。
5. 評估困難
Agent 的表現不像傳統模型可以用準確率衡量。
一個任務可能有多種完成方式,很難定義「正確答案」。
這些挑戰,正是後續文章要一一拆解的主題。
八、總結:從對話到行動的典範轉移
讓我們回顧這一篇的核心:
- Chatbot 只能生成文字,知識有截止日期,沒有記憶,無法行動。
- Agent 能感知、推理、行動、記憶、反思,真正完成任務。
- Agent 的核心是一個循環:觀察 → 思考 → 行動 → 反思。
- Agent 需要工具、記憶、規劃、反思與護欄等關鍵組件。
- Agent 帶來強大的自動化能力,但也伴隨幻覺、安全、評估等新挑戰。
理解這個轉變,是進入 Agent 世界的第一步。
接下來,我們要深入 Agent 的核心循環,看看目前最主流的幾種設計模式:ReAct、Plan-and-Execute 與 Reflection。
下一篇預告
《Agent 的核心循環:ReAct、Plan-and-Execute 與 Reflection》
我們會解釋這三種主流 Agent 設計模式的運作邏輯、適用場景與優缺點,並用具體例子說明它們如何讓 LLM 從「被動回答」變成「主動解決問題」。