什麼是 LLM Agent?從 Chatbot 到自主行動

從只會生成文字的 Chatbot,到能感知、規劃、行動與反思的 LLM Agent,理解這場從對話到行動的典範轉移。

什麼是 LLM Agent?從 Chatbot 到自主行動

你已經理解了大語言模型的內部運作:它如何把文字變成向量、如何用注意力理解語境、如何自回歸生成回應。

但你有沒有發現一件事——傳統的 LLM 只會「說」,不會「做」

你問它「今天台北天氣如何」,它可能給你一段聽起來很合理的回答,但那段回答可能是幻覺。
你問它「幫我訂一張明天的高鐵票」,它只能告訴你「請自行上網訂購」。

這一篇,我們要談的是:當 LLM 不再只是聊天,而是能自主行動時,會發生什麼事?
這就是 LLM Agent 的起點。

Chatbot → Tool Use → Memory → Autonomous Agent

一、Chatbot 的本質與極限

我們先回頭看看,一個標準的 Chatbot 到底在做什麼。

當你對 ChatGPT 說:「幫我寫一封信」,它會:

  1. 把你的文字轉成 Token
  2. 經過多層 Transformer 計算
  3. 自回歸地一個字一個字生成回應
  4. 把生成的 Token 轉回文字給你

整個過程,本質上就是文字接龍
它根據你給的提示,預測最可能的下一個詞,然後接下去,直到生成完整的回答。

這個模式非常強大,但它有幾個根本限制:

1. 它只有「語言知識」,沒有「即時資訊」

模型的知識來自訓練資料,有截止日期。
它不知道今天的天氣、現在的股價、你公司內部的文件內容。

2. 它只能「生成文字」,不能「採取行動」

它不能幫你寄 email、不能查資料庫、不能呼叫 API、不能操作你的電腦。
它只能輸出一段文字,然後你自己去做。

3. 它沒有「記憶」,每次對話都是新的開始

除非你手動把之前的對話貼回去,否則模型不會記得你是誰、你喜歡什麼、你上次問過什麼。

4. 它容易「幻覺」,卻無法自我驗證

當模型不確定答案時,它可能生成一段聽起來很合理但完全錯誤的內容。
它沒有能力去查證、去計算、去實驗,只能「猜」。

這些限制,讓 Chatbot 停留在「對話工具」的層次。
而要突破這些限制,就需要 Agent

二、Agent 是什麼?從「會說」到「會做」

LLM Agent 的核心概念是:

讓 LLM 不只是生成文字,而是能自主決定並執行一系列行動,以完成某個目標。

一個 Agent 通常包含以下幾個關鍵能力:

1. 感知(Perception)

Agent 能接收外部資訊,例如:

  • 使用者的指令
  • 工具回傳的結果
  • 環境狀態的變化
  • 之前的對話記憶

2. 推理與規劃(Reasoning & Planning)

Agent 能根據目標,決定下一步要做什麼。
例如:「我需要先查天氣,再決定要不要帶傘。」

3. 行動(Action)

Agent 能呼叫工具、執行 API、操作系統,真正「做事」。
例如:呼叫天氣 API、寄送 email、查詢資料庫。

4. 記憶(Memory)

Agent 能記住過去的互動與結果,並在後續決策中使用。
例如:「使用者上次說他住在台北。」

5. 反思(Reflection)

Agent 能檢視自己的行動是否有效,並在失敗時調整策略。
例如:「剛才的搜尋沒有找到答案,我換個關鍵字再試一次。」

用一個比喻來說:

  • Chatbot 像一個博學但只能動嘴的顧問。
  • Agent 像一個能動嘴、能動手的助理,會查資料、會打電話、會幫你把事情辦好。

Chatbot (Talk Only) vs. Agent (Perceive + Plan + Act)

三、Agent 的核心循環:觀察 → 思考 → 行動 → 反思

一個 Agent 的運作,通常不是一次性的輸入輸出,而是一個循環

這個循環可以簡化為四個步驟:

步驟 1:觀察(Observe)

Agent 接收當前的狀態,包括:

  • 使用者的指令
  • 上一步行動的結果
  • 環境的變化
  • 記憶中的相關資訊

步驟 2:思考(Think)

Agent 根據觀察到的資訊,進行推理與規劃:

  • 目標是什麼?
  • 目前進度到哪裡?
  • 下一步應該做什麼?
  • 有哪些工具可以用?

步驟 3:行動(Act)

Agent 執行選擇的行動,例如:

  • 呼叫某個 API
  • 查詢資料庫
  • 撰寫一段文字
  • 發送一則訊息

步驟 4:反思(Reflect)

Agent 檢視行動的結果:

  • 成功了嗎?
  • 有達到預期目標嗎?
  • 如果失敗,原因是什麼?
  • 下一步要怎麼調整?

然後回到步驟 1,繼續循環,直到目標完成或達到終止條件。

Observe → Think → Act → Reflect → Repeat

四、一個具體的例子:從 Chatbot 到 Agent

假設你對一個 Chatbot 說:

幫我查明天台北的天氣,如果會下雨,提醒我帶傘。

傳統 Chatbot 的回應可能是:

根據一般情況,台北明天可能會有陣雨,建議您攜帶雨具。
但請注意,我無法查詢即時天氣資訊。

這段回答聽起來合理,但其實沒有解決你的問題。
它沒有查天氣、沒有判斷、沒有提醒,只是生成了一段「像答案的文字」。

Agent 的運作方式則完全不同:

  1. 觀察:使用者要求查明天台北天氣,並在雨天時提醒帶傘。
  2. 思考:我需要先查天氣,再根據結果決定是否提醒。
  3. 行動:呼叫天氣 API,查詢明天台北的天氣預報。
  4. 觀察:API 回傳「明天降雨機率 80%」。
  5. 思考:降雨機率高,應該提醒使用者帶傘。
  6. 行動:發送一則提醒訊息:「明天台北降雨機率 80%,建議攜帶雨具。」
  7. 反思:任務完成,使用者已收到提醒。

這就是 Agent 和 Chatbot 的根本差別:

Agent 會去查、去判斷、去行動,而不是只生成一段聽起來合理的文字。

五、Agent 需要哪些關鍵組件?

要讓 LLM 從「會說」變成「會做」,通常需要以下幾個組件:

1. 工具(Tools)

Agent 需要能呼叫外部工具,例如:

  • 搜尋引擎
  • 天氣 API
  • 計算機
  • 資料庫查詢
  • 程式碼執行環境
  • 檔案系統

工具讓 Agent 能接觸到模型內部沒有的資訊,也能執行模型本身做不到的操作。

2. 記憶(Memory)

Agent 需要記住過去的互動與結果,才能做出連貫的決策。
記憶可以分為:

  • 短期記憶:當前對話的上下文
  • 長期記憶:跨對話的使用者偏好、歷史紀錄
  • 向量記憶:用嵌入向量儲存與檢索的知識庫

3. 規劃(Planning)

Agent 需要能把一個大目標拆解成多個小步驟,並決定執行順序。
例如:「寫一份報告」可以拆成「蒐集資料 → 整理大綱 → 撰寫內容 → 校對」。

4. 反思(Reflection)

Agent 需要能檢視自己的行動結果,並在失敗時調整策略。
例如:「剛才的搜尋沒有找到答案,我換個關鍵字再試一次。」

5. 護欄(Guardrails)

Agent 需要安全機制,避免做出危險或不可逆的行動。
例如:限制可呼叫的 API、設定預算上限、要求人類審核高風險操作。

Tools + Memory + Planning + Reflection + Guardrails

六、Agent 的常見類型

根據自主程度與應用場景,Agent 可以大致分為幾種類型:

1. 工具型 Agent(Tool-Use Agent)

最常見的類型。
LLM 根據使用者需求,決定呼叫哪些工具,並整合工具回傳的結果。

例如:查天氣、查股價、寄 email、查資料庫。

2. 檢索型 Agent(RAG Agent)

專注於從外部知識庫檢索資訊,再生成回答。
適合問答系統、企業知識管理、客服機器人。

3. 規劃型 Agent(Planning Agent)

能把複雜目標拆解成多個步驟,並依序執行。
適合自動化工作流程、專案管理、研究助理。

4. 多 Agent 系統(Multi-Agent System)

多個 Agent 各自扮演不同角色,協同完成任務。
例如:一個負責規劃、一個負責寫作、一個負責審查。

5. 自主型 Agent(Autonomous Agent)

能在最小人類干預下,長時間自主運作,追求一個高階目標。
這是目前最前沿、也最具爭議的方向。

七、Agent 的挑戰與風險

Agent 很強大,但也帶來新的問題:

1. 幻覺與錯誤累積

Agent 的每一步都可能出錯,而錯誤會沿著循環累積。
如果第一步查錯了資料,後面所有推理都會跟著錯。

2. 無限迴圈與資源消耗

Agent 可能陷入「一直重試卻無法成功」的迴圈,消耗大量 API 額度與時間。

3. 工具誤用與安全風險

Agent 可能呼叫不該呼叫的工具,或執行危險操作。
例如:刪除檔案、發送未經審核的郵件、洩漏敏感資訊。

4. Prompt Injection

外部內容可能藏有惡意指令,誘導 Agent 做出非預期的行為。

5. 評估困難

Agent 的表現不像傳統模型可以用準確率衡量。
一個任務可能有多種完成方式,很難定義「正確答案」。

這些挑戰,正是後續文章要一一拆解的主題。

八、總結:從對話到行動的典範轉移

讓我們回顧這一篇的核心:

  • Chatbot 只能生成文字,知識有截止日期,沒有記憶,無法行動。
  • Agent 能感知、推理、行動、記憶、反思,真正完成任務。
  • Agent 的核心是一個循環:觀察 → 思考 → 行動 → 反思
  • Agent 需要工具、記憶、規劃、反思與護欄等關鍵組件。
  • Agent 帶來強大的自動化能力,但也伴隨幻覺、安全、評估等新挑戰。

理解這個轉變,是進入 Agent 世界的第一步。

接下來,我們要深入 Agent 的核心循環,看看目前最主流的幾種設計模式:ReAct、Plan-and-Execute 與 Reflection。


下一篇預告

《Agent 的核心循環:ReAct、Plan-and-Execute 與 Reflection》

我們會解釋這三種主流 Agent 設計模式的運作邏輯、適用場景與優缺點,並用具體例子說明它們如何讓 LLM 從「被動回答」變成「主動解決問題」。