Afterglow Papers
Research notes on AI, agents & cognitive systems
Series
全部系列 → Series
LLM Agent 核心原理
10 篇
- 01 什麼是 LLM Agent?從 Chatbot 到自主行動
- 02 Agent 的核心循環:ReAct、Plan-and-Execute 與 Reflection
- 03 工具呼叫與 Function Calling:讓 LLM 連接外部世界
- 04 從零打造一個最基礎的 Agent:LLM + 工具 + 迴圈
- 05 Agent 的記憶機制:短期、長期與向量資料庫
- 還有 5 篇 →
Series
Application Trilogy:LLM 部署與推理優化
8 篇
- 01 LLM 部署的挑戰:延遲、吞吐、成本
- 02 KV Cache:為什麼推理需要它
- 03 量化:FP16、INT8、INT4 的取捨
- 04 vLLM 與 PagedAttention:高吞吐推理的關鍵
- 05 批次處理與連續批次:提升吞吐的關鍵
- 還有 3 篇 →
Recent Notes
vLLM 與 PagedAttention:高吞吐推理的關鍵 成本優化:快取、路由、降級與自動擴縮 批次處理與連續批次:提升吞吐的關鍵 推測解碼:用小模型加速大模型 LLM 部署的挑戰:延遲、吞吐、成本 KV Cache:為什麼推理需要它 LLM-as-Judge 與 Jev:推理式評估與決策式評估的取捨 CI/CD 整合與持續改進:讓 Harness 自動跑 什麼是 Agent Harness? 回歸測試與失敗分析:確保修改不退步 自動化執行與評分:Runner、Evaluator 與報告 測試案例設計:從單元到端到端 量化:FP16、INT8、INT4 的取捨 Skill 的版本管理與迭代 Skill 的權限與安全邊界 Skill 的組合與編排:讓 Skill 呼叫 Skill 實作:建立一個 Skill 系統 從 Skill 到 Skill Library:建立組織級能力庫 什麼是 Agent Skill?從工具到技能的演進 Skill 的結構:指令、工具、資源與範例 設計一個可重用的 Skill:以程式碼審查為例 Agent 的核心循環:ReAct、Plan-and-Execute 與 Reflection Agent 的安全與護欄:Prompt Injection、權限控制與人類審核 Agent 的評估與可觀測性:Trace、Log、指標與失敗模式 Agent 的記憶機制:短期、長期與向量資料庫 RAG 完整解析:檢索、重排、生成 什麼是 LLM Agent?從 Chatbot 到自主行動 多 Agent 協作:角色分工、辯論與 Swarm 完整 Agent 實作:整合工具、記憶、RAG、護欄與可觀測性 從零打造一個最基礎的 Agent:LLM + 工具 + 迴圈 工具呼叫與 Function Calling:讓 LLM 連接外部世界 大模型為什麼難訓練?三項關鍵技術Normalization、Residual 與 Dropout 大模型如何運作:從自回歸生成到推理採樣 大模型如何計算 Loss:訓練與推理的差異 注意力機制入門:QKV、Mask 與縮放點積 Transformer 的心臟:多頭注意力與 FFN 從文字到向量:NLP 向量化與 Token 的演進 詞嵌入與位置編碼:模型如何理解語意與順序