Afterglow Papers

Research notes on AI, agents & cognitive systems

Issue 039

分散式推理:張量平行、流水線平行與專家平行

從張量平行、流水線平行到專家平行,拆解當模型太大、單張 GPU 放不下時,如何用多張 GPU 協同推理。

Distributed Inference 28 min
Series

LLM Agent 核心原理

10 篇
  1. 01 什麼是 LLM Agent?從 Chatbot 到自主行動
  2. 02 Agent 的核心循環:ReAct、Plan-and-Execute 與 Reflection
  3. 03 工具呼叫與 Function Calling:讓 LLM 連接外部世界
  4. 04 從零打造一個最基礎的 Agent:LLM + 工具 + 迴圈
  5. 05 Agent 的記憶機制:短期、長期與向量資料庫
  6. 還有 5 篇 →
Series

Application Trilogy:LLM 部署與推理優化

8 篇
  1. 01 LLM 部署的挑戰:延遲、吞吐、成本
  2. 02 KV Cache:為什麼推理需要它
  3. 03 量化:FP16、INT8、INT4 的取捨
  4. 04 vLLM 與 PagedAttention:高吞吐推理的關鍵
  5. 05 批次處理與連續批次:提升吞吐的關鍵
  6. 還有 3 篇 →
vLLM 與 PagedAttention:高吞吐推理的關鍵 VLLM 28 min 成本優化:快取、路由、降級與自動擴縮 Cost Optimization 30 min 批次處理與連續批次:提升吞吐的關鍵 Batching 28 min 推測解碼:用小模型加速大模型 Speculative Decoding 26 min LLM 部署的挑戰:延遲、吞吐、成本 Deployment 24 min KV Cache:為什麼推理需要它 KV Cache 26 min LLM-as-Judge 與 Jev:推理式評估與決策式評估的取捨 Harness 22 min CI/CD 整合與持續改進:讓 Harness 自動跑 Harness 30 min 什麼是 Agent Harness? Harness 22 min 回歸測試與失敗分析:確保修改不退步 Harness 28 min 自動化執行與評分:Runner、Evaluator 與報告 Harness 28 min 測試案例設計:從單元到端到端 Harness 28 min 量化:FP16、INT8、INT4 的取捨 Quantization 28 min Skill 的版本管理與迭代 Skill 26 min Skill 的權限與安全邊界 Skill 26 min Skill 的組合與編排:讓 Skill 呼叫 Skill Skill 26 min 實作:建立一個 Skill 系統 Skill 30 min 從 Skill 到 Skill Library:建立組織級能力庫 Skill 30 min 什麼是 Agent Skill?從工具到技能的演進 Skill 18 min Skill 的結構:指令、工具、資源與範例 Skill 22 min 設計一個可重用的 Skill:以程式碼審查為例 Skill 28 min Agent 的核心循環:ReAct、Plan-and-Execute 與 Reflection Agent 18 min Agent 的安全與護欄:Prompt Injection、權限控制與人類審核 Security 24 min Agent 的評估與可觀測性:Trace、Log、指標與失敗模式 Evaluation 26 min Agent 的記憶機制:短期、長期與向量資料庫 Memory 20 min RAG 完整解析:檢索、重排、生成 RAG 24 min 什麼是 LLM Agent?從 Chatbot 到自主行動 Agent 14 min 多 Agent 協作:角色分工、辯論與 Swarm Multi-Agent 26 min 完整 Agent 實作:整合工具、記憶、RAG、護欄與可觀測性 Agent 30 min 從零打造一個最基礎的 Agent:LLM + 工具 + 迴圈 Agent 16 min 工具呼叫與 Function Calling:讓 LLM 連接外部世界 Artificial Intelligence 18 min 大模型為什麼難訓練?三項關鍵技術Normalization、Residual 與 Dropout Artificial Intelligence 14 min 大模型如何運作:從自回歸生成到推理採樣 Artificial Intelligence 12 min 大模型如何計算 Loss:訓練與推理的差異 Artificial Intelligence 14 min 注意力機制入門:QKV、Mask 與縮放點積 Artificial Intelligence 13 min Transformer 的心臟:多頭注意力與 FFN Artificial Intelligence 13 min 從文字到向量:NLP 向量化與 Token 的演進 Artificial Intelligence 10 min 詞嵌入與位置編碼:模型如何理解語意與順序 Artificial Intelligence 13 min