Series

Application Trilogy:LLM 部署與推理優化

8 篇 · 建議依序閱讀

  1. 01

    LLM 部署的挑戰:延遲、吞吐、成本

    從延遲、吞吐到成本,拆解 LLM 部署的三大核心指標、它們之間的取捨,以及為什麼 LLM 部署比傳統服務難得多。

    2026.09.21 · 24 min
  2. 02

    KV Cache:為什麼推理需要它

    從自回歸生成的重複計算到記憶體瓶頸,拆解 KV Cache 的原理、大小計算、優化技術與最佳實踐。

    2026.09.21 · 26 min
  3. 03

    量化:FP16、INT8、INT4 的取捨

    從 FP16 到 INT4,拆解量化的原理、不同精度的取捨、常見量化方法,以及如何在實際部署中做出選擇。

    2026.09.21 · 28 min
  4. 04

    vLLM 與 PagedAttention:高吞吐推理的關鍵

    從 KV Cache 的記憶體浪費到 PagedAttention 與連續批次,拆解 vLLM 如何成為現代 LLM 部署的標準方案。

    2026.09.22 · 28 min
  5. 05

    批次處理與連續批次:提升吞吐的關鍵

    從靜態批次、動態批次到連續批次,拆解調度策略、批次大小取捨,並用 Python 實作一個連續批次系統。

    2026.09.22 · 28 min
  6. 06

    推測解碼:用小模型加速大模型

    從自回歸生成的序列依賴到接受拒絕機制,拆解推測解碼如何在不損失品質的前提下把生成速度提升 2 到 3 倍。

    2026.09.22 · 26 min
  7. 07

    分散式推理:張量平行、流水線平行與專家平行

    從張量平行、流水線平行到專家平行,拆解當模型太大、單張 GPU 放不下時,如何用多張 GPU 協同推理。

    2026.09.22 · 28 min
  8. 08

    成本優化:快取、路由、降級與自動擴縮

    從成本結構到快取、路由、降級與自動擴縮,拆解如何在不犧牲品質的前提下把 LLM 服務成本降低數倍。

    2026.09.22 · 30 min