Series

LLM 核心原理

7 篇 · 建議依序閱讀

  1. 01

    從文字到向量:NLP 向量化與 Token 的演進

    從 Bag-of-Words 一路談到 Transformer,理解「文字向量化」這條關鍵演化之路。

    2026.09.15 · 10 min
  2. 02

    詞嵌入與位置編碼:模型如何理解語意與順序

    從 Word2Vec 的靜態詞向量到 Transformer 的動態上下文嵌入,並解析位置編碼如何讓模型理解詞序。

    2026.09.15 · 13 min
  3. 03

    注意力機制入門:QKV、Mask 與縮放點積

    拆解 Transformer 的核心——注意力機制,從 QKV 三部曲到縮放點積與因果 Mask。

    2026.09.15 · 13 min
  4. 04

    Transformer 的心臟:多頭注意力與 FFN

    從單頭注意力的極限出發,理解多頭注意力、前饋神經網路與多層堆疊如何構築深層語言理解。

    2026.09.15 · 13 min
  5. 05

    大模型如何運作:從自回歸生成到推理採樣

    從自回歸生成到推理採樣,理解 LLM 如何在推論階段一個字一個字生成回應。

    2026.09.16 · 12 min
  6. 06

    大模型如何計算 Loss:訓練與推理的差異

    深入交叉熵損失、反向傳播與梯度下降,徹底釐清訓練與推理階段的本質差異。

    2026.09.16 · 14 min
  7. 07

    大模型為什麼難訓練?Normalization、Residual 與 Dropout

    拆解深層網路訓練的三大挑戰——訓練不穩定、梯度消失、過擬合,以及對應的三項關鍵技術。

    2026.09.16 · 14 min