Series
LLM 核心原理
- 01
從文字到向量:NLP 向量化與 Token 的演進
從 Bag-of-Words 一路談到 Transformer,理解「文字向量化」這條關鍵演化之路。
→ - 02
詞嵌入與位置編碼:模型如何理解語意與順序
從 Word2Vec 的靜態詞向量到 Transformer 的動態上下文嵌入,並解析位置編碼如何讓模型理解詞序。
→ - 03
注意力機制入門:QKV、Mask 與縮放點積
拆解 Transformer 的核心——注意力機制,從 QKV 三部曲到縮放點積與因果 Mask。
→ - 04
Transformer 的心臟:多頭注意力與 FFN
從單頭注意力的極限出發,理解多頭注意力、前饋神經網路與多層堆疊如何構築深層語言理解。
→ - 05
大模型如何運作:從自回歸生成到推理採樣
從自回歸生成到推理採樣,理解 LLM 如何在推論階段一個字一個字生成回應。
→ - 06
大模型如何計算 Loss:訓練與推理的差異
深入交叉熵損失、反向傳播與梯度下降,徹底釐清訓練與推理階段的本質差異。
→ - 07
大模型為什麼難訓練?Normalization、Residual 與 Dropout
拆解深層網路訓練的三大挑戰——訓練不穩定、梯度消失、過擬合,以及對應的三項關鍵技術。
→