Afterglow Papers

Research notes on AI, agents & cognitive systems

Issue 007

大模型為什麼難訓練?Normalization、Residual 與 Dropout

拆解深層網路訓練的三大挑戰——訓練不穩定、梯度消失、過擬合,以及對應的三項關鍵技術。

Artificial Intelligence 14 min
Series

LLM 核心原理

7 篇
  1. 01 從文字到向量:NLP 向量化與 Token 的演進
  2. 02 詞嵌入與位置編碼:模型如何理解語意與順序
  3. 03 注意力機制入門:QKV、Mask 與縮放點積
  4. 04 Transformer 的心臟:多頭注意力與 FFN
  5. 05 大模型如何運作:從自回歸生成到推理採樣
  6. 還有 2 篇 →