知識分享 · AI 基礎
AI 是如何「思考」的?從「我喜歡貓」看懂大語言模型背後的 5 大數學基石
當你和 ChatGPT 順暢對話時,螢幕另一端其實沒有人類靈魂。剝開 AI 華麗的白話外衣,本質上都是在做「張量計算」。本文用最直覺的圖解與比喻,帶你掌握現代 AI 的運算核心。
語言的積木 —— Token(詞元)
人類是用文字思考,但電腦的視界裡只有數字。當你輸入一句話(例如「我喜歡貓」)時,AI 接收到的第一步不是理解意思,而是將句子切碎成最小處理單元,這個單元就叫做 Token(詞元)。
【我】、【喜歡】、【貓】 三個 Token,並分別被賦予一個獨一無二的數字身分證(ID)。
然而,純粹的數字 ID 對電腦來說依然毫無意義:電腦無法分辨 1034 究竟代表毛茸茸的動物「貓」,還是會飛的鋼鐵「飛機」。要讓電腦懂得詞意,我們必須進入第二關。
語義空間的座標 —— 嵌入向量(Embedding)
嵌入向量(Embedding)的本質,是用一組包含特徵的數字,將文字放置在一個高維度的幾何空間中。在這個空間裡,意思越相近的詞,座標距離就越接近!
真實的大語言模型維度高達幾千甚至上萬維,特徵數值也不是單純的 0 與 1,而是連續的精確小數。當「我」、「喜歡」、「貓」的向量按順序疊加排列在一起時,就形成了可以被數學計算的嵌入矩陣。
閱讀理解與畫重點 —— 注意力機制(Attention)
同一個詞在不同語境有完全不同的含義。例如:
1️⃣ 「蘋果發布了新手機」 vs 2️⃣ 「我吃了一個蘋果」
注意力機制(Attention Mechanism) 的作用,就是計算句子中各個詞之間的關聯權重分數,讓 AI 在閱讀「蘋果」時,自動將關注焦點放在「發布」與「手機」上!
大腦調音師 —— 權重矩陣與矩陣乘法
知道了上下文後,AI 必須根據規律加工生成答案。這個加工的「規則庫」,就是模型內部龐大的 權重矩陣(Weight Matrix)。
終極維度引擎 —— 張量計算(Tensor)
在真正的 AI 訓練與推理中,資料維度遠超單一平面。我們需要同時處理:句子長度、特徵維度、批次樣本數量以及詞位置。這時就需要更高維度的數據結構——張量(Tensor)。
| 概念名稱 | 白話比喻 | 數學角色與作用 |
|---|---|---|
| Token (詞元) | 語言積木 / 數字身分證 | 將文字切分為最小可計算數字 ID |
| Embedding (嵌入向量) | 幾何空間的語義座標 | 將詞轉為多維向量,表達詞與詞間的相似度 |
| Attention (注意力) | 螢光筆畫重點 | 計算上下文關聯,解決一詞多義與語境問題 |
| Weight (權重矩陣) | 錄音室調音師 | 儲存模型學到的規則,將輸入特徵加工轉換 |
| Tensor (張量計算) | 高維度疊疊樂運算 | 並行處理大量維度的矩陣乘法,實現智慧湧現 |
互動實驗室:體驗 AI 數位化模擬器
點選不同句子,觀察 AI 如何即時拆解 Token 與生成向量座標:
參考與引用來源 (References & Sources)
- 1. 原影片來源 (Original Video) https://www.youtube.com/watch?v=Xuw0aDQ5UdE
- 2. Transformer 架構與注意力機制論文 (Attention Mechanism) https://arxiv.org/abs/1706.03762
- 3. 詞嵌入向量基礎論文 (Word Embeddings / Vector Space) https://arxiv.org/abs/1301.3781
- 4. 大語言模型與 Byte Pair Encoding (BPE / Tokenization) https://openai.com/research/language-unsupervised