翼王資訊社

知識分享 · AI 基礎

AI 是如何「思考」的?從「我喜歡貓」看懂大語言模型背後的 5 大數學基石

當你和 ChatGPT 順暢對話時,螢幕另一端其實沒有人類靈魂。剝開 AI 華麗的白話外衣,本質上都是在做「張量計算」。本文用最直覺的圖解與比喻,帶你掌握現代 AI 的運算核心。

翼王資訊社 · 知識分享 2026-07-26

Step 01 • 文字數位化

語言的積木 —— Token(詞元)

人類是用文字思考,但電腦的視界裡只有數字。當你輸入一句話(例如「我喜歡貓」)時,AI 接收到的第一步不是理解意思,而是將句子切碎成最小處理單元,這個單元就叫做 Token(詞元)

💡 拆解範例:「我喜歡貓」 ➔ 被分詞器切成 【我】【喜歡】【貓】 三個 Token,並分別被賦予一個獨一無二的數字身分證(ID)。
"我喜歡貓" 分詞器 Tokenizer 【我】 Token ID ➔ 1732 【喜歡】 Token ID ➔ 9251 【貓】 Token ID ➔ 1034

然而,純粹的數字 ID 對電腦來說依然毫無意義:電腦無法分辨 1034 究竟代表毛茸茸的動物「貓」,還是會飛的鋼鐵「飛機」。要讓電腦懂得詞意,我們必須進入第二關。

Step 02 • 幾何特徵空間

語義空間的座標 —— 嵌入向量(Embedding)

嵌入向量(Embedding)的本質,是用一組包含特徵的數字,將文字放置在一個高維度的幾何空間中。在這個空間裡,意思越相近的詞,座標距離就越接近!

X 軸:動物特徵 (Animal Score) Y 軸:毛髮特徵 (Furry Score) 🐱 貓 (Cat) Vector: [1, 1, 0, 1] 🐶 狗 (Dog) Vector: [1, 1, 0, 0] 高幾何相似度 ✈️ 飛機 (Airplane) Vector: [0, 0, 1, 0]

真實的大語言模型維度高達幾千甚至上萬維,特徵數值也不是單純的 0 與 1,而是連續的精確小數。當「我」、「喜歡」、「貓」的向量按順序疊加排列在一起時,就形成了可以被數學計算的嵌入矩陣

Step 03 • 上下文對焦

閱讀理解與畫重點 —— 注意力機制(Attention)

同一個詞在不同語境有完全不同的含義。例如:
1️⃣ 「蘋果發布了新手機」 vs 2️⃣ 「我吃了一個蘋果

注意力機制(Attention Mechanism) 的作用,就是計算句子中各個詞之間的關聯權重分數,讓 AI 在閱讀「蘋果」時,自動將關注焦點放在「發布」與「手機」上!

蘋果 發布 手機 0.92 0.08 0.88
Step 04 • 模型資訊加工

大腦調音師 —— 權重矩陣與矩陣乘法

知道了上下文後,AI 必須根據規律加工生成答案。這個加工的「規則庫」,就是模型內部龐大的 權重矩陣(Weight Matrix)

🎵 調音師比喻: 權重矩陣就像錄音室的調音台,將輸入的語音訊號放大特定頻率、調低噪音,最終輸出完美的音效。而在數學上,這就是將輸入向量乘以權重矩陣的「矩陣乘法」運算。
輸入向量 (X) [ 0.8 ] [ 0.2 ] [ 0.5 ] × 權重矩陣 (W) [ 0.4, 0.9, -0.1 ] [ 0.1, 0.3, 0.8 ] [ 0.7, -0.2, 0.5 ] = 加工後新向量 [ 0.95 ] [ 0.48 ] [ 0.71 ] 進入下一層網路
Step 05 • 終極維度矩陣

終極維度引擎 —— 張量計算(Tensor)

在真正的 AI 訓練與推理中,資料維度遠超單一平面。我們需要同時處理:句子長度、特徵維度、批次樣本數量以及詞位置。這時就需要更高維度的數據結構——張量(Tensor)

0維:純量 單一數字 (5) 1維:向量 一維陣列 [1, 2, 3] 2維:矩陣 Excel 表格 (列/行) 3維 / 4維:張量 多張表格疊加 (Tensor)
概念名稱 白話比喻 數學角色與作用
Token (詞元) 語言積木 / 數字身分證 將文字切分為最小可計算數字 ID
Embedding (嵌入向量) 幾何空間的語義座標 將詞轉為多維向量,表達詞與詞間的相似度
Attention (注意力) 螢光筆畫重點 計算上下文關聯,解決一詞多義與語境問題
Weight (權重矩陣) 錄音室調音師 儲存模型學到的規則,將輸入特徵加工轉換
Tensor (張量計算) 高維度疊疊樂運算 並行處理大量維度的矩陣乘法,實現智慧湧現

互動實驗室:體驗 AI 數位化模擬器

點選不同句子,觀察 AI 如何即時拆解 Token 與生成向量座標:

載入中……

參考與引用來源 (References & Sources)

  • 1. 原影片來源 (Original Video) 影片標題:AI的數學基礎:token、嵌入向量、注意力機制、權重矩陣、矩陣乘法和張量計算 | 創作者:修餅 xiubing https://www.youtube.com/watch?v=Xuw0aDQ5UdE
  • 2. Transformer 架構與注意力機制論文 (Attention Mechanism) Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems (NeurIPS 2017). https://arxiv.org/abs/1706.03762
  • 3. 詞嵌入向量基礎論文 (Word Embeddings / Vector Space) Mikolov, T., Chen, K., Corrado, G., & Dean, J. (2013). Efficient Estimation of Word Representations in Vector Space. arXiv preprint arXiv:1301.3781. https://arxiv.org/abs/1301.3781
  • 4. 大語言模型與 Byte Pair Encoding (BPE / Tokenization) Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., & Sutskever, I. (2019). Language Models are Unsupervised Multitask Learners. OpenAI Blog. https://openai.com/research/language-unsupervised

MORE

← 回知識分享總覽