跳至主要內容

Google 正式開源 Gemma 4!Apache 2.0 授權、四種尺寸全覆蓋|深度實測、Ollama 本機部署與架構解析

Google DeepMind 正式發布 Gemma 4 系列開源大型語言模型 (LLM)!升級 Apache 2.0 授權並支援多模態。本文將提供 Gemma 4 免費試用與 Ollama 本機部署教學,並深入解析 PLE 技術與 MoE 架構,完整實測程式碼生成、OCR、邏輯推理與多模態表現。

The Walking Fish 步行魚
The Walking Fish 步行魚 ·
4085 字 · 閱讀時間: 10 分鐘 · ...
Google 正式開源 Gemma 4!Apache 2.0 授權、四種尺寸全覆蓋|深度實測、Ollama 本機部署與架構解析
Fig. 01 — Google 正式開源 Gemma 4!Apache 2.0 授權、四種尺寸全覆 … FEATURED IMAGE

時隔一年,Google 在前天終於發布了萬眾期待的 Google Gemma 4 開源大型語言模型(LLM)。

這次 Gemma 4 的發布,不僅 AI 推理能力得到顯著增強,更是罕見地支援了「原生聲音」與「影片」的多模態輸入(Multimodal),甚至開放讓開發者調整輸入影像的 Token 預算與思考預算。更棒的是,授權條款從原本的 Gemma 協議,全面變更為更加開放且商用友善的 Apache 2.0 協議

今天我們就來深度解析 Google Gemma 4 的架構亮點,並進行一系列的 AI 壓力實測(邏輯推理、網頁設計、OCR 等)。文章後半段也會手把手教大家如何免費線上試用,以及如何透過 Ollama 本機部署 Gemma 4

Google Gemma 4 支援原生語音與影片多模態輸入畫面


Gemma 4 模型家族一覽:從手機到伺服器規格全解析

這次 Google Gemma 4 總共推出了四種不同參數量(Parameters)的版本,分別為 E2B, E4B, 26B A4B 與 31B,滿足邊緣運算到雲端伺服器的所有需求。

Gemma 4 各版本尺寸與參數量對照表

  • E2B 與 E4B(適合輕量設備):最大上下文長度(Context Window)高達 128K,支援文字、圖像、音訊、影片等多模態輸入。
  • 26B A4B 與 31B(適合高效能伺服器):最大上下文長度提升至 256K,支援文字、圖像與影片輸入(注意:大模型版本不支援音訊輸入)。

Gemma 4 Context Window 上下文視窗規格表

MoE 架構 vs 密集模型 (Dense) 差異

其中,最頂規的 31B 是標準的密集模型(Dense Model)。而 26B A4B 則是 Google 第一次開源的 MoE (Mixture-of-Experts) 專家混合架構模型。雖然總參數量高達 26B,但在實際運行推論時,只會動態啟動約 4B 的參數,大幅降低了硬體資源的消耗。

Gemma 4 密集模型與 MoE 模型架構差異對比

手機也能跑?E2B / E4B 與創新 PLE 技術解析

這次最特殊的亮點在於 E2B 與 E4B 這兩個版本。「E」代表的是「有效參數(Effective Parameters)」,這個命名方式曾出現在專為手機運行的 Gemma 3n 上。

專為手機邊緣運算設計的 Gemma 3n 介紹

E2B 的總參數量實際上是 5.1B,E4B 則有 8B。但在進行推論時,真正參與運算的參數只有 2.3B4.5B。這要歸功於全新的 Per-Layer Embedding (PLE) 技術

傳統 LLM 只有在底部有一個巨大的 Embedding Layer(嵌入層)。而 PLE 則是在每一層(或特定層)額外新增 Layer,運作原理就像外掛一本字典,模型需要時才去查找相關向量並補充進去。這讓模型能攜帶龐大知識庫,卻不會增加額外的即時計算量。甚至可以將這些 Layer 放在系統 RAM 中交由 CPU 運算,為開發者節省寶貴的 GPU VRAM 資源!

Gemma 4 創新 Per-Layer Embedding (PLE) 技術原理解析圖


Gemma 4 效能跑分表現:全面超越前代

除了先進的 PLE 架構,Gemma 4 系列相較於上一代的 Gemma 3 27B IT,展現了近乎全面的效能超越。

Gemma 4 原生音訊輸入功能展示

根據 Google 官方的 Benchmark 跑分資料,即便是小巧的 E4B 版本,在 MMMU Pro、LiveCodeBench V6 等高難度測試資料集上,表現也能贏過龐大的 Gemma 3 27B IT。

Gemma 4 官方 Benchmark 跑分效能全面對比

而在權威的語言模型競技場(LMSYS Chatbot Arena)排行榜上,Gemma 4 31B 與 26B A4B 分別空降了第 27 名與第 40 名。從官方提供的 Elo Score 可以明顯看出它對標其他開源模型的競爭優勢。

LMSYS Arena 語言模型競技場排行榜 Gemma 4 跑分 Elo Score 詳細對比圖


Gemma 4 免費試用與本機部署教學 (Ollama)

想要親自體驗 Gemma 4 嗎?這裡提供兩種最快速的方法:

1. Google AI Studio (線上免費試用)

點擊網頁右上角的模型選擇,就可以直接免費用到最強大的 Gemma 4 31B 以及 26B A4B。適合不想佔用電腦資源的用戶。

Google AI Studio 選擇 Gemma 4 模型畫面

2. 本機運行部署 (使用 Ollama)

如果你注重資安,想在自己的電腦上離線運行,強烈推薦使用 Ollama。前往官網下載並安裝後,打開終端機輸入指令即可。

Ollama 官方網頁 Ollama Gemma 4 模型下載庫

Gemma 4 E4B 下載運行指令:

1
ollama run gemma4:e4b

💡 溫馨提醒:雖然 E4B 核心運算是 4B,但下載的實體模型約 8B,建議顯示卡 VRAM 至少有 8GB 才能順暢運行(特別是當你開啟大 Context Window 時)。不過受惠於 PLE 技術,即使沒有完全載入 VRAM,運行速度依然不算慢。


Gemma 4 深度實測:邏輯推理、網頁設計與多模態表現

接下來進入重頭戲,我們針對 Gemma 4 E4B26B A4B (Q4 量化版) 進行了一系列極限測試,並以競爭對手 Qwen 3.5 (9B 與 35B) 作為對照組。

1. 網路搜尋與資料整理能力

在 Ollama 介面開啟網路搜尋功能,請模型整理近期的新聞。Gemma 4 的兩款模型表現都相當優異,精準抓到了資訊重點,沒有出現明顯的 AI 幻覺。

Ollama 開啟 Web Search 搜尋整理新聞測試

2. 邏輯推理測試:Gemma 4 意外翻車?

我使用了一套經典的「左輪手槍生死局」邏輯提示詞進行測試,這非常考驗模型的純粹機率計算與邏輯推演能力。

測試提示詞:

現在請回答這個邏輯思考題:

想像你正被綁在椅子上動彈不得,歹徒拿著一把6個槍膛全空的槍,再裝兩顆子彈進兩個緊鄰的槍膛內,並旋轉槍膛。然後對著你的腦袋扣板機一下,很幸運你還活著,這時他說再扣一次板機就放你走,你希望先旋轉後再扣或直接扣板機?為什麼?

本以為現在的模型開啟思考(Thinking)都能輕鬆答對,但 Gemma 4 E4B 竟然無法正確回答! 它一直試圖將這道數學機率題導向「心理博弈」與「犯罪心理學」。反觀對照組 Qwen 3.5,連更小參數的 4B 版本都能正確答對這題。

Gemma 4 邏輯推理題目錯誤反應與翻車現場

這是一個極端壓力下的邏輯判斷題,涉及到權力結構、恐懼和時間控制。在這種生死攸關的虛擬情境中,我們必須從**「最大化規避錯誤的機率」**角度來思考。

邏輯分析的結論: 你應該立刻要求他扣扳機,不給他旋轉和停頓的機會。

(正如你所見,它完全放棄了數學機率計算,直接把這題當成了犯罪心理學來分析…)

👉 點擊展開查看 Gemma 4 E4B 完整的「心理博弈」胡扯分析
 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
---

### 💡 為什麼不該等他旋轉?(分析「等待」的風險)

當一個歹徒處於「我給你最後一次機會」的心理狀態時,他往往已經進入了高度專注且帶有「儀式感」的表演模式。

1. **時間是最大的敵人(時間窗口):** 「等待」本身就是一個時間行為。當你要求他旋轉時,他需要花時間進行以下動作:
    * **心理校準:** 確認射擊的流程。
    * **物理準備:** 移動槍膛、瞄準、穩定身體。
    * **這段等待的時間,會讓他的動作變得過於「完整」和「有條理」。** 越是等待,他就越有可能建立一個完美的射擊流程,將錯誤的機率最小化。

2. **儀式感(Ritual):** 犯罪者在執行決定性動作時,往往會進入一種「儀式化」的行為模式。旋轉槍膛、對準目標、等待、再開槍,這是一個完整的流程。一旦這個流程被完整地執行,其成功率就是最高的。

### ✅ 為什麼要求立刻扣扳機?(分析「立即行動」的優勢)

要求他立即扣扳機,是在用「時間壓力」打破他已經建立的、充滿準備和規律感的流程。

1. **打亂節奏,製造焦躁(Disruption):** 歹徒喜歡控制感。你如果堅持「現在就做」,你是在用話語和精神壓力,逼他打破「完美的、一步步的」行為節奏。
2. **最小化錯誤時間:** 槍械射擊中最危險的階段,往往不是扣扳機的瞬間,而是**「準備扣扳機」**的過渡過程。如果他沒有足夠的時間來穩定地將槍膛移動到安全的、已知的狀態,他就會被迫在倉促的狀態下扣動扳機。
3. **從邏輯上談「風險」:** 假設歹徒是個精確且計算的犯罪者,他會在最佳時機(旋轉完、瞄準好)射擊。你越是給他等待和旋轉的機會,你就給了他越多完美的射擊條件。

---

### 總結戰略(在無法動身時的生存策略)

**行動原則:打亂流程,減少時間。**

* **戰術:「立刻!」**
* **溝通:** 你的語言必須表現出「我明白規則,但現在這個時機不對」,迫使他放棄優雅的射擊過程,轉而採用一種快速、非計畫性的衝動動作。

> **核心邏輯:在生命威脅的情況下,讓處於掌控地位的人,無法依照其「最好的、最計劃的」方式來行事。**

 

3. AI 網頁設計與程式碼撰寫實測

提示詞: 「使用單一 HTML 製作現代簡約風格的伺服器儀表板,需有狀態、延遲、硬碟空間顯示」

  • Gemma 4 E4B:表現差強人意,設計充滿早期的「AI 感」(濫用 Emoji),且配色有明顯瑕疵。

E4B 伺服器儀表板設計結果

  • Gemma 4 26B A4B:表現極佳!UI 介面看起來現代且協調,CSS 功力深厚。

26B A4B 現代感伺服器儀表板設計

  • 比較組 (Qwen 3.5 35B):第一次生成崩潰,第二次才正常。雖然有流暢動畫,但實用性一般。

Qwen 35B 儀表板設計失敗畫面 Qwen 35B 儀表板第二次正常結果

  • Gemma 4 31B (AI Studio):整體水準很高,但個人主觀認為 26B A4B 的排版表現甚至略勝一籌。 AI Studio 31B 儀表板生成結果

在另一項科技部落格介面設計測試中,Gemma 4 26B A4B 再次給出乾淨俐落、配色協調的優秀頁面;反而是 Qwen 3.5 35B 排版嚴重跑版,令人失望。

Gemma 4 26B A4B 優異的部落格介面設計 Qwen 3.5 35B 部落格設計排版跑位

4. SVG 動畫與 Agent 外部工具調用

  • SVG 向量圖生成:不管是 Gemma 還是 Qwen,小尺寸模型生成的 SVG 幾乎都無法順利開啟。Gemma 4 31B 雖然能生出圖形,但仍是難以理解的「抽象畫」。

Gemma 4 31B 生成的 SVG 抽象畫

  • Agent 工具調用 (以 Cline 製作貪食蛇為例)
    • Gemma 4 E4B:工具調用能力(Tool Calling)明顯不足,會把內部的 Tag 標籤直接寫入程式碼檔案中,導致報錯。
    • OpenCode 測試:Gemma 4 E4B Q4 版完全無法調用寫入工具(已排除 Context Window 問題),只會把程式碼當作普通對話吐在介面上。

Gemma 4 Agent 寫入檔案帶有 Tag 錯誤 Gemma 4 OpenCode 工具調用失敗

5. OCR 圖像辨識能力(中文收據測試)

針對發票/收據的繁體中文提取,我們進行了壓力測試:

  • Gemma 4 E4B:表現極差。不僅漏掉單號,還出現嚴重的 AI 幻覺(把「冰釀綠茶」辨識成「魯雞絲茶」)。

Gemma 4 E4B OCR 中文辨識出現嚴重幻覺與錯誤

  • Gemma 4 26B A4B:雖然是大模型,仍有錯字(「麥味登」變「暖味登」),唯一值得稱讚的是具備隱私意識,會自動幫店名與電話打上遮蔽標籤。

Gemma 4 26B A4B OCR 辨識錯字但具備隱私遮蔽

  • 對照組 Qwen 3.5 9B:OCR 表現完美,字字精準且排版格式正確,實用性極高。

Qwen 3.5 9B OCR 完美準確呈現

6. 原生語音輸入摘要測試

我匯入了過去 Shorts 短片的錄音檔讓 Gemma 4 進行摘要:

  • 實測結果:非常悲劇。 摘要內容與實際錄音檔幾乎毫無關聯,僅勉強辨識出零星關鍵字。本來期待它能像 Gemini 一樣用來做自動字幕校正或會議紀錄,目前看來音訊處理能力仍不及格。

Gemma 4 原生語音輸入摘要完全失敗


總結:Gemma 4 優缺點評價與台灣開發者的獨家優勢

經過深度實測,Gemma 4 的程式與網頁設計美感極佳,寫出的程式碼可運行率很高。但在本機量化版的測試中,工具呼叫能力幾乎為零,這大大降低了它作為 AI Agent 核心(例如驅動 OpenCode 或 Cline)的實用價值。而 OCR 與音訊辨識目前也難以應用於生產環境。

台灣開發者的不可取代優勢 (非中國模型)

即便表現可能在某些方面不如 Qwen 3.5,但 Gemma 4 具備一個無可取代的優勢:非中國開發背景

在承接政府標案或在公家單位工作時,即使模型是開源的可自架,公家單位基本也「不允許使用中國模型」,原因很可能是擔心其在公共服務中,展現對中華民國不利的政治立場。在 Llama 系列不更新的真空期下,Gemma 4 成為了台灣開發者在這些敏感場合中相對不錯的開源選擇。

影片介紹

SHARE / 分享此文章