跳至主要內容

Gemini 2.5 Pro 發布:Google 最強 AI 登場,一句話生成完整遊戲|會「思考」還稱霸語言模型競技場!

Google 最新 AI 模型 Gemini 2.5 Pro 登場!這是一個會「思考」的模型,擁有百萬 Token 上下文和超強程式碼能力。這篇文章帶你深入分析它的亮點以及實際表現。

The Walking Fish 步行魚
The Walking Fish 步行魚 ·
5771 字 · 閱讀時間: 13 分鐘 · ...
Gemini 2.5 Pro 發布:Google 最強 AI 登場,一句話生成完整遊戲|會「思考」還稱霸語言模型競技場!
Fig. 01 — Gemini 2.5 Pro 發布:Google 最強 AI 登場,一句話生成完 … FEATURED IMAGE

最近科技圈的大事,莫過於 Google 又端出了他們最新的 AI 大菜 —— Gemini 2.5 Pro。身為一個熱愛追新技術的開發者,看到 Google 宣稱這是他們「至今最聰明」的 AI 模型,並在度登頂語言模型競技場的排名第一,當然要來好好研究一番。

Google 說這款模型特別擅長處理複雜問題,推理和寫程式碼能力都有顯著提升。聽起來很厲害,但它真的有這麼神嗎?跟之前的版本或競爭對手比起來又如何?這篇文章就來幫大家拆解一下,看看 Gemini 2.5 Pro 到底葫蘆裡賣什麼藥。

Gemini 2.5 Pro 目前是 LMArena 的排名第一

什麼是 Gemini 2.5 Pro?它跟之前的有什麼不一樣?

首先,Gemini 系列算是 Google 的 AI 王牌。從最早的 1.0 到現在的 2.5 Pro,看得出來 Google 一直在努力追趕甚至想超越 OpenAI 的 GPT 系列。

這次 2.5 Pro 最特別的地方,就是最近各大模型廠商都有發表的「思考模型」 (Thinking LLM)。老實說,這個詞聽起來有點行銷味,但背後的概念是,這個模型在給你答案之前,會先進行一個更深層、更像人類思考的「推理」過程(CoT, Chain of Thought)。不像以前的模型可能只是快速反應,2.5 Pro 會試著先想清楚再回答。理論上,這能讓它在處理需要邏輯、分析的複雜任務時,表現得更準確、更可靠。

Gemini 2.5 Pro 在回覆前會先經過一段思考過程 Gemini 2.5 Pro 的思考過程

發布時程與重點

Google 是在 2025 年 3 月 25 日 正式宣布推出 Gemini 2.5 Pro 的實驗版。一開始,只有付費訂閱 Gemini Advanced 的用戶才能嚐鮮。

但有趣的是,大概過不到一個禮拜 (差不多 3 月 30、31 日左右),Google 就跌破大家眼鏡地把它免費開放給所有使用者了!雖然免費仔會有一些使用上的限制 (後面會提),但這個操作速度真的很快。

我的猜測啦,這可能是 Google 急著想擴大用戶基礎,收集更多真實世界的回饋數據,畢竟對手 ChatGPT 熱度一直很高。而且,把它標示為「實驗性」,也給 Google 留了後路,表示他們還在調整、優化,大家也別期望它一開始就完美無缺。

目前大家可以在 Google AI Studio 和 Gemini App 裡面用到它。未來也會整合到給企業用的 Vertex AI 平台。

核心功能亮點

那 Gemini 2.5 Pro 到底有哪些讓人眼睛一亮的本事呢?

1. 會「思考」的 AI?強化推理能力

這點前面提過了,就是所謂的「思考模型」。它不是直接輸出答案,而是會先進行內部推理。這讓它在一些需要深度思考的基準測試上表現突出,例如在超難的 Humanity's Last Exam 推理測試中,拿到了 18.8% 的分數,領先其他對手。

這聽起來就像是… AI 不再只是個快速反應的鸚鵡,而是開始學會「謀定而後動」。對於需要嚴謹邏輯分析的科學研究、市場分析等領域,這種能力可能非常有價值。

Gemini 2.5 Pro 測試資料集表現

2. 程式碼能力大躍進

跟上一代 Gemini 2.0 比起來,2.5 Pro 在寫程式方面的能力有明顯進步。官方說它很擅長建立視覺效果不錯的 Web App、寫一些能主動執行的程式碼,甚至還能做程式碼轉換。

在一些程式碼相關的基準測試,像是 SWE-Bench Verified (拿到 63.8%) 和 LiveCodeBench v5 (70.4%),表現都很不錯。最誇張的是,Google 還展示了一個 Demo,只用一行提示就讓 Gemini 2.5 Pro 建立了一個簡單的視訊遊戲!

Demo 影片

3. 原生多模態支援

這點算是繼承了 Gemini 家族的優良傳統。Gemini 2.5 Pro 天生就能理解文字、圖片、聲音、甚至影片等多種不同的資訊格式。你可以丟給它各種資料,它都能無縫地整合處理。

在多模態理解能力的基準測試 MMMU 上,它也拿到了 81.7% 的高分。這讓 AI 更接近我們人類處理資訊的方式,畢竟我們也是同時用眼睛看、用耳朵聽來理解世界。未來在多媒體內容創作、分析,或是更自然的人機互動上,應該會有更多應用。

4. 驚人的 100 萬 Token 上下文視窗以及回撤能力

這大概是 Gemini 2.5 Pro 最讓人印象深刻的規格之一了。它擁有高達 100 萬 Token 的上下文視窗 (Context Window),而且 Google 還計畫未來要擴展到 200 萬 Token!

100 萬 Token 是什麼概念?簡單來說,你可以把將近 70 萬個英文單字或 1500 頁的文件一次丟給它處理!這讓它可以理解非常長的對話、分析整本書的內容,或者讀懂一個大型專案的全部程式碼,而不會像以前的模型一樣,讀到後面就忘了前面。

在長上下文理解的基準測試 MRCR 上,Gemini 2.5 Pro 的表現也確實輾壓對手,在 128K Token 長度下拿到 91.5%,在 1M Token 長度下也有 83.1%。這對於需要處理大量資訊的任務,比如法律文件分析、學術研究、大型軟體開發等,簡直是神器。

另外在 Fiction.live 網站的測試中,Gemini 2.5 Pro 也展示了它在回撤 (Retrieval) 能力上的優勢,能夠在海量資料中找到最相關的答案。他們發現 Gemini 2.5 Pro 能夠在 10 萬字以上的文本長度中,收回故事初期埋下的伏筆。在目前所有的大型語言模型中,Gemini 2.5 Pro 的回撤能力名列前茅。

fiction.live 測試的 Gemini 2.5 Pro 回撤能力

效能跑分與比較

講了這麼多功能,實際跑分怎麼樣?Google 當然也秀出了一堆基準測試成績。

  • 在模仿人類偏好的 LMArena 排行榜上,Gemini 2.5 Pro 衝到了第一名,表示很多人覺得它的回答品質高、用起來順手。
  • 在數學和科學推理方面,像是 GPQA (84.0%) 和 AIME 2025 (86.7%),它也領先群雄。
  • 程式碼能力雖然強,但在某些特定的測試項目 (例如 SWE-bench Verified 和 LiveCodeBench v5),有些對手如 Claude 3.7 Sonnet 或 OpenAI 的 o3-mini 表現甚至更好一些。
  • 長上下文 (MRCR) 和多模態 (MMMU) 理解則是它的強項,分數都相當亮眼。

跑分固然重要,但沒有一個模型是萬能的。從下表可以看到,不同模型各有擅長。Gemini 2.5 Pro 整體看起來很強,尤其在推理和長上下文方面,但在純粹的程式碼生成或事實性方面,可能還有其他選擇。最終還是要看你的具體需求是什麼。

表 1:主要基準測試比較

實際使用測試

光說不練沒意思,我們也實際動手玩了一下 Gemini 2.5 Pro,看看它在各種場景下的表現究竟如何。以下是一些關鍵測試:

1. 邏輯推理能力:經典左輪手槍題

首先,我們用了常來測試語言模型的「左輪手槍推理題」來考驗 Gemini 2.5 Pro。這個問題需要一定的邏輯推導才能算出正確答案。

測試平台: Google AI Studio

問題描述:

現在請回答這個邏輯思考題:

想像你正被綁在椅子上動彈不得,歹徒拿著一把6個槍膛全空的槍,再裝兩顆子彈進兩個緊鄰的槍膛內,並旋轉槍膛。然後對著你的腦袋扣板機一下,很幸運你還活著,這時他說再扣一次板機就放你走,你希望先旋轉後再扣或直接扣板機?為什麼?

過程與結果: 輸入問題後,可以看到 Gemini 2.5 Pro 在回覆前確實顯示了一段「思考中」的狀態,類似之前的 Gemini 2.0 Flash Thinking。稍待片刻,它成功給出了正確答案,並且計算過程也完全正確。雖然現在其他採用 CoT 技術的模型 (如 o3-mini, DeepSeek R1) 也大多能解開此題,但考量到之前的 Gemini 2.0 Flash Thinking 有時仍會答錯,這算是一個穩定的進步。

Gemini 2.5 Pro 成功解開左輪手槍推理題

o3-mini 與 Deepseek R1 也一樣可以解出

2. 多模態辨識能力:收據與手寫字

Gemini 系列一直強調多模態能力,這次我們也針對圖片辨識進行了測試。

測試平台: Google AI Studio

測試一:收據辨識

  • 目標: 上傳一張收據圖片,要求模型辨識內容並按原格式輸出。
  • 結果: 成功。Gemini 2.5 Pro 準確地復刻了收據上的文字和格式。

收據照片 辨識結果截圖

測試二:高難度手寫字辨識

  • 目標: 上傳一張去年在學校領畢業證書時拍的照片,照片中有一台機器上貼著公告,部分內容是辨識度較低的手寫字。要求模型辨識公告全文。
  • 結果: 表現驚艷。不僅電腦打字的部分被完美辨識,連非常潦草、連我自己都看不太懂的手寫文字,Gemini 2.5 Pro 也一字不漏地轉錄了出來。
  • 對比測試: 同一張圖片拿去給 ChatGPT (GPT-4o) 和 Claude (3.7 Sonnet) 測試,兩者都無法成功辨識出手寫的那行字。這顯示 Gemini 2.5 Pro 在困難的 OCR 場景下具有明顯優勢。

輸入的照片 Gemini 2.5 Pro 成功辨識手寫字

GPT-4o 無法辨識

Claude 3.7 Sonnet 無法辨識

3. YouTube 影片理解

Google AI Studio 現在支援直接貼上 YouTube 影片網址匯入整部影片(包含聲音和畫面,不只是 CC 字幕)進行分析。我們簡單試了一下:

  • 功能: 可以讓它總結影片內容(尤其適合沒字幕的影片),甚至拿來輔助上字幕。
  • 限制: 因為是處理完整影音,過長的影片(如超過一小時)可能會遇到 Token 數量限制。

4. 程式碼生成:Canvas 互動網頁

為了驗證官方宣稱的程式碼能力大躍進,我們使用了 Gemini 網頁版內建的 Canvas 功能來進行測試。

測試平台: Gemini 網頁版 + Canvas

測試一:簡單遊戲生成

  • 提示詞: 「製作一個 3D 飛行遊戲,有摩天大樓」
  • 結果: 初版效果普通。經過幾次提示詞調整後,遊戲基本可以運作,但畫面中間沒有飛機模型,操作手感也有些奇怪。算是堪用但仍需大量調整。

Canvas 生成的飛行遊戲 (調整後)

測試二:現代風格部落格

  • 初始提示詞: 「生成一個現代簡約風格的部落格,使用 Tailwind CSS」
  • 結果: 效果不佳,可能因為提示詞太過簡略。
  • 調整後提示詞: (使用 Gemini 2.5 Pro 在 AI Studio 生成了更詳細的需求列表後再輸入)
  • 結果: 效果大幅改善,生成了一個視覺上相當不錯的部落格框架。這說明給予 Gemini 2.5 Pro 詳細、具體的提示詞至關重要。

初次生成效果較為普通

詳細提示詞生成的部落格頁面效果不錯

5. 程式碼生成:實際專案開發 (API Key 管理器)

接著,我們嘗試讓 Gemini 2.5 Pro 協助完成一個小型實際專案。

測試平台: VS Code + Cline 插件 (使用 Gemini 2.5 Pro API)

目標: 製作一個 Web 應用,可以記錄多個 Gemini API Key,並在調用時進行輪循,以盡量規避免費額度的速率限制。

過程與結果: 基本上全程僅下達指令,觀看 Gemini 2.5 Pro 編輯程式碼並儲存。最終,它成功生成了一個功能完整的網頁應用:

  • 介面可以添加、管理來自不同帳號的 Gemini API Key。
  • 提供一個 OpenAI 相容的 API 端點,將請求指向這個應用即可實現 Key 的輪循調用。
  • 實際測試功能正常運作。
  • 值得稱讚的是,這次生成的應用介面美觀度相較過往的 Gemini 模型有顯著提升,不再是過去那種非常基礎、簡陋的風格。

過程基本都只有按儲存

由 Gemini 2.5 Pro 開發的 API Key 輪循管理器,介面美觀且功能完整

(後續整理完確定沒問題將會把此專案開源至 GitHub)

2025/04/13 更: 專案已開源到 GitHub

6. 程式碼生成:修改現有專案 (個人部落格)

最後,既然前面生成了部落格,就順勢讓它試試修改本人目前的這個 Hugo 部落格。

測試平台: VS Code + Cline 插件

目標: 改善現有部落格的樣式和佈局。

過程與結果: 由於 Hugo 模板檔案較分散、結構複雜,過程並非一帆風順,需要多次對話溝通和部分手動修改。但最終的成品視覺效果提升明顯,達到了相當精美的程度。

經過 Gemini 2.5 Pro (及部分手動調整) 修改後的部落格

小結:

從這些實際測試來看,Gemini 2.5 Pro 在邏輯推理、多模態辨識(尤其是困難 OCR)、程式碼生成(特別是前端美感和處理複雜專案)方面確實有長足進步。但在程式碼方面,提示詞的精確度和專案的複雜度仍會顯著影響結果,有時需要使用者介入引導或修正。

應用場景與潛力

看了這些功能和跑分,Gemini 2.5 Pro 能用在哪裡呢?

  • 軟體開發:分析大型程式碼庫、自動生成文件、輔助設計複雜的 Web 應用、實作架構模式等等。
  • 科學研究與數學:解決複雜的數學或邏輯問題、分析科學文獻、進行模擬。
  • 創意與設計:潛力應用包括遊戲開發(前面提的 Demo)、互動式模擬、動畫製作、物理模擬。
  • 資料分析:處理超長的文件、從大量非結構化數據中提取洞見。
  • 電腦視覺:雖然主要輸出是文字,但它的多模態理解能力讓它可以用於物件偵測、圖片標註、光學字元辨識 (OCR) 等任務。

總之,它強大的推理、程式碼和長上下文能力,讓它特別適合處理那些複雜、需要大量知識背景的任務。

開發者怎麼看? (正面與負面回饋)

任何新工具出來,最重要的還是實際用起來的感受。目前開發者社群對 Gemini 2.5 Pro 的看法怎麼樣呢?

正面回饋

  • 不少人對它的整體智慧,尤其是在長篇分析和數理科學 (STEM) 領域的表現感到驚艷。
  • 強大的推理和程式碼能力獲得很多讚賞。
  • 巨大的上下文視窗被認為是殺手級應用,對於分析大型程式碼庫或文件來說超級方便。
  • 有些開發者回報,在特定的程式碼任務或理解專案上下文方面,感覺比 GPT-4 或其他對手更好用。

初步看起來,開發者對這個新玩具的反應是蠻正面的,特別是長上下文這點打中了很多人的痛點。

負面回饋與已知問題

當然,沒有完美的工具,尤其這還只是個「實驗版」。開發者也回報了一些問題:

  • 有人覺得跟 Gemini 2.0 比起來,2.5 Pro 在某些任務(例如翻譯、簡單問答)上的表現反而下降了。
  • 因為多了「思考」過程,回應速度明顯變慢,對於追求效率的場景可能不太適合。
  • 程式碼方面,有人遇到一致性問題、版本追蹤困難,或是解釋錯誤日誌的能力不足。
  • 產生的程式碼有時過於精簡(可讀性差)或不必要的複雜。
  • 在 Google AI Studio 中使用時,偶爾會遇到不明原因的速率限制或錯誤。
  • 不少人希望可以手動關閉「思考」模式,讓它在處理簡單問題時能快一點。

這些回饋提醒我們,Gemini 2.5 Pro 可能還需要一些時間打磨。Google 似乎在這個版本優先強化了推理和長上下文,但可能在其他方面(如速度、某些基礎任務的穩定性)做出了一些取捨。

技術規格速覽

這裡快速列一下 Gemini 2.5 Pro 的關鍵技術規格:

  • 模型代碼: gemini-2.5-pro-exp-03-25
  • 輸入類型: 文字、圖片、音訊、視訊
  • 輸出類型: 僅文字
  • 輸入 Token 上限: 1,048,576 (1 百萬)
  • 輸出 Token 上限: 65,536 (64K)
  • 知識截止日期: 2025 年 1 月
  • 支援功能: 結構化輸出、函數呼叫、程式碼執行、搜尋整合、原生工具使用、思考 (Thinking)
  • 不支援功能: 快取 (Caching)、微調 (Fine-tuning)

特別值得一提的是那個 64K 的輸出 Token 限制,這比很多主流模型 (通常是 4K 或 8K,頂多 32K) 都要大方得多!這表示它可以生成非常長、非常詳細的回應,而不用擔心被中間截斷。

表 2:Gemini 2.5 Pro 技術規格

規格項目 數值/描述
模型代碼 gemini-2.5-pro-exp-03-25
輸入類型 音訊、圖像、視訊和文字
輸出類型 僅文字
輸入 Token 上限 1,048,576 (1M)
輸出 Token 上限 65,536 (64K)
知識截止日期 2025 年 1 月
支援能力 結構化輸出、函數呼叫、程式碼執行、搜尋基礎、原生工具使用、思考
不支援能力 快取、微調

實際應用展示

光說不練沒意思,Google 也放出了一些 Demo 來展示 Gemini 2.5 Pro 的能耐:

  • 前面提到的「一行提示生成無盡奔跑遊戲」。
  • 其他互動式 Demo 還包括:創建宇宙魚動畫、分形視覺化、繪製經濟數據圖表、模擬複雜行為動畫、編寫粒子模擬程式碼等。
  • 還有影片展示了用它來創建視覺記憶遊戲/互動測驗,甚至模擬外科手術!
  • 社群也有貢獻,像是 Ultralytics 就提供了用 Gemini 2.5 Pro 進行電腦視覺任務的 Colab 筆記本。
  • 也有教學文章教你如何使用 Gemini 2.5 Pro API 來建立程式碼分析應用。

看得出來 Google 特別想強調它在程式開發、科學模擬、互動式內容生成方面的潛力。這些範例也讓開發者更容易上手,激發更多創意應用。

總結與未來展望

那麼,Gemini 2.5 Pro 到底值不值得期待?

優點很明顯:

  • 更強的推理能力(歸功於「思考」機制)。
  • 顯著提升的程式碼編寫能力。
  • 原生的多模態支援。
  • 極具競爭力的 100 萬 Token 上下文視窗和 64K Token 輸出能力。

但挑戰和疑慮也存在:

  • 「思考」帶來的回應延遲問題。
  • 部分任務相較前代可能出現效能回歸。
  • 作為「實驗版」,穩定性和可用性還有待觀察。
  • 目前還不支援微調,對於需要客製化的企業來說是個限制。

我個人認為,Gemini 2.5 Pro 無疑是 Google 在 AI 競賽中的重要一步棋。特別是「思考模型」和超長上下文這兩點,如果能持續優化並證明其價值,很可能會對 AI 的發展方向產生影響,讓 AI 能更好地應對複雜的真實世界問題。

當然,現在下定論還太早。接下來的關鍵是觀察 Google 如何根據收集到的回饋來改進這個模型,以及開發者社群能用它玩出什麼令人驚豔的新花樣。就讓我們拭目以待吧!

影片介紹

SHARE / 分享此文章