最近科技圈的大事,莫過於 Google 又端出了他們最新的 AI 大菜 —— Gemini 2.5 Pro。身為一個熱愛追新技術的開發者,看到 Google 宣稱這是他們「至今最聰明」的 AI 模型,並在度登頂語言模型競技場的排名第一,當然要來好好研究一番。
Google 說這款模型特別擅長處理複雜問題,推理和寫程式碼能力都有顯著提升。聽起來很厲害,但它真的有這麼神嗎?跟之前的版本或競爭對手比起來又如何?這篇文章就來幫大家拆解一下,看看 Gemini 2.5 Pro 到底葫蘆裡賣什麼藥。

什麼是 Gemini 2.5 Pro?它跟之前的有什麼不一樣?
首先,Gemini 系列算是 Google 的 AI 王牌。從最早的 1.0 到現在的 2.5 Pro,看得出來 Google 一直在努力追趕甚至想超越 OpenAI 的 GPT 系列。
這次 2.5 Pro 最特別的地方,就是最近各大模型廠商都有發表的「思考模型」 (Thinking LLM)。老實說,這個詞聽起來有點行銷味,但背後的概念是,這個模型在給你答案之前,會先進行一個更深層、更像人類思考的「推理」過程(CoT, Chain of Thought)。不像以前的模型可能只是快速反應,2.5 Pro 會試著先想清楚再回答。理論上,這能讓它在處理需要邏輯、分析的複雜任務時,表現得更準確、更可靠。

發布時程與重點
Google 是在 2025 年 3 月 25 日 正式宣布推出 Gemini 2.5 Pro 的實驗版。一開始,只有付費訂閱 Gemini Advanced 的用戶才能嚐鮮。
但有趣的是,大概過不到一個禮拜 (差不多 3 月 30、31 日左右),Google 就跌破大家眼鏡地把它免費開放給所有使用者了!雖然免費仔會有一些使用上的限制 (後面會提),但這個操作速度真的很快。
我的猜測啦,這可能是 Google 急著想擴大用戶基礎,收集更多真實世界的回饋數據,畢竟對手 ChatGPT 熱度一直很高。而且,把它標示為「實驗性」,也給 Google 留了後路,表示他們還在調整、優化,大家也別期望它一開始就完美無缺。
目前大家可以在 Google AI Studio 和 Gemini App 裡面用到它。未來也會整合到給企業用的 Vertex AI 平台。
核心功能亮點
那 Gemini 2.5 Pro 到底有哪些讓人眼睛一亮的本事呢?
1. 會「思考」的 AI?強化推理能力
這點前面提過了,就是所謂的「思考模型」。它不是直接輸出答案,而是會先進行內部推理。這讓它在一些需要深度思考的基準測試上表現突出,例如在超難的 Humanity's Last Exam 推理測試中,拿到了 18.8% 的分數,領先其他對手。
這聽起來就像是… AI 不再只是個快速反應的鸚鵡,而是開始學會「謀定而後動」。對於需要嚴謹邏輯分析的科學研究、市場分析等領域,這種能力可能非常有價值。

2. 程式碼能力大躍進
跟上一代 Gemini 2.0 比起來,2.5 Pro 在寫程式方面的能力有明顯進步。官方說它很擅長建立視覺效果不錯的 Web App、寫一些能主動執行的程式碼,甚至還能做程式碼轉換。
在一些程式碼相關的基準測試,像是 SWE-Bench Verified (拿到 63.8%) 和 LiveCodeBench v5 (70.4%),表現都很不錯。最誇張的是,Google 還展示了一個 Demo,只用一行提示就讓 Gemini 2.5 Pro 建立了一個簡單的視訊遊戲!
Demo 影片
3. 原生多模態支援
這點算是繼承了 Gemini 家族的優良傳統。Gemini 2.5 Pro 天生就能理解文字、圖片、聲音、甚至影片等多種不同的資訊格式。你可以丟給它各種資料,它都能無縫地整合處理。
在多模態理解能力的基準測試 MMMU 上,它也拿到了 81.7% 的高分。這讓 AI 更接近我們人類處理資訊的方式,畢竟我們也是同時用眼睛看、用耳朵聽來理解世界。未來在多媒體內容創作、分析,或是更自然的人機互動上,應該會有更多應用。
4. 驚人的 100 萬 Token 上下文視窗以及回撤能力
這大概是 Gemini 2.5 Pro 最讓人印象深刻的規格之一了。它擁有高達 100 萬 Token 的上下文視窗 (Context Window),而且 Google 還計畫未來要擴展到 200 萬 Token!
100 萬 Token 是什麼概念?簡單來說,你可以把將近 70 萬個英文單字或 1500 頁的文件一次丟給它處理!這讓它可以理解非常長的對話、分析整本書的內容,或者讀懂一個大型專案的全部程式碼,而不會像以前的模型一樣,讀到後面就忘了前面。
在長上下文理解的基準測試 MRCR 上,Gemini 2.5 Pro 的表現也確實輾壓對手,在 128K Token 長度下拿到 91.5%,在 1M Token 長度下也有 83.1%。這對於需要處理大量資訊的任務,比如法律文件分析、學術研究、大型軟體開發等,簡直是神器。
另外在 Fiction.live 網站的測試中,Gemini 2.5 Pro 也展示了它在回撤 (Retrieval) 能力上的優勢,能夠在海量資料中找到最相關的答案。他們發現 Gemini 2.5 Pro 能夠在 10 萬字以上的文本長度中,收回故事初期埋下的伏筆。在目前所有的大型語言模型中,Gemini 2.5 Pro 的回撤能力名列前茅。

效能跑分與比較
講了這麼多功能,實際跑分怎麼樣?Google 當然也秀出了一堆基準測試成績。
- 在模仿人類偏好的
LMArena排行榜上,Gemini 2.5 Pro 衝到了第一名,表示很多人覺得它的回答品質高、用起來順手。 - 在數學和科學推理方面,像是
GPQA(84.0%) 和AIME 2025(86.7%),它也領先群雄。 - 程式碼能力雖然強,但在某些特定的測試項目 (例如
SWE-bench Verified和LiveCodeBench v5),有些對手如 Claude 3.7 Sonnet 或 OpenAI 的 o3-mini 表現甚至更好一些。 - 長上下文 (MRCR) 和多模態 (MMMU) 理解則是它的強項,分數都相當亮眼。
跑分固然重要,但沒有一個模型是萬能的。從下表可以看到,不同模型各有擅長。Gemini 2.5 Pro 整體看起來很強,尤其在推理和長上下文方面,但在純粹的程式碼生成或事實性方面,可能還有其他選擇。最終還是要看你的具體需求是什麼。

實際使用測試
光說不練沒意思,我們也實際動手玩了一下 Gemini 2.5 Pro,看看它在各種場景下的表現究竟如何。以下是一些關鍵測試:
1. 邏輯推理能力:經典左輪手槍題
首先,我們用了常來測試語言模型的「左輪手槍推理題」來考驗 Gemini 2.5 Pro。這個問題需要一定的邏輯推導才能算出正確答案。
測試平台: Google AI Studio
問題描述:
現在請回答這個邏輯思考題:
想像你正被綁在椅子上動彈不得,歹徒拿著一把6個槍膛全空的槍,再裝兩顆子彈進兩個緊鄰的槍膛內,並旋轉槍膛。然後對著你的腦袋扣板機一下,很幸運你還活著,這時他說再扣一次板機就放你走,你希望先旋轉後再扣或直接扣板機?為什麼?
過程與結果: 輸入問題後,可以看到 Gemini 2.5 Pro 在回覆前確實顯示了一段「思考中」的狀態,類似之前的 Gemini 2.0 Flash Thinking。稍待片刻,它成功給出了正確答案,並且計算過程也完全正確。雖然現在其他採用 CoT 技術的模型 (如 o3-mini, DeepSeek R1) 也大多能解開此題,但考量到之前的 Gemini 2.0 Flash Thinking 有時仍會答錯,這算是一個穩定的進步。


2. 多模態辨識能力:收據與手寫字
Gemini 系列一直強調多模態能力,這次我們也針對圖片辨識進行了測試。
測試平台: Google AI Studio
測試一:收據辨識
- 目標: 上傳一張收據圖片,要求模型辨識內容並按原格式輸出。
- 結果: 成功。Gemini 2.5 Pro 準確地復刻了收據上的文字和格式。

測試二:高難度手寫字辨識
- 目標: 上傳一張去年在學校領畢業證書時拍的照片,照片中有一台機器上貼著公告,部分內容是辨識度較低的手寫字。要求模型辨識公告全文。
- 結果: 表現驚艷。不僅電腦打字的部分被完美辨識,連非常潦草、連我自己都看不太懂的手寫文字,Gemini 2.5 Pro 也一字不漏地轉錄了出來。
- 對比測試: 同一張圖片拿去給 ChatGPT (GPT-4o) 和 Claude (3.7 Sonnet) 測試,兩者都無法成功辨識出手寫的那行字。這顯示 Gemini 2.5 Pro 在困難的 OCR 場景下具有明顯優勢。



3. YouTube 影片理解
Google AI Studio 現在支援直接貼上 YouTube 影片網址匯入整部影片(包含聲音和畫面,不只是 CC 字幕)進行分析。我們簡單試了一下:
- 功能: 可以讓它總結影片內容(尤其適合沒字幕的影片),甚至拿來輔助上字幕。
- 限制: 因為是處理完整影音,過長的影片(如超過一小時)可能會遇到 Token 數量限制。

4. 程式碼生成:Canvas 互動網頁
為了驗證官方宣稱的程式碼能力大躍進,我們使用了 Gemini 網頁版內建的 Canvas 功能來進行測試。
測試平台: Gemini 網頁版 + Canvas
測試一:簡單遊戲生成
- 提示詞: 「製作一個 3D 飛行遊戲,有摩天大樓」
- 結果: 初版效果普通。經過幾次提示詞調整後,遊戲基本可以運作,但畫面中間沒有飛機模型,操作手感也有些奇怪。算是堪用但仍需大量調整。

測試二:現代風格部落格
- 初始提示詞: 「生成一個現代簡約風格的部落格,使用 Tailwind CSS」
- 結果: 效果不佳,可能因為提示詞太過簡略。
- 調整後提示詞: (使用 Gemini 2.5 Pro 在 AI Studio 生成了更詳細的需求列表後再輸入)
- 結果: 效果大幅改善,生成了一個視覺上相當不錯的部落格框架。這說明給予 Gemini 2.5 Pro 詳細、具體的提示詞至關重要。


5. 程式碼生成:實際專案開發 (API Key 管理器)
接著,我們嘗試讓 Gemini 2.5 Pro 協助完成一個小型實際專案。
測試平台: VS Code + Cline 插件 (使用 Gemini 2.5 Pro API)
目標: 製作一個 Web 應用,可以記錄多個 Gemini API Key,並在調用時進行輪循,以盡量規避免費額度的速率限制。
過程與結果: 基本上全程僅下達指令,觀看 Gemini 2.5 Pro 編輯程式碼並儲存。最終,它成功生成了一個功能完整的網頁應用:
- 介面可以添加、管理來自不同帳號的 Gemini API Key。
- 提供一個 OpenAI 相容的 API 端點,將請求指向這個應用即可實現 Key 的輪循調用。
- 實際測試功能正常運作。
- 值得稱讚的是,這次生成的應用介面美觀度相較過往的 Gemini 模型有顯著提升,不再是過去那種非常基礎、簡陋的風格。


(後續整理完確定沒問題將會把此專案開源至 GitHub)
2025/04/13 更: 專案已開源到 GitHub
6. 程式碼生成:修改現有專案 (個人部落格)
最後,既然前面生成了部落格,就順勢讓它試試修改本人目前的這個 Hugo 部落格。
測試平台: VS Code + Cline 插件
目標: 改善現有部落格的樣式和佈局。
過程與結果: 由於 Hugo 模板檔案較分散、結構複雜,過程並非一帆風順,需要多次對話溝通和部分手動修改。但最終的成品視覺效果提升明顯,達到了相當精美的程度。

小結:
從這些實際測試來看,Gemini 2.5 Pro 在邏輯推理、多模態辨識(尤其是困難 OCR)、程式碼生成(特別是前端美感和處理複雜專案)方面確實有長足進步。但在程式碼方面,提示詞的精確度和專案的複雜度仍會顯著影響結果,有時需要使用者介入引導或修正。
應用場景與潛力
看了這些功能和跑分,Gemini 2.5 Pro 能用在哪裡呢?
- 軟體開發:分析大型程式碼庫、自動生成文件、輔助設計複雜的 Web 應用、實作架構模式等等。
- 科學研究與數學:解決複雜的數學或邏輯問題、分析科學文獻、進行模擬。
- 創意與設計:潛力應用包括遊戲開發(前面提的 Demo)、互動式模擬、動畫製作、物理模擬。
- 資料分析:處理超長的文件、從大量非結構化數據中提取洞見。
- 電腦視覺:雖然主要輸出是文字,但它的多模態理解能力讓它可以用於物件偵測、圖片標註、光學字元辨識 (OCR) 等任務。
總之,它強大的推理、程式碼和長上下文能力,讓它特別適合處理那些複雜、需要大量知識背景的任務。
開發者怎麼看? (正面與負面回饋)
任何新工具出來,最重要的還是實際用起來的感受。目前開發者社群對 Gemini 2.5 Pro 的看法怎麼樣呢?
正面回饋
- 不少人對它的整體智慧,尤其是在長篇分析和數理科學 (STEM) 領域的表現感到驚艷。
- 強大的推理和程式碼能力獲得很多讚賞。
- 巨大的上下文視窗被認為是殺手級應用,對於分析大型程式碼庫或文件來說超級方便。
- 有些開發者回報,在特定的程式碼任務或理解專案上下文方面,感覺比 GPT-4 或其他對手更好用。
初步看起來,開發者對這個新玩具的反應是蠻正面的,特別是長上下文這點打中了很多人的痛點。
負面回饋與已知問題
當然,沒有完美的工具,尤其這還只是個「實驗版」。開發者也回報了一些問題:
- 有人覺得跟 Gemini 2.0 比起來,2.5 Pro 在某些任務(例如翻譯、簡單問答)上的表現反而下降了。
- 因為多了「思考」過程,回應速度明顯變慢,對於追求效率的場景可能不太適合。
- 程式碼方面,有人遇到一致性問題、版本追蹤困難,或是解釋錯誤日誌的能力不足。
- 產生的程式碼有時過於精簡(可讀性差)或不必要的複雜。
- 在 Google AI Studio 中使用時,偶爾會遇到不明原因的速率限制或錯誤。
- 不少人希望可以手動關閉「思考」模式,讓它在處理簡單問題時能快一點。
這些回饋提醒我們,Gemini 2.5 Pro 可能還需要一些時間打磨。Google 似乎在這個版本優先強化了推理和長上下文,但可能在其他方面(如速度、某些基礎任務的穩定性)做出了一些取捨。
技術規格速覽
這裡快速列一下 Gemini 2.5 Pro 的關鍵技術規格:
- 模型代碼:
gemini-2.5-pro-exp-03-25 - 輸入類型: 文字、圖片、音訊、視訊
- 輸出類型: 僅文字
- 輸入 Token 上限: 1,048,576 (1 百萬)
- 輸出 Token 上限: 65,536 (64K)
- 知識截止日期: 2025 年 1 月
- 支援功能: 結構化輸出、函數呼叫、程式碼執行、搜尋整合、原生工具使用、思考 (Thinking)
- 不支援功能: 快取 (Caching)、微調 (Fine-tuning)
特別值得一提的是那個 64K 的輸出 Token 限制,這比很多主流模型 (通常是 4K 或 8K,頂多 32K) 都要大方得多!這表示它可以生成非常長、非常詳細的回應,而不用擔心被中間截斷。
表 2:Gemini 2.5 Pro 技術規格
| 規格項目 | 數值/描述 |
|---|---|
| 模型代碼 | gemini-2.5-pro-exp-03-25 |
| 輸入類型 | 音訊、圖像、視訊和文字 |
| 輸出類型 | 僅文字 |
| 輸入 Token 上限 | 1,048,576 (1M) |
| 輸出 Token 上限 | 65,536 (64K) |
| 知識截止日期 | 2025 年 1 月 |
| 支援能力 | 結構化輸出、函數呼叫、程式碼執行、搜尋基礎、原生工具使用、思考 |
| 不支援能力 | 快取、微調 |
實際應用展示
光說不練沒意思,Google 也放出了一些 Demo 來展示 Gemini 2.5 Pro 的能耐:
- 前面提到的「一行提示生成無盡奔跑遊戲」。
- 其他互動式 Demo 還包括:創建宇宙魚動畫、分形視覺化、繪製經濟數據圖表、模擬複雜行為動畫、編寫粒子模擬程式碼等。
- 還有影片展示了用它來創建視覺記憶遊戲/互動測驗,甚至模擬外科手術!
- 社群也有貢獻,像是 Ultralytics 就提供了用 Gemini 2.5 Pro 進行電腦視覺任務的 Colab 筆記本。
- 也有教學文章教你如何使用 Gemini 2.5 Pro API 來建立程式碼分析應用。
看得出來 Google 特別想強調它在程式開發、科學模擬、互動式內容生成方面的潛力。這些範例也讓開發者更容易上手,激發更多創意應用。
總結與未來展望
那麼,Gemini 2.5 Pro 到底值不值得期待?
優點很明顯:
- 更強的推理能力(歸功於「思考」機制)。
- 顯著提升的程式碼編寫能力。
- 原生的多模態支援。
- 極具競爭力的 100 萬 Token 上下文視窗和 64K Token 輸出能力。
但挑戰和疑慮也存在:
- 「思考」帶來的回應延遲問題。
- 部分任務相較前代可能出現效能回歸。
- 作為「實驗版」,穩定性和可用性還有待觀察。
- 目前還不支援微調,對於需要客製化的企業來說是個限制。
我個人認為,Gemini 2.5 Pro 無疑是 Google 在 AI 競賽中的重要一步棋。特別是「思考模型」和超長上下文這兩點,如果能持續優化並證明其價值,很可能會對 AI 的發展方向產生影響,讓 AI 能更好地應對複雜的真實世界問題。
當然,現在下定論還太早。接下來的關鍵是觀察 Google 如何根據收集到的回饋來改進這個模型,以及開發者社群能用它玩出什麼令人驚豔的新花樣。就讓我們拭目以待吧!