跳至主要內容

OpenAI 重磅開源!GPT-OSS 模型全面測試 本機部署、線上使用教學|睽違五年 OpenAI 終於「Open」了!

睽違五年,OpenAI 終於再度開源大型語言模型 GPT-OSS!本文將完整介紹這款號稱媲美 o3-mini 與 o4-mini 的模型規格、性能表現,並提供詳盡的線上試用與本機部署教學,帶你一同實測它在邏輯推理、程式編寫與防範幻覺等方面的真實能力。

The Walking Fish 步行魚
The Walking Fish 步行魚 ·
2529 字 · 閱讀時間: 6 分鐘 · ...
OpenAI 重磅開源!GPT-OSS 模型全面測試 本機部署、線上使用教學|睽違五年 OpenAI 終於「Open」了!
Fig. 01 — OpenAI 重磅開源!GPT-OSS 模型全面測試 本機部署、線上使用教學|睽 … FEATURED IMAGE

前幾天,OpenAI 終於兌現承諾,釋出了一款全新的開源大型語言模型 gpt-oss,這也是繼 Whisper 與 CLIP 後,睽違五年 OpenAI 首度開源新模型。在過去幾年,由於對安全風險的擔憂和商業模式的轉變,OpenAI 似乎變得不再那麼「Open」,選擇了一條以閉源 API 為主的道路。

然而,這次 gpt-oss 的發布,不僅模型權重使用 Apache 2.0 協議 可以自由商用,更算是正面回應了市場對於模型透明度與本地部署的需求。畢竟,在上週 OpenAI 又爆出聊天記錄外洩事件,這也體現了處理機密或個資資訊時,自行部署模型的重要性。

今天,我們就來好好介紹 gpt-oss 的規格與性能,並分享如何在本機與線上使用它!

gpt-oss 模型規格介紹

OpenAI 這次發布的 gpt-oss 有兩種參數版本:20B 與 120B。兩者都採用了 MoE (混合專家模型) 架構,這代表模型在推理時並非動用所有參數,大幅降低了計算資源需求。

  • gpt-oss-20b: 啟用參數量為 3.6B,主要針對消費級硬體,僅需 16GB VRAM 即可運行。
  • gpt-oss-120b: 啟用參數量為 5.1B,可在單張 80GB 記憶體的專業顯卡(如 H100 或 MI300X)上運行。

為了提升效率,gpt-oss 還具備以下特點:

  • 原生 MXFP4 量化: 降低推理時所需的計算資源。
  • 分組多重查詢注意力 (GQA): 群組大小為 8,提升推論與記憶體效率。
  • 128K 上下文長度: 支援超長文本的輸入與理解。
  • 專屬 Tokenizer: 開源了名為 o200k_harmony 的 Tokenizer,它同時也是 o4-mini 和 gpt-4o 所使用的,能有效壓縮 Token 數量,提升模型效率。

訓練資料方面,gpt-oss 主要以英文為主,著重於 STEM 領域、程式編寫與一般知識,並透過 GPT-4o 過濾掉生化等危險內容,避免模型被濫用。

性能評測表現

在官方公布的評測中,gpt-oss 的表現相當亮眼,號稱與自家的 o3-mini、o4-mini 相當。

  • 程式能力 (Codeforces): 120B 版本在可調用工具時略輸 o3 與 o4-mini,但 20B 版本在不調用工具時超越了 o3-mini。

  • 人類的最終測試 (Humanity’s Last Exam): 120B 與 20B 在可使用工具的情況下,與 o4-mini 相當。

  • 醫療知識 (HealthBench): OpenAI 特別納入了自家的醫療領域測試集,gpt-oss 表現不俗,但官方也強調模型不能取代專業醫療人員。

  • 工具調用 (Tau-Bench): 120B 表現相當不錯,但 20B 則稍有差距。

一個有趣的功能是,開發者可以透過在系統訊息中加入 reasoning_effort 指令,設定低、中、高三種推理強度,在延遲與效能之間進行取捨。

如何使用 gpt-oss?

介紹完規格與性能,接著來看看我們該如何實際使用這款模型。

線上使用

對於想快速體驗的使用者,有以下幾種推薦的線上平台:

  1. OpenAI gpt-oss Playground: 官方提供的試玩介面,操作簡潔直白,可以選擇不同模型和調整推理強度。

  2. Poe: 由 Quora 創建的模型整合網站,提供眾多開源與閉源模型,免費用戶每天有 3000 點積分可使用。

  3. Groq: 使用自研 LPU 進行推理,速度極快。每日提供免費額度,但 gpt-oss 的額度給得較少,適合輕度或 API 調用需求。

本機部署 (Ollama)

對於有本地部署需求的用戶,我會直接推薦使用 Ollama,它現在已內建聊天介面,讓操作更方便。

步驟 1. 下載並安裝 Ollama

前往 Ollama 官網,點擊 “Download” 下載並完成安裝。

步驟 2. 下載 gpt-oss 模型

打開終端機或命令提示字元,輸入以下指令來下載模型:

1
2
3
4
5
# 下載 20B 模型 (預設)
ollama pull gpt-oss

# 下載 120B 模型
ollama pull gpt-oss:120b

步驟 3. 執行模型

模型下載完成後,有兩種方式可以與模型對話:

  • 命令列模式: 在終端機輸入 ollama run gpt-oss。
  • 圖形化介面: 在工作列右下角找到 Ollama 圖示,點擊右鍵選擇 “Open Ollama” 即可打開聊天介面。

命令列模式 圖形化介面

另外,LM Studio 也是一個不錯的選擇,它提供了更豐富的模型管理功能,核心同樣是使用 llama.cpp,速度基本上與 Ollama 沒有差異。

實際能力測試

接下來,讓我們來實際測試看看 gpt-oss 的表現如何。

邏輯推理:左輪手槍問題

現在請回答這個邏輯思考題:

想像你正被綁在椅子上動彈不得,歹徒拿著一把6個槍膛全空的左輪手槍,再裝兩顆子彈進兩個緊鄰的槍膛內,並旋轉槍膛。然後對著你的腦袋扣板機一下,很幸運你還活著,這時他說再扣一次板機就放你走,你希望先旋轉後再扣或直接扣板機?為什麼?

120B 模型能正確回答這個經典的推理問題。而 20B 模型雖然做法有點取巧(直接列出所有可能),但最終也答對了,並且解釋與數學計算都正確。

gpt-oss-120b gpt-oss-20b

文字處理:計算大寫字母與特定字母數量

20B 模型就能夠精準地計算出 “The Walking Fish is a YouTuber” 中所有的大寫字母數量,也能正確回答 “strawberry” 中有幾個 “r”。

20b 計算大寫數量 20b 計算 strawberry 有幾個 “r”

幻覺測試:虛構名詞與事件

  • 量子纏繞穩定器: 120B 能正確辨識出這是不存在的名詞。20B 一開始也辨識出來,但後續的科普內容卻出現幻覺,捏造了不存在的科幻作品作為例子。
  • 2023年紐約時報頭條: 120B 正確指出沒有這篇關於火星運河的報導。但 20B 模型則被誤導,沒有發現這是一則假新聞。

got-oss-120b 能夠成功辨識不存在的名詞:量子纏繞穩定器

got-oss-20b 能夠辨識名詞不存在 但是在後續的科普中出現幻覺

長文理解與重組:逐字稿轉文章

將影片逐字稿轉換為文章時,模型大致上能完成任務,但出現了一些小問題,例如將 Markdown 連結語法寫成 HTML,並在缺乏資訊時自行腦補了 mcp.json 設定檔的內容。

程式編寫能力

  • 製作部落格頁面: 120B 的生成結果完美符合預期。20B 的版本則在 CDN 引用上出了點小錯,手動修正後,介面佈局甚至比 120B 的更好。
  • 製作動畫: 要求生成「一個旋轉的六邊形內有顆球在彈跳」的動畫。120B 生成了相當完美的結果,物理效果非常真實。20B 的版本雖然物理效果有些詭異,但它已是少數能讓球體成功與邊框互動的 30B 以下模型。

部落格生成 120b 部落格生成 20b

gpt-oss-120b 與 20b 生成六邊形內有顆球在彈跳的效果

總結與個人看法

整體來說,gpt-oss 的表現相當不錯。20B 的模型大小加上 MoE 架構,讓許多普通家用電腦都能夠順暢運行。在程式編寫方面,我個人的簡單測試感覺比 Qwen3 30B 的表現要好一些。

這裡有個小插曲,我在知乎上看到一篇瘋狂吹捧 Qwen3 並貶低 gpt-oss 的文章。我好奇地用它文中的範例進行了測試,結果發現 gpt-oss-20b 在程式方面的能力,依然勝過未量化的 Qwen3 30B,並非文章所說的「被完爆」。我個人懷疑該文作者可能使用了更強的 Qwen3-235b 模型,或是 Qwen3-Coder 來進行不對等的比較。

當然,由於 gpt-oss 的訓練資料以英文為主,在中文文法與表達能力上可能不及 Qwen3,這點是比較合理的。

總而言之,gpt-oss 是一款值得嘗試的強大開源模型,它不僅為開發者和 AI 愛好者提供了更多選擇,也象徵著 OpenAI 在開源道路上邁出了重要的一步。

影片介紹

SHARE / 分享此文章