跳至主要內容

Nvidia 發布 Llama-3.1 Nemotron Ultra:挑戰 DeepSeek R1,瞄準企業級 AI

Nvidia 開源 253B 參數的 Llama-3.1 Nemotron Ultra 模型,藉由神經架構搜尋與後訓練優化,宣稱以一半參數量達到 DeepSeek R1 等級效能,適合企業級 AI 應用。

The Walking Fish 步行魚
The Walking Fish 步行魚 ·
1822 字 · 閱讀時間: 5 分鐘 · ...
Nvidia 發布 Llama-3.1 Nemotron Ultra:挑戰 DeepSeek R1,瞄準企業級 AI
Fig. 01 — Nvidia 發布 Llama-3.1 Nemotron Ultra: … FEATURED IMAGE

Nvidia 近期正式開源其 Llama Nemotron 系列的旗艦模型:Llama-3.1-Nemotron-Ultra-253B-v1。這款擁有 2530 億(253B)參數的大型語言模型(LLM)引發業界高度關注,Nvidia 宣稱其效能足以挑戰參數規模近兩倍(671B)的頂尖模型 DeepSeek R1,但僅需一半的參數量,顯著降低了部署門檻,明確瞄準對效能與效率均有高度要求的企業級 AI 市場。

Llama-3.1-Nemotron-Ultra 是 Nvidia 在三月 GTC 大會上預告的 Llama Nemotron 家族一員,該系列旨在滿足不同規模的應用需求,從終端裝置的 Nano (8B)、單一 GPU 的 Super (49B) 到此次發布、適用於多 GPU 伺服器的 Ultra (253B)。此模型基於 Meta 強大的 Llama-3.1-405B-Instruct 模型進行衍生開發,並經過 Nvidia 的精心後訓練,特別強化了推理、人類偏好對齊、RAG(檢索增強生成)及工具呼叫等關鍵能力。

該模型支援高達 128k token 的上下文長度,使其能有效處理長篇文件分析、多輪對話等複雜任務。為達最佳推論效能,Nvidia 建議使用配置 8 張 H100 GPU 的伺服器節點。

關鍵技術:實現效能與效率的平衡

Nvidia 如何在縮減參數量的情況下維持頂尖效能?關鍵在於其創新的技術應用:

  1. 神經架構搜尋 (Neural Architecture Search, NAS): Nvidia 運用新穎的 NAS 技術對模型架構進行深度優化。透過引入「跳躍注意力」(Skip Attention,在部分 Transformer 層省略計算密集型的注意力機制或替換為簡單線性層)和「融合前饋網路」(Fused Feedforward Networks, FFN)以及可變壓縮率 FFN 等設計,成功在維持輸出品質的同時,大幅減少模型的記憶體佔用和運算需求,進而提升吞吐量並降低延遲。
  2. 多階段後訓練 (Multi-stage Post-training): 模型經歷了嚴謹的多階段後訓練流程。首先透過監督微調(SFT)強化其在數學、程式設計、邏輯推理和對話方面的基礎能力;接著運用「群組關聯政策優化」(Group Relative Policy Optimization, GRPO)演算法進行強化學習(RL),使其輸出更貼近人類偏好,並提升指令遵循的精確度。
  3. 推理模式切換 (Reasoning ON/OFF Mode): 模型內建獨特的「推理模式」開關。開發者可根據任務需求動態啟用或關閉此模式。開啟時,模型會調動更多資源進行複雜的邏輯推理;關閉時,則能以更高效率處理較簡單的任務,實現效能與資源的最佳化配置。

Nvidia Nemotron Ultra 訓練流程圖

效能標竿比較:以小博大的實力展現

Nvidia 公布了一系列標竿測試結果,將 Llama-3.1-Nemotron-Ultra 與其主要競爭對手 DeepSeek R1 (671B)、Meta 自家的 Llama 4 系列模型以及基礎模型 Llama 3.1-405B 進行比較。以下表格根據 Nvidia 提供的圖表,直接比較了 Nemotron Ultra 與 DeepSeek R1 在多項基準測試上的表現:

基準測試 (Benchmark) Llama-3.1 Nemotron Ultra (253B) DeepSeek R1 (671B) 領先者
科學推理 (GPQA Diamond) 76.0% 71.5% Nemotron Ultra
複雜數學 (AIME 2024) 80.8% 79.8% Nemotron Ultra
複雜數學 (AIME 2025) 72.5% 70.0% Nemotron Ultra
編程 (LiveCodeBench 24.08-25.02) 66.3% 65.9% Nemotron Ultra
指令遵循 (IFEval) 89.5% 88.8% Nemotron Ultra
複雜數學 (MATH 500) 97.0% 97.3% DeepSeek R1
聊天 (Arena Hard) 87.0 92.0 DeepSeek R1

註:此表格數據直接源自 Nvidia 公布的特定比較圖表。不同來源或測試設置下的結果可能有所差異。例如,AIME 2025 的結果可能受 Nemotron Ultra 是否啟用「推理模式」影響。

從圖表數據來看:

  • Nemotron Ultra 在科學推理、AIME 2024、AIME 2025 (根據此圖)、程式撰寫、指令遵循等任務上領先 DeepSeek R1。
  • DeepSeek R1 在MATH 500 和聊天 (Arena Hard) 評測中表現更優。
  • 相較於其基礎模型 Llama 3.1-405B (圖中淺藍色條),Nemotron Ultra 在所有項目上均有顯著進步。
  • Nvidia 亦強調,Nemotron Ultra 的推理吞吐量大幅優於 DeepSeek R1,展現了卓越的運行效率,但具體倍數未在此圖表中呈現。

應用場景與開源可用性

Llama-3.1-Nemotron-Ultra 的高效能與高效率使其成為眾多企業級 AI 應用的理想選擇,包括:

  • AI 代理人系統 (AI Agent):執行複雜任務、與外部工具互動。
  • 企業級聊天機器人:提供更精準、更自然的客戶服務或內部知識問答。
  • 進階 RAG 應用:結合大量內部文件進行檢索與生成。
  • 程式碼生成與輔助:提升開發效率與品質。
  • 工具呼叫與自動化流程。
  • 其他需要通用指令遵循能力的 AI 任務。

該模型主要支援英文和程式語言,同時也具備對德語、法語、義大利語、葡萄牙語、西班牙語、泰語及北印度語 (Hindi) 的多語言能力。

好消息是,Nvidia 已將 Llama-3.1-Nemotron-Ultra 開源釋出,開發者可以在 Hugging Face 平台下載模型。模型遵循 Nvidia Open Model License 和 Llama 3.1 社群授權協議,允許進行商業用途。

結語

Nvidia Llama-3.1-Nemotron-Ultra 的發布,不僅為市場帶來了一個極具競爭力的高效能大型語言模型選項,更重要的是,它有力地證明了透過先進的架構設計與訓練優化,可以在不犧牲頂尖性能的前提下,顯著降低模型的資源需求。這對於希望部署先進 AI 但受限於運算成本的企業而言是一大福音,也可能引導 AI 產業從單純追求更大參數規模,轉向更注重效率與性能平衡的發展路徑。

SHARE / 分享此文章