別再慢慢上字幕了!Gemini + Whisper 字幕工作流,上字幕速度快 10 倍!
過去我曾介紹過 OpenAI 開源的 Whisper 語音辨識模型,至今我仍常用它來生成影片字幕。但最近,我的工作流程有了重大升級! 自從 Google Gemini 2.5 Pro 推出後,其 優異的多模態辨識
過去我曾介紹過 OpenAI 開源的 Whisper 語音辨識模型,至今我仍常用它來生成影片字幕。但最近,我的工作流程有了重大升級! 自從 Google Gemini 2.5 Pro 推出後,其 優異的多模態辨識
29日凌晨,阿里巴巴發布了全新的 Qwen3 系列大型語言模型,憑藉其在多項基準測試中的亮眼表現,足以與 DeepSeek R1、o3-mini 與 Gemini 2.5 Pro 等級的模型相提並論
近期,由 輝達 (NVIDIA)、南京大學、香港理工大學 及 羅格斯大學 的研究團隊攜手合作,推出了一項名為 Eagle 2.5 的重大 AI 研究成果。這款專為 長上下文多模
OpenAI 於台灣時間 4 月 25 日清晨在 X 平台宣布,ChatGPT 將推出輕量版 Deep Research(深度研究)功能,並將此功能的使用範圍擴展至所有用戶層級,
Google 近日正式宣布推出其最新語言模型的預覽版 —— Gemini 2.5 Flash。此版本標誌著 Google 在模型效率與控制性方面的新進展,特別導入了創新的可控推理功能與 思考
Nvidia 近期正式開源其 Llama Nemotron 系列的旗艦模型:Llama-3.1-Nemotron-Ultra-253B-v1。這款擁有 2530 億(253B)參數的大型語言
最近科技圈的大事,莫過於 Google 又端出了他們最新的 AI 大菜 —— Gemini 2.5 Pro。身為一個熱愛追新技術的開發者,看到 Google 宣稱這是他們「至今最聰明」的 AI 模型,並
在 Gemini 2.0 剛推出時,Google 有表示 Gemini 2.0 將支援原生的圖片輸出功能,而現在 ── 他來了!在上上個禮拜,這項功能已經在 Google AI Studio 中免費推出了! 現在我們不
Google 在 12 月 11 日發表了 Gemini 2.0,宣稱這是面向 AI 代理時代的模型,並開放了 Gemini 2.0 Flash 實驗版的試用。Flash 模型主打速度,但其表現卻令人驚艷,甚至超越了
上週我關注的AI繪圖模型 SANA 終於開源了!它的特點是極快的生成速度、較少的參數量和較低的硬體需求,號稱可以在筆記型電腦上部署。雖然生成品質可能不