別再慢慢上字幕了!Gemini + Whisper 字幕工作流,上字幕速度快 10 倍!
過去我曾介紹過 OpenAI 開源的 Whisper 語音辨識模型,至今我仍常用它來生成影片字幕。但最近,我的工作流程有了重大升級! 自從 Google Gemini 2.5 Pro 推出後,其 優異的多模態辨識
過去我曾介紹過 OpenAI 開源的 Whisper 語音辨識模型,至今我仍常用它來生成影片字幕。但最近,我的工作流程有了重大升級! 自從 Google Gemini 2.5 Pro 推出後,其 優異的多模態辨識
29日凌晨,阿里巴巴發布了全新的 Qwen3 系列大型語言模型,憑藉其在多項基準測試中的亮眼表現,足以與 DeepSeek R1、o3-mini 與 Gemini 2.5 Pro 等級的模型相提並論
近期,由 輝達 (NVIDIA)、南京大學、香港理工大學 及 羅格斯大學 的研究團隊攜手合作,推出了一項名為 Eagle 2.5 的重大 AI 研究成果。這款專為 長上下文多模
今天要來跟大家介紹一下,如何在 FramePack 中安裝 Sage Attention,來加速影片生成的速度,大幅減少超過 30% 的影片生成時間! 前幾天我有介紹了 Lvmin Zhang 大神所開
OpenAI 於台灣時間 4 月 25 日清晨在 X 平台宣布,ChatGPT 將推出輕量版 Deep Research(深度研究)功能,並將此功能的使用範圍擴展至所有用戶層級,
前天,許久未見的 ControlNet 作者 Lvmin Zhang 大神再次震撼開源界,推出了一個名為 FramePack 的新專案。 專案不只能夠生成結果流暢、自然的影片,最驚人的地方在於,它能夠一次生
Google 近日正式宣布推出其最新語言模型的預覽版 —— Gemini 2.5 Flash。此版本標誌著 Google 在模型效率與控制性方面的新進展,特別導入了創新的可控推理功能與 思考
人工智慧領域的領導者 OpenAI 再度投下震撼彈,於今日正式發佈其 o 系列最新推理模型 OpenAI o3 與 OpenAI o4-mini。這兩款模型不僅代表了 OpenAI 迄今為止最智慧、最強大
OpenAI 於 2025 年 4 月 14 日投下震撼彈,正式發布了新一代旗艦級大型語言模型系列:GPT-4.1、GPT-4.1 mini 與 GPT-4.1 nano。此次更新不僅標榜性能全面超
你是否常常覺得瀏覽器內建的翻譯功能只能「取代」原文,沒辦法對照看很麻煩?或是覺得翻譯品質有待加強?今天要來跟大家介紹一款我自己用了之後就回不