Gemma 4 上 Cerebras 衝到每秒 1800 token,讓即時語音 AI 真的能用
Google DeepMind 的開源多模態模型 Gemma 4 這次跟 Cerebras 合作,把速度推到能做即時語音的等級。Gemma 4 是一整個家族,有 E2B、E4B、31B 與 26B-A4B(MoE)等尺寸,走 Apache 2 授權可商用,音訊能力落在 E2B、E4B 與 12B 上,能做語音辨識、講者分離、影片理解與 agent 推理。開源加上多模態,本來就是想讓開發者把語音助理這類應用自己長出來。
真正的關鍵是速度。Gemma 4 31B 跑在 Cerebras Inference 上超過每秒 1800 token,官方稱是全世界最快的多模態模型;更重要的是首個回應 token 只要 1.5 秒就吐出來。語音互動最怕延遲,人一開口、等超過一兩秒才回話就崩了,Cerebras 說自己是唯一能讓 Gemma 4 用在即時場景的供應商,賣的正是這個『夠快到不尷尬』的體感。6 月 29 日起,Gemma 4 31B 已在 Cerebras Inference Cloud 公開預覽。
把開源多模態模型跟專用推理硬體綁在一起,等於給想做即時語音 AI 的團隊一條不必自己養旗艦閉源模型的路。對台灣的應用開發者,這意味著做客服語音、即時口譯、語音 agent 的技術門檻正在下降,Apache 2 授權也讓商用少了法務顧慮。真正要盤算的是成本與延遲的甜蜜點落在哪裡,以及本機小模型(例如 Mac 上的 Ollama)跟這種高速雲端推理該怎麼分工。
歸剛點評|即時語音 AI 卡了很久的『延遲』問題被硬體端解掉了一大半。開源多模態+每秒 1800 token 的組合,把語音助理、即時口譯這類應用的門檻拉低。想做語音產品的台灣團隊,現在有了不必自建旗艦模型的可行路徑。