Google Gemini Omni 正式發表!讓你用說話的方式製作高品質影片

Photo of author

By albert

發布:

Google 在 2026 年 I/O 開發者大會上,除了發布 Google Gemini 3.5 Flash 及 Gemini Spark,也正式揭曉旗下新一代多模態生成模型 Gemini Omni,第一個推出的版本為 Gemini Omni Flash。這款模型最大的亮點,在於它不是一個影片生成工具,它能理解並整合圖片、文字、音訊、影片等各種輸入,輸出具有真實感的高品質影片。換句話說,你只需要用日常口語跟它說話,它就能幫你把腦海中的畫面變成現實。

相關新聞:Google Gemini 3.5 Flash 正式發布!速度快四倍、Gemini Spark 全天候幫你工作

用對話就能剪片

Gemini Omni 以自然語言進行多輪影片編輯,不需要學習複雜的剪輯軟體,只要對它說「把背景換成外太空」或「讓這個人物的手臂變成鏡面材質」,系統就能照辦。每一輪對話的編輯都會疊加在上一輪之上,角色保持一致、物理邏輯不會跑掉、場景的連貫性也完整保留下來。對於長期需要修改影片的創作者來說,這簡直是省下大量時間的利器。

Google Gemini Omni 正式發表!讓你用說話的方式製作高品質影片
Prompt (提示詞/指令):將小提琴手傳送到圖像環境中

懂物理、懂歷史,不只是套模板

Omni 並不是單純地把素材拼貼在一起,它背後依賴的是 Gemini 本身對現實世界的理解能力。重力、動能、流體力學這些物理規律,它都能在生成影片時自然呈現,不是靠視覺特效蒙混過關。除此之外,模型還能結合歷史、科學與文化知識來生成具有意義的敘事內容。例如你給它一段簡短的提示,它可以生成一部用黏土動畫解釋蛋白質折疊原理的影片,甚至還搭配音樂和視覺風格,這種程度的整合,已經遠超過過去「以文字生成影片」的框架了。

任何素材都能當起點

支援混合輸入,你可以同時丟給它圖片、文字、音訊和影片作為參考,然後讓它合成為一個統一、連貫的輸出。就算你只有一張草稿圖或一段錄音,它也能幫你延伸出完整的影片內容。語音輸入目前率先支援,其他類型的音訊輸入也即將陸續開放。

Google Gemini Omni 正式發表!讓你用說話的方式製作高品質影片
提示:這是一段以 image_0.png 為基礎所製作的動態科幻風格影片。其中的各個元素會隨著 audio_0.wav 中的音樂節奏而閃爍,其效果與 video_0.mp4 中的相似。

數位分身功能,責任先行

Omni 還提供了數位分身 (Avatar) 功能,讓你能夠上傳自己的影像和聲音,生成看起來和聽起來都像你本人的影片。不過 Google 也坦言這項功能仍在測試階段,後續如何對外開放,仍在評估中。所有透過 Omni 生成的影片,都會嵌入 Google 的 SynthID 數位水印,讓使用者可以在 Gemini 應用程式、Chrome 以及 Google 搜尋中驗證其是否為 AI 生成內容。在深偽技術 (Deepfake) 氾濫的當下,這個機制的存在顯得很重要。

現在在哪裡可以用?

目前已向 Google AI Plus、Pro 和 Ultra 訂閱用戶全面開放,可透過 Gemini 應用程式及 Google Flow 使用。同時,它也正在整合進 YouTube Shorts 和 YouTube Create App,並對用戶免費提供。開發者和企業用戶方面,Google 預計在未來幾週內透過 API 開放存取權限。 至於未來,Omni 家族還將陸續支援圖片和音訊的生成輸出,整個多模態生態系正在加速成形。

Google Gemini Omni 正式發表!讓你用說話的方式製作高品質影片


如果喜歡這篇文章,並想持續收到更多限時免費科技新聞Apple 資訊,以及 AIWordPress 教學資源分享,歡迎透過以下方式支持我,讓我更有動力創作:

按讚與追蹤:鎖定我的 Facebook專頁InstagramThreadsX,就不會錯過最新內容。

☕ 請我喝杯咖啡:如果內容對你有幫助,歡迎到 Ko-fi 小額支持,為我注入創作能量。

你的一個 Like追蹤或是一杯咖啡的鼓勵,都能激勵我持續分享更多實用文章。由衷感謝大家。

發佈留言