影片工具
帶有原生音訊的 AI 影片

在同一次請求裡面,生成一支帶有聲音的 AI 短影片。

請同時描述你想要的畫面,以及要跟著畫面一起出現的對白、環境聲或是音效。Vizify 只會使用經過檢查、確定支援原生音訊的政策;如果找不到這樣的模型,它會直接停下來並且向你說明原因,而不是安安靜靜地交回一支無聲的影片。

把聲音視為必要的條件,而不是附加的加分項目 一份畫面上面的需求,加上你所需要的對白、環境聲或是音效 一支帶有原生音訊的短影片成品
從不完整的想法開始選填項目能協助 Vizify 更快理解交付需求。
試試這些開場方式

你所寫下的需求內容,以及暫存起來的輸入檔案,都會先在 Vizify 裡面開啟讓你確認;一直要等到你確認無誤之後,才會真正開始進行生成。

你提供

你期待聽到的那些聲音,描述得要跟畫面本身一樣精確

一份畫面上面的需求,加上你所需要的對白、環境聲或是音效

請描述整個場景、發生的動作、鏡頭的運動、要說出來的台詞、環境的聲音,以及你需要的音效

Vizify 交付

一支帶有原生音訊的短影片成品

在影片進入剪輯或是送上動態消息之前,你可以連同聲音一起檢查的一支短片

你先前暫存起來的任何參考音訊,都會繼續附著在這一次的請求上面

功能

從輸入到可直接使用的成果。

Vizify

聲音是這一次請求的必要條件之一

音訊是否受到支援,完全取決於個別的模型。Vizify 只會使用一個已經檢查過、確定支援聲音的政策;找不到的時候,它會停下來並且向你說明原因,不會改用無聲的模型頂替,同時它也不承諾能夠做到精準的對嘴效果。

Vizify

描述整體的混音效果,而不是只描述畫面

請把三個音訊的層次分開來寫,也就是說出來的台詞、空間裡面的環境聲,以及特定的音效,並且說明其中哪一個層次應該佔據主導的地位。如果聲音只是在一份視覺需求的最後被順手補上一句,那麼通常換回來的,就只會是一段沒有什麼特色的背景噪音。

Vizify

先用耳朵聽過一次,再用眼睛看過一次

請先開著聲音把整支影片播放過一次:確認說話的內容和你所提供的台詞一致,環境聲符合這個場景所在的地點,而且也沒有任何一個音效落在錯誤的畫格上面。

常見問題

你可能想了解的問題。

如果沒有任何一個相容的模型支援音訊,那會發生什麼事?

Vizify 會直接停下來,並且向你說明這一次的不相容情況究竟是出在哪裡。它不會退而求其次改用一個無聲的模型,也不會把那樣的結果當成已經滿足了你的音訊需求,然後呈現給你看。

我可以上傳一段用來當作參考的音訊軌嗎?

可以,支援 MP3、WAV、OGG、FLAC 或是 M4A 格式,最多 3 個檔案,而且每一個檔案 20 MB。這段音訊的作用是引導節奏與聲音的質感,而不是被原封不動地複製進成品裡面當成配樂;另外,使用上傳功能需要有一個免費的 Vizify 帳戶。

對嘴的準確度高不高?

並不高。嘴型的動作只是近似值,而且在不同次的生成之間都會有所改變,所以請把台詞寫得簡短一些;在任何真的很在意說話準確度的場合使用之前,都要自己先把整支影片檢查過一遍。

我可以指定某一種特定的聲線或是口音嗎?

你可以描述一種聲音,包括年齡、語氣、語速與口音,模型會依照這一段描述去加以詮釋。不過 Vizify 不會複製任何一位指名的真實人物的聲音,而且同樣的一段描述,在不同的工作之間也不會產生完全一致的聲音。

我可以要求音樂,而不是對白嗎?

你可以指定一種情緒或者是一組樂器的配置,有些模型也確實會照著這個要求去做,但是這個頁面所提供的是影片方面的能力,而不是一個音樂生成工具。完整的樂曲創作,以及取得授權的音樂,都應該交給專門處理音訊的流程來完成。

這個頁面實際上會挑選哪一種模型?

只會挑選那些經過檢查、而且政策確實支援本次操作與輸入的音訊需求的公開模型。這樣的條件會讓可以選擇的範圍變得比較小,因此某些在無聲影片頁面上面提供的畫面比例或是影片長度組合,在這一個頁面上並不一定能夠使用。

把需求送出去之後,會立刻就拿到影片嗎?

不會。影片生成是一項以非同步方式執行的工作,它所需要的時間通常是以分鐘來計算,而不是幾秒鐘就能夠結束。在這一段等待的期間,Vizify 會持續輪詢這個工作,直到它順利完成或是明確失敗為止;因此你最後拿到的,一定是一個已經完成的檔案,或者是一則清楚說明失敗原因的訊息,而絕對不會是一個被包裝成結果、但實際上還在等待中的處理狀態。

使用這個工具的時候,我需要有一個 Vizify 帳號嗎?

你不需要先登入,就可以在這個公開的頁面上面撰寫需求,並且反覆地調整內容,一直修改到你自己滿意為止。不過,實際去執行生成工作、上傳檔案,以及在生成結束之後,把已經完成的成品保存在你自己的工作區裡面,這三件事情都需要有一個 Vizify 帳號才能夠進行。

把整份需求收斂成一支短短的影片

請同時描述你想要的畫面,以及要跟著畫面一起出現的對白、環境聲或是音效。Vizify 只會使用經過檢查、確定支援原生音訊的政策;如果找不到這樣的模型,它會直接停下來並且向你說明原因,而不是安安靜靜地交回一支無聲的影片。 音訊是否受到支援,完全取決於個別的模型。Vizify 只會使用一個已經檢查過、確定支援聲音的政策;找不到的時候,它會停下來並且向你說明原因,不會改用無聲的模型頂替,同時它也不承諾能夠做到精準的對嘴效果。

目前的對嘴技術實際上能做到什麼程度

那些能夠同時生成畫面與語音的模型,確實可以把一個聲音擺放得相當有說服力,但是嘴型的變化仍然只是近似值,而且在不同的拍次之間都會有所不同。因此請盡量把要說出來的台詞寫得短一點;在準確度真的很重要的時候,避免使用貼著嘴部拍攝的大特寫;並且把任何對白比重很高的結果,都當成一份草稿來看待,一格一格檢查過之後,再把它拿出去使用。

仔細檢查生成出來的結果

Vizify 會一路追蹤這個在背景執行的非同步工作,直到它順利完成或是明確失敗為止;接著它交還給你的,會是一份已經完成的影片成品,而不是一個還停留在等待中的處理狀態。 請先開著聲音把整支影片播放過一次:確認說話的內容和你所提供的台詞一致,環境聲符合這個場景所在的地點,而且也沒有任何一個音效落在錯誤的畫格上面。

從一份需求,到一支完成的影片

在 Vizify 裡面準備你的下一支影片。

開啟 Vizify