
- 登入
- 註冊

我以前剪一支影片,動不動要花三個小時,忙起來甚至一整天。用過達芬奇、剪映 CapCut、開拍,最後常常還是拿手機剪,手指粗,按老半天。
現在的流程只剩兩件事:拿手機拍一支影片,把檔案丟進 ChatGPT,它把成片交給我。
這篇把背後實際跑的 8 個步驟拆開講,包含每一步用什麼工具、為什麼需要它,以及完整的操作順序。看完你可以直接照做。
「丟給 ChatGPT 就好」聽起來像一鍵完成,實際上它在背後跑了一條有八個環節的流水線。知道每一段在做什麼,之後出問題你才知道要調哪裡。
| 步驟 | 做什麼 | 用什麼工具 |
|---|---|---|
| 1. 素材檢查 | 確認影片檔案與長度 | Codex |
| 2. 逐字轉寫 | 把你講的話變成文字 | ElevenLabs API(雲端)或 Whisper(本地) |
| 3. 內容整理 | 刪掉講錯的、重複的、語病,抓出主線 | Codex |
| 4. 剪輯決策 | 決定哪一段留、哪一段剪 | 開源工具包 video use |
| 5. 逐段粗剪 | 處理音訊淡入淡出與剪接邊界 | ffmpeg |
| 6. 修飾 | 轉場、圖卡、字幕合成 | AVFoundation、Pillow |
| 7. 混音 | 調整聲音大小與平衡 | ffmpeg |
| 8. QA 與定稿 | 讓 AI 回頭把整支影片再看一遍 | Codex |
第 5 步的 ffmpeg 是很多人會忽略但影響最大的一環。它負責判斷音訊的邊界,避免你話還沒講完就被卡掉,或是句子跟句子之間剪得太緊,聽起來喘不過氣。
第 8 步是我自己加的。原本的流程剪完就結束,我讓 AI 剪完之後再回去看一遍整支影片,確認前後有沒有斷掉的地方。
第 2 步有兩個選擇,差別在你的素材敏不敏感。
如果你拍的是公開要發的內容,用 ElevenLabs 就好。如果是客戶會議、內部討論這種不能外流的素材,走本地 Whisper。
不用講究。我示範用的那支是拿手機在公司隨手拍的,42 秒,中間還講錯話重來了一次。講錯不用管,第 3 步會處理掉。
ChatGPT 現在已經跟 Codex 合併,在介面上點選 work,它就會變成可以實際執行任務的智慧體,而不只是聊天。
把影片檔拖進對話框,接著貼上提示詞。我的提示詞開頭是這樣:
你是一位 AI 短影音剪輯導演與製作代理。請把我提供的原始影片,剪成一支真實、有節奏、可以發布的繁體中文直式短影音。請依照以下 8 個步驟執行⋯⋯
後面就是把上面那張表的八個步驟寫清楚。提示詞寫一次,之後每支影片都能重複用。
API 你可以想成一把鑰匙,有了它,你在自己電腦上跑的 AI 就能呼叫 ElevenLabs 的功能。
權限我自己是直接全開,因為方便。如果你在意安全,就一項一項勾你真正要用的。
字幕要好看,字型要先講。我用的是思源黑體,做法很簡單:把思源黑體的官方網址複製起來,回到對話裡告訴它「字型使用」再貼上網址就好。
剪片的目的本來就是省時間,所以模型直接選當前最強的,推理強度我選超高,希望一次到位不要來回。
速度的部分要看你的方案。我用的是 Max,可以選快速。如果你是 Plus 或 Pro,建議把速度調成標準,比較不會中途卡住。
一支節奏比較單純的短影音,大概 10 到 20 分鐘會處理完。這段時間你可以去做任何事,不用盯著。
跑完打開資料夾,成片的字體、雙行字幕、特效、流程圖、講到哪裡跟到哪裡的高亮,都已經補齊了。
不用回去重寫提示詞,直接用講的。我實際調過的幾條:
你可以把這件事想成以前把規範交給剪輯師:聲音要怎麼處理、字幕怎麼斷、字體用哪一套,你本來就要交代一輪。現在對象換成 AI,而且它會把這些記下來,下一支不用再講。
調到滿意之後,把整組設定打包成一個 skill,之後就是重複使用。我自己延伸出了幾個版本:手機直接口播用的、旅行 Vlog 用的、講新聞趨勢熱點用的,各自的節奏和字幕規範都不一樣。
這一段請務必看完。API Key 等同你的信用卡帳號密碼,不要給任何人。
我自己不會把 API Key 直接打在對話裡。做法是先複製到剪貼簿,再請它從剪貼簿讀取並設成全域變數,之後都能用。這樣 Key 不會以明文留在對話紀錄裡。
另外 ElevenLabs 有洩漏偵測,如果它發現你的 Key 外流,會直接停用那把 Key。這個保護我是預設開啟的。
可以。這套流程的設計就是讓不懂剪輯的人也能產出成片,你先照著跑,之後再慢慢調整規範。
更有必要。你越懂剪輯,越知道要跟 AI 交代什麼,調教出來的結果就越接近你要的樣子。我常形容 AI 時代的專業人士像流水線上的裁判:你的專業不是用來動手,是用來判斷 AI 做得對不對。
ElevenLabs 有免費額度可以先試。ChatGPT 的部分,方案越高階能選的速度和推理強度越多,但 Plus 也跑得動,把速度調成標準即可。
節奏單純的短影音大約 10 到 20 分鐘。素材越長、要求越細,時間會拉長。
我認為不會。工具會把執行的部分吃掉,但判斷什麼叫好、要傳達什麼,還是人的工作。差別在於你以後花時間的地方,會從拉時間軸變成調教規範。
這套流程真正省下來的不是剪輯技術,是時間。以前一支影片三小時,現在我可以把那三小時放回內容本身,或是放回生活。
如果你正在把 AI 接進自己的工作流,可以接著看一人公司的最小 AI 工具組合,那篇講的是工具怎麼選、不要一次裝太多。想理解這件事對個人工作者的整體意義,可以看超級個體是什麼。
如果你是企業,想把類似的流程做進團隊的日常工作,可以看AI 導入顧問方案。