ChatGPT Codex 自動剪片完整教學:從手機素材到成片的 8 個步驟

我以前剪一支影片,動不動要花三個小時,忙起來甚至一整天。用過達芬奇、剪映 CapCut、開拍,最後常常還是拿手機剪,手指粗,按老半天。

現在的流程只剩兩件事:拿手機拍一支影片,把檔案丟進 ChatGPT,它把成片交給我。

這篇把背後實際跑的 8 個步驟拆開講,包含每一步用什麼工具、為什麼需要它,以及完整的操作順序。看完你可以直接照做。

這套流程實際在做什麼

「丟給 ChatGPT 就好」聽起來像一鍵完成,實際上它在背後跑了一條有八個環節的流水線。知道每一段在做什麼,之後出問題你才知道要調哪裡。

步驟 做什麼 用什麼工具
1. 素材檢查 確認影片檔案與長度 Codex
2. 逐字轉寫 把你講的話變成文字 ElevenLabs API(雲端)或 Whisper(本地)
3. 內容整理 刪掉講錯的、重複的、語病,抓出主線 Codex
4. 剪輯決策 決定哪一段留、哪一段剪 開源工具包 video use
5. 逐段粗剪 處理音訊淡入淡出與剪接邊界 ffmpeg
6. 修飾 轉場、圖卡、字幕合成 AVFoundation、Pillow
7. 混音 調整聲音大小與平衡 ffmpeg
8. QA 與定稿 讓 AI 回頭把整支影片再看一遍 Codex

第 5 步的 ffmpeg 是很多人會忽略但影響最大的一環。它負責判斷音訊的邊界,避免你話還沒講完就被卡掉,或是句子跟句子之間剪得太緊,聽起來喘不過氣。

第 8 步是我自己加的。原本的流程剪完就結束,我讓 AI 剪完之後再回去看一遍整支影片,確認前後有沒有斷掉的地方。

逐字轉寫要選雲端還是本地

第 2 步有兩個選擇,差別在你的素材敏不敏感。

  • ElevenLabs:把聲音丟到雲端處理,速度快,設定簡單。
  • Whisper:在你自己電腦上跑,檔案不出門,沒有外洩問題。

如果你拍的是公開要發的內容,用 ElevenLabs 就好。如果是客戶會議、內部討論這種不能外流的素材,走本地 Whisper。

實際操作:從拍完到成片

第一步:拍一支原始影片

不用講究。我示範用的那支是拿手機在公司隨手拍的,42 秒,中間還講錯話重來了一次。講錯不用管,第 3 步會處理掉。

第二步:把影片和提示詞一起丟進去

ChatGPT 現在已經跟 Codex 合併,在介面上點選 work,它就會變成可以實際執行任務的智慧體,而不只是聊天。

把影片檔拖進對話框,接著貼上提示詞。我的提示詞開頭是這樣:

你是一位 AI 短影音剪輯導演與製作代理。請把我提供的原始影片,剪成一支真實、有節奏、可以發布的繁體中文直式短影音。請依照以下 8 個步驟執行⋯⋯

後面就是把上面那張表的八個步驟寫清楚。提示詞寫一次,之後每支影片都能重複用。

第三步:申請 ElevenLabs API Key

API 你可以想成一把鑰匙,有了它,你在自己電腦上跑的 AI 就能呼叫 ElevenLabs 的功能。

  1. 到 ElevenLabs 官網註冊並登入。
  2. 左下角找到開發者相關的選項,進去就會看到 API Key 的頁面。
  3. 建立一組新的 Key,取個看得懂的名字,例如「AI 剪輯」。
  4. 設定這把 Key 能用哪些功能。ElevenLabs 有文字轉語音、語音轉語音、語音轉文字、音效,付費方案還有自動生成音樂和聲音克隆。

權限我自己是直接全開,因為方便。如果你在意安全,就一項一項勾你真正要用的。

第四步:指定字型

字幕要好看,字型要先講。我用的是思源黑體,做法很簡單:把思源黑體的官方網址複製起來,回到對話裡告訴它「字型使用」再貼上網址就好。

第五步:把模型和推理強度調到最強

剪片的目的本來就是省時間,所以模型直接選當前最強的,推理強度我選超高,希望一次到位不要來回。

速度的部分要看你的方案。我用的是 Max,可以選快速。如果你是 Plus 或 Pro,建議把速度調成標準,比較不會中途卡住。

第六步:送出,然後去做別的事

一支節奏比較單純的短影音,大概 10 到 20 分鐘會處理完。這段時間你可以去做任何事,不用盯著。

跑完打開資料夾,成片的字體、雙行字幕、特效、流程圖、講到哪裡跟到哪裡的高亮,都已經補齊了。

成品不滿意怎麼調

不用回去重寫提示詞,直接用講的。我實際調過的幾條:

  • 字幕一行控制在 8 個字以內
  • 斷句要依照語意判斷,不要硬切
  • 字幕維持單行,不要有時候變成兩行
  • 開頭標題放在畫面最上方

你可以把這件事想成以前把規範交給剪輯師:聲音要怎麼處理、字幕怎麼斷、字體用哪一套,你本來就要交代一輪。現在對象換成 AI,而且它會把這些記下來,下一支不用再講。

調到滿意之後,把整組設定打包成一個 skill,之後就是重複使用。我自己延伸出了幾個版本:手機直接口播用的、旅行 Vlog 用的、講新聞趨勢熱點用的,各自的節奏和字幕規範都不一樣。

API Key 的安全做法

這一段請務必看完。API Key 等同你的信用卡帳號密碼,不要給任何人。

我自己不會把 API Key 直接打在對話裡。做法是先複製到剪貼簿,再請它從剪貼簿讀取並設成全域變數,之後都能用。這樣 Key 不會以明文留在對話紀錄裡。

另外 ElevenLabs 有洩漏偵測,如果它發現你的 Key 外流,會直接停用那把 Key。這個保護我是預設開啟的。

常見問題

完全不會剪輯的人可以用嗎

可以。這套流程的設計就是讓不懂剪輯的人也能產出成片,你先照著跑,之後再慢慢調整規範。

已經很會剪輯的人有必要用嗎

更有必要。你越懂剪輯,越知道要跟 AI 交代什麼,調教出來的結果就越接近你要的樣子。我常形容 AI 時代的專業人士像流水線上的裁判:你的專業不是用來動手,是用來判斷 AI 做得對不對。

需要付費方案嗎

ElevenLabs 有免費額度可以先試。ChatGPT 的部分,方案越高階能選的速度和推理強度越多,但 Plus 也跑得動,把速度調成標準即可。

剪一支要多久

節奏單純的短影音大約 10 到 20 分鐘。素材越長、要求越細,時間會拉長。

剪輯師會不會被取代

我認為不會。工具會把執行的部分吃掉,但判斷什麼叫好、要傳達什麼,還是人的工作。差別在於你以後花時間的地方,會從拉時間軸變成調教規範。

接下來

這套流程真正省下來的不是剪輯技術,是時間。以前一支影片三小時,現在我可以把那三小時放回內容本身,或是放回生活。

如果你正在把 AI 接進自己的工作流,可以接著看一人公司的最小 AI 工具組合,那篇講的是工具怎麼選、不要一次裝太多。想理解這件事對個人工作者的整體意義,可以看超級個體是什麼

如果你是企業,想把類似的流程做進團隊的日常工作,可以看AI 導入顧問方案

分享此內容: