💡 核心結論速覽 (TL;DR)
- 省的是工,不是判斷:第二集原始錄音 16 分 04 秒,剪到成品 12 分 40 秒、下了 20 刀,但每一刀該不該下是我逐條看過的。
- 驗收線比工具重要:Apple Podcasts 官方要求響度 −16 dB LKFS ±1、真峰值不超過 −1 dBFS;我兩集實際量到 −16.04 與 −16.08。
- 我把降噪關掉了:沒經過人耳確認的降噪,我寧可不套——雜訊修掉的同時,氣音和句尾也會一起變薄。
- 下一步:先錄 10 分鐘試音檔,用 −16 LKFS 這條線檢查,再決定要不要花錢買任何 AI 後製工具。
第二集混完那一版,音樂確實進去了,響度也對了,技術檢查一路綠燈。我戴上耳機聽完,回了一句話:
「片頭音樂出現的地方不對哦,要在 節目介紹之前。」
技術上,那個版本沒有任何錯。音樂有進來、沒有爆音、長度也沒跑掉。錯的是順序——一個聽眾在第 20 秒會不會知道「這是一檔節目、這是誰在講話」,這件事沒有任何一個參數量得出來。
我是夜羽凌。過去幾週我把一檔中文單口 Podcast 的前兩集,從錄音做到上架 Apple Podcasts 與 Spotify。整條後製線我確實交了一大半給 AI:轉逐字稿、找贅字、對時間碼、算響度、輸出上架格式。但真正把我卡住的五件事,AI 一件都沒辦法替我決定。
這篇不是「7 步驟教你開 Podcast」。網路上那種已經很多了,而且大多長得一樣。我想講的是另一半:當你把工交出去之後,剩下來非你不可的是什麼——以及這一半,決定了你的節目聽起來像不像一個人。
用 AI 做 Podcast 能省多少?先看我這兩集的真實剪輯帳
用 AI 做 Podcast 最實際的省力點,在「把聲音變成可以閱讀的東西」這一步。錄完之後,AI 先把整段音訊轉成帶時間碼的逐字稿,你就能用「讀」的方式找出重錄、贅字和長停頓,而不是戴著耳機來回拖時間軸。
這句話講起來很抽象,我直接把兩集的帳攤開:
| 項目 | 第一集 | 第二集 |
|---|---|---|
| 原始錄音長度 | 多次分段錄製 | 16 分 04 秒 |
| 成品長度 | 13 分 49 秒 | 12 分 40 秒 |
| 剪掉多少 | 38 刀 | 20 刀、共 3 分 35 秒 |
| 真人補錄 | 1 段整段替換 | 無 |
| 定版版本 | 第 18 版 | 第 4 版 |
第二集那 3 分 35 秒被剪掉的東西,八成不是「講錯」,而是「講了兩次」。重錄的開頭、沒接完的半句、想了三秒才接上的空白——這些在錄的當下你自己毫無感覺,回頭讀逐字稿才會發現滿滿都是。
我用的轉稿模型是 Whisper 的 large-v3。這件事沒什麼玄機,市面上大部分 AI 逐字稿服務底層跑的也是同一類模型;中文逐字稿到底誰最準,我另外拿 Notta、Fireflies、Plaud 錄同一場會議比過,結論是差距沒有廠商講的那麼大,真正的差別在你願不願意校稿。
所以「AI 能省多少」,我的答案是:它省掉的是你在時間軸上來回拖的那幾個小時,不是你聽完一遍的那 13 分鐘。後者沒有捷徑。

AI 做 Podcast 的第 1 個坎:節目要叫什麼,它給不出結論
命名是整個過程裡,我覺得 AI 最無能為力的一關。不是它想不出名字——正好相反,它一口氣可以給你二十個,而且每個都說得出道理。
我當時來回討論過好幾個方向。《人生試算表》聽起來很專業,但我立刻想到:一個上班族滑到這個名字,第一反應大概是「下班了還要看試算表?」。《聽夜羽凌聊聊天》很親近,可是我追問了一句更難的:不認識夜羽凌的人,為什麼會想點進來?《打破看不見的牆》講的是我真正想說的事,但它太像一本心靈成長書的書名。
來回到某個晚上,我打了一句話出去:
給了你那麼多,你到現在沒給我結論
現在回頭看那句話有點好笑,但那就是重點。AI 很擅長把選項攤開,卻沒有立場替你承擔選錯的後果。它不用管三年後這個名字念起來會不會膩,也不用管別人介紹你的節目時說不說得出口。
最後定下來的是《嘿,你真的醒了嗎?》——這個名字是我自己提的。定下來之後我才發現一個意外的樂趣:我幾年前錄過一檔叫 《助眠小故事》 的節目,專門陪人入睡。這兩個名字剛好對著幹,而我居然是取完才想到的。
如果你也在命名這關卡住,我會這樣做:把 AI 給的名單全部念出來,念給一個沒在聽你講話的人。念得出口、對方會追問「那是在講什麼」的,留下;自己念到一半覺得尷尬的,不管理由多充分都刪掉。名字是要被說出口的,不是被排版出來的。
AI 剪 Podcast 最會踩的雷:它聽不出「這句話不像我會說的」
AI 剪 Podcast 最容易出錯的地方,不是剪錯位置,而是它判斷不了語意上的斷裂。它可以精準抓到你停頓了 3.1 秒,卻不會發現這一段的敘事根本前後矛盾。
我在確認稿子的時候抓到過一句:前一句寫「朋友把手機推過來」,下一句卻變成朋友看見了我的訂閱清單。我讀到這裡停下來,問了一個很直白的問題:
誰的手機?為什麼朋友的手機推過來會看到我的訂閱?
這種東西技術檢查抓不到,因為它文法完全正確、時間軸也完全連續。它只是不成立而已。而聽眾在耳機裡聽到這裡,不會像讀文章一樣往回捲——他們只會覺得「好像哪裡怪怪的」,然後注意力就掉了。
另一個更細的雷是用詞。我看到「接住」這種字眼會直接圈起來,因為那不是我平常會用的詞,它是一種很典型的、被磨得很圓的說法。「AI 味」到底怎麼看出來,我另外整理過一份不會冤枉人的判準;放到聲音裡,這件事會被放大好幾倍——文字你可以掃過去,聲音是一個字一個字灌進耳朵的。
我的做法很土:定稿前把整份逐字稿念出聲。念到卡舌頭、念到自己覺得「我幹嘛這樣講話」的地方,就是要改的地方。這一步只花十幾分鐘,卻是整個流程裡投報率最高的。
片頭音樂該放哪?這是 AI 做 Podcast 幫不到的第 3 件事
片頭音樂放錯位置,是我第二集唯一一次退回重做。音樂本身沒問題、音量沒問題、淡入淡出也沒問題——問題是它出現在節目介紹之後,而我要它在之前。
這件事的差別在哪?聽眾點開一集節目,前 30 秒在做一個判斷:我要不要繼續聽。如果冷開場講完直接接下一段話,他不知道自己聽到哪裡了;中間放五秒音樂,等於在說「剛剛那是引子,現在正式開始」。
最後的處理是:冷開場結束、我說完「排不下」那句之後,接五秒純音樂,再進節目介紹。插入點是第 26.5 秒,塞進去的是原本就存在的一段安靜間隙——沒有為了讓音樂進來而剪短或拉長任何一句口播。這條線我守得很死,因為一旦開始為了配樂去動說話的節奏,整集就會開始有「被生產出來」的感覺。
❶ 冷開場(勾住人,講一件具體的事)
❷ 五秒片頭音樂(換場訊號)
❸ 節目介紹(我是誰、這是哪一檔)
❹ 正文
你可以照抄這個順序,也可以不抄。但請確定順序是你決定的——因為工具的預設值永遠是「音樂放最前面」,而那個預設值不是為你的節目設計的。
哪些段落一定要真人重錄?AI 修不掉的兩種情況
有兩種情況我不會交給 AI 修,一定重錄:一是話沒說完整,二是講的內容過期了。
第一集我就遇到第二種。裡面有一段是導流到舊文章的口播,後來內容需要更新,我沒有去接一句話進去,而是整段重錄、整段替換。技術上這叫替換:拿掉舊的 21.9 秒,放進新錄的 32.6 秒,接縫用 0.024 秒的交叉淡化蓋過去。
規則我定得很硬:整段替換、不拆句混接、不變速。為什麼?因為拆句混接一定聽得出來。你今天錄音的狀態、離麥克風的距離、房間的殘響,跟三天前不會一樣;把兩天的聲音縫在一句話裡,聽眾說不出哪裡怪,但就是會覺得怪。
那一集我最後定版在第 18 版。不是因為我完美主義,是因為每改一次就要重新走一次技術檢查,而中間我改變過幾次主意。
另一件事:我把降噪關掉了
這大概是這篇文章裡最反直覺的一段。我第二集的降噪是關的——處理紀錄上明明白白寫著未啟用,理由是「沒有經過確認的降噪一律不套」。
市面上幾乎所有 AI 後製工具都把降噪當成頭號賣點,Adobe Podcast 的 Enhance Speech 甚至直接把它做成免費入口。它們確實有效,效果好到你會忍不住每一集都套一次。
問題是降噪不是外科手術,它是統計。它拿掉的不只是冷氣聲,還有你句尾那口氣、笑聲的尾巴、講到激動時的一點沙啞。這些東西單獨聽都不重要,加起來就是「這聽起來像不像真人」。
我實際做的處理很保守:高通濾波切掉 70 Hz 以下的低頻嗡嗡聲、低通切掉 16 kHz 以上、再加一點輕度壓縮(門檻 −20 dB、比例 2:1)。這些都是可逆、可解釋的處理,不是「讓 AI 猜哪些是雜訊」。
我會怎麼判斷:先套一次降噪,跟沒套的版本 A/B 聽同一段有笑聲或吸氣的地方。如果你聽得出人味變少了,那就別套——房間吸音比降噪外掛有用太多,而且是一次性成本。
定版前那一遍,我一定自己聽——AI 做 Podcast 的最後一道關
技術檢查全綠不等於可以上架。我第二集的品質報告最後有一欄寫著「人工試聽:必要」——那是流程自己給自己的限制,不是我後來加上去的。
第一集通過了 19 項技術檢查:編碼對、取樣率對、聲道對、位元率對、響度在容許範圍、真峰值沒超標、前後段沒被動到、38 筆剪輯全部沒跑掉。這 19 項全過,我還是從頭聽了一遍才回了一句「OK 定版吧。」第二集是「可以定版」。
為什麼要這麼囉嗦?因為技術檢查驗的是「檔案有沒有壞」,不是「這集好不好聽」。接縫聽起來突不突兀、笑點有沒有被剪掉半個、道別那句是不是收得太急——這些沒有任何一個欄位量得出來。
身為一個 INFP,我在這一步其實特別容易內耗:聽到第三遍就會開始懷疑整集都很爛。所以我給自己定了規則——只聽兩遍。第一遍聽接縫,第二遍聽情緒。兩遍聽完沒有明顯問題就放行,不准聽第三遍。不然這集永遠出不去。
AI 做 Podcast 的工具怎麼配?我的分工表
用 AI 做 Podcast 不是找一個「全能工具」,而是把八個環節分別交出去。哪些能交、哪些不能交,我整理成一張表——第三欄是我這兩集實際的做法,第四欄是我的判斷。
| 環節 | 常見選項 | 我怎麼做 | 能不能交出去 |
|---|---|---|---|
| 選題與大綱 | Claude、ChatGPT、Gemini | 拿來擴散想法、追問自己 | 可以交一半,結論自己下 |
| 錄音收音 | USB 麥克風、手機、Riverside | 本人錄音,24-bit/48 kHz | ❌ 不能交 |
| 轉逐字稿 | Whisper、Notta | Whisper large-v3 | ✅ 完全可以交 |
| 找贅字與重錄 | Descript 這類文字剪音訊 | AI 出建議清單,我逐條裁決 | 建議可以交,下刀不行 |
| 降噪與人聲 | Adobe Podcast、Auphonic | 降噪關閉,只做濾波與輕壓縮 | ⚠️ 要聽過才交 |
| 響度與輸出 | FFmpeg loudnorm、Auphonic | 兩段式正規化到 −16 LUFS | ✅ 完全可以交 |
| 封面與視覺 | Canva、AI 生圖 | 從既有羽毛 Logo 發展,文字隨圖生成 | 可以交,但要盯 |
| 託管與上架 | SoundOn、Firstory | SoundOn,一鍵送 Apple 與 Spotify | ✅ 完全可以交 |
這張表最重要的不是「我用了什麼」,而是第四欄的三種狀態:可以交、要聽過才交、不能交。你的工具組合可以跟我完全不一樣,但這三欄的分類邏輯是通用的。
封面那格我多說兩句。我的封面是從原本部落格的羽毛 Logo 發展出來的:深色底、銀白羽毛、一輪月,節目名的文字直接隨圖生成,沒有另外後製上字。好處是字和圖的光影是一體的;代價是改一個字就要整張重來。如果你的節目名還沒定,先別急著做封面。想找能輸中文又能商用的免費 AI 繪圖工具,我實測過 10 款、也標出哪幾款能安心拿來賺錢。
錄音那一格是唯一一個我標「不能交」的實體環節。而我發現想開節目的人,卡住的第一步幾乎都一樣:先跑去研究要買哪一支麥克風。那是最好查、也最像有在前進的一步,卻不是最該先做的一步。如果你正在猶豫要不要先買麥克風,我把三支千元級的排過順序,也寫了哪兩種人現在先別買——先看房間,再看型號。
這張表也可以反過來用:先確認每一格你打算用什麼,再回頭看有沒有哪一格是空的。空的那一格,就是你這集會卡住的地方。想一次看完寫作、繪圖、影片、簡報各環節我每天在用哪些 AI 工具,我另外做了一份按需求分類的總整理。
做一集 Podcast 要花多少錢和時間?兩集的實帳
錢的部分比多數人想的便宜,時間的部分比多數人想的貴。這是我做完兩集之後最誠實的結論。
錢:真正必付的只有兩筆
託管這一塊,SoundOn 官方頁面寫的是 NT$0 月費、沒有方案分層,一鍵送 Apple Podcasts 與 Spotify。贊助與廣告分潤另有抽成,實際比例以官方頁為準。所以嚴格來說,把節目放上網這件事本身,可以是零元。
真正會花錢的是兩處:一支堪用的麥克風,還有你本來就在付的 AI 訂閱。我自己同時付 ChatGPT、Claude 與 Google AI Pro——這三家我怎麼分工、為什麼曾經把 ChatGPT 降級三個月,第一集節目和這篇比較文都有講。
如果你已經有其中一個訂閱,做 Podcast 不會讓你多付一毛;還沒訂的話也別急著衝最高階——ChatGPT 三檔方案的帳我算過,Go 升 Plus 多付的那筆我沒買,先確認自己真的用得到再說。
時間:貴在你以為不用算的那幾段
| 階段 | 誰在做 | 能不能壓縮 |
|---|---|---|
| 想清楚這集要說什麼 | 你 | ❌ 不能 |
| 錄音(含重錄) | 你 | ❌ 不能 |
| 轉稿、找贅字、對時間碼 | AI | ✅ 大幅壓縮 |
| 裁決每一刀 | 你 | ⚠️ 只能靠經驗變快 |
| 混音、響度、輸出 | AI/腳本 | ✅ 大幅壓縮 |
| 定版前完整聽兩遍 | 你 | ❌ 不能 |
六個階段裡,AI 只吃得掉兩個。剩下四個要嘛只有你能做,要嘛只有你能拍板。所以「AI 讓做 Podcast 變輕鬆」這句話,我只同意一半——它讓你不用學混音,但沒有讓你少聽一次。
順便講一下上架的技術門檻,其實比想像低
Apple Podcasts 的官方音訊要求寫得很清楚:RSS 用 MP3 或 AAC,立體聲建議 128–256 kbps、44.1 或 48 kHz;整體響度目標約 −16 dB LKFS、容許 ±1 dB;最大真峰值不超過 −1 dBFS。
我兩集的成品分別落在 −16.04 與 −16.08 LUFS,真峰值 −2.00,都在標準內。你不需要懂混音,只需要記住 −16 這個數字——把它當驗收線,剩下的交給工具做,然後用耳朵確認一次。

這套 AI 做 Podcast 的流程,我整理成了一份操作包
上面那張時間表裡標「你」的那幾欄,是我花最久才摸出順序的地方。後來我把整條線寫成一份付費的《讓 AI 幫你剪 Podcast|夜羽凌真人單口後製操作包》,NT$990、單次購買,不是訂閱制。
這一包後來為什麼放 Portaly、抽成和提領怎麼算、要不要升頂級會員,我在數位商品怎麼賣那篇整理成一張表和一條回本線。
會做這件事,是因為前兩集踩到一個很難用文字描述的問題。
逐字稿看起來乾乾淨淨,一句重複都沒有,可是聲音裡還留著一小段沒講完的起頭。文字上它已經被歸成同一句了,耳朵卻聽得出來那裡「頓了一下才真的開始」。那次之後我就確定:剪輯完成不能用「逐字稿讀起來順」來判定。所以包裡除了怎麼剪,還有怎麼回報問題、怎麼確認結果。
裡面有 PDF 與純文字兩種格式的操作手冊(4 份教學+1 份 FAQ)、12 份分階段的 AI 提示詞、6 份工作範本、22 題常見問題,以及一套在 Windows 本機跑的基礎後製工具——從環境準備、交代單集需求,一路到剪點確認、輸出與驗收。
分工是這樣的:手冊是給你看的,提示詞是填好資料後交給 AI 的,判斷還是留給你。你不用一邊學後製、一邊重新想每個步驟該怎麼問;隔了幾天再回來,也有工作紀錄可以查自己停在哪一步。至於哪一次講得比較好、哪個停頓要留著,那還是你的事——就是這篇從頭到尾在講的那五件事。
買之前先確認這三件事
❶ 不會寫程式可以用嗎?可以,包裡有安裝指引、基礎工具和分階段提示詞。但你仍要照步驟安裝、處理可能跳出來的錯誤,並自己確認結果——在本機跑這類 AI 工具最常卡在硬碟、安全設定和限流,我整理過一份常見問題大全。它不是點一點就好的圖形化剪輯軟體。
❷ NT$990 之外還要付什麼?這是操作包本身的單次售價,不含 AI 帳號與額度、也不含硬體。本包不使用付費的音訊處理 API,但首次要連網下載工具與模型,會占一些磁碟空間。
❸ 手機或 Mac 可以嗎?這一版不行。支援範圍是 Windows 11 x64/AMD64+Python 3.11 x64,用 CPU 處理基本清楚的中文真人單口錄音;Windows ARM、多人重疊說話或嚴重失真都不在這一版裡。也不需要 MCP。
該講清楚的邊界我一次講完:它不含自動降噪、語音合成或聲音複製,也沒有我的私人錄音、聲線和主題音樂。補錄換接、配樂這些,包裡給的是進階協作的提示詞與判斷方法,不是按一次就完成的功能。它也不是代剪服務——支援範圍是購買後 30 天內的下載、解壓縮與手冊步驟問題。
所以,如果你已經錄好了音,卡在「後製到底該從哪裡開始」,這份包大概就是為你整理的。適不適合你,看商品頁上的環境需求最準。
👉 查看操作包的完整內容與使用條件(NT$990 單次購買)
如果你目前只是想聽節目,那完全不用理它——往下走就好。
用 AI 做 Podcast 適合誰、不適合誰?
我先講不適合的,這比較重要。
❌ 這三種人先別開始
❶ 想要全自動的人。如果你的期待是「輸入題目、產出一集」,那你要的是 AI 生成節目,不是 AI 協助後製,兩件事完全不同。
❷ 不打算自己聽完的人。不聽就上架,遲早會有一集出事,而且是你的名字掛在上面。
❸ 現在就需要靠它賺錢的人。Podcast 是慢的。我兩集都上架了,也還沒有任何收聽數據可以拿出來說嘴。
✅ 這三種人很值得試
❶ 已經在寫東西的人。你手上的文章、筆記、講稿本來就是選題庫,一稿多用怎麼拆才不會變成八篇廢話,我整理過 5 個步驟和我不拆的 4 種內容。
❷ 講得比寫得好的人。有些人打字會卡,開口反而流暢——這種人做 Podcast 的邊際成本比寫部落格低太多,而自媒體這條路要配哪些工具,我實測三年後留下 14 款常用的。
❸ 想被「這個人」記住,而不是被某篇文章記住的人。聲音在建立人味這件事上,效率高得不成比例。
如果你是第三種,順便提醒一件事:Podcast 不會自己帶來收入,它帶來的是「有人記得你」。怎麼把記得變成收入是另一題——內容創作的 5 種變現模式,以及我自己的起步順序,我另外寫過一篇,也可以先看看用 AI 經營內容網站到底能賺多少的真實數字與我踩過的 3 個坑,別把期待放在錯的地方。
下一步很簡單:這週錄一段 10 分鐘的試音檔,什麼都不要買——想先摸手感,我每天在用的免費 AI 工具挑了 8 款出來,夠你把這一輪跑完。用它去跑一次轉稿、剪一次贅字、正規化到 −16 LUFS,然後戴耳機聽完。聽完你就會知道,卡住你的到底是工具,還是別的東西。

《嘿,你真的醒了嗎?》前兩集:你可以從哪一集開始聽
這檔節目叫《嘿,你真的醒了嗎?》,副標是「工作、金錢與人生選擇」。前兩集已經在 Apple Podcasts 和 Spotify 上,每一集都可以獨立聽,不用從第一集補起。
想知道這檔節目在聊什麼、為什麼我從文字走到聲音,開播那篇把節目定位和兩集怎麼挑都講清楚了。
第一集:〈ChatGPT、Claude、Gemini 怎麼選?我為什麼把 ChatGPT 降級三個月〉——如果你正在猶豫要不要升級某個 AI 訂閱,或看著帳單覺得付得莫名其妙,從這集開始。我不排終身名次,只講怎麼用三個問題檢查一筆訂閱。
第二集:〈想多賺一點,下班後就一定要做副業嗎?〉——如果你想增加收入,但下班後連追個劇的力氣都沒有,從這集開始。我從在登機門前一直改不完開頭那件事聊起,談時間之外還要算進去的體力。
兩集的共通點是:把一個「好像應該跟上」的選項,放回自己的生活裡重新看一次。第一集從錢進來,第二集從力氣進來。
👉 在 Apple Podcasts 收聽《嘿,你真的醒了嗎?》 | 在 Spotify 收聽
喔對,如果你之前聽過我那檔陪人入睡的 《助眠小故事》,那這檔剛好相反——以前陪你慢慢睡,這次想聊聊醒著的時候會遇到的選擇。
FAQ 常見問題
AI 剪 Podcast 和自己剪,最後聽起來差在哪?該選哪一種?
差別不在音質,在「哪一刀是誰下的」。AI 出建議、你裁決,成品跟純手工剪幾乎聽不出差別,但你會省掉在時間軸上來回拖的幾個小時。真正會被聽出來的是另一種:把裁決權也交出去。贅字被剪光、停頓被壓平的節目,聽起來會很順、也很不像人。我的建議是:建議清單交給 AI,下刀鍵留給自己。
我可以直接用 AI 配音做 Podcast 嗎?還是一定要真人錄?
技術上完全可以,中文 AI 語音這兩年進步很多。但要先分清楚你的節目賣的是什麼:如果是資訊型、教學型、有聲書型內容,AI 配音很划算;如果你要建立的是「這個人」,那真人錄音幾乎沒有替代品——聽眾記得的是猶豫、笑聲和那口氣,不是發音標準度。我這檔是後者,所以全部自己錄。如果你要走 AI 配音路線,5 款中文文字轉語音我實測過差距和商用授權的隱藏條款。
做了兩集就停掉會很尷尬嗎?要不要先囤幾集再上架?
先上架。囤稿最大的風險不是浪費,是你會在囤的過程中不斷修改定位,然後永遠不覺得夠好。我的做法是:每一集都當成有人第一次認識我來寫,不預設聽眾聽過前面。這樣就算只有兩集,那兩集也是完整的——不會因為沒有第三集就變成半成品。至於尷尬,沒上架的節目沒有人尷尬,因為沒有人聽得到。
沒有錄音室、家裡有噪音,還能做嗎?
能,但處理順序要反過來。多數人的直覺是「錄完再用 AI 降噪救」,而降噪救得回冷氣聲,救不回被一起削掉的人味。比較有效的順序是:先挑家裡最小、最多軟布的房間(衣櫃前面通常比書房好),關掉風扇和除濕機,麥克風靠近一點;錄完之後只做基本濾波,先不要套降噪。真的還有雜訊,再來考慮。房間是一次性成本,降噪是每一集都要付的代價。
我不會寫程式,這套流程我做得起來嗎?
做得起來,但要先確定你要的是哪一種。市面上的一體式工具(文字剪音訊、一鍵降噪、自動輸出)不用寫程式就能上手,代價是流程被工具決定。我這條線是自己接的,好處是每一個環節都可以停下來檢查、也能重現,代價是要花時間搭。同樣的思路我在口播影片上也走過一次——用 Claude Code 指揮 FFmpeg 和 Whisper 自動剪掉贅字,那篇的工具鏈跟這裡是同一套邏輯。
寫在最後:把工交出去,把「像不像我」留下來
做完這兩集,我對 AI 的態度沒有變得更樂觀,也沒有更悲觀,只是更清楚了一點:它非常擅長把 16 分 04 秒變成 12 分 40 秒,但它沒辦法告訴你,那句話像不像你會說的。
這也是我後來想通的事。真正決定一檔節目能不能被記住的,從來不是降噪乾不乾淨、響度準不準,而是聽眾在第 20 秒有沒有覺得「這個人講話的方式我還想再聽一下」。那個東西沒有 API,只能你自己給。
如果你也想試,我的建議還是那句:這週錄十分鐘,別買任何東西。錄完聽一遍,你就知道下一步該補什麼了。
想聽聽這套流程做出來是什麼樣子,可以直接從 《嘿,你真的醒了嗎?》 挑一集開始——正在為 AI 訂閱糾結就聽第一集,正在猶豫要不要做副業就聽第二集。覺得還行再追蹤,這樣就夠了。關於我為什麼同時在寫、在錄、也在做這些實驗,都寫在 關於夜羽凌 這一頁。
參考資料
- Apple Podcasts for Creators — Audio requirements(音訊格式、響度與真峰值官方規格)
- FFmpeg 官方濾鏡文件 — loudnorm(EBU R128 兩段式響度正規化)
- OpenAI Whisper — 官方開源專案與模型說明
- SoundOn Podcast 託管服務官方說明