ポッドキャストの音声編集をプログラムで自動化。1回20秒・コストほぼゼロ
ポッドキャストの初心者は、なめらかに話せずに間が空きすぎたり、音質がいまいちだったりするのがあるあるです。
ぼくもポッドキャスト「超実践AI論」を始めて1ヶ月ほどですが、喋りの技術も音質もイマイチです。
そこで、配信を聞きやすくするために、間の調整と音質を整える作業をプログラムで自動化しました。以下の動画もそのプログラムで処理した音声を使っています。
この記事では、プログラムがやっている3つの処理、AIにプログラムを作らせた手順を解説します。
動画で見たい方はこちら。
音声編集はAIよりプログラムの方が速く・タダで・品質も安定

音声編集はAIに丸投げすることもできます。
でも、プログラムの方が次の3点で優れています。
- 処理が圧倒的に速い
- 編集ごとのコストがゼロ
- 品質にばらつきがない
実際、4分ほどの音声なら、プログラムをワンクリック実行するだけで20秒ほどで編集が終わります。プログラム実行でAIのトークン消費はゼロです。
プログラムがやるのは間のカット・雑音除去・音量調整

プログラムでやっていることは3つです。
- 間のカット
- 雑音の除去
- 声の音量を調整し、明瞭な音にする
使っている道具はすべて無料です。声のある区間の検出はSilero VAD、雑音の除去はDeepFilterNet、音量の調整はFFmpegで、いずれも無料で使えるオープンソースのソフトウェアです。
※これらのソフトはAstraがプログラムを作るときに選定したものです
声のない区間は一律0.2秒に縮める。根拠は2002年の研究

間のカットでは、声のない区間を一律で0.2秒に縮めています。
0.2秒にした根拠は、2002年の間についての研究です。5言語・約6,000件の間を分析したこの研究では、間は0.2秒未満の短いもの、0.2〜1秒の中程度のもの、1秒を超える長いものの3つに分かれると報告されています。
つまり、0.2秒が「人が間として認識する最小の長さ」ということです。
扇風機の音・破裂音・息遣いを取り除く

雑音の除去では、次の音を取り除いています。
- 背後で鳴っている扇風機や空調の音
- バ行を発音したときに入る破裂音
- 息遣いや喉を鳴らす音
声の音量をそろえて明瞭にする
音量の調整では、声の大きさを配信向けの一定の水準にそろえ、聞き取りやすい明瞭な音にしています。
スクリプトはAstraに部品ごとに作らせ、最後に組み合わせる

間のカット・雑音除去・音量調整のスクリプトは、GPT-6 Astraに作ってもらいました。
一気に作らせたわけではなく、まず間のカット、次に雑音の除去、最後に音量の調整と、部品を1つずつ作って最後に組み合わせました。
一回でまとめて作らせると、スクリプトを使ってイマイチだったとき、何が悪いのか原因がわかりづらいです。なので、やりたいことを1つずつ実装・検証し、最後に組み合わせています。
調整が必要だったのは間のカットだけ。コードは一切読んでいない
調整が必要だったのは、間のカットの部分だけです。最初に試したときは、0.2秒になっていない箇所がいくつかありました。
そこでAstraに次のように指示して、スクリプトを直してもらいました。
43秒の部分と1分15秒の部分と2分18秒の部分が0.2秒になっていないので、原因を調べてスクリプトを修正してスクリプトの調整はこれだけ。ぼくはコードを一切読まずに、求める品質のスクリプトができました。
文と文の間だけはAIが0.8秒に直す

ただ、間がすべて0.2秒だと不自然です。そこで、文と文の間は0.8秒に直しています。
これはスクリプトだけでは難しいので、AIの力も使っています。流れは次のとおりです。
- スクリプトで音声全体の間を0.2秒に縮め、雑音の除去と音量の調整まで済ませる
- AIが音声全体を見て、文と文の間にあたる箇所をすべて抽出
- 抽出した箇所に対して、AIがスクリプトを使って0.8秒に直す
先にスクリプトで音声をぐっと圧縮してから、AIにしかできないところだけをピンポイントで任せる。AIの仕事を必要最小限にすることで、トークンを大幅節約できます。
まとめの前に、お知らせを。
無料メルマガで実務で使えるAI活用を毎日配信中。1分で登録できます。
超実践AI論Substacktaichiaiworker.substack.com
ながら聞きで、AIを仕事に活かす方法がわかるポッドキャストをSpotifyでも配信しています。
超実践AI論Spotifyopen.spotify.com
まとめ:音声編集スクリプトはAIに一度作らせれば、以降はコストゼロ
この記事の要点は次の4つです。
- プログラムで音声編集をすると、速く、編集ごとのコストがゼロで、品質にばらつきがない
- プログラムがやるのは、間を0.2秒へ短縮、雑音除去、音量調整の3つ
- スクリプトはAstraに部品ごとに作らせて最後に組み合わせた
- 文と文の間を0.8秒に直す作業だけAIに任せ、トークン消費を節約
AIに一度プログラムを作ってもらえば、以降は短時間かつAIのトークン消費ほぼゼロで音声編集を自動化できます。それほど難しい作業ではないので、ClaudeのFable 5.1やOpus 5でも、おそらく可能です。
ぜひあなたも、ポッドキャスト配信の音声編集自動化プログラムをAIで作ってみてください。
この記事をシェア


