音声のみからアニメーションスライド動画をAIで自動生成する仕組みと作り方
ぼくは、超実践AI論というYouTubeチャンネルで動画をほぼ毎日投稿しています。
この動画の元になっているのは、収録した音声ファイルだけ。動画編集ソフトは使わず、AIとプログラムが自動で動画を作っています。
この記事では、動画ができるまでの4工程と動画化の仕組みを作った具体的な手順を解説します。
元になるのは音声だけ。実行はスキルを呼ぶだけ

動画の材料は、収録した音声ファイル1つと、その文字起こしです。
文字起こしは、OpenAIが無料で公開している音声認識ツールのWhisperで簡単に作れます。商用利用もできるMITライセンスです。
動画はAIとプログラムを組み合わせた4つの工程で作られます。この4工程はエージェントスキル(AI専用の手順書)にまとめています。
そのため、実際に動画を作るときにやることは、対象の音声ファイルを渡してスキルを呼ぶだけ。あとは音声をもとに、アニメーション動画が自動で作成されます。
4工程:カット割り、スライド生成、部品化、Remotionで動画化

4つの工程は次のとおり。
- カット割りの設計:文字起こしを話のまとまりごとに区切り、各まとまりを1カットとして分割
- スライドの画像生成:カット1枚ごとにスライド画像を1枚生成
- 部品への分解:生成した画像から、文字やイラスト、アイコンなどを別々の部品画像として切り出し
- アニメーション動画の作成:音声、文字起こし、カット割り、画像、部品から動画を作る
3つ目の部品化が必要なのは、1枚の画像のままでは、話の流れに合わせて要素を順番に表示できないからです。カット割りの構成に応じて、動かしたい要素を個別の画像に分けておきます。
動画化はプログラムで動画を作れるRemotion。AIが扱いやすい

4つ目の動画作成には、Remotionを使っています。Remotionは、動画をプログラムで作れるツールです。
動画の動きやアニメーションをプログラムで制御できるので、AIにとって扱いやすいのが選んだ理由です。
Remotionは、個人、従業員3人までの営利企業、非営利団体なら商用利用を含めて無料で使えます。
AIの動画作成は検証と改善の繰り返し

この動画作成スキルは、最初から今の形だったわけではありません。部品を1つずつ作り、検証と改善を繰り返して今の形になりました。
たとえば、最初は文字起こしの精度がどのくらいかを確かめました。精度が悪かったので、文字起こしの後にAIが誤字脱字を修正する工程を挟みました。
カット割りに応じて画像を生成させると、どれも同じようなカットになったこともあります。このときは画像生成の指示を何度も調整しました。
今もなお、作った動画を確認しながら、より良くできるところがあれば少しずつ改善しています。
ここからは、この動画作成スキルを最初に作るときに、どのように作業を進めたかを解説します。
作り方1:GPT-6 Astraに数秒のサンプルを作らせ、実現できるかを確かめる

最初にやったのは、GPT-6 Astraで、音声ファイルと文字起こしだけからどの程度のスライドアニメーション動画が作れるかの検証です。
音声ファイルを渡して、次のように指示しました。
この音声ファイルを元に、話の内容に応じたスライド画像を生成して、話の流れに沿ってRemotionでアニメーションをつけて。まずはサンプルとして数秒分作成して出てきたサンプルは、微調整は必要なものの、それなりのクオリティでした。そこで本格的に作ることにしました。
AIが実現できるか分からない作業は、このようにまず少しだけサンプルを作らせてから、本格的な開発に着手するのがおすすめです。
一気に完成版を作らせて、成果物が満足のいくものでなかった場合、時間とコストが無駄になるからです。
作り方2:grill-with-docsで設計を固めてから、AIに実装させる

サンプルで実現できると分かったら、次は設計です。grill-with-docsというエージェントスキルで、動画化スキルの設計を固めました。
grill-with-docsは、海外の有名エンジニアMatt Pocockさんが作った無料のスキルです。
このスキルを使うと、やりたいことについてAIが質問を1つずつぶつけてきます。その質問にすべて答えることで、AIとの認識のズレを潰した上で作業に入れます。
AIからの質問には、AIが推奨する回答つき。推奨回答と自分の認識にズレがなければ、それを選ぶだけで設計が固まっていきます。
grill-with-docsのインストールは、AIに以下の指示をすればOKです。使い方もAIに聞くのがはやいです。
npx skills@latest add mattpocock/skills を実行して、grill-with-docsスキルと、そのスキルが呼び出すgrillingとdomain-modelingのスキルをインストールして規模が大きい・難しい開発ほど、設計を先に固める

ぼくは、ある程度規模が大きかったり難しかったりするプログラムやスキルの開発では、grill-with-docsでまず設計を固めてから、AIに作業してもらうようにしています。
いきなりAIにすべて作らせて、こちらの認識との違いがあった場合、その直しは手間もコストも膨大なものになるからです。
人が担う箇所1:AIのカット割りはレビューする

grill-with-docsで固めた設計に沿ってAIにスキルを作らせると、ある程度満足のいくものができました。ですが、どうしてもうまくいかない2箇所だけは、自分で修正を加えました。
1つ目の修正は、カット割りに対して人のレビューを挟むことです。
AIが作ったカット割りには、1つのカットに2つ以上の話題が入っていることがあります。そのままだと、話が進んでも画面に変化がなく退屈です。
なので、カット割りができた段階でぼくがレビューします。「このカットは2つの話題が入っているので、別々のカットにして」といった指示で微調整をします。
人が担う箇所2:部品の切り出しは、簡単な部分はプログラム、複雑な部分は人

2つ目の修正は、部品の切り出し作業をAIに任せるのをやめたことです。
1枚の画像から、イラストやアイコン、記号などを背景が透明な個別の部品として切り出すことは、一応Codexにもできます。
ですが、Codexにやらせたときは、実際は背景が透明になっていなかったり、イラストの中身が少し変わってしまっていたりと、かなり不安定でした。
そこで、部品の作成は次のように分けました。
- プログラム:画像の周りをカットするだけのような、シンプルな切り出し
- 人:要素の一部に被りがある、特定の部品の背景を透明にする、といった複雑な切り出し
人がやる切り出しや背景の透過は、Macに標準搭載されているプレビューアプリで簡単にできます。
1つの動画のうち、プログラムで対応できない部品だけを手動で抽出するので、手作業はだいたい5分くらいで終わります。
カット割りのレビューと一部の部品の手作業抽出は、あなたが同じスキルを作るときも参考になると思います。
まとめの前に、お知らせを。
無料メルマガで実務で使えるAI活用を毎日配信中。1分で登録できます。
超実践AI論Substacktaichiaiworker.substack.com
ながら聞きで、AIを仕事に活かす方法がわかるポッドキャストをSpotifyでも配信しています。
超実践AI論Spotifyopen.spotify.com
まとめ:サンプル、設計、実装、改善の順で音声の動画化に挑戦する
この記事の要点は次の4つです。
- 動画の元は音声とWhisperによる文字起こしだけ。カット割り、スライド生成、部品化、Remotionで動画化の4工程をまとめたスキルで動画化
- AIが実現できるか分からない作業は、まず数秒のサンプルを作らせて検証
- 規模が大きい・難しい開発は、grill-with-docsで設計を固める
- AIのカット割りは人がレビューし、部品の切り出しはプログラムで難しいところだけ人がやる
音声だけから動画を作れると、動画作成のハードルはぐっと下がります。ぜひあなたも、音声の動画化にチャレンジしてみてください。
この記事をシェア


