パワポから自動的にVOICEPEAKの音声付き動画を作る

VoicepeakにAzure用辞書を作ったりと、ちょくちょくと思い出したように使い続けてるのは理由があって、TTS(Text To Speech)の音声の、特にイントネーションがほぼ修正が不要という点が気にいっている。

とはいえ、辞書を作ったことからも分かるように、英単語にはめっぽう弱かったり、生成した音声をパワポから出力した動画に乗せるにはAdobe Premiereを使わざるを得なかったりする。

affilunの紹介動画などは、まさにこうやって作成しているわけだけど、別にそこまで凝らなくても良いことも多い。つまり、読み上げ原稿をノートに入れたパワポを、そのままナレーション付きで動画にして欲しい、というのは以前からずっと考えてた。

で、まずはQwen3-TTSとIndex-TTS 2.5で、約30分ほど日英2言語で喋った自分の声を参照音声とする手法で、TTSを実行してみた。結果としては、Index-TTS 2.5の方が、かなり似ること、イントネーションもほぼ気にならない程度の品質で生成されることが確認できた。ただし、MacStudio M4 MAX 128GB上で、150GBもメモリを消費したものだからスワップが発生するし、生成時間もQwen3の4〜5倍ほど必要。

とはいえ、Index-TTSをChatGPTから利用すれば、自動的にパワポに音声を付けられるところまではイケた。どういうことかというと、ChatGPTというか、今のLLMはTTS/STTのどちらも可能で、品質を問わないなら、実はVoicepeakは不要になっている。でも、Voicepeakのプロの声優さんの声が欲しい、という要件を満たすにはこうするしかない、のと、STTがあるので生成された音声をチェックできるということ。

さて。Voicepeakで音声を生成、パワポから生成した動画に音声トラックとしてくっつけるプログラムと、それを呼び出すSKILLで自動化するセットを作ってみた。

https://github.com/rioriost/vp-manager

インストールは以下。

brew tap rioriost/tap
brew install vp-manager
vp-manager --version
vp-manager install-skill

で、ChatGPTにパワポのファイルを渡して、以下。

このPPTXのノートから読みを調整して確認用動画を作って

# チャットで開始すると、Workに切り替わるはずです。

1つだけ問題があって、VoicepeakをCLIで呼び出すとGUIを立ち上げようとして異常終了する。macOSのダイアログが出るので、[無視]すること。

パワポから自動的にVOICEPEAKの音声付き動画を作る

このPythonとSKILLで自動生成してみたのが以下。パワポに含まれる動画デモを動画として出力することがまだできないので注意。