HOWLRSProduct engineering相談する
Build notes
動画生成オープンソース

自動字幕・音声・動画生成デスクトップアプリ DEGUCHIKAI のご紹介

スライド画像とテキストを入力し、Voicevox による音声合成と字幕を組み合わせて動画を生成するデスクトップアプリです。コマンド操作中心だった動画生成をGUIから扱えるようにし、Windows・macOS・Linux向けにGitHubでソースコードを公開しています。

Project snapshot

この実装で扱ったこと

Stack
  • Voicevox
目次 5 sections
  1. 課題:スライドを説明動画にする作業を、ひとつの画面にまとめる
  2. 実装したこと
  3. 利用方法
  4. 提供先と制約
  5. ライセンス情報

課題:スライドを説明動画にする作業を、ひとつの画面にまとめる

プレゼン資料を動画にするには、スライド画像の準備、ナレーションの作成、字幕の配置、動画ファイルへの書き出しと、複数の工程があります。DEGUCHIKAI は、この流れを画像とテキストを入力するデスクトップアプリとしてまとめた試作です。

DEGUCHIKAI は、スライド(画像とテキスト)から音声を合成し、字幕を含む動画を生成します。コマンド操作中心だった動画生成を、GUIから扱えるようにすることを目標に実装しました。

実装したこと

  • スライド用の画像と表示するテキストを入力として扱う
  • テキストを Voicevox で音声合成する
  • 字幕と音声をスライドに組み合わせ、動画として出力する
  • GUIから動画生成の操作を行う

インターフェース

利用方法

  1. スライドに使う画像と、各スライドに対応するテキストを準備します。
  2. アプリに入力し、音声合成と動画生成を実行します。
  3. 生成結果を確認します。

Voicevox を利用する構成のため、利用環境の準備や詳細な手順はリポジトリのREADMEを確認してください。

提供先と制約

ソースコードとライセンスは github.com/howlrs/deguchikai で公開しています。利用できるOSや必要な依存関係、配布物の有無はリポジトリの記載を正として確認してください。紹介動画と画面画像は、実装したGUIでの動画生成フローを示すために掲載しています。

ライセンス情報

LICENSE

Keep exploring

動画生成

テキストファイルからプログラマブルに動画を生成するツール Slide with voice(vox)の紹介

3 min read
開発基盤

SynapseGit — AIと人間の共創で「なぜこの形になったか」を残す

5 min read
ゲーム・PWA

ピクセルズ — Web で遊ぶ「思考に集中できる」ノノグラム (ピクチャーロジック)

8 min read