まず、Geminiを使って現在バズっている動画コンテンツのカテゴリをリサーチ・分析し、取り上げるテーマを選定します。次に、そのテーマに基づいて・某AIツールで関連情報を収集・分析し、重要なポイントを・某AIツールで自動的に整理したうえで解説動画を生成します。
生成した動画から音声のみを抽出し、Geminiでその音声を文字起こしします。文字起こしした文章をもとに、独自開発したスライド画像作成用GPTsで「Nanobanana2」のプロンプトを出力し、そのプロンプトを使ってGeminiでスライド画像を作成します。
最後に、Vrewを使ってスライド画像・字幕・解説音声を同期させ、完成した動画に仕上げています。
全て私が考えたオリジナルの方法です。
動画解説:
【衝撃】電話の声は本物じゃない?保留音がショボい理由とAIが変える通信の未来
「電話の相手の声、なんだかいつもと違う気がする…」
そう感じたことはありませんか?実はその感覚、正しいんです。
私たちがスマホで聞いているのは、相手の「生の声」ではなく、スマホの中でリアルタイムに組み立てられた「声の模倣品」かもしれません。
今回の動画では、なぜ電話の保留音はあんなに音質が悪いのか?という謎から、人間の声を数学的に再現する驚きの仕組み「ソース・フィルタモデル」、そしてGoogleが開発する次世代AIコーデック「Lyra(ライラ)」まで、通信の裏側を徹底解説します。
動画の最後には、AIが声を「生成」する時代になったとき、私たちが話している相手は一体誰なのか?という少し怖い未来についてもお話しします。