AIボイスチェンジャー(えーあいぼいすちぇんじゃー)とは

AIボイスチェンジャーとは、録音または入力された音声の話す内容や間、強弱、感情を利用しながら、声質や話者らしさを別の声へ変換するAI技術です。文字から声を新しく作るだけでなく、実際に話した演技を変換後の声へ引き継げる点に特徴があります。

AIボイスチェンジャーが残す要素と変える要素を示す概念図

英語表記:AI voice changer / voice conversion / speech-to-speech

声を変えても、何を残すのか

元の音声には、発話内容のほか、話す速さ、間、抑揚、息づかい、感情が含まれます。AIボイスチェンジャーは音声を分析し、こうした発話の特徴と、声の高さ、響き、話者らしさを分けて扱う仕組み。前者をできるだけ残し、後者を変換先の声へ寄せて音声を作り直します。

そのため、同じ台本でも俳優が演じた怒りやためらいを別のキャラクター声へ移す、話者の声質を変えながらナレーションの間を保つ、といった使い方ができます。ただし変換後に同じ言葉が聞こえることと、元の演技が完全に保存されることは別です。長い音声、重なった声、雑音、叫び声では崩れ方が変わるかもしれません。

音声合成やボイスクローンとの違い

技術主な入力主な目的
AIボイスチェンジャー実際に話した音声内容や演技を残し、声質を変える
音声合成テキスト文章から音声を生成する
ボイスクローン対象話者の音声例その人らしい声の特徴をモデル化する

ボイスクローンで作った声を、ボイスチェンジャーの変換先に使うことがあります。そのため製品画面では両機能が並びますが、同義ではありません。音声認識は音声を文字へ変える技術で、声質の変換を目的にしません。「何を入力し、何を残し、何を変えるか」で区別すると理解しやすくなります。

どんな制作業務で使える?

広告動画の仮ナレーション、ゲームのキャラクター声、研修教材、オーディオブック、映像の吹き替えなどで使えます。演者が先に自然な間と感情を付けて読み、その演技を別の声色へ変えれば、テキストだけの指示より意図を伝えやすい場合も。多言語化では翻訳や発音確認も別工程になるため、声を変えただけで意味まで正確になるわけではありません。

業務テストでは、同じ元音声を使い、聞き取りやすさ、元の感情、変換先との近さ、雑音、長尺での一貫性を比較します。社内レビューでは音だけを聞かせ、意味が伝わるか、人物を誤認しないかも確認。制作時間が短くなっても、修正や権利確認が増えれば全体工数は下がりません。

実在人物の声を使う前に決めること

声は本人を識別し、信頼やブランドと結び付く素材です。録音する許可だけでなく、AIへの入力、声のモデル化、生成物の公開、広告利用、利用期間、二次利用、契約終了後の削除を分けて合意します。出演契約に「音声素材を使える」とあっても、AIで別の発言を作る権限まで含むとは限りません。

ElevenLabs利用規定は、同意や法的権利のないなりすましに加え、AIが作った声だと分からせない使い方も禁じています。高精度な複製機能Professional Voice Cloningでは、登録できるのは自分の声だけで、相手の同意があっても他人の声は複製できません。声の持ち主が自分のアカウントで登録・認証し、その声を相手へ共有する手順です。それでも提供元の安全策だけに依存せず、元音声、同意記録、生成担当者、使用モデル、公開先を自社で残すべきです。外部公開時にAI変換音声だと分かる表示を付ければ、ディープフェイクとの誤認も減らせます。

なりすましを防ぐ運用

ディープフェイク詐欺では、聞き慣れた声そのものが本人確認の弱点になります。送金、契約変更、認証情報の共有など影響の大きい依頼は、声だけで承認せず、登録済みの別経路で確認する運用が必要です。経営者や広報担当者の公開音声が多い企業ほど、緊急依頼の折り返し先、合言葉、二者承認を決めておくべきでしょう。

制作側では、利用できる声の台帳、承認者、公開期間、削除依頼の窓口を置きます。検出ツールは補助になりますが、すべてのサービスや編集後の音声を確実に判定できるわけではありません。「似ているから使う」ではなく、「使う権利を証明できるから使う」という順序が、事業利用の最低条件です。

Topic音声変換の共通評価は2016年に始まっていた

Voice Conversion Challenge 2016では、世界17の研究グループが同じ音声データを使い、発話内容を保ったまま話者らしさを変える課題に取り組みました。5人の話者から5人の話者への25通りの組み合わせで作った音声を、200人の聴取者が「自然さ」と「対象話者への似方」という2つの尺度で採点。ChatGPTが一般公開された2022年より6年前、つまり生成AIが広く注目される前から、変換音声は別々の2つの物差しで測られていたのです。

AIボイスチェンジャーに関するよくある質問

AIボイスチェンジャーはリアルタイムでも使えますか?
リアルタイム対応の製品もありますが、遅延、雑音、端末性能、ネットワークで品質が変わります。配信や通話では、実際の機材と接続条件で確認します。
自分の声なら自由にAI変換してよいですか?
自分の声でも、契約中の広告、所属先の権利、共同制作物、利用サービスの規約が関係する場合があります。公開や商用利用の条件を用途ごとに確認します。
AIボイスチェンジャーは元の発音ミスも直しますか?
通常の音声変換は元の発話内容や演技を利用するため、言い間違いや不要な間も残ることがあります。必要なら元音声を録り直すか、編集・音声合成を別工程で使います。
AIボイスチェンジャーは歌声にも使えますか?
歌声変換に対応する製品もありますが、音域、息づかい、伴奏との分離、権利条件が会話音声と異なります。製品の対応範囲と音源の利用許諾を確認してください。

あわせて読みたい記事