ポッドキャスト編集者
収録したインタビューの話し声の背後に、空調音やキーボードの打鍵音、にぎやかな室内音が入っている場合。
間やカット、音量を編集する前に、話し声を強調し、背景音を抑えるよう指示します。
インタビュー音声をクリアにするAIによる音声分離
ボイスアイソレーターAIを使えば、音楽や環境音、気になる背景音から話し声を際立たせられます。分離したい音を具体的に指示して、処理に進みましょう。
目的を明確にする
良質な元音声と具体的な目標があれば、AIによる音声処理で役立つ結果を得やすくなります。
収録したインタビューの話し声の背後に、空調音やキーボードの打鍵音、にぎやかな室内音が入っている場合。
間やカット、音量を編集する前に、話し声を強調し、背景音を抑えるよう指示します。
インタビュー音声をクリアにするクリップの会話に、音楽や街の環境音、騒がしい撮影現場の音が重なっている場合。
編集に合う仕上がりになるよう、話者、不要な音、希望する音のバランスを説明します。
動画用の会話音声を準備するボーカルテイクを確認したり、リハーサル録音から口頭の指示を聞き取ったりする必要がある場合。
タイミングや音色を判断できるだけの細部を残しながら、聴き取りを助けるために分離を使います。
リハーサルのボーカルを分離するフィールド録音で、主な話者の声に風や交通の音、ほかの人の会話が重なっている場合。
最も明瞭な部分から始め、内容を聞き取れる音声中心のバージョンを生成して確認します。
フィールド録音を改善する作業の流れ
手順はシンプルですが、指示の一つひとつが、モデルにとって残すべき声と不要な音の判断に影響します。
主な話者またはボーカルを指定します。必要であれば言語も伝え、1人の声だけを残すのか、聞こえるすべての話者を残すのかを明確にします。
背景音楽、ハムノイズ、風の音、部屋の環境音など、妨げとなる音を挙げます。自然な環境音を残すか、減らすかも伝えます。
子音が途切れていないか、水中で聞こえるようなノイズがないか、言葉が欠けていないか、不自然な間がないかを確認します。毎回最大限の除去を求めるのではなく、リクエストを調整してください。
プロンプトの選択肢
以下のプロンプト例は、求める仕上がりによって分離対象がどう変わるかを示しています。いずれかをコピーし、音源に固有の情報を自分のものに置き換えてください。
インタビュー
1
Isolate the main speaker in this interview, reduce room tone and keyboard clicks, and keep the voice natural and intelligible.
音楽
2
Bring the lead vocal forward, lower the instrumental backing, and preserve the singer's breath and consonants without harsh processing.
屋外
3
Prioritize the person speaking near the camera, reduce wind and traffic, and retain a small amount of natural outdoor ambience.
リハーサル
4
Extract the spoken instructions from this rehearsal, reduce instruments behind them, and keep overlapping words as intelligible as possible.
対象の声、不要な音、そしてどの程度自然な背景音を残したいかを具体的に指定してください。
現実的な期待値を設定する
AIによる分離は便利ですが、魔法ではありません。ここでは、よくある失敗のポイントと、元音源を諦める前に試せる実用的な調整方法を紹介します。
話者が同時に話していたり、似た声質を持っていたりすると、出力で音節が混ざったり、言葉が別の話者に割り当てられたりする場合があります。
回避策最も明瞭な部分を個別に処理し、完璧な文字起こしではなく補助として結果を使用してください。
遠くにいる話者や、他の音に大きくかき消された話者の声は、モデルが復元できる音声の詳細が少なすぎるため、薄く、金属的、または不完全な音になる場合があります。
回避策最も音量の大きい部分にトリミングし、まず競合する音を小さくしてから、最終ゲインを上げすぎないようにしてください。
密度の高い音楽に重なった声は、分離を強くしすぎると、子音や残響、声の質感が失われることがあります。
回避策完全な除去ではなく、話し声の強調と音楽の低減を指定し、その後で結果を元音源とブレンドしてください。
元音源がすでにクリップしていたり、過入力になっていたり、ひどく圧縮されていたりする場合、AIモデルでも、そもそも録音されていなかった情報を確実に再現することはできません。
回避策利用可能な中で最もきれいな音源を使用し、処理後のファイルは元音源の代替ではなく、復元を補助するものとして扱ってください。
ワークフローを選ぶ
同じAI機能でも、入力が会話、音楽演奏、動画のセリフのどれかによって動作は異なります。
1人以上が話していて、内容を聞き取りやすくしたい場合は、この方法を使います。最も重視する話者と、音量を下げたい背景音を指定してください。
楽曲やリハーサルでは、リードボーカル、バックボーカル、または話し声によるカウントインのどれが必要かを指定します。音楽の一部を残すと、タイミングやフレージングを判断しやすくなります。
素材が動画クリップの場合は、画面に映っている話者と、セリフの妨げになっている音を特定します。背景を完全に無音にするより、適度に残したほうが編集になじむことがよくあります。
実際に試してみる
実際のクリップと具体的な指示を使って、ワークフローを試しましょう。まずは短く代表的な部分から始め、聞き取りやすさ、音の不自然さ、残すべき背景音の量を判断してください。
声を分離するよくある質問
音声録音を分析して、どの部分が話し声や歌声に当たるかを推定し、対象の声がより際立つ音声を作成します。結果は元の音声の明瞭さや、声がほかの音とどの程度重なっているかによって異なります。
確実に除去できるわけではありません。競合する音の多くは低減できますが、除去を強くかけすぎると、金属的な音になったり、子音が欠けたり、不自然な無音部分が生じたりすることがあります。背景を完全に無音にしようとするより、適度に低減するほうが使いやすい場合が多いです。
はい。特に、ボーカルと楽器の音が比較的はっきり分かれている場合に有効です。音が密集した編曲、強いエフェクト、残響、周波数の重なりがあると、ボーカルの一部が欠けることがあるため、処理後の音声を元の音声と比較してください。
音声トラックにアクセスできれば、動画制作のワークフロー内で収録された会話音声にも使用できます。画面に映っている話者と競合する音を特定し、元の音声を差し替えたりミックスしたりする前に、分離した結果が映像と合っているか確認してください。
対象の声、取り除きたい音、仕上がりにどの程度の自然さを求めるかを書いてください。たとえば、屋外の雰囲気をすべて消さずに、風や交通の音を抑えながら主な話者の声を優先するよう指定します。