【配信】自分の声をカワ(・∀・)イイ!!声に変えて配信しよう!!!【ゆかりねっと】

技術雑記

「ゲーム実況やってみたいけど、自分でしゃべるのは身近な人にバレそうで嫌だなぁ」
「うーん、自分の声、少し聞き苦しくないかな……?」
「端々の音が途切れて聞きづらいなぁ。」
「やっぱり地声でしゃべるのに勇気がいるなぁ……」

 と考えたことのある方もいるかと思います。
そんなお悩みが少し解決するかもしれない方法を今回は取り上げていきたいと思います。

ゆかりねっとwith音声合成ソフト!好きな声で配信・映像制作!

”ゆかりねっと”とはなんぞや?

 この記事を開いている人の大半は音声合成ソフトのあれこれ(一般にはずんだもんが一番浸透しているか……?)に関しては既にご存じだと思うので、そこに関しては割愛させていただきます。

 それら音声合成ソフトは簡単にいえば「文章を入力→再生or音声ファイルとして保存」という風なUIとなっているので、音声認識機能(入力した音声を文章に変換する機能)は存在していません。
そこで音声認識機能(サードパーティ製の音声認識エンジン)と音声合成ソフトをつないで、

                 マイクの音声入力
                     ↓
  音声処理(テキストへの変換) ⇆ ゆかりねっと ⇆ 音声合成ソフト

おおざっぱに上記の様なつながりで音声入力からソフトに読めるように変換、ソフトに読ませた音声の再生を行ってくれるソフトというわけですね。
音声認識処理の部分については、ゆかりねっとのデフォルトでGoogleの音声認識によるものが含まれているので実質的にゆかりネットが音声認識処理も兼ねている感じです。
(ライセンスや利用規約的にひっかかるところがあるなど、別の音声認識処理にしたいときに変更することも可能。筆者はゆーかねすぴれこ経由で別の処理を使っています。)

この方法をとることによるメリット・デメリット

 ではゆかりねっと(withボイロ系ソフト)を用いて配信することにどのようなメリット・デメリットがあるか(どのような人に向いているか)、並べてみていきましょう。

メリット

  • 明瞭な音声で発声できる
    =マイクを通すと声が聞き取りづらくなってしまうと感じる人も、音声の内容がしっかり認識されていれば明瞭な音声で話すことができる。
  • 生声と比較して、周囲のノイズや環境音に左右されない
    =外の環境音などをそのままマイクで拾うことはないので、マイクの設定次第で対策がしやすい。
  • 好きな声で配信できる
    =思い入れのあるボイロの声で話してもいいし、日によって気分の声で配信してもいい。
     自由とはそういうものだ。

デメリット

  • マイク入力~音声処理~再生までのラグが発生する
    =そのため通常の生声実況のような反応速度は得られない。
  • 音声認識処理の精度にも限界がある
    =意図した変換がされなかったり、誤変換されることも多々ある。
  • 音声合成ソフト内のイントネーションなどのパラメータまでは操作されない
    =ゆっくりや棒読みちゃんに慣れていれば気にならないが、平坦な読みが気になる人は気になるかも?気になる人はそこらへんまで操作するソフトやプラグインを自分で開発するんだよぉ!!!

ぐらいですかね。
他にもあるとは思いますが、イメージとしては現実とデジタルの境界線をよりデジタル側に寄せた感じを想像してもらえたらいいのかなと。
現実の空気をシャットアウトする代わりに即応性がなくなるといえばいいのか。
……でもね、それぐらいの実況の空気が好きな人もいるんです。(自分語り)
ゲームをプレイしているところにコメントして、ときたまぼちぼち反応が返ってくる。
カロリーを使わないぼんやりと見れる配信がね……。

そして主観的な話で上に入れるか微妙なところですが、

  • 声のキャラ性が強い(この声=この絵・このキャラと結びつきやすい)ものも多いので、受け入れられやすい・づらいが一部にはあるかも。
  • また、キャラ立ち絵とセットで扱うならニコニコの方が受け入れられやすいかも。
    (ニコニコの生配信自体が過疎気味ではあるけれども……)

みたいなところもある気がする。(圧倒的な個人的感想によるものです。)
なのでおススメはニコニコ1ですが、Youtubeなど他のサイトで挑戦するのも全然ありです。
まあ、動画コンテンツは群雄割拠の時代なので、個人でやる分には趣味の範疇になるでしょうからね。

使用する素敵な数々のご紹介

 それではようやく本題。
改めまして、タイトルで既に知っている方は多くいるとは思いますが、今回使うソフト・プラグインの一覧からご覧いただきましょう。

以下は必要に応じて、導入するもの。

  • ゆーかねすぴれこ(https://harukei66494739.github.io/recognize/)
    →縁の下の力持ち!上記だけでも音声処理は可能ですが、認識の詰まりを少なくしてくれます!
    また自身のPCのGPUでローカルの音声処理を行うこともできます(NVIDIA製のグラボ必須?)。
    さらにゆかりねっとからの出力ではなく、力業で音声合成ソフトからの直出力2もできます(ゆかりねっと連携は同様に必要)。
  • ゆかりねっとの音声合成ソフト対応プラグイン(https://booth.pm/ja/items/4328375・https://booth.pm/ja/items/3350433など)
    →デフォルトではVOICEROID系の対応が主なので、VOICEPEAKやVOICEVOXを使いたい場合は必要に応じて導入してください。
  • 各種配信ソフト(OBSなど)
    →必要に応じて用意。今回はあくまでゆかりねっと周りの紹介なので、
     配信関連の設定は見送らせていただきとうございます……! 

以上がおおよそ必要なものとなりまする。

各種の導入については用意されている資料が一番参考になると思いまする……。

 いや、さぼりというわけではなくて、自分の足らずな説明より、確実な説明なのでありまして……。

 というわけで導入方法は各種導入の資料があるので参照してほしいのですが、大枠の手順だけは示しておきます。

はじめに音声合成ソフト・ゆかりねっと・
対応する音声ソフトのプラグイン・Chromeを導入
(この時点で3点もしくはプラグイン含め4点以上の導入を終えているはず)
↓
音声合成ソフト・ゆかりねっとを起動後、動作を確認
↓
音声の認識詰まりが気になったり、ローカルのGPUで音声処理したい場合は
追加でゆーかねすぴれこを導入
↓
音声合成ソフト・ゆかりねっと・ゆーかねすぴれこの3点を起動後、動作を確認
↓
配信・録画ソフトの音声ソースとして、ゆかりねっとのウィンドウを認識させる
(自分はOBSでアプリケーション音声キャプチャで採ってます)

以上ですかね。気になるところがあれば、この投稿のポストに寄せていただければと。

 あと”ゆーかねすぴれこ”の導入について一点。
導入資料の”簡単スタート”にも書いてあるのですが、マイク調整はやっておきましょう。

自分は(ひとまず)こんな感じ。環境によって環境音境界値がかなり違うと思うので、資料を参照して微調整してくだしあ。

以上、諸々の紹介でした……!

 十年ぐらい前からあるツールなのですが、やはり音声合成ソフト界隈という枠がそこまで広くない……はずはないのですが、認知度はそこそこな印象。
表現力ではボイロ系ソフト本来の運用(各種パラメータの調整)、相応性では生声に勝てないので枠がなかった・道を開けなかったのが大きくは広まらなかった要因か。(筆者の井戸から海が見えていなかっただけかもしれませんが。)
それでも使い方によっては魅力あふれるツールなので、みんなで新しい界隈を切り開こうぜ!
……といったところで今回はここまで。
これを見てくれた人がボイロ系の声でニコ生配信界隈を盛り上げてくれると(勝手に)信じて、
それではまたの機会に。

  1. 国内のプラットフォームとして応援したいところではあるが、サイバー攻撃問題などのセキュリティ面での不安も残るところから全面的には推しづらい……。
    が、それでも国内の動画配信・投稿プラットフォームとしては未だに大きいところではあるので、デジタル植民地的な観点からも負けずに頑張ってほしいところ。 ↩︎
  2. こちらの方がマイクの入力からのレスポンスが早いが、常に音声合成ソフト側のGUIを表示しておかなければならない。配信時には多くのウィンドウを開くことになると思うので、画面の余剰(モニターの数)が多い人向け。 ↩︎
タイトルとURLをコピーしました