概要
森野詩葉の音声系は、構想段階ではなくRaspberry Pi 5上で一連の会話パイプラインが動作するところまで進んでいる。
現在動作している経路
基本構成は、
Microphone
→ Speech Recognition
→ Language Model
→ VOICEVOX
→ Speaker
となる。
音声入力は48kHz。
認識用に16kHzへ変換し、faster-whisperで文字起こし。
応答生成後、VOICEVOXで24kHz音声を生成し、出力時に48kHzへ変換する。
VOICEVOXでは現在、冥鳴ひまり・ノーマルを森野詩葉の主音声として使用している。
AIバックエンド
応答生成は外部AIとローカルAIを切り替えられるHybridBackend構成を進めている。
ネットワークやAPI状態に応じて、ローカル側へフォールバックできることを重視する。
現在の課題
頭部試験で使用した8Ω 2W級スピーカーでは、会話用として音量に余裕がない。
そのため、単純にスピーカーを頭部内へ置く方式ではなく、口内発声ユニットとして再設計する。
左右耳位置にはMEMSマイクを配置し、実体詩葉が音源方向を判断できる構成へ発展させる。
次にやること
- 口内発声ユニット設計
- 音圧改善
- 左右マイク実装
- VAD再検討
- リップシンクとの連動
- 頭部吸排気との干渉確認