DEVELOPMENT LOG / VOICE
DEV LOG #029 CURRENT

VOICE――「聞く・考える・話す」音声系の実動作と頭部発声再設計

DATE
2026.08.26
CATEGORY
VOICE
COMPONENT
STT / LLM / TTS / AUDIO
STATUS
TESTING

概要

森野詩葉の音声系は、構想段階ではなくRaspberry Pi 5上で一連の会話パイプラインが動作するところまで進んでいる。

現在動作している経路

基本構成は、

Microphone
→ Speech Recognition
→ Language Model
→ VOICEVOX
→ Speaker

となる。

音声入力は48kHz。

認識用に16kHzへ変換し、faster-whisperで文字起こし。

応答生成後、VOICEVOXで24kHz音声を生成し、出力時に48kHzへ変換する。

VOICEVOXでは現在、冥鳴ひまり・ノーマルを森野詩葉の主音声として使用している。

AIバックエンド

応答生成は外部AIとローカルAIを切り替えられるHybridBackend構成を進めている。

ネットワークやAPI状態に応じて、ローカル側へフォールバックできることを重視する。

現在の課題

頭部試験で使用した8Ω 2W級スピーカーでは、会話用として音量に余裕がない

そのため、単純にスピーカーを頭部内へ置く方式ではなく、口内発声ユニットとして再設計する。

左右耳位置にはMEMSマイクを配置し、実体詩葉が音源方向を判断できる構成へ発展させる。

次にやること

← 開発ログ一覧