音声入力
3CX Call Control API · 8 kHz mono
getAudioStreamProjects
Voice Agent
Voice Agent Orchestrator は telephony 上で AI voice agent を構築・評価・運用する standalone on-premises プラットフォーム。単一の speech-to-speech モデルで会話全体を回すか、pipeline mode — 各段階を独立設定できる composable STT → LLM → TTS stack を使う。Knowledge retrieval、MCP tooling、built-in evaluation は単一 control plane で管理。
Voice AI 連携は特定のプロバイダー、runtime、デプロイ前提を中心に構築されることが多い。組織が新しいモデル、ローカル推論、ナレッジシステム、ハイブリッドアーキテクチャを導入するにつれ、ビジネスロジックは実装詳細との結合が深まる。
その結果、実験は遅くなり、連携が重複し、基盤 AI スタックが変わるたびにメンテナンスコストが増える。課題は単一プロバイダーやモデルを支えることではなく、周辺プラットフォームまで巻き込まずに会話システムを進化させることにある。
プラットフォームは 2 つの interchangeable voice runtime アーキテクチャを中心に構築され、PBX から独立してデプロイされる — AI スタックは通信コアに結合せず、独自のペースでスケールし、素早く出荷できる。
Realtime mode は単一の speech-to-speech プロバイダーで会話全体を回す。Pipeline mode は独立した STT、LLM、TTS 段階を cloud、on-premises、hybrid デプロイに組み合わせる — プロバイダーが native streaming か batch API かに関わらず、統一された runtime 抽象を使う。
Turn-taking、barge-in、provider orchestration は telephony 連携コードではなく voice runtime 内で処理される。
プラットフォームは Call Control API 経由で 3CX と統合しリアルタイム通話を処理。内蔵 3CX MCP server を主要な tool 実行レイヤーとする。連絡先検索、内線発見、通話転送、ルーティングなどの中核 telephony 機能を MCP tools 経由で agent に公開。電話帳検索は 3CX の fuzzy linguistic matching を活用し、音声認識誤差を補完する。
コントロールプレーン
任意のアーキテクチャ・デプロイ種別の複数スタックを作成し、スタックごとに agent を割り当て — すべて 1 つの runtime で同時稼働。
エージェント
agent ごとに voice、言語、プロンプト、ツール、ナレッジアクセスなどを設定。
音声処理アーキテクチャ
ライブ通話の音声処理パス — 入力音声から応答音声まで。







