音频输入
3CX Call Control API · 8 kHz mono
getAudioStream项目
Voice Agent
Voice Agent Orchestrator 是独立的 on-premises 平台,用于在 telephony 上构建、评估与运行 AI voice agent。组织可通过单一 speech-to-speech 模型运行完整对话,或使用 pipeline mode — 可独立配置各阶段的 composable STT → LLM → TTS stack。Knowledge retrieval、MCP tooling 与 built-in evaluation 统一由单一 control plane 管理。
Voice AI 集成往往围绕特定 provider、runtime 和部署假设构建。当组织引入新模型、本地推理、知识系统或混合架构时,业务逻辑与实现细节之间的耦合越来越深。
结果是实验变慢、集成重复,且底层 AI 栈每次变化都会推高维护成本。挑战不在于支持单一 provider 或模型,而在于让对话系统能够演进,而不迫使周边平台随之一起演进。
平台围绕两种可互换的 voice runtime 架构构建,独立于 PBX 部署 — AI 栈可以自主扩展与迭代,而不必绑定通信核心。
Realtime mode 通过单一 speech-to-speech provider 运行完整对话。Pipeline mode 将独立的 STT、LLM、TTS 阶段组合为 cloud、on-premises 或 hybrid 部署 — 无论 provider 是 native streaming 还是 batch API,均使用统一的 runtime 抽象。
Turn-taking、barge-in 与 provider orchestration 在 voice runtime 内部处理,而非 telephony 集成代码中。
平台通过 Call Control API 与 3CX 集成以处理实时通话,并以内置 3CX MCP server 作为主要 tool 执行层。联系人查找、分机发现、呼叫转接与路由等核心 telephony 能力通过 MCP tools 暴露给 agent;电话簿搜索利用 3CX 的 fuzzy linguistic matching,以弥补语音识别误差。
控制平面
可创建任意架构或部署类型的多个栈,为每个栈配置 agent — 在同一 runtime 中并行运行。
Agent
按 agent 配置语音、语言、提示词、工具、知识库访问等。
语音处理架构
实时通话的语音处理路径 — 从音频输入到语音输出。







