Dit artikel introduceert een router- en gateway-systeem voor Voice AI (Speko) dat automatisch het beste model kiest voor Speech-to-text (STT) en Text-to-speech (TTS). In plaats van te vertrouwen op leverancierslijsten, baseert de router zijn keuzes op specifieke taalbenchmarks, aangezien er geen universele winnaar is over alle talen heen.
De kernpunten zijn:
- Benchmark-analyse: Er is een gedetailleerde vergelijking tussen modellen op basis van de Word Error Rate (WER) en de kosten per minuut.
- Gateway-functionaliteit: Het systeem biedt één centrale API-sleutel en basis-URL, waardoor ontwikkelaars eenvoudig kunnen schakelen tussen verschillende providers via de OpenAI API-standaard.
- Integraties: Het systeem is compatibel met frameworks zoals LiveKit (TypeScript), Pipecat (Python) en kan worden geconfigureerd via MCP voor Claude en Cursor.
De Router voor Voice AI
De Router
De router bepaalt welk model moet worden aangeroepen per taal en per doelstelling. Deze beslissing is gebaseerd op gepubliceerde metingen in plaats van de Engelse ranglijsten van leveranciers.
Benchmark-dekking per taal
De benchmark-dekking is beschikbaar voor zowel Speech-to-text (STT) als Text-to-speech (TTS) over diverse talen (waaronder EN, AR, FR, DE, HI, ES, IT, AT, E).
Belangrijke bevindingen uit de metingen:
- Beperkte meertalige data: 11 van de 23 modellen zijn alleen in het Engels gemeten. De rangschikking van deze modellen in andere talen is onbekend, inclusief het model dat bovenaan de Engelse tabel staat.
- Geen universele winnaar: Vier verschillende modellen winnen over negen verschillende talen. Er is geen enkel model dat overal het beste is, waardoor de juiste keuze afhangt van de taal die de gebruikers spreken.
Score versus kosten per fase
In de analyse van nauwkeurigheid (Word Error Rate - WER) versus kosten per minuut voor Speech-to-text, LLM, Text-to-speech en Speech-to-speech, komen de volgende resultaten naar voren:
Overzicht van modellen (Speech-to-text):
| Rang | Model | WER | Kosten per minuut |
| 1 | Universal-3.5 Pro (assemblyai:universal-3-5-pro) | 2.0% | $0.0075 |
| 2 | GPT-4o Transcribe (openai:gpt-4o-transcribe) | 2.3% | $0.0060 |
| 3 | GPT-4o-mini Transcribe (openai:gpt-4o-mini-transcribe) | 2.7% | $0.0030 |
| 4 | Qwen3-ASR (alibaba:qwen3-asr-flash) | 2.8% | $0.0054 |
| 5 | Realtime STT-1 (inworld:inworld-stt-1) | 3.3% | $0.0025 |
| 6 | Chirp 3 (google:chirp_3) | 3.9% | $0.0160 |
| 7 | Velma 2 (modulate:velma-2-stt-streaming-english-v2) | 4.4% | $0.0010 |
| 8 | Grok STT (xai:stt) | 4.8% | $0.0033 |
| 9 | Solaria-1 (gladia:solaria-1) | 5.0% | $0.0125 |
| 10 | Pulse (smallest:pulse) | 5.1% | ~$0.0050 |
| 11 | stt-rt-v5 (soniox:stt-rt-v5) | 7.5% | $0.0020 |
| 12 | Gradium ASR (gradium:default) | 8.4% | $0.0104 |
| 13 | Nova-3 (deepgram:nova-3) | 9.8% | $0.0048 |
| 14 | Ink-2 (cartesia:ink-2) | 11.0% | $0.0090 |
| — | Flux (deepgram:flux-general-en) | — | $0.0065 |
| — | Scribe v2 Realtime (elevenlabs:scribev2realtime) | — | $0.0065 |
| — | GPT Live Transcribe (openai:gpt-live-transcribe) | — | $0.0170 |
Gateway
De gateway biedt één basis-URL en één API-sleutel voor elke provider, waarbij gebruik wordt gemaakt van de API die jouw framework reeds aanroept.
Voer je voice-workers uit en observeer ze
Speko ondersteunt de OpenAI API, waardoor frameworks die je al gebruikt enkel een hostname en een modelstring nodig hebben.
Integraties:
- LiveKit (TypeScript): Richt de OpenAI-plugin op de gateway. De agent-code blijft ongewijzigd.
- Pipecat (Python)
- Claude / Cursor (MCP)
Voorbeeldimplementatie LiveKit (TypeScript)
import { defineAgent, voice } from '@livekit/agents';
import * as openai from '@livekit/agents-plugin-openai';
const key = process.env.SPEKO_API_KEY!;
const baseURL = 'https://api.speko.ai/v1';
export default defineAgent({
entry: async (ctx) => {
const session = new voice.AgentSession({
stt: new openai.STT({ apiKey: key, baseURL, model: 'auto' }),
llm: new openai.LLM({ apiKey: key, baseURL, model: 'auto' }),
tts: new openai.TTS({ apiKey: key, baseURL, model: 'auto' }),
});
await session.start({ agent: new voice.Agent({ ... }) });
},
});
MCP Configuratie
Om je agent naar Speko te richten via MCP, kan de volgende curl-opdracht worden gebruikt:
$ claude mcp add --transport http speko https://mcp.speko.ai/mcp
De Router voor Voice AI
De Router
De router bepaalt welk model moet worden aangeroepen per taal en per doelstelling. Deze beslissing is gebaseerd op gepubliceerde metingen in plaats van de Engelse ranglijsten van leveranciers.
Benchmark-dekking per taal
De benchmark-dekking is beschikbaar voor zowel Speech-to-text (STT) als Text-to-speech (TTS) over diverse talen (waaronder EN, AR, FR, DE, HI, ES, IT, AT, E).
Belangrijke bevindingen uit de metingen:
- Beperkte meertalige data: 11 van de 23 modellen zijn alleen in het Engels gemeten. De rangschikking van deze modellen in andere talen is onbekend, inclusief het model dat bovenaan de Engelse tabel staat.
- Geen universele winnaar: Vier verschillende modellen winnen over negen verschillende talen. Er is geen enkel model dat overal het beste is, waardoor de juiste keuze afhangt van de taal die de gebruikers spreken.
Score versus kosten per fase
In de analyse van nauwkeurigheid (Word Error Rate - WER) versus kosten per minuut voor Speech-to-text, LLM, Text-to-speech en Speech-to-speech, komen de volgende resultaten naar voren:
Overzicht van modellen (Speech-to-text):
| Rang | Model | WER | Kosten per minuut |
| 1 | Universal-3.5 Pro (assemblyai:universal-3-5-pro) | 2.0% | $0.0075 |
| 2 | GPT-4o Transcribe (openai:gpt-4o-transcribe) | 2.3% | $0.0060 |
| 3 | GPT-4o-mini Transcribe (openai:gpt-4o-mini-transcribe) | 2.7% | $0.0030 |
| 4 | Qwen3-ASR (alibaba:qwen3-asr-flash) | 2.8% | $0.0054 |
| 5 | Realtime STT-1 (inworld:inworld-stt-1) | 3.3% | $0.0025 |
| 6 | Chirp 3 (google:chirp_3) | 3.9% | $0.0160 |
| 7 | Velma 2 (modulate:velma-2-stt-streaming-english-v2) | 4.4% | $0.0010 |
| 8 | Grok STT (xai:stt) | 4.8% | $0.0033 |
| 9 | Solaria-1 (gladia:solaria-1) | 5.0% | $0.0125 |
| 10 | Pulse (smallest:pulse) | 5.1% | ~$0.0050 |
| 11 | stt-rt-v5 (soniox:stt-rt-v5) | 7.5% | $0.0020 |
| 12 | Gradium ASR (gradium:default) | 8.4% | $0.0104 |
| 13 | Nova-3 (deepgram:nova-3) | 9.8% | $0.0048 |
| 14 | Ink-2 (cartesia:ink-2) | 11.0% | $0.0090 |
| — | Flux (deepgram:flux-general-en) | — | $0.0065 |
| — | Scribe v2 Realtime (elevenlabs:scribev2realtime) | — | $0.0065 |
| — | GPT Live Transcribe (openai:gpt-live-transcribe) | — | $0.0170 |
Gateway
De gateway biedt één basis-URL en één API-sleutel voor elke provider, waarbij gebruik wordt gemaakt van de API die jouw framework reeds aanroept.
Voer je voice-workers uit en observeer ze
Speko ondersteunt de OpenAI API, waardoor frameworks die je al gebruikt enkel een hostname en een modelstring nodig hebben.
Integraties:
- LiveKit (TypeScript): Richt de OpenAI-plugin op de gateway. De agent-code blijft ongewijzigd.
- Pipecat (Python)
- Claude / Cursor (MCP)
Voorbeeldimplementatie LiveKit (TypeScript)
import { defineAgent, voice } from '@livekit/agents';
import * as openai from '@livekit/agents-plugin-openai';
const key = process.env.SPEKO_API_KEY!;
const baseURL = 'https://api.speko.ai/v1';
export default defineAgent({
entry: async (ctx) => {
const session = new voice.AgentSession({
stt: new openai.STT({ apiKey: key, baseURL, model: 'auto' }),
llm: new openai.LLM({ apiKey: key, baseURL, model: 'auto' }),
tts: new openai.TTS({ apiKey: key, baseURL, model: 'auto' }),
});
await session.start({ agent: new voice.Agent({ ... }) });
},
});
MCP Configuratie
Om je agent naar Speko te richten via MCP, kan de volgende curl-opdracht worden gebruikt:
$ claude mcp add --transport http speko https://mcp.speko.ai/mcp