De Router voor Voice AI

De Router

De router bepaalt welk model moet worden aangeroepen per taal en per doelstelling. Deze beslissing is gebaseerd op gepubliceerde metingen in plaats van de Engelse ranglijsten van leveranciers.

Benchmark-dekking per taal

De benchmark-dekking is beschikbaar voor zowel Speech-to-text (STT) als Text-to-speech (TTS) over diverse talen (waaronder EN, AR, FR, DE, HI, ES, IT, AT, E).

Belangrijke bevindingen uit de metingen:

  • Beperkte meertalige data: 11 van de 23 modellen zijn alleen in het Engels gemeten. De rangschikking van deze modellen in andere talen is onbekend, inclusief het model dat bovenaan de Engelse tabel staat.
  • Geen universele winnaar: Vier verschillende modellen winnen over negen verschillende talen. Er is geen enkel model dat overal het beste is, waardoor de juiste keuze afhangt van de taal die de gebruikers spreken.

Score versus kosten per fase

In de analyse van nauwkeurigheid (Word Error Rate - WER) versus kosten per minuut voor Speech-to-text, LLM, Text-to-speech en Speech-to-speech, komen de volgende resultaten naar voren:

Overzicht van modellen (Speech-to-text):

RangModelWERKosten per minuut
1Universal-3.5 Pro (assemblyai:universal-3-5-pro)2.0%$0.0075
2GPT-4o Transcribe (openai:gpt-4o-transcribe)2.3%$0.0060
3GPT-4o-mini Transcribe (openai:gpt-4o-mini-transcribe)2.7%$0.0030
4Qwen3-ASR (alibaba:qwen3-asr-flash)2.8%$0.0054
5Realtime STT-1 (inworld:inworld-stt-1)3.3%$0.0025
6Chirp 3 (google:chirp_3)3.9%$0.0160
7Velma 2 (modulate:velma-2-stt-streaming-english-v2)4.4%$0.0010
8Grok STT (xai:stt)4.8%$0.0033
9Solaria-1 (gladia:solaria-1)5.0%$0.0125
10Pulse (smallest:pulse)5.1%~$0.0050
11stt-rt-v5 (soniox:stt-rt-v5)7.5%$0.0020
12Gradium ASR (gradium:default)8.4%$0.0104
13Nova-3 (deepgram:nova-3)9.8%$0.0048
14Ink-2 (cartesia:ink-2)11.0%$0.0090
Flux (deepgram:flux-general-en)$0.0065
Scribe v2 Realtime (elevenlabs:scribev2realtime)$0.0065
GPT Live Transcribe (openai:gpt-live-transcribe)$0.0170

Gateway

De gateway biedt één basis-URL en één API-sleutel voor elke provider, waarbij gebruik wordt gemaakt van de API die jouw framework reeds aanroept.

Voer je voice-workers uit en observeer ze

Speko ondersteunt de OpenAI API, waardoor frameworks die je al gebruikt enkel een hostname en een modelstring nodig hebben.

Integraties:

  • LiveKit (TypeScript): Richt de OpenAI-plugin op de gateway. De agent-code blijft ongewijzigd.
  • Pipecat (Python)
  • Claude / Cursor (MCP)

Voorbeeldimplementatie LiveKit (TypeScript)

import { defineAgent, voice } from '@livekit/agents';
import * as openai from '@livekit/agents-plugin-openai';

const key = process.env.SPEKO_API_KEY!;
const baseURL = 'https://api.speko.ai/v1';

export default defineAgent({
  entry: async (ctx) => {
    const session = new voice.AgentSession({
      stt: new openai.STT({ apiKey: key, baseURL, model: 'auto' }),
      llm: new openai.LLM({ apiKey: key, baseURL, model: 'auto' }),
      tts: new openai.TTS({ apiKey: key, baseURL, model: 'auto' }),
    });
    await session.start({ agent: new voice.Agent({ ... }) });
  },
});

MCP Configuratie

Om je agent naar Speko te richten via MCP, kan de volgende curl-opdracht worden gebruikt:

$ claude mcp add --transport http speko https://mcp.speko.ai/mcp