Mercury 2.5 is het nieuwste en meest capabele productiemodel van Inception. Het is een diffusion-taalmodel (dLLM) dat significant is verbeterd ten opzichte van zijn voorganger, met een toename in intelligentie van 40%. Het model blinkt uit in snelheid (1.107 tokens per seconde) en biedt een contextvenster van 260K tokens tegen zeer lage kosten.
Het model is specifiek ontworpen voor latentiegevoelige toepassingen:
- Zoekagents en RAG-pipelines: Versnelt complexe zoekprocessen door snelle opeenvolgende modelaanroepen.
- Voice-agents: Vermindert responstijden aanzienlijk (bijv. tot 170ms), wat essentieel is voor natuurlijke spraakinteracties.
- Coding-assistenten: Optimaliseert context-compressie en model-routering, wat leidt tot enorme kosten- en tijdsbesparingen.
Daarnaast introduceert het bedrijf previews voor Mercury Voice, geoptimaliseerd voor voice-agents, en Mercury Router, dat prompts intelligent routeert naar de meest geschikte modellen. Mercury 2.5 is beschikbaar via de Inception API, Baseten en OpenRouter.
Introductie van Mercury 2.5
Vandaag brengen we Mercury 2.5 uit, ons meest capabele productiemodel tot nu toe. Het is een aanzienlijke stap voorwaarts in kwaliteit ten opzichte van Mercury 2, met hetzelfde profiel van lage latentie en lage kosten.
Sinds de lancering van Mercury 2 hebben duizenden ontwikkelaars ermee gebouwd, hebben tientallen bedrijven het in productie genomen en is het gebruik met een factor tien gegroeid. Het model wordt nu ingezet voor latentiegevoelige workloads in zoek-, spraak- en codeproducten.
Deze workloads gaven ons een duidelijker signaal dan benchmarks alleen. We hebben feedback van klanten en foutgevallen uit productie gebruikt om de evaluaties aan te scherpen en de training te focussen. Mercury 2.5 is het eerste resultaat van die loop.
Wat is er veranderd
Mercury 2.5 is het meest capabele diffusion LLM op de markt. Voor zover wij weten is dit het grootste diffusion-taalmodel dat ooit is getraind.
- Kwaliteit: 40% toename in intelligentie ten opzichte van Mercury 2. Vergelijkbaar met kosten-geoptimaliseerde frontier-modellen zoals GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite en Claude Haiku 4.5.
- Snelheid: 1.107 tokens per seconde op veelgebruikte NVIDIA GPU's.
- Context: 260K tokens.
- Prijs: $0,20 per miljoen input-tokens en $0,75 per miljoen output-tokens.
- Bij lancering is Mercury 2.5 verkrijgbaar met 80% korting: $0,04 per miljoen input en $0,15 per miljoen output.
- Mogelijkheden: Instelbare redenering (tunable reasoning), parallelle tool-aanroepen en schema-conforme JSON.
"Sinds de lancering van Mercury 2 hebben we gezien hoe Inception diffusion-gebaseerde taalmodellen verder heeft ontwikkeld op NVIDIA AI-infrastructuur. De sprong in intelligentie van Mercury 2.5, gecombineerd met aanhoudende snelheden en lage kosten, weerspiegelt hoe snel nieuwe architecturen kunnen rijpen tot productieklaar systemen op het NVIDIA-platform."
— Shruti Koparkar, Senior Manager of Product, Accelerated Computing Group at NVIDIA
Mercury in productie
Zoekagents en RAG-pipelines
Eén zoekopdracht kan tientallen modelaanroepen triggeren: het plannen van de zoekopdracht, het herschrijven van queries, het opnieuw rangschikken van resultaten, het structureren van feiten, het samenvatten van bronnen en het controleren van het antwoord. Mercury houdt deze aanroepen snel genoeg om binnen een enkele gebruikersinteractie te blijven. Diverse toonaangevende bedrijven in zoekinfrastructuur draaien het model inmiddels in productie.
Voice-agents en interactieve applicaties
Bij spraak is latentie geen detail van de infrastructuur; het is de pauze die een beller hoort.
OpenCall bouwt AI-telefoonagents die live klantgesprekken afhandelen. In hun productie-workload bracht Mercury de mediane responstijd van het model terug naar bijna 170 milliseconden.
"Nadat we overstapten naar Mercury, daalde onze P99-responstijd van enkele minuten naar slechts één seconde, en onze P50 daalde van 0,4 seconden naar minder dan 0,2 — significant sneller dan elke andere provider die we hebben gezien, en dat inclusief redenering."
— Oliver Silverstein, Co-founder and CEO, OpenCall
Coding-subagents en assistenten
Coding-agents splitsen werk vaak al op over verschillende modellen. Eén model kan het plan maken of de code schrijven, terwijl anderen zoeken, tools uitvoeren, verzoeken routeren, de status samenvatten of een lange sessie comprimeren. Omdat deze ondersteunende aanroepen herhaaldelijk plaatsvinden, stapelen latentie en kosten zich snel op.
Augment Code gebruikt Mercury voor context-compressie, model-routering en MCP tool-search. Door compressie te verplaatsen naar Mercury werd de latentie met 82% verminderd (van ongeveer 150 seconden naar 27 seconden) en de kosten met 90% verlaagd, terwijl de kwaliteit behouden bleef. Samenvattingen van tool-zoekopdrachten worden in minder dan een seconde teruggegeven.
Dezelfde snelheid is van toepassing op het ontwikkelen van webapps. In de demo is te zien hoe Mercury 2.5 vanuit een paar prompts een werkende webapp voor muziekontdekking genereert.
Preview: Mercury Voice en Mercury Router
Naast Mercury 2.5 kondigen we een preview aan van Mercury Voice en Mercury Router.
- Mercury Voice: Levert een time-to-first-token (TTFT) van minder dan 170 milliseconden. Dit is een dLLM die is geoptimaliseerd voor voice-agents met de strengste latentie-budgetten.
- Mercury Router: Begrijpt inkomende prompts met een dLLM en routeert deze naar de beste modellen (zowel open als gesloten modellen) die de beste mix bieden van kwaliteit, snelheid en kosten.
Aan de slag
Mercury-modellen zijn beschikbaar via onze Inception API, Baseten en OpenRouter. Enterprise-implementaties ondersteunen dedicated capaciteit, autoscaling, compliance-controles en configureerbare gegevensbewaring.
- Chat: Probeer Mercury 2.5 in de chat.
- API: Probeer de API met 100 miljoen gratis tokens of raadpleeg de API-documentatie.
- Baseten-klanten: Implementeer Mercury 2.5 via uw bestaande Baseten-setup.
- Y Combinator-bedrijven: Claim $500.000 aan voordelen voor implementatie.
Voor partijen die Mercury evalueren voor voice-toepassingen, bieden we ondersteuning bij het testen van de workload-fit en het valideren van de prestaties onder specifieke serveerbeperkingen.
Wat volgt er nog
We zijn al begonnen met het trainen van ons volgende model. Dit wordt ons grootste model tot nu toe en we streven naar een release in de komende maanden. Ons volgende model zal een sprong in capaciteit betekenen zonder de snelheid en token-efficiëntie van diffusion op te geven. Dit vereist vooruitgang op het gebied van modeltraining, inferentie, evaluaties en infrastructuur.
Introductie van Mercury 2.5
Vandaag brengen we Mercury 2.5 uit, ons meest capabele productiemodel tot nu toe. Het is een aanzienlijke stap voorwaarts in kwaliteit ten opzichte van Mercury 2, met hetzelfde profiel van lage latentie en lage kosten.
Sinds de lancering van Mercury 2 hebben duizenden ontwikkelaars ermee gebouwd, hebben tientallen bedrijven het in productie genomen en is het gebruik met een factor tien gegroeid. Het model wordt nu ingezet voor latentiegevoelige workloads in zoek-, spraak- en codeproducten.
Deze workloads gaven ons een duidelijker signaal dan benchmarks alleen. We hebben feedback van klanten en foutgevallen uit productie gebruikt om de evaluaties aan te scherpen en de training te focussen. Mercury 2.5 is het eerste resultaat van die loop.
Wat is er veranderd
Mercury 2.5 is het meest capabele diffusion LLM op de markt. Voor zover wij weten is dit het grootste diffusion-taalmodel dat ooit is getraind.
- Kwaliteit: 40% toename in intelligentie ten opzichte van Mercury 2. Vergelijkbaar met kosten-geoptimaliseerde frontier-modellen zoals GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite en Claude Haiku 4.5.
- Snelheid: 1.107 tokens per seconde op veelgebruikte NVIDIA GPU's.
- Context: 260K tokens.
- Prijs: $0,20 per miljoen input-tokens en $0,75 per miljoen output-tokens.
- Bij lancering is Mercury 2.5 verkrijgbaar met 80% korting: $0,04 per miljoen input en $0,15 per miljoen output.
- Mogelijkheden: Instelbare redenering (tunable reasoning), parallelle tool-aanroepen en schema-conforme JSON.
"Sinds de lancering van Mercury 2 hebben we gezien hoe Inception diffusion-gebaseerde taalmodellen verder heeft ontwikkeld op NVIDIA AI-infrastructuur. De sprong in intelligentie van Mercury 2.5, gecombineerd met aanhoudende snelheden en lage kosten, weerspiegelt hoe snel nieuwe architecturen kunnen rijpen tot productieklaar systemen op het NVIDIA-platform."
— Shruti Koparkar, Senior Manager of Product, Accelerated Computing Group at NVIDIA
Mercury in productie
Zoekagents en RAG-pipelines
Eén zoekopdracht kan tientallen modelaanroepen triggeren: het plannen van de zoekopdracht, het herschrijven van queries, het opnieuw rangschikken van resultaten, het structureren van feiten, het samenvatten van bronnen en het controleren van het antwoord. Mercury houdt deze aanroepen snel genoeg om binnen een enkele gebruikersinteractie te blijven. Diverse toonaangevende bedrijven in zoekinfrastructuur draaien het model inmiddels in productie.
Voice-agents en interactieve applicaties
Bij spraak is latentie geen detail van de infrastructuur; het is de pauze die een beller hoort.
OpenCall bouwt AI-telefoonagents die live klantgesprekken afhandelen. In hun productie-workload bracht Mercury de mediane responstijd van het model terug naar bijna 170 milliseconden.
"Nadat we overstapten naar Mercury, daalde onze P99-responstijd van enkele minuten naar slechts één seconde, en onze P50 daalde van 0,4 seconden naar minder dan 0,2 — significant sneller dan elke andere provider die we hebben gezien, en dat inclusief redenering."
— Oliver Silverstein, Co-founder and CEO, OpenCall
Coding-subagents en assistenten
Coding-agents splitsen werk vaak al op over verschillende modellen. Eén model kan het plan maken of de code schrijven, terwijl anderen zoeken, tools uitvoeren, verzoeken routeren, de status samenvatten of een lange sessie comprimeren. Omdat deze ondersteunende aanroepen herhaaldelijk plaatsvinden, stapelen latentie en kosten zich snel op.
Augment Code gebruikt Mercury voor context-compressie, model-routering en MCP tool-search. Door compressie te verplaatsen naar Mercury werd de latentie met 82% verminderd (van ongeveer 150 seconden naar 27 seconden) en de kosten met 90% verlaagd, terwijl de kwaliteit behouden bleef. Samenvattingen van tool-zoekopdrachten worden in minder dan een seconde teruggegeven.
Dezelfde snelheid is van toepassing op het ontwikkelen van webapps. In de demo is te zien hoe Mercury 2.5 vanuit een paar prompts een werkende webapp voor muziekontdekking genereert.
Preview: Mercury Voice en Mercury Router
Naast Mercury 2.5 kondigen we een preview aan van Mercury Voice en Mercury Router.
- Mercury Voice: Levert een time-to-first-token (TTFT) van minder dan 170 milliseconden. Dit is een dLLM die is geoptimaliseerd voor voice-agents met de strengste latentie-budgetten.
- Mercury Router: Begrijpt inkomende prompts met een dLLM en routeert deze naar de beste modellen (zowel open als gesloten modellen) die de beste mix bieden van kwaliteit, snelheid en kosten.
Aan de slag
Mercury-modellen zijn beschikbaar via onze Inception API, Baseten en OpenRouter. Enterprise-implementaties ondersteunen dedicated capaciteit, autoscaling, compliance-controles en configureerbare gegevensbewaring.
- Chat: Probeer Mercury 2.5 in de chat.
- API: Probeer de API met 100 miljoen gratis tokens of raadpleeg de API-documentatie.
- Baseten-klanten: Implementeer Mercury 2.5 via uw bestaande Baseten-setup.
- Y Combinator-bedrijven: Claim $500.000 aan voordelen voor implementatie.
Voor partijen die Mercury evalueren voor voice-toepassingen, bieden we ondersteuning bij het testen van de workload-fit en het valideren van de prestaties onder specifieke serveerbeperkingen.
Wat volgt er nog
We zijn al begonnen met het trainen van ons volgende model. Dit wordt ons grootste model tot nu toe en we streven naar een release in de komende maanden. Ons volgende model zal een sprong in capaciteit betekenen zonder de snelheid en token-efficiëntie van diffusion op te geven. Dit vereist vooruitgang op het gebied van modeltraining, inferentie, evaluaties en infrastructuur.