Desert Ant Labs is een nieuw Europees AI-lab dat zich richt op 'opinionated' on-device intelligence. In plaats van te vertrouwen op grote cloud-modellen, ontwikkelt het lab kleine, gespecialiseerde modellen voor audio, visie en tekst die direct op het apparaat van de gebruiker draaien.
Kernpunten uit de lancering:
- Modellen en SDK: Er zijn 18 modellen gelanceerd (waaronder Voz voor transcriptie, Clear voor audio-optimalisatie, Redact voor privacy en Tongue voor taalidentificatie), toegankelijk via een SDK voor Swift, Kotlin en JavaScript.
- Prestaties: De modellen zijn ontworpen voor extreme snelheid en lage latentie. Zo is Voz tot 4,7x sneller dan Whisper en verbruikt het model 'Clips' 470x minder energie dan Claude Sonnet voor video-clipping.
- Privacy en Soevereiniteit: Door on-device inferentie verlaat data het apparaat niet, wat zorgt voor maximale privacy en onafhankelijkheid van cloud-providers.
- Visie: Desert Ant Labs streeft naar een gelaagde AI-architectuur. Ze beginnen met het 'cerebellum' (snelle, gespecialiseerde modellen voor routineuze taken), gevolgd door een 'cortex' die bepaalt welk model (lokaal of in de cloud) het beste kan antwoorden.
Introductie van Desert Ant Labs: On-device intelligence voor elk product
We bouwen kleine, gespecialiseerde modellen voor audio, visie en tekst. Elk model reageert in milliseconden en kost niets om te draaien. Hierdoor kun je intelligentie integreren in elke productinteractie, zonder beperkt te worden door tokenkosten of inferentiesnelheid. De modellen zijn klein genoeg om te draaien op een vijf jaar oude telefoon, snel genoeg om te gebruiken bij elk frame of elke toetsaanslag, en presteren beter dan de API-aanroepen waarvoor je nu betaalt.
De eerste modellen en SDK
De eerste 18 modellen zijn vandaag live (12 stabiel en zes in bèta), toegankelijk via één SDK voor Swift, Kotlin en JavaScript. Er is één model per taak, elk ontworpen om de snelste manier te zijn om die specifieke taak op een apparaat uit te voeren:
- Voz: Transcribeert 10 minuten audio in twee seconden op een iPhone – 4,7x sneller dan Whisper – met een start- en eindtijd voor elk woord.
- Clear: Een model van 9MB dat een opname van vijf minuten op een laptop in één seconde kan omzetten naar studiokwaliteit audio.
- Redact: Maskeert namen, adressen en kaartnummers in realtime in 27 talen, zodat deze gegevens nooit je servers bereiken.
- Tongue: Identificeert 84 talen op basis van slechts drie woorden, met een model van 2MB.
Prestaties en benchmarks
Taalidentificatie (Tongue):
- Tongue (2MB): 0,933 nauwkeurigheid (op basis van drie woorden)
- Detector (293MB): 0,887 nauwkeurigheid
Persoonsgegevens detectie (Redact):
- Redact (12MB): 88,8% van de data gevangen
- GLiNER-PII (2,3GB): 91,1% van de data gevangen
- Rampart (14,7MB): 61,4% van de data gevangen
- OpenAI filter (3GB): 60,2% van de data gevangen
Volledige specificaties en benchmarks voor de overige veertien modellen zijn te vinden op desertant.com/models en Hugging Face. Elk model is gratis tot 100.000 maandelijkse actieve apparaten. Geen tokens, geen logins.
Europese soevereiniteit en privacy
We bouwen dit in Europa, waar "on-device" de soevereine standaard is. De data verlaat nooit de handen van de klant, de functionaliteit is nooit afhankelijk van de cloud van een ander, en wat nooit is geüpload, kan nooit worden opgevraagd door derden.
De weg hiernaartoe
Vijf jaar lang hebben we onze video-app, Detail, gebouwd met een on-device first benadering. Maar toen we functies introduceerden zoals 'Auto Edit' voor het maken van korte clips, of audioverbetering voor podcasts, moesten we terugvallen op cloud-API's. Naarmate de populariteit van Detail groeide, stegen ook onze infrastructuurkosten.
Ik zocht elke paar maanden naar bruikbare on-device modellen op Hugging Face, bijvoorbeeld voor het vinden van stopwoorden of het opschonen van opnames. Hoewel de hardware (chips, Core ML) en het onderzoek aanwezig waren, ontbrak de brug naar de implementatie: een model dat je simpelweg in je app kunt plaatsen en kunt verzenden met een paar regels code.
Daarom hebben we de modellen zelf getraind. Het bleek dat het trainen van een model een uitdaging in productdesign is, en dat is precies waar onze expertise ligt. We hebben modellen en lokale inferentie ontworpen die cloudservices verslaan op snelheid, kwaliteit en kosten, en die beter presteren dan andere lokale en cloudmodellen, bij een fractie van hun omvang.
Resultaten in de praktijk
- Audioverbetering: We hebben Dolby vervangen door Clear voor betere en snellere audioverbetering.
- Transcripties: Met Voz zijn onze on-device transcripties 5x sneller geworden.
- Video-clipping: We hebben Claude Sonnet vervangen door Clips, ons model van 284MB. Dit model zet een video van 10 minuten in 5 seconden om in een dozijn clips. Dit is 10x sneller en verbruikt 470x minder energie dan Sonnet, met behoud van dezelfde kwaliteit.
Snelheid audioverbetering (Clear - 5 minuten audio):
- iPhone 16 Pro: 302x realtime
- MacBook Pro (M5): 345x realtime
(Gebaseerd op een model van 9MB dat een clip verbetert, mastert en opnieuw codeert).
Transcriptiesnelheid (30 minuten audio op M3 Ultra):
- Voz: 319x (bereikt 298x op een iPhone 17 Pro)
- Apple SpeechAnalyzer: 78x
- Whisper large-v3-turbo: 50x
Detail 6, dat zal worden gelanceerd met iOS 27, vervangt al onze cloud-API's door onze eigen modellen die volledig op het apparaat draaien.
De verschuiving van Cloud naar Device
De afgelopen jaren hebben we LLM's behandeld alsof ze slechts een andere API waren. In de hype rondom generalistische 'frontier brains' zijn we bijna vergeten dat zij niet de enige optie zijn. Veel ontwikkelaars hebben een verlanglijst aan on-device modellen die ze zouden bouwen als kosten geen rol speelden, of functies waar ze nu teveel tokens aan verbruiken.
Taken zoals het opschonen van een opname, het taggen van een foto, het extraheren van een datum uit een zin of het detecteren van een naam voordat de tekst naar de server gaat, hebben geen frontier model nodig. Onderzoekers van NVIDIA stelden vast dat 40% tot 70% van de aanroepen naar een groot model vervangen zou kunnen worden door een klein, gespecialiseerd model.
De rekenkracht is al aanwezig
Terwijl de industrie dit jaar ongeveer 450 miljard dollar uitgeeft aan datacenters, worden er wereldwijd meer dan een miljard telefoons, tablets en laptops verscheept met steeds krachtigere chips. Er is meer rekenkracht beschikbaar in de handen van mensen dan in alle AI-datacenters op aarde.
Gratis inferentie geeft ons een onfair voordeel. Er zijn geen kosten per aanroep, waardoor een functie bij elk bericht kan draaien in plaats van alleen bij de berichten die je je kunt veroorloven te controleren. Er is geen round-trip naar een server en de gegevens van de klant verlaten het apparaat niet.
Visie: Kleine hersenen in elk product
Om met lokale modellen te bouwen, moet de ontwikkelaarservaring aanzienlijk verbeteren. Er is behoefte aan commercieel bruikbare modellen die superieur zijn in snelheid en kwaliteit, eenvoudig te ontdekken zijn en met een paar regels code kunnen worden geïmplementeerd.
We zien de eerste honderd modellen als het cerebellum (het kleine brein). Dit deel regelt het constante werk – balans, timing, vaardigheden waar je niet over nadenkt – zodat de rest van het brein vrij is om te denken. Dat is wat we eerst bouwen: snelle, gespecialiseerde modellen voor werk dat de hele dag door gratis op het apparaat draait.
Daarna volgt de cortex, de laag die beslist welk model antwoordt: eerst een klein lokaal model, een groter model wanneer de taak daarom vraagt, en de cloud alleen wanneer het werk het apparaat moet verlaten. Naarmate open onderzoek vordert en hardware krachtiger wordt, groeien de lokale modellen mee.
In tegenstelling tot cloud-labs, die neutrale modellen leveren vanwege de prijsstelling per token, levert elk Desert Ant-model een door ons gekozen standaardinstelling, met de knoppen om die aan te passen. We optimaliseren het model en de runtime samen: op een iPhone draaien Clear en Voz op de Neural Engine, en in de browser draaien dezelfde weights van Clear via WebAssembly.
De SDK
Je kunt Desert Ant-modellen implementeren in je app via onze native Swift, Kotlin en JavaScript SDK, beschikbaar op GitHub. Onze documentatie is geschreven voor ontwikkelaars en agents. Je kunt de modellen uitproberen op je Mac via de CLI, of in je browser op Hugging Face.
Introductie van Desert Ant Labs: On-device intelligence voor elk product
We bouwen kleine, gespecialiseerde modellen voor audio, visie en tekst. Elk model reageert in milliseconden en kost niets om te draaien. Hierdoor kun je intelligentie integreren in elke productinteractie, zonder beperkt te worden door tokenkosten of inferentiesnelheid. De modellen zijn klein genoeg om te draaien op een vijf jaar oude telefoon, snel genoeg om te gebruiken bij elk frame of elke toetsaanslag, en presteren beter dan de API-aanroepen waarvoor je nu betaalt.
De eerste modellen en SDK
De eerste 18 modellen zijn vandaag live (12 stabiel en zes in bèta), toegankelijk via één SDK voor Swift, Kotlin en JavaScript. Er is één model per taak, elk ontworpen om de snelste manier te zijn om die specifieke taak op een apparaat uit te voeren:
- Voz: Transcribeert 10 minuten audio in twee seconden op een iPhone – 4,7x sneller dan Whisper – met een start- en eindtijd voor elk woord.
- Clear: Een model van 9MB dat een opname van vijf minuten op een laptop in één seconde kan omzetten naar studiokwaliteit audio.
- Redact: Maskeert namen, adressen en kaartnummers in realtime in 27 talen, zodat deze gegevens nooit je servers bereiken.
- Tongue: Identificeert 84 talen op basis van slechts drie woorden, met een model van 2MB.
Prestaties en benchmarks
Taalidentificatie (Tongue):
- Tongue (2MB): 0,933 nauwkeurigheid (op basis van drie woorden)
- Detector (293MB): 0,887 nauwkeurigheid
Persoonsgegevens detectie (Redact):
- Redact (12MB): 88,8% van de data gevangen
- GLiNER-PII (2,3GB): 91,1% van de data gevangen
- Rampart (14,7MB): 61,4% van de data gevangen
- OpenAI filter (3GB): 60,2% van de data gevangen
Volledige specificaties en benchmarks voor de overige veertien modellen zijn te vinden op desertant.com/models en Hugging Face. Elk model is gratis tot 100.000 maandelijkse actieve apparaten. Geen tokens, geen logins.
Europese soevereiniteit en privacy
We bouwen dit in Europa, waar "on-device" de soevereine standaard is. De data verlaat nooit de handen van de klant, de functionaliteit is nooit afhankelijk van de cloud van een ander, en wat nooit is geüpload, kan nooit worden opgevraagd door derden.
De weg hiernaartoe
Vijf jaar lang hebben we onze video-app, Detail, gebouwd met een on-device first benadering. Maar toen we functies introduceerden zoals 'Auto Edit' voor het maken van korte clips, of audioverbetering voor podcasts, moesten we terugvallen op cloud-API's. Naarmate de populariteit van Detail groeide, stegen ook onze infrastructuurkosten.
Ik zocht elke paar maanden naar bruikbare on-device modellen op Hugging Face, bijvoorbeeld voor het vinden van stopwoorden of het opschonen van opnames. Hoewel de hardware (chips, Core ML) en het onderzoek aanwezig waren, ontbrak de brug naar de implementatie: een model dat je simpelweg in je app kunt plaatsen en kunt verzenden met een paar regels code.
Daarom hebben we de modellen zelf getraind. Het bleek dat het trainen van een model een uitdaging in productdesign is, en dat is precies waar onze expertise ligt. We hebben modellen en lokale inferentie ontworpen die cloudservices verslaan op snelheid, kwaliteit en kosten, en die beter presteren dan andere lokale en cloudmodellen, bij een fractie van hun omvang.
Resultaten in de praktijk
- Audioverbetering: We hebben Dolby vervangen door Clear voor betere en snellere audioverbetering.
- Transcripties: Met Voz zijn onze on-device transcripties 5x sneller geworden.
- Video-clipping: We hebben Claude Sonnet vervangen door Clips, ons model van 284MB. Dit model zet een video van 10 minuten in 5 seconden om in een dozijn clips. Dit is 10x sneller en verbruikt 470x minder energie dan Sonnet, met behoud van dezelfde kwaliteit.
Snelheid audioverbetering (Clear - 5 minuten audio):
- iPhone 16 Pro: 302x realtime
- MacBook Pro (M5): 345x realtime
(Gebaseerd op een model van 9MB dat een clip verbetert, mastert en opnieuw codeert).
Transcriptiesnelheid (30 minuten audio op M3 Ultra):
- Voz: 319x (bereikt 298x op een iPhone 17 Pro)
- Apple SpeechAnalyzer: 78x
- Whisper large-v3-turbo: 50x
Detail 6, dat zal worden gelanceerd met iOS 27, vervangt al onze cloud-API's door onze eigen modellen die volledig op het apparaat draaien.
De verschuiving van Cloud naar Device
De afgelopen jaren hebben we LLM's behandeld alsof ze slechts een andere API waren. In de hype rondom generalistische 'frontier brains' zijn we bijna vergeten dat zij niet de enige optie zijn. Veel ontwikkelaars hebben een verlanglijst aan on-device modellen die ze zouden bouwen als kosten geen rol speelden, of functies waar ze nu teveel tokens aan verbruiken.
Taken zoals het opschonen van een opname, het taggen van een foto, het extraheren van een datum uit een zin of het detecteren van een naam voordat de tekst naar de server gaat, hebben geen frontier model nodig. Onderzoekers van NVIDIA stelden vast dat 40% tot 70% van de aanroepen naar een groot model vervangen zou kunnen worden door een klein, gespecialiseerd model.
De rekenkracht is al aanwezig
Terwijl de industrie dit jaar ongeveer 450 miljard dollar uitgeeft aan datacenters, worden er wereldwijd meer dan een miljard telefoons, tablets en laptops verscheept met steeds krachtigere chips. Er is meer rekenkracht beschikbaar in de handen van mensen dan in alle AI-datacenters op aarde.
Gratis inferentie geeft ons een onfair voordeel. Er zijn geen kosten per aanroep, waardoor een functie bij elk bericht kan draaien in plaats van alleen bij de berichten die je je kunt veroorloven te controleren. Er is geen round-trip naar een server en de gegevens van de klant verlaten het apparaat niet.
Visie: Kleine hersenen in elk product
Om met lokale modellen te bouwen, moet de ontwikkelaarservaring aanzienlijk verbeteren. Er is behoefte aan commercieel bruikbare modellen die superieur zijn in snelheid en kwaliteit, eenvoudig te ontdekken zijn en met een paar regels code kunnen worden geïmplementeerd.
We zien de eerste honderd modellen als het cerebellum (het kleine brein). Dit deel regelt het constante werk – balans, timing, vaardigheden waar je niet over nadenkt – zodat de rest van het brein vrij is om te denken. Dat is wat we eerst bouwen: snelle, gespecialiseerde modellen voor werk dat de hele dag door gratis op het apparaat draait.
Daarna volgt de cortex, de laag die beslist welk model antwoordt: eerst een klein lokaal model, een groter model wanneer de taak daarom vraagt, en de cloud alleen wanneer het werk het apparaat moet verlaten. Naarmate open onderzoek vordert en hardware krachtiger wordt, groeien de lokale modellen mee.
In tegenstelling tot cloud-labs, die neutrale modellen leveren vanwege de prijsstelling per token, levert elk Desert Ant-model een door ons gekozen standaardinstelling, met de knoppen om die aan te passen. We optimaliseren het model en de runtime samen: op een iPhone draaien Clear en Voz op de Neural Engine, en in de browser draaien dezelfde weights van Clear via WebAssembly.
De SDK
Je kunt Desert Ant-modellen implementeren in je app via onze native Swift, Kotlin en JavaScript SDK, beschikbaar op GitHub. Onze documentatie is geschreven voor ontwikkelaars en agents. Je kunt de modellen uitproberen op je Mac via de CLI, of in je browser op Hugging Face.