DeepSeek heeft DeepSeek-V4.1-Flash gelanceerd, een model dat is ontworpen voor hogere snelheid, doorvoer en efficiëntie.
De belangrijkste technische details zijn:
- Architectuur: Het model gebruikt een asymmetrische Mixture of Experts (MoE) met 552 miljard parameters, waarvan slechts 8 miljard actief zijn voor input en 16 miljard voor output.
- Optimalisatie: Door een aanzienlijk kleinere KV-cache (1/4 van het HBM en 1/8 van de SSD-opslag) worden de operationele kosten verlaagd.
- Beschikbaarheid: Het model is beschikbaar via de DeepSeek API (onder de naam
deepseek-flash) en op Hugging Face.
- Prijsstelling: De verhoogde efficiëntie resulteert in lagere API-prijzen, waarbij gebruikers extra kunnen besparen door werklasten in te plannen tijdens daluren.
DeepSeek introduceert DeepSeek-V4.1-Flash
Architectuur en intelligentie
Het model maakt gebruik van een asymmetrische architectuur om meer intelligentie te leveren tegen lagere kosten.
- MoE-structuur: Een Mixture of Experts (MoE) met 552 miljard parameters.
- Causal Encoder–Decoder: Een nieuwe architectuur waarbij slechts 8 miljard actieve parameters worden gebruikt voor input en 16 miljard actieve parameters voor output.
- Training: Nieuwe pre-training methoden in combinatie met grootschalige RL (Reinforcement Learning) post-training zorgen voor benchmarkresultaten die voorop lopen.
Efficiëntie en KV-cache
V4.1-Flash realiseert aanzienlijke besparingen door een kleinere KV-cache. Vergeleken met de vorige generatie heeft de KV-cache van V4.1-Flash slechts nodig:
- 1/4 van het HBM (High Bandwidth Memory).
- 1/8 van de SSD-opslag.
Aangezien cache-hit kosten vaak een groot deel van de agent-kosten uitmaken, verlaagt deze compressie van de cache de kosten aanzienlijk.
API en beschikbaarheid
DeepSeek-V4.1-Flash is nu live op de DeepSeek API met native multimodale ondersteuning. Gebruikers kunnen het model instellen op deepseek-flash.
Wat betreft compatibiliteit geldt het volgende:
- V4-Flash en V4-Flash-Vision-Exp zijn stopgezet.
- Voor de compatibiliteit worden verzoeken naar
deepseek-v4-flash en deepseek-v4-flash-vision-exp tijdelijk omgeleid naar V4.1-Flash.
Kosten en prijzen
Door de efficiëntere architectuur kan DeepSeek meer gebruikers bedienen tegen lagere kosten, wat wordt doorgegeven aan de klant in de vorm van lagere API-prijzen.
Om de vraag te balanceren, blijft er een onderscheid tussen piek- en daluren:
- Tarieven tijdens daluren bedragen 50% van de tarieven tijdens piekuren.
- Flexibele werklasten kunnen tijdens daluren worden ingepland om kosten te besparen.
Open source en implementatie
DeepSeek werkt nauw samen met de open-source community voor de ondersteuning van de inferentie van V4.1-Flash en onderzoekt verdere implementatie-opties. Het model is beschikbaar via Hugging Face onder deepseek-ai/DeepSeek-V4.1-Flash.
Voor grootschalige implementaties (met 2.000 GPU's en een storagecluster) staat DeepSeek open voor overleg.
***
Aanvullende informatie Er wordt opgemerkt dat DeepSeek-V4.1 toegankelijker is dankzij de 196B engram.
DeepSeek introduceert DeepSeek-V4.1-Flash
Architectuur en intelligentie
Het model maakt gebruik van een asymmetrische architectuur om meer intelligentie te leveren tegen lagere kosten.
- MoE-structuur: Een Mixture of Experts (MoE) met 552 miljard parameters.
- Causal Encoder–Decoder: Een nieuwe architectuur waarbij slechts 8 miljard actieve parameters worden gebruikt voor input en 16 miljard actieve parameters voor output.
- Training: Nieuwe pre-training methoden in combinatie met grootschalige RL (Reinforcement Learning) post-training zorgen voor benchmarkresultaten die voorop lopen.
Efficiëntie en KV-cache
V4.1-Flash realiseert aanzienlijke besparingen door een kleinere KV-cache. Vergeleken met de vorige generatie heeft de KV-cache van V4.1-Flash slechts nodig:
- 1/4 van het HBM (High Bandwidth Memory).
- 1/8 van de SSD-opslag.
Aangezien cache-hit kosten vaak een groot deel van de agent-kosten uitmaken, verlaagt deze compressie van de cache de kosten aanzienlijk.
API en beschikbaarheid
DeepSeek-V4.1-Flash is nu live op de DeepSeek API met native multimodale ondersteuning. Gebruikers kunnen het model instellen op deepseek-flash.
Wat betreft compatibiliteit geldt het volgende:
- V4-Flash en V4-Flash-Vision-Exp zijn stopgezet.
- Voor de compatibiliteit worden verzoeken naar
deepseek-v4-flash en deepseek-v4-flash-vision-exp tijdelijk omgeleid naar V4.1-Flash.
Kosten en prijzen
Door de efficiëntere architectuur kan DeepSeek meer gebruikers bedienen tegen lagere kosten, wat wordt doorgegeven aan de klant in de vorm van lagere API-prijzen.
Om de vraag te balanceren, blijft er een onderscheid tussen piek- en daluren:
- Tarieven tijdens daluren bedragen 50% van de tarieven tijdens piekuren.
- Flexibele werklasten kunnen tijdens daluren worden ingepland om kosten te besparen.
Open source en implementatie
DeepSeek werkt nauw samen met de open-source community voor de ondersteuning van de inferentie van V4.1-Flash en onderzoekt verdere implementatie-opties. Het model is beschikbaar via Hugging Face onder deepseek-ai/DeepSeek-V4.1-Flash.
Voor grootschalige implementaties (met 2.000 GPU's en een storagecluster) staat DeepSeek open voor overleg.
***
Aanvullende informatie Er wordt opgemerkt dat DeepSeek-V4.1 toegankelijker is dankzij de 196B engram.