DeepSeek introduceert DeepSeek-V4.1-Flash

Architectuur en intelligentie

Het model maakt gebruik van een asymmetrische architectuur om meer intelligentie te leveren tegen lagere kosten.

  • MoE-structuur: Een Mixture of Experts (MoE) met 552 miljard parameters.
  • Causal Encoder–Decoder: Een nieuwe architectuur waarbij slechts 8 miljard actieve parameters worden gebruikt voor input en 16 miljard actieve parameters voor output.
  • Training: Nieuwe pre-training methoden in combinatie met grootschalige RL (Reinforcement Learning) post-training zorgen voor benchmarkresultaten die voorop lopen.

Efficiëntie en KV-cache

V4.1-Flash realiseert aanzienlijke besparingen door een kleinere KV-cache. Vergeleken met de vorige generatie heeft de KV-cache van V4.1-Flash slechts nodig:

  • 1/4 van het HBM (High Bandwidth Memory).
  • 1/8 van de SSD-opslag.

Aangezien cache-hit kosten vaak een groot deel van de agent-kosten uitmaken, verlaagt deze compressie van de cache de kosten aanzienlijk.

API en beschikbaarheid

DeepSeek-V4.1-Flash is nu live op de DeepSeek API met native multimodale ondersteuning. Gebruikers kunnen het model instellen op deepseek-flash.

Wat betreft compatibiliteit geldt het volgende:

  • V4-Flash en V4-Flash-Vision-Exp zijn stopgezet.
  • Voor de compatibiliteit worden verzoeken naar deepseek-v4-flash en deepseek-v4-flash-vision-exp tijdelijk omgeleid naar V4.1-Flash.

Kosten en prijzen

Door de efficiëntere architectuur kan DeepSeek meer gebruikers bedienen tegen lagere kosten, wat wordt doorgegeven aan de klant in de vorm van lagere API-prijzen.

Om de vraag te balanceren, blijft er een onderscheid tussen piek- en daluren:

  • Tarieven tijdens daluren bedragen 50% van de tarieven tijdens piekuren.
  • Flexibele werklasten kunnen tijdens daluren worden ingepland om kosten te besparen.

Open source en implementatie

DeepSeek werkt nauw samen met de open-source community voor de ondersteuning van de inferentie van V4.1-Flash en onderzoekt verdere implementatie-opties. Het model is beschikbaar via Hugging Face onder deepseek-ai/DeepSeek-V4.1-Flash.

Voor grootschalige implementaties (met 2.000 GPU's en een storagecluster) staat DeepSeek open voor overleg.

***

Aanvullende informatie Er wordt opgemerkt dat DeepSeek-V4.1 toegankelijker is dankzij de 196B engram.