ARGODRIVE Deltafin: Kimi K3 (2.8T MoE) via SSD-streaming op Apple Silicon

Prestaties en Benchmarks

De volgende metingen zijn uitgevoerd op 8 september 2026 met de configuratie van deze fork (k3-public-bench/env.sh). Elk getal is gebaseerd op één 'cold run' met exact dezelfde prompt. De volledige logs zijn beschikbaar in k3-public-bench/results/.

TestDrafter uitDrafter aan
Constante decode, 512 gegenereerde tokens0,9232 tok/s1,0015 tok/s
Constante decode, 128 gegenereerde tokens0,9261 tok/s1,1252 tok/s
17-token prompt (mediaan van 3 runs)0,9631 tok/s
Tijd tot eerste token, 512-token prompt≈ 376 s≈ 375 s

Belangrijke bevindingen

  • Schaalbaarheid van schijven: De snelheid bij het gebruik van verschillende aantallen schijven volgt een ladder: één schijf haalt ongeveer 52% van de snelheid van vier schijven, twee spiegels halen ongeveer 73%, en drie schijven halen ongeveer 90%. De traagste van de 16 leesacties per laag bepaalt het tempo, niet de totale bandbreedte.
  • Prefill-vertraging: Een prompt van 512 tokens duurt ongeveer 6,3 minuten voordat het eerste token wordt gegenereerd. De oorzaak is dat prefill de experts van elke laag acht keer opnieuw leest; een oplossing hiervoor is gepland maar nog niet geïmplementeerd.

Projectdoelstelling en Filosofie

Deltafin is een enkele native binary die de volledige Kimi K3 draait. Er is niets gesnoeid (pruned) en niets overgeslagen. K3 bepaalt elk token. Alle 16 experts worden voor elk token gebruikt; er zijn geen shortcuts.

De kwaliteitsregel is simpel: K3 zelf beslist over elk token. Kleine 'draft'-modellen mogen vooruit gissen om de snelheid te verhogen, maar K3 controleert elke gok. Niets bereikt de gebruiker zonder de officiële goedkeuring van K3.

Missie

Het doel is om pure, onversneden K3-kwaliteit te leveren, zo snel als mogelijk. Snelheid mag nooit ten koste gaan van de modelkwaliteit. Deltafin behoudt alle 16 gerouteerde experts en hanteert de volledige K3-doelstelling als de enige autoriteit voor elk token.

Waarom dit project?

Deltafin is geen productpitch, maar een experiment in hoe ver consumentenhardware kan worden gepusht. Kimi K3 is ontworpen voor infrastructuur met 16 nodes en ongeveer 4,8 TB aan geaggregeerd VRAM. Het draaien van de volledige 2,8 biljoen parameters en het contextvenster van 1 miljoen tokens op een thuisopstelling is een extreme uitdaging.

Terwijl andere projecten K3 sneller laten draaien door de expert-bank te hercoderen naar ongeveer 3 bits (wat resulteert in een model dat "dicht genoeg" bij het origineel ligt), kiest Deltafin voor de andere route: elke byte van elke expert exact zoals uitgebracht door Moonshot, zo snel als de natuurkunde toelaat.

Installatie

Deltafin installeert vrijwel alles wat nodig is.

1. De software downloaden en bouwen

# Clone de repository
git clone https://github.com/gavamedia/deltafin.git
cd deltafin

# Bouw het project
cargo build --locked --release

2. Het model installeren

Je hebt twee opties voor de installatie van het K3-model:

Optie A: Volledige installatie (snelst, vereist veel schijfruimte) Download het volledige K3-model van 1,7 TB naar je schijf:

./target/release/deltafin setup --full

Optie B: Streaming installatie (bespaart ruimte, langzamer bij start) Stream K3 terwijl je het gebruikt. Dit vereist in eerste instantie slechts 215 GB. Experts worden on-demand opgehaald en in cache opgeslagen:

./target/release/deltafin setup --stream

3. Optionele componenten (DSpark en Qwen)

De standaardinstallatie bevat Inferact's Kimi-K3-DSpark (6,635 GiB op schijf). Deltafin vermijdt een redundante kopie van de embedding van K3.

Voor snellere raw text continuation kan Qwen worden toegevoegd:

./target/release/deltafin setup-qwen

Qwen versnelt alleen de ruwe voltooiing door te gissen wat er volgt, waarna K3 dit controleert. Dit is vooral nuttig voor code-autocomplete en /v1/completions verkeer.

Upgraden

Om Deltafin bij te werken, voer je uit vanuit de Deltafin-map:

./target/release/deltafin upgrade

Deze actie downloadt de benodigde updates en bouwt de binary opnieuw. Modellen, geconverteerde gewichten en caches blijven behouden.

Let op bij overstap van de oude Python-versie: Controleer eerst of er geen onbehandelde wijzigingen zijn:

git status --short
# Ga alleen verder als dit niets teruggeeft
git pull --ff-only
cargo build --locked --release
./target/release/deltafin upgrade

Gebruik

Via de opdrachtregel (CLI)

Chat-modus: Gebruikt het geauditeerde chat-template van K3 en stopt bij de end-marker van het model.

./target/release/deltafin run --chat \
--prompt "Wat zijn de drie grootste manen van Saturnus?"

Ruwe voltooiing (Raw continuation): Omdat ruwe tekst geen chat-boundary heeft, moet de output worden begrensd.

./target/release/deltafin run \
--prompt "De hoofdstad van Frankrijk is" --max-new 17

Met statistieken: Voeg doorvoer- en transactiestatistieken toe.

./target/release/deltafin run \
--prompt "De grootste planeet in ons zonnestelsel is" --max-new 17 --stats

Via een OpenAI-compatibele server

Start de server:

./target/release/deltafin serve --host 127.0.0.1 --port 8000

Voorbeeld van een aanvraag via curl:

curl http://127.0.0.1:8000/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{"model":"deltafin-kimi-k3","stream":true,"messages":[{"role":"user","content":"Hallo!"}]}'

De server implementeert /v1/chat/completions, /v1/completions en /v1/models. De standaardlimiet voor responsen is één miljoen tokens.

Documentatieoverzicht

  • Native Runtime: Uitleg over het one-binary in-process design (Rust core, C-ABI providers, router tracing).
  • Server Referentie: Details over geaccepteerde API-velden en chat-versnellingen.
  • Health Checks: Read-only auditors om de runtime en componenten te verifiëren.
  • Storage Preparation: Informatie over de row-int8 resident spine, BF16 selectie en DFSP-bestanden.
  • Performance Reference: Hoe metingen te reproduceren met de benchmark harness.
  • Configuratie: Overzicht van relevante flags en omgevingsvariabelen.
  • Ondersteunde Platforms: Status van MPS/Metal, CUDA en native CPU.

Credits

Deltafin is mogelijk gemaakt door het werk van anderen:

  • Moonshot AI: Voor het vrijgeven van de K3-gewichten, architectuur en model-semantiek.
  • Inferact: Voor het K3-specifieke DSpark checkpoint.
  • Marcel Rød (GigaToken): Inspiratie voor het parallelle tokenisatiepad.
  • Maurice Brown (trumb): Bijdragen aan Linux, aarch64, x86 SIMD en NVIDIA-bevindingen.
  • colibri & ds4 / DwarfStar: Voor concepten rond MoE-streaming, router-lookahead en cache-ownership.
  • Qwen: Voor de optionele 0.6B/1.7B proposal-modellen.
  • Community: Essentiële semantiek van flash-linear-attention, PyTorch, llama.cpp/ggml en tiktoken.

Licentie

De code van het Deltafin-project is gelicentieerd onder MIT. De Kimi K3-gewichten, het DSpark-checkpoint, optionele Qwen-checkpoints en overig materiaal van derden behouden hun eigen oorspronkelijke licentievoorwaarden. Deltafin is een onafhankelijk project zonder affiliatie met Moonshot AI.