Deltafin is een experimenteel project dat het massieve Kimi K3 Mixture of Experts (MoE) model, met 2,8 biljoen parameters, draaiend krijgt op consumentenhardware, specifiek een MacBook Pro M5 Max met 128 GB RAM.
De belangrijkste kenmerken zijn:
- SSD-streaming: Omdat het model (1,45 TB aan gewichten) niet in het RAM past, worden experts vanaf SSD's gestreamd. De snelheid schaalt mee met het aantal gebruikte schijven.
- Onversneden kwaliteit: In tegenstelling tot andere projecten die modellen 'prunen' of kwantiseren naar 3-bit, behoudt Deltafin de volledige precisie van de originele gewichten.
- Technische implementatie: Het project is geschreven in Rust als een native binary. Het ondersteunt zowel een CLI-interface als een OpenAI-compatibele server.
- Prestaties: Hoewel de prefill-vertraging aanzienlijk is (ongeveer 6,3 minuten voor 512 tokens), is het project een bewijs van wat mogelijk is op moderne Apple Silicon hardware.
ARGODRIVE Deltafin: Kimi K3 (2.8T MoE) via SSD-streaming op Apple Silicon
Prestaties en Benchmarks
De volgende metingen zijn uitgevoerd op 8 september 2026 met de configuratie van deze fork (k3-public-bench/env.sh). Elk getal is gebaseerd op één 'cold run' met exact dezelfde prompt. De volledige logs zijn beschikbaar in k3-public-bench/results/.
| Test | Drafter uit | Drafter aan |
| Constante decode, 512 gegenereerde tokens | 0,9232 tok/s | 1,0015 tok/s |
| Constante decode, 128 gegenereerde tokens | 0,9261 tok/s | 1,1252 tok/s |
| 17-token prompt (mediaan van 3 runs) | — | 0,9631 tok/s |
| Tijd tot eerste token, 512-token prompt | ≈ 376 s | ≈ 375 s |
Belangrijke bevindingen
- Schaalbaarheid van schijven: De snelheid bij het gebruik van verschillende aantallen schijven volgt een ladder: één schijf haalt ongeveer 52% van de snelheid van vier schijven, twee spiegels halen ongeveer 73%, en drie schijven halen ongeveer 90%. De traagste van de 16 leesacties per laag bepaalt het tempo, niet de totale bandbreedte.
- Prefill-vertraging: Een prompt van 512 tokens duurt ongeveer 6,3 minuten voordat het eerste token wordt gegenereerd. De oorzaak is dat prefill de experts van elke laag acht keer opnieuw leest; een oplossing hiervoor is gepland maar nog niet geïmplementeerd.
Projectdoelstelling en Filosofie
Deltafin is een enkele native binary die de volledige Kimi K3 draait. Er is niets gesnoeid (pruned) en niets overgeslagen. K3 bepaalt elk token. Alle 16 experts worden voor elk token gebruikt; er zijn geen shortcuts.
De kwaliteitsregel is simpel: K3 zelf beslist over elk token. Kleine 'draft'-modellen mogen vooruit gissen om de snelheid te verhogen, maar K3 controleert elke gok. Niets bereikt de gebruiker zonder de officiële goedkeuring van K3.
Missie
Het doel is om pure, onversneden K3-kwaliteit te leveren, zo snel als mogelijk. Snelheid mag nooit ten koste gaan van de modelkwaliteit. Deltafin behoudt alle 16 gerouteerde experts en hanteert de volledige K3-doelstelling als de enige autoriteit voor elk token.
Waarom dit project?
Deltafin is geen productpitch, maar een experiment in hoe ver consumentenhardware kan worden gepusht. Kimi K3 is ontworpen voor infrastructuur met 16 nodes en ongeveer 4,8 TB aan geaggregeerd VRAM. Het draaien van de volledige 2,8 biljoen parameters en het contextvenster van 1 miljoen tokens op een thuisopstelling is een extreme uitdaging.
Terwijl andere projecten K3 sneller laten draaien door de expert-bank te hercoderen naar ongeveer 3 bits (wat resulteert in een model dat "dicht genoeg" bij het origineel ligt), kiest Deltafin voor de andere route: elke byte van elke expert exact zoals uitgebracht door Moonshot, zo snel als de natuurkunde toelaat.
Installatie
Deltafin installeert vrijwel alles wat nodig is.
1. De software downloaden en bouwen
# Clone de repository
git clone https://github.com/gavamedia/deltafin.git
cd deltafin
# Bouw het project
cargo build --locked --release
2. Het model installeren
Je hebt twee opties voor de installatie van het K3-model:
Optie A: Volledige installatie (snelst, vereist veel schijfruimte) Download het volledige K3-model van 1,7 TB naar je schijf:
./target/release/deltafin setup --full
Optie B: Streaming installatie (bespaart ruimte, langzamer bij start) Stream K3 terwijl je het gebruikt. Dit vereist in eerste instantie slechts 215 GB. Experts worden on-demand opgehaald en in cache opgeslagen:
./target/release/deltafin setup --stream
3. Optionele componenten (DSpark en Qwen)
De standaardinstallatie bevat Inferact's Kimi-K3-DSpark (6,635 GiB op schijf). Deltafin vermijdt een redundante kopie van de embedding van K3.
Voor snellere raw text continuation kan Qwen worden toegevoegd:
./target/release/deltafin setup-qwen
Qwen versnelt alleen de ruwe voltooiing door te gissen wat er volgt, waarna K3 dit controleert. Dit is vooral nuttig voor code-autocomplete en /v1/completions verkeer.
Upgraden
Om Deltafin bij te werken, voer je uit vanuit de Deltafin-map:
./target/release/deltafin upgrade
Deze actie downloadt de benodigde updates en bouwt de binary opnieuw. Modellen, geconverteerde gewichten en caches blijven behouden.
Let op bij overstap van de oude Python-versie: Controleer eerst of er geen onbehandelde wijzigingen zijn:
git status --short
# Ga alleen verder als dit niets teruggeeft
git pull --ff-only
cargo build --locked --release
./target/release/deltafin upgrade
Gebruik
Via de opdrachtregel (CLI)
Chat-modus: Gebruikt het geauditeerde chat-template van K3 en stopt bij de end-marker van het model.
./target/release/deltafin run --chat \
--prompt "Wat zijn de drie grootste manen van Saturnus?"
Ruwe voltooiing (Raw continuation): Omdat ruwe tekst geen chat-boundary heeft, moet de output worden begrensd.
./target/release/deltafin run \
--prompt "De hoofdstad van Frankrijk is" --max-new 17
Met statistieken: Voeg doorvoer- en transactiestatistieken toe.
./target/release/deltafin run \
--prompt "De grootste planeet in ons zonnestelsel is" --max-new 17 --stats
Via een OpenAI-compatibele server
Start de server:
./target/release/deltafin serve --host 127.0.0.1 --port 8000
Voorbeeld van een aanvraag via curl:
curl http://127.0.0.1:8000/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{"model":"deltafin-kimi-k3","stream":true,"messages":[{"role":"user","content":"Hallo!"}]}'
De server implementeert /v1/chat/completions, /v1/completions en /v1/models. De standaardlimiet voor responsen is één miljoen tokens.
Documentatieoverzicht
- Native Runtime: Uitleg over het one-binary in-process design (Rust core, C-ABI providers, router tracing).
- Server Referentie: Details over geaccepteerde API-velden en chat-versnellingen.
- Health Checks: Read-only auditors om de runtime en componenten te verifiëren.
- Storage Preparation: Informatie over de row-int8 resident spine, BF16 selectie en DFSP-bestanden.
- Performance Reference: Hoe metingen te reproduceren met de benchmark harness.
- Configuratie: Overzicht van relevante flags en omgevingsvariabelen.
- Ondersteunde Platforms: Status van MPS/Metal, CUDA en native CPU.
Credits
Deltafin is mogelijk gemaakt door het werk van anderen:
- Moonshot AI: Voor het vrijgeven van de K3-gewichten, architectuur en model-semantiek.
- Inferact: Voor het K3-specifieke DSpark checkpoint.
- Marcel Rød (GigaToken): Inspiratie voor het parallelle tokenisatiepad.
- Maurice Brown (trumb): Bijdragen aan Linux, aarch64, x86 SIMD en NVIDIA-bevindingen.
- colibri & ds4 / DwarfStar: Voor concepten rond MoE-streaming, router-lookahead en cache-ownership.
- Qwen: Voor de optionele 0.6B/1.7B proposal-modellen.
- Community: Essentiële semantiek van flash-linear-attention, PyTorch, llama.cpp/ggml en tiktoken.
Licentie
De code van het Deltafin-project is gelicentieerd onder MIT. De Kimi K3-gewichten, het DSpark-checkpoint, optionele Qwen-checkpoints en overig materiaal van derden behouden hun eigen oorspronkelijke licentievoorwaarden. Deltafin is een onafhankelijk project zonder affiliatie met Moonshot AI.
ARGODRIVE Deltafin: Kimi K3 (2.8T MoE) via SSD-streaming op Apple Silicon
Prestaties en Benchmarks
De volgende metingen zijn uitgevoerd op 8 september 2026 met de configuratie van deze fork (k3-public-bench/env.sh). Elk getal is gebaseerd op één 'cold run' met exact dezelfde prompt. De volledige logs zijn beschikbaar in k3-public-bench/results/.
| Test | Drafter uit | Drafter aan |
| Constante decode, 512 gegenereerde tokens | 0,9232 tok/s | 1,0015 tok/s |
| Constante decode, 128 gegenereerde tokens | 0,9261 tok/s | 1,1252 tok/s |
| 17-token prompt (mediaan van 3 runs) | — | 0,9631 tok/s |
| Tijd tot eerste token, 512-token prompt | ≈ 376 s | ≈ 375 s |
Belangrijke bevindingen
- Schaalbaarheid van schijven: De snelheid bij het gebruik van verschillende aantallen schijven volgt een ladder: één schijf haalt ongeveer 52% van de snelheid van vier schijven, twee spiegels halen ongeveer 73%, en drie schijven halen ongeveer 90%. De traagste van de 16 leesacties per laag bepaalt het tempo, niet de totale bandbreedte.
- Prefill-vertraging: Een prompt van 512 tokens duurt ongeveer 6,3 minuten voordat het eerste token wordt gegenereerd. De oorzaak is dat prefill de experts van elke laag acht keer opnieuw leest; een oplossing hiervoor is gepland maar nog niet geïmplementeerd.
Projectdoelstelling en Filosofie
Deltafin is een enkele native binary die de volledige Kimi K3 draait. Er is niets gesnoeid (pruned) en niets overgeslagen. K3 bepaalt elk token. Alle 16 experts worden voor elk token gebruikt; er zijn geen shortcuts.
De kwaliteitsregel is simpel: K3 zelf beslist over elk token. Kleine 'draft'-modellen mogen vooruit gissen om de snelheid te verhogen, maar K3 controleert elke gok. Niets bereikt de gebruiker zonder de officiële goedkeuring van K3.
Missie
Het doel is om pure, onversneden K3-kwaliteit te leveren, zo snel als mogelijk. Snelheid mag nooit ten koste gaan van de modelkwaliteit. Deltafin behoudt alle 16 gerouteerde experts en hanteert de volledige K3-doelstelling als de enige autoriteit voor elk token.
Waarom dit project?
Deltafin is geen productpitch, maar een experiment in hoe ver consumentenhardware kan worden gepusht. Kimi K3 is ontworpen voor infrastructuur met 16 nodes en ongeveer 4,8 TB aan geaggregeerd VRAM. Het draaien van de volledige 2,8 biljoen parameters en het contextvenster van 1 miljoen tokens op een thuisopstelling is een extreme uitdaging.
Terwijl andere projecten K3 sneller laten draaien door de expert-bank te hercoderen naar ongeveer 3 bits (wat resulteert in een model dat "dicht genoeg" bij het origineel ligt), kiest Deltafin voor de andere route: elke byte van elke expert exact zoals uitgebracht door Moonshot, zo snel als de natuurkunde toelaat.
Installatie
Deltafin installeert vrijwel alles wat nodig is.
1. De software downloaden en bouwen
# Clone de repository
git clone https://github.com/gavamedia/deltafin.git
cd deltafin
# Bouw het project
cargo build --locked --release
2. Het model installeren
Je hebt twee opties voor de installatie van het K3-model:
Optie A: Volledige installatie (snelst, vereist veel schijfruimte) Download het volledige K3-model van 1,7 TB naar je schijf:
./target/release/deltafin setup --full
Optie B: Streaming installatie (bespaart ruimte, langzamer bij start) Stream K3 terwijl je het gebruikt. Dit vereist in eerste instantie slechts 215 GB. Experts worden on-demand opgehaald en in cache opgeslagen:
./target/release/deltafin setup --stream
3. Optionele componenten (DSpark en Qwen)
De standaardinstallatie bevat Inferact's Kimi-K3-DSpark (6,635 GiB op schijf). Deltafin vermijdt een redundante kopie van de embedding van K3.
Voor snellere raw text continuation kan Qwen worden toegevoegd:
./target/release/deltafin setup-qwen
Qwen versnelt alleen de ruwe voltooiing door te gissen wat er volgt, waarna K3 dit controleert. Dit is vooral nuttig voor code-autocomplete en /v1/completions verkeer.
Upgraden
Om Deltafin bij te werken, voer je uit vanuit de Deltafin-map:
./target/release/deltafin upgrade
Deze actie downloadt de benodigde updates en bouwt de binary opnieuw. Modellen, geconverteerde gewichten en caches blijven behouden.
Let op bij overstap van de oude Python-versie: Controleer eerst of er geen onbehandelde wijzigingen zijn:
git status --short
# Ga alleen verder als dit niets teruggeeft
git pull --ff-only
cargo build --locked --release
./target/release/deltafin upgrade
Gebruik
Via de opdrachtregel (CLI)
Chat-modus: Gebruikt het geauditeerde chat-template van K3 en stopt bij de end-marker van het model.
./target/release/deltafin run --chat \
--prompt "Wat zijn de drie grootste manen van Saturnus?"
Ruwe voltooiing (Raw continuation): Omdat ruwe tekst geen chat-boundary heeft, moet de output worden begrensd.
./target/release/deltafin run \
--prompt "De hoofdstad van Frankrijk is" --max-new 17
Met statistieken: Voeg doorvoer- en transactiestatistieken toe.
./target/release/deltafin run \
--prompt "De grootste planeet in ons zonnestelsel is" --max-new 17 --stats
Via een OpenAI-compatibele server
Start de server:
./target/release/deltafin serve --host 127.0.0.1 --port 8000
Voorbeeld van een aanvraag via curl:
curl http://127.0.0.1:8000/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{"model":"deltafin-kimi-k3","stream":true,"messages":[{"role":"user","content":"Hallo!"}]}'
De server implementeert /v1/chat/completions, /v1/completions en /v1/models. De standaardlimiet voor responsen is één miljoen tokens.
Documentatieoverzicht
- Native Runtime: Uitleg over het one-binary in-process design (Rust core, C-ABI providers, router tracing).
- Server Referentie: Details over geaccepteerde API-velden en chat-versnellingen.
- Health Checks: Read-only auditors om de runtime en componenten te verifiëren.
- Storage Preparation: Informatie over de row-int8 resident spine, BF16 selectie en DFSP-bestanden.
- Performance Reference: Hoe metingen te reproduceren met de benchmark harness.
- Configuratie: Overzicht van relevante flags en omgevingsvariabelen.
- Ondersteunde Platforms: Status van MPS/Metal, CUDA en native CPU.
Credits
Deltafin is mogelijk gemaakt door het werk van anderen:
- Moonshot AI: Voor het vrijgeven van de K3-gewichten, architectuur en model-semantiek.
- Inferact: Voor het K3-specifieke DSpark checkpoint.
- Marcel Rød (GigaToken): Inspiratie voor het parallelle tokenisatiepad.
- Maurice Brown (trumb): Bijdragen aan Linux, aarch64, x86 SIMD en NVIDIA-bevindingen.
- colibri & ds4 / DwarfStar: Voor concepten rond MoE-streaming, router-lookahead en cache-ownership.
- Qwen: Voor de optionele 0.6B/1.7B proposal-modellen.
- Community: Essentiële semantiek van flash-linear-attention, PyTorch, llama.cpp/ggml en tiktoken.
Licentie
De code van het Deltafin-project is gelicentieerd onder MIT. De Kimi K3-gewichten, het DSpark-checkpoint, optionele Qwen-checkpoints en overig materiaal van derden behouden hun eigen oorspronkelijke licentievoorwaarden. Deltafin is een onafhankelijk project zonder affiliatie met Moonshot AI.