Shoehorn is een tool die taalmodellen (LLM's) optimaliseert om maximaal gebruik te maken van het beschikbare systeemgeheugen of VRAM. In plaats van standaard kwantisaties te gebruiken, berekent shoehorn een mixed-precision toewijzing per tensor, waardoor bijna 100% van het geheugenbudget wordt benut zonder dat het model te groot wordt voor de hardware.
Belangrijke kenmerken van de tool zijn:
- Modelselectie: Een browser-gebaseerde scanner die modellen van Hugging Face filtert op basis van de hardwareprofielen van de gebruiker.
- Installatie: Ondersteuning voor macOS (via Homebrew), Linux en Windows, of installatie via Rust-broncode.
- Interface: Een lokale web-app (
shoehorn ui) die het budget visualiseert als een rolmaat en direct chatten mogelijk maakt.
- Techniek: De quantizer is volledig in Rust geschreven, produceert GGUF v3-output en maakt gebruik van
llama.cpp als inferentie-backend.
shoehorn — maak elk taalmodel geschikt voor jouw machine
Vooraf ingestelde kwantisaties negeren je hardware: als je er een kiest die past, verspil je ofwel honderden megabytes aan kwaliteitsruimte, of ontdek je bij het laden dat het model toch niet paste. shoehorn vertrekt vanuit het geheugen dat je daadwerkelijk tot je beschikking hebt, trekt daarvan af wat de inferentie zelf nodig heeft, en lost een mixed-precision toewijzing per tensor op die tot op een afrondingsfout binnen het restant valt. Hierdoor wordt routinematig 99,99% van het budget benut, soms tot op de byte nauwkeurig.
$ shoehorn fit unsloth/Qwen3-4B-GGUF --serve
weights: 519.2 MiB of 519.2 MiB budget (99.998% used, 13 KB slack)
Welke modellen passen op jouw machine?
Door je hardware te selecteren, scant deze pagina de meest gedownloade modellen van Hugging Face om te bepalen welke modellen shoehorn binnen jouw budget kan passen — gerangschikt op de kwaliteit die jouw geheugen toelaat. Dit proces draait volledig in je browser.
Jouw machine
- Mac — 8 GB
- Mac — 16 GB
- Mac — 24 GB
- Mac — 32 GB
- Mac — 48 GB
- Mac — 64 GB
- Mac — 96 GB
- Mac — 128 GB
- GPU — 8 GB VRAM
- GPU — 12 GB VRAM
- GPU — 16 GB VRAM
- GPU — 24 GB VRAM
- GPU — 32 GB VRAM
- Custom…
Conversatieruimte
- 4k tokens — korte chats
- 8k tokens — dagelijks gebruik
- 16k tokens — lange documenten
- 32k tokens — een hele novelle
Installatie
shoehorn heeft llama.cpp nodig op je PATH als inferentie-backend (de installatie via Homebrew regelt dit automatisch voor je). Daarna opent shoehorn ui de lokale app — kies een model, druk op één knop en begin met chatten.
brew install notactuallytreyanastasio/shoehorn/shoehorn
Alternatieve installatiemogelijkheden:
- macOS (Apple Silicon)
- Linux (x86-64 · NVIDIA of AMD)
- Windows (x86-64 · NVIDIA)
Of vanuit de broncode: cargo install --path . (na het klonen van de repository).
De applicatie
Eén knop, je volledige budget
De lokale web-app meet je machine, streamt de passing, visualiseert het budget als een rolmaat, geeft een perplexity-cijfer weer voor de kosten van de passing, en eindigt met een Chat-knop.
De software is gelicenseerd onder MIT. De quantizer is vanaf nul geïmplementeerd in Rust — er is geen llama.cpp-code gekoppeld — en de output is standaard GGUF v3, wat kan worden geladen door alles wat downstream van llama.cpp werkt.
shoehorn — maak elk taalmodel geschikt voor jouw machine
Vooraf ingestelde kwantisaties negeren je hardware: als je er een kiest die past, verspil je ofwel honderden megabytes aan kwaliteitsruimte, of ontdek je bij het laden dat het model toch niet paste. shoehorn vertrekt vanuit het geheugen dat je daadwerkelijk tot je beschikking hebt, trekt daarvan af wat de inferentie zelf nodig heeft, en lost een mixed-precision toewijzing per tensor op die tot op een afrondingsfout binnen het restant valt. Hierdoor wordt routinematig 99,99% van het budget benut, soms tot op de byte nauwkeurig.
$ shoehorn fit unsloth/Qwen3-4B-GGUF --serve
weights: 519.2 MiB of 519.2 MiB budget (99.998% used, 13 KB slack)
Welke modellen passen op jouw machine?
Door je hardware te selecteren, scant deze pagina de meest gedownloade modellen van Hugging Face om te bepalen welke modellen shoehorn binnen jouw budget kan passen — gerangschikt op de kwaliteit die jouw geheugen toelaat. Dit proces draait volledig in je browser.
Jouw machine
- Mac — 8 GB
- Mac — 16 GB
- Mac — 24 GB
- Mac — 32 GB
- Mac — 48 GB
- Mac — 64 GB
- Mac — 96 GB
- Mac — 128 GB
- GPU — 8 GB VRAM
- GPU — 12 GB VRAM
- GPU — 16 GB VRAM
- GPU — 24 GB VRAM
- GPU — 32 GB VRAM
- Custom…
Conversatieruimte
- 4k tokens — korte chats
- 8k tokens — dagelijks gebruik
- 16k tokens — lange documenten
- 32k tokens — een hele novelle
Installatie
shoehorn heeft llama.cpp nodig op je PATH als inferentie-backend (de installatie via Homebrew regelt dit automatisch voor je). Daarna opent shoehorn ui de lokale app — kies een model, druk op één knop en begin met chatten.
brew install notactuallytreyanastasio/shoehorn/shoehorn
Alternatieve installatiemogelijkheden:
- macOS (Apple Silicon)
- Linux (x86-64 · NVIDIA of AMD)
- Windows (x86-64 · NVIDIA)
Of vanuit de broncode: cargo install --path . (na het klonen van de repository).
De applicatie
Eén knop, je volledige budget
De lokale web-app meet je machine, streamt de passing, visualiseert het budget als een rolmaat, geeft een perplexity-cijfer weer voor de kosten van de passing, en eindigt met een Chat-knop.
De software is gelicenseerd onder MIT. De quantizer is vanaf nul geïmplementeerd in Rust — er is geen llama.cpp-code gekoppeld — en de output is standaard GGUF v3, wat kan worden geladen door alles wat downstream van llama.cpp werkt.