shoehorn — maak elk taalmodel geschikt voor jouw machine

Vooraf ingestelde kwantisaties negeren je hardware: als je er een kiest die past, verspil je ofwel honderden megabytes aan kwaliteitsruimte, of ontdek je bij het laden dat het model toch niet paste. shoehorn vertrekt vanuit het geheugen dat je daadwerkelijk tot je beschikking hebt, trekt daarvan af wat de inferentie zelf nodig heeft, en lost een mixed-precision toewijzing per tensor op die tot op een afrondingsfout binnen het restant valt. Hierdoor wordt routinematig 99,99% van het budget benut, soms tot op de byte nauwkeurig.

$ shoehorn fit unsloth/Qwen3-4B-GGUF --serve
weights: 519.2 MiB of 519.2 MiB budget (99.998% used, 13 KB slack)

Welke modellen passen op jouw machine?

Door je hardware te selecteren, scant deze pagina de meest gedownloade modellen van Hugging Face om te bepalen welke modellen shoehorn binnen jouw budget kan passen — gerangschikt op de kwaliteit die jouw geheugen toelaat. Dit proces draait volledig in je browser.

Jouw machine

  • Mac — 8 GB
  • Mac — 16 GB
  • Mac — 24 GB
  • Mac — 32 GB
  • Mac — 48 GB
  • Mac — 64 GB
  • Mac — 96 GB
  • Mac — 128 GB
  • GPU — 8 GB VRAM
  • GPU — 12 GB VRAM
  • GPU — 16 GB VRAM
  • GPU — 24 GB VRAM
  • GPU — 32 GB VRAM
  • Custom…

Conversatieruimte

  • 4k tokens — korte chats
  • 8k tokens — dagelijks gebruik
  • 16k tokens — lange documenten
  • 32k tokens — een hele novelle

Installatie

shoehorn heeft llama.cpp nodig op je PATH als inferentie-backend (de installatie via Homebrew regelt dit automatisch voor je). Daarna opent shoehorn ui de lokale app — kies een model, druk op één knop en begin met chatten.

brew install notactuallytreyanastasio/shoehorn/shoehorn

Alternatieve installatiemogelijkheden:

  • macOS (Apple Silicon)
  • Linux (x86-64 · NVIDIA of AMD)
  • Windows (x86-64 · NVIDIA)

Of vanuit de broncode: cargo install --path . (na het klonen van de repository).

De applicatie

Eén knop, je volledige budget

De lokale web-app meet je machine, streamt de passing, visualiseert het budget als een rolmaat, geeft een perplexity-cijfer weer voor de kosten van de passing, en eindigt met een Chat-knop.

De software is gelicenseerd onder MIT. De quantizer is vanaf nul geïmplementeerd in Rust — er is geen llama.cpp-code gekoppeld — en de output is standaard GGUF v3, wat kan worden geladen door alles wat downstream van llama.cpp werkt.