llama.cpp is een open-source tool waarmee gebruikers geavanceerde AI-modellen volledig lokaal kunnen draaien, waardoor API-sleutels, telemetrie en externe limieten overbodig worden. De installatie kan eenvoudig via een curl-commando of diverse package managers.
Belangrijke kenmerken zijn:
- Integratie: Door
llama serve te gebruiken in combinatie met de pi-llama plugin, kan de tool gekoppeld worden aan lokale coding agents zoals Pi.
- Hardwareondersteuning: De software is breed geoptimaliseerd voor uiteenlopende hardware, waaronder Apple Silicon, NVIDIA RTX en Enterprise GPU's, AMD Radeon, Intel Arc, CPU's en Jetson.
- Beschikbare Modellen: Er wordt ondersteuning geboden voor diverse moderne modellen, zoals Qwen 3.6 (Alibaba), Gemma 4 en Gemma 3 (Google), en de open-weight GPT-OSS van OpenAI.
llama.cpp
Draai geavanceerde AI volledig op je eigen machine. Geen API-sleutels, geen telemetrie en geen limieten. Je bent zelf eigenaar van je modellen en gespreksgegevens.
Installatie
Je kunt llama.cpp installeren via de volgende opdracht:
curl -LsSf https://llama.app/install.sh | sh
Gebruik je liever Brew of Winget? Raadpleeg dan de package managers. Wil je het liever vanuit de broncode bouwen? Volg dan de instructies.
Koppel het aan een lokale coding agent
Voer llama serve uit, installeer de pi-llama plugin en start Pi. De applicatie zal automatisch je lokale model ontdekken. Er is geen configuratie of API-sleutel nodig. Bestanden blijven op je machine en verzoeken verlaten het systeem niet.
Stappenplan:
- Serve een model
llama serve
- Installeer de pi-llama plugin
pi install git:github.com/huggingface/pi-llama
- Start Pi (alles is nu ingesteld)
pi
Geoptimaliseerd voor elke hardware
Van je laptop tot een cluster, llama.cpp draait op alle beschikbare hardware. Het maakt gebruik van dezelfde binary, dezelfde modellen en dezelfde handmatig afgestemde kernels voor elke GPU en CPU.
Ondersteunde hardware onder andere:
- Apple Silicon (M Ultra, M Pro, M Max)
- NVIDIA RTX-serie (RTX 5090, 4090, 3090)
- NVIDIA Enterprise (H100, A100, T4)
- AMD Radeon RX & MI300
- Intel Arc
- CPU & Jetson
- DGX Spark
Draai je eerste model
Hieronder volgen enkele beschikbare modellen:
Qwen 3.6 De volgende generatie native multimodale redeneermodellen van Alibaba. Beschikbaar in Dense- en MoE-varianten die, op het gebied van coderen en visuele taken, kunnen wedijveren met modellen die vele malen groter zijn.
Gemma 4 De meest capabele open modellen van Google, gebouwd op Gemini 3-technologie. Ondersteunt multimodale redenering, agentische workflows en meer dan 140 talen.
GPT-OSS De eerste open-weight modellen van OpenAI sinds GPT-2. Gebouwd voor redenering, agentische taken en gebruik door ontwikkelaars, inclusief functies voor function calling en toolgebruik.
Gemma 3 Multimodale modellen van Google gebouwd op Gemini-technologie. Ondersteunt meer dan 140 talen, visuele taken en teksttaken met een contextvenster tot 128K voor implementatie van edge tot cloud.
llama.cpp
Draai geavanceerde AI volledig op je eigen machine. Geen API-sleutels, geen telemetrie en geen limieten. Je bent zelf eigenaar van je modellen en gespreksgegevens.
Installatie
Je kunt llama.cpp installeren via de volgende opdracht:
curl -LsSf https://llama.app/install.sh | sh
Gebruik je liever Brew of Winget? Raadpleeg dan de package managers. Wil je het liever vanuit de broncode bouwen? Volg dan de instructies.
Koppel het aan een lokale coding agent
Voer llama serve uit, installeer de pi-llama plugin en start Pi. De applicatie zal automatisch je lokale model ontdekken. Er is geen configuratie of API-sleutel nodig. Bestanden blijven op je machine en verzoeken verlaten het systeem niet.
Stappenplan:
- Serve een model
llama serve
- Installeer de pi-llama plugin
pi install git:github.com/huggingface/pi-llama
- Start Pi (alles is nu ingesteld)
pi
Geoptimaliseerd voor elke hardware
Van je laptop tot een cluster, llama.cpp draait op alle beschikbare hardware. Het maakt gebruik van dezelfde binary, dezelfde modellen en dezelfde handmatig afgestemde kernels voor elke GPU en CPU.
Ondersteunde hardware onder andere:
- Apple Silicon (M Ultra, M Pro, M Max)
- NVIDIA RTX-serie (RTX 5090, 4090, 3090)
- NVIDIA Enterprise (H100, A100, T4)
- AMD Radeon RX & MI300
- Intel Arc
- CPU & Jetson
- DGX Spark
Draai je eerste model
Hieronder volgen enkele beschikbare modellen:
Qwen 3.6 De volgende generatie native multimodale redeneermodellen van Alibaba. Beschikbaar in Dense- en MoE-varianten die, op het gebied van coderen en visuele taken, kunnen wedijveren met modellen die vele malen groter zijn.
Gemma 4 De meest capabele open modellen van Google, gebouwd op Gemini 3-technologie. Ondersteunt multimodale redenering, agentische workflows en meer dan 140 talen.
GPT-OSS De eerste open-weight modellen van OpenAI sinds GPT-2. Gebouwd voor redenering, agentische taken en gebruik door ontwikkelaars, inclusief functies voor function calling en toolgebruik.
Gemma 3 Multimodale modellen van Google gebouwd op Gemini-technologie. Ondersteunt meer dan 140 talen, visuele taken en teksttaken met een contextvenster tot 128K voor implementatie van edge tot cloud.