llama.cpp

Draai geavanceerde AI volledig op je eigen machine. Geen API-sleutels, geen telemetrie en geen limieten. Je bent zelf eigenaar van je modellen en gespreksgegevens.

Installatie

Je kunt llama.cpp installeren via de volgende opdracht:

curl -LsSf https://llama.app/install.sh | sh

Gebruik je liever Brew of Winget? Raadpleeg dan de package managers. Wil je het liever vanuit de broncode bouwen? Volg dan de instructies.

Koppel het aan een lokale coding agent

Voer llama serve uit, installeer de pi-llama plugin en start Pi. De applicatie zal automatisch je lokale model ontdekken. Er is geen configuratie of API-sleutel nodig. Bestanden blijven op je machine en verzoeken verlaten het systeem niet.

Stappenplan:

  1. Serve een model

llama serve

  1. Installeer de pi-llama plugin

pi install git:github.com/huggingface/pi-llama

  1. Start Pi (alles is nu ingesteld)

pi

Geoptimaliseerd voor elke hardware

Van je laptop tot een cluster, llama.cpp draait op alle beschikbare hardware. Het maakt gebruik van dezelfde binary, dezelfde modellen en dezelfde handmatig afgestemde kernels voor elke GPU en CPU.

Ondersteunde hardware onder andere:

  • Apple Silicon (M Ultra, M Pro, M Max)
  • NVIDIA RTX-serie (RTX 5090, 4090, 3090)
  • NVIDIA Enterprise (H100, A100, T4)
  • AMD Radeon RX & MI300
  • Intel Arc
  • CPU & Jetson
  • DGX Spark

Draai je eerste model

Hieronder volgen enkele beschikbare modellen:

Qwen 3.6 De volgende generatie native multimodale redeneermodellen van Alibaba. Beschikbaar in Dense- en MoE-varianten die, op het gebied van coderen en visuele taken, kunnen wedijveren met modellen die vele malen groter zijn.

Gemma 4 De meest capabele open modellen van Google, gebouwd op Gemini 3-technologie. Ondersteunt multimodale redenering, agentische workflows en meer dan 140 talen.

GPT-OSS De eerste open-weight modellen van OpenAI sinds GPT-2. Gebouwd voor redenering, agentische taken en gebruik door ontwikkelaars, inclusief functies voor function calling en toolgebruik.

Gemma 3 Multimodale modellen van Google gebouwd op Gemini-technologie. Ondersteunt meer dan 140 talen, visuele taken en teksttaken met een contextvenster tot 128K voor implementatie van edge tot cloud.