Dit artikel biedt een overzicht van de AI-modellen die beschikbaar zijn via de publieke endpoints van Cerebras, toegankelijk via gratis proefversies of pay-as-you-go-abonnementen.
De belangrijkste punten zijn:
- Beschikbare modellen: Er wordt een lijst gepresenteerd met modellen zoals OpenAI GPT OSS en Qwen 3.8 27B, inclusief specificaties over parameters, contextvensters en tokensnelheid.
- Modelcompressie: Cerebras benadrukt dat de modellen op de publieke endpoints niet zijn 'gepruned' (gesnoeid). Hoewel zij onderzoek doen naar pruning via de REAP-techniek (beschikbaar op Hugging Face), worden deze niet in de productie-API gebruikt.
- Kwantisatie: Er wordt gebruikgemaakt van selectieve weight-only quantization voor opslag om geheugen te besparen, terwijl de daadwerkelijke bewerkingen in hoge precisie worden uitgevoerd om de kwaliteit te behouden.
- Definities: Het artikel sluit af met een uitleg over het verschil tussen kwantisatie (het verminderen van precisie) en pruning (het permanent verwijderen van delen van het model).
Modelcatalogus
Modellen op de openbare endpoints van Cerebras zijn beschikbaar in de gratis proefversie en de pay-as-you-go-abonnementen, onderhevig aan limieten en prijzen. Voor aanvullende modelfamilies, gereserveerde capaciteit, hogere doorvoersnelheid en productie-SLA's, zie Dedicated Endpoints.
Nieuw hier? Volg de Quickstart om je eerste API-aanroep te doen. Om een model te kiezen op basis van het gebruiksscenario, raadpleeg dan de gids voor modelselectie. Selecteer hieronder een modelnaam voor volledige specificaties, mogelijkheden en limieten per niveau.
Beschikbare Modellen
| Modelnaam | Model-ID | Parameters | Context (gratis / betaald) | Snelheid (tokens/s) |
| OpenAI GPT OSS | gpt-oss-120b | 120 miljard | 65k / 131k | ~3000 |
| Qwen 3.8 27B | qwen-3.8-27b | 27 miljard | 64k / 128k | ~1500 |
Zoekt u naar meer modellen? Veel aanvullende modelfamilies zijn beschikbaar via Dedicated Endpoints.
Modelcompressie
Deze sectie biedt transparantie over de compressiestatus van elk model dat beschikbaar is op ons platform.
We hosten diverse open-source modellen uit de community. Momenteel hosten we geen geprunede (gesnoeide) modellen op onze openbare endpoints. Alle modellen die via onze openbare endpoints worden aangeboden, zijn de originele, niet-geprunede versies.
Hoewel we onderzoek doen naar pruning-technieken zoals REAP (Router-weighted Expert Activation Pruning), worden deze geprunede modellen gedeeld met de onderzoeksgemeenschap op Hugging Face en zijn ze niet beschikbaar via onze gedeelde API. Je kunt meer lezen over REAP in onze onderzoeksblog. Al onze openbare modellen zijn niet gepruned.
Cerebras gebruikt selectieve weight-only quantization uitsluitend tijdens de opslag om de maximale kwaliteit te behouden. Dit betekent dat de gewichten worden opgeslagen in partiële 16-bit / 8-bit / 4-bit, in lijn met de industriestandaarden. Voor de kwaliteit worden gevoelige lagen op volledige precisie opgeslagen met dequantisatie on-the-fly, zodat bewerkingen in hoge precisie worden uitgevoerd. De activaties, attention en kv cache blijven in volledige precisie en ongekwantiseerd.
Veelgestelde Vragen
Zullen jullie de architectuur van een model zonder kennisgeving wijzigen? Nee. We zetten ons in om de originele modellen aan te bieden voor alle bestaande endpoints, zonder modificaties. We wijzigen modelarchitecturen niet via pruning in ons gehoste portfolio. Als we in de toekomst extra compressietechnieken (zoals pruning) verkennen, zouden deze worden aangeboden als aparte endpoints met pruning-specifieke namen, om volledige transparantie te garanderen en u in staat te stellen te kiezen welke versie het beste bij uw behoeften past.
Waar kan ik jullie REAP-geprunede modellen vinden? Onze REAP-geprunede modellen zijn beschikbaar op Hugging Face voor onderzoeks- en experimentele doeleinden: Cerebras REAP Collection. Deze modellen tonen ons pruning-onderzoek, maar worden niet aangeboden via onze productie-API.
Wat zijn compressie, kwantisatie en pruning? Compressie is een overkoepelende term voor technieken die de modelgrootte of de computationele vereisten verminderen. Veelvoorkomende compressietechnieken zijn:
- Kwantisatie (Quantization): Het verminderen van de precisie van getallen die worden gebruikt om modelgewichten weer te geven (bijv. converteren van FP16 naar FP8). Dit vermindert het geheugengebruik zonder de architectuur van het model te wijzigen.
- Pruning: Het permanent verwijderen van delen van een model, zoals lagen of experts, om de modelgrootte te verminderen. Dit wijzigt de architectuur van het model en creëert een ander model.
Modelcatalogus
Modellen op de openbare endpoints van Cerebras zijn beschikbaar in de gratis proefversie en de pay-as-you-go-abonnementen, onderhevig aan limieten en prijzen. Voor aanvullende modelfamilies, gereserveerde capaciteit, hogere doorvoersnelheid en productie-SLA's, zie Dedicated Endpoints.
Nieuw hier? Volg de Quickstart om je eerste API-aanroep te doen. Om een model te kiezen op basis van het gebruiksscenario, raadpleeg dan de gids voor modelselectie. Selecteer hieronder een modelnaam voor volledige specificaties, mogelijkheden en limieten per niveau.
Beschikbare Modellen
| Modelnaam | Model-ID | Parameters | Context (gratis / betaald) | Snelheid (tokens/s) |
| OpenAI GPT OSS | gpt-oss-120b | 120 miljard | 65k / 131k | ~3000 |
| Qwen 3.8 27B | qwen-3.8-27b | 27 miljard | 64k / 128k | ~1500 |
Zoekt u naar meer modellen? Veel aanvullende modelfamilies zijn beschikbaar via Dedicated Endpoints.
Modelcompressie
Deze sectie biedt transparantie over de compressiestatus van elk model dat beschikbaar is op ons platform.
We hosten diverse open-source modellen uit de community. Momenteel hosten we geen geprunede (gesnoeide) modellen op onze openbare endpoints. Alle modellen die via onze openbare endpoints worden aangeboden, zijn de originele, niet-geprunede versies.
Hoewel we onderzoek doen naar pruning-technieken zoals REAP (Router-weighted Expert Activation Pruning), worden deze geprunede modellen gedeeld met de onderzoeksgemeenschap op Hugging Face en zijn ze niet beschikbaar via onze gedeelde API. Je kunt meer lezen over REAP in onze onderzoeksblog. Al onze openbare modellen zijn niet gepruned.
Cerebras gebruikt selectieve weight-only quantization uitsluitend tijdens de opslag om de maximale kwaliteit te behouden. Dit betekent dat de gewichten worden opgeslagen in partiële 16-bit / 8-bit / 4-bit, in lijn met de industriestandaarden. Voor de kwaliteit worden gevoelige lagen op volledige precisie opgeslagen met dequantisatie on-the-fly, zodat bewerkingen in hoge precisie worden uitgevoerd. De activaties, attention en kv cache blijven in volledige precisie en ongekwantiseerd.
Veelgestelde Vragen
Zullen jullie de architectuur van een model zonder kennisgeving wijzigen? Nee. We zetten ons in om de originele modellen aan te bieden voor alle bestaande endpoints, zonder modificaties. We wijzigen modelarchitecturen niet via pruning in ons gehoste portfolio. Als we in de toekomst extra compressietechnieken (zoals pruning) verkennen, zouden deze worden aangeboden als aparte endpoints met pruning-specifieke namen, om volledige transparantie te garanderen en u in staat te stellen te kiezen welke versie het beste bij uw behoeften past.
Waar kan ik jullie REAP-geprunede modellen vinden? Onze REAP-geprunede modellen zijn beschikbaar op Hugging Face voor onderzoeks- en experimentele doeleinden: Cerebras REAP Collection. Deze modellen tonen ons pruning-onderzoek, maar worden niet aangeboden via onze productie-API.
Wat zijn compressie, kwantisatie en pruning? Compressie is een overkoepelende term voor technieken die de modelgrootte of de computationele vereisten verminderen. Veelvoorkomende compressietechnieken zijn:
- Kwantisatie (Quantization): Het verminderen van de precisie van getallen die worden gebruikt om modelgewichten weer te geven (bijv. converteren van FP16 naar FP8). Dit vermindert het geheugengebruik zonder de architectuur van het model te wijzigen.
- Pruning: Het permanent verwijderen van delen van een model, zoals lagen of experts, om de modelgrootte te verminderen. Dit wijzigt de architectuur van het model en creëert een ander model.