AMD neemt AI-chip startup Taalas over om inferentieprestaties te verbeteren door modellen in silicium te etsen

In een nieuw initiatief om de dominantie van Nvidia op het gebied van AI-hardware te doorbreken, heeft AMD het AI-chipbedrijf Taalas overgenomen. Taalas maakt gebruik van een proces waarbij modelgewichten direct in het silicium worden "gebakken", wat belooft de inferentieprestaties met een factor tien of meer te verhogen.

De deal, die donderdag bij het sluiten van de markt werd aangekondigd, lijkt in dezelfde context geplaatst als de licentiedeal van 20 miljard dollar tussen Nvidia en Groq vorig december: het sneller en goedkoper maken van hoogwaardige "premium" inferentiediensten die essentieel zijn voor AI-agents, zoals code-assistenten. AMD heeft de voorwaarden van de deal niet bekendgemaakt, maar naar verluidt gaat het om een volledige overname en niet om een acquihire.

Taalas is in 2023 opgericht in Toronto. De benadering van inferentie is radicaal anders dan die van conventionele GPU's of de dataflow-architecturen die ten grondslag liggen aan Groq LPU's of de waferscale-acceleratoren van Cerebras.

Een model-specifieke geïntegreerde schakeling (MSIC)

De chips van Taalas vertrouwen niet op HBM (High Bandwidth Memory) om de modelgewichten op te slaan, maar etsen deze direct in het silicium. In feite zijn de chips van Taalas model-specifieke geïntegreerde schakelingen, of MSIC's (model-specific integrated circuits).

Deze technologie is niet enkel conceptueel. In februari onthulde de startup zijn eerste testchip, gebouwd op het 6nm-proces van TSMC, genaamd de HC1. Initiële benchmarks lieten zien dat de chip Meta’s Llama 3.1 8B bediende met een snelheid van 16.960 tokens per seconde. Op het moment van de aankondiging in februari was dit 48 keer sneller dan de GPU's van Nvidia en 8,5 keer sneller dan de acceleratoren van Cerebras. Hoewel Llama 3.1 naar huidige maatstaven verouderd is (met een debuut in medio 2024), diende deze chip vooral om het concept te bewijzen.

Taalas is zeer geheimzinnig over de exacte werking, maar bekend is dat de processoren uit twee hoofdregio's bestaan:

  • De mask-ROM recall fabric: waar de modelgewichten zijn geëtst.
  • De SRAM recall fabric: waar KV-caches en fine-tuning adapters worden opgeslagen.

Voor de tweede generatie, de HC2-chip die deze zomer verschijnt, streeft Taalas ernaar het aantal parameters te verhogen naar 20 miljard. Om grotere modellen te ondersteunen, worden de gewichten via pipeline parallelism verdeeld over meerdere acceleratoren. Bij 20 miljard parameters per chip zijn er slechts 50 acceleratoren nodig om een model met een biljoen parameters te ondersteunen. AMD beschikt reeds over een compute-platform op rack-schaal en een intern systeemontwerpteam dat dit kan faciliteren. Dit is aanzienlijk ruimte- en energie-efficiënter dan de onlangs onthulde LPX-systemen van Nvidia, die tientallen GPU's of minstens 2.000 Groq LPU's nodig zouden hebben voor hetzelfde model.

AMD is van plan om zijn Instinct-gebaseerde Helios-racks te koppelen aan chips op basis van de Taalas-technologie. Dit wijst op een gedisaggregeerde architectuur waarbij rekenintensieve promptverwerking op GPU's gebeurt, terwijl de tokengeneratie wordt uitbesteed aan de Taalas-acceleratoren.

Het is ook mogelijk dat AMD een 'tick-tock'-ritme hanteert: klanten implementeren en valideren modellen eerst op Instinct-acceleratoren en stappen over naar Taalas-acceleratoren zodra ze tevreden zijn. Vamsi Boppana, SVP of AI bij AMD, verklaarde hierover: "AMD bouwt een full-stack AI-platform dat klanten de flexibiliteit geeft om de juiste compute-oplossingen in te zetten voor elke AI-workload."

De beperking: starheid van het model

Hoewel de technologie razendsnel is, is er een aanzienlijk nadeel: zodra de chips zijn geïmplementeerd, zit je vast aan dat specifieke model. Elke wijziging die groter is dan bijvoorbeeld een LoRA-adapter vereist een nieuwe productiecyclus (re-spin) van de chips, wat zowel duur als tijdrovend is.

In een markt waar bijna maandelijks nieuwe modellen verschijnen, moeten klanten van AMD zeer zeker zijn van hun modelkeuze om van Taalas' technologie te kunnen profiteren. Volgens de startup valt dit echter mee; bij een nieuwe modelversie hoeft men niet volledig opnieuw te beginnen. Er moeten slechts twee metaallagen worden gewijzigd, wat goedkoper en sneller is dan een volledige herontwikkeling.

Marktpotentieel en ontwikkeling

Het wordt verwacht dat deze technologie voornamelijk zal worden ingezet door AI-modelontwikkelaars, infrastructuurproviders en een select aantal inferentieproviders. Taalas suggereerde in februari dat het etsen van modelgewichten in silicium 100 keer goedkoper is dan het trainen van een frontier-model.

AMD bevindt zich in een sterke positie om deze deals te sluiten, aangezien OpenAI, Anthropic en Meta allemaal belangrijke klanten zijn van de Instinct-lijn. Het zou daarom niet verrassend zijn als GPT of Claude wordt ingezet op een combinatie van Taalas- en Instinct-acceleratoren.

De technologie heeft ook gevolgen voor modelontwikkeling. Ontwikkelaars proberen hallucinaties te verminderen via test-time scaling, waarbij een model langer mag "nadenken" voordat het antwoordt. Een nadeel hiervan is dat het aanzienlijk meer tokens verbruikt, wat duur is en zorgt voor langere wachttijden voor de gebruiker. Als AMD's overname van Taalas de kosten per token kan verlagen en de outputsnelheid met 10 tot 20 keer kan verhogen, kunnen modelontwikkelaars besluiten om deze redeneertijd verder uit te breiden.

Onder voorbehoud van goedkeuring door de regelgevende instanties wordt verwacht dat de deal in het vierde kwartaal zal worden afgerond.