Drie websites hebben 215.128 "beste software"-pagina's gemaakt voor AI. Perplexity citeert ze

Van de 380 onderzochte softwarecategorieën komen 59,8% van de bronnen achter de AI-aanbevelingen van websites die buiten de 100.000 meest bezochte websites vallen. Verscheidene van de meest geciteerde sites zijn specifiek gebouwd om door modellen te worden gelezen in plaats van door mensen.

We hebben twee web-grounded modellen gevraagd naar de beste producten in 380 softwarecategorieën en elke door hen opgehaalde URL vastgelegd. Van de 7.534 citaties die terugkwamen, wijzen 59,8% naar domeinen die lager zijn gerangschikt dan #100.000 in de Tranco top-1M lijst, en 23,4% naar domeinen die helemaal niet in de top miljoen staan. Twee van de sites die voor de grounding zorgen, hebben hun homepage de HTML-titel “Facts & Grounding Page” gegeven — grounding is de retrieval-stap die deze modellen uitvoeren. Samen met een derde site onder schijnbaar gemeenschappelijk beheer hebben zij 215.128 door machines gegenereerde "best <category>" pagina's gepubliceerd; geen van deze drie domeinen bestond vóór december 2023.

De uitvoering van het onderzoek

Op 2 september 2026 hebben we 380 categorieën met aankoopintentie — van "CRM-software" tot "museumcollectie-beheersoftware" — ingevoerd bij perplexity/sonar en perplexity/sonar-pro via OpenRouter. Er werd één prompt per categorie per model gebruikt, in totaal 760 calls. Elke call vroeg om een gerangschikte top vijf in JSON-formaat, inclusief het officiële homepage-domein van elk product. Alle 760 calls leverden een parsebaar antwoord op. Beide modellen rapporteren de URL's die ze hebben opgehaald, wat de reden is dat ze voor dit onderzoek zijn gekozen. De categorieën waren vooraf bepaald en werden nooit herzien.

Dit resulteerde in 3.800 aanbevelingsslots waarin 1.807 verschillende producten werden genoemd, en 7.534 citaties verdeeld over 2.055 verschillende domeinen. Vervolgens hebben we elk geciteerd domein opgezocht in de Tranco dagelijkse lijst van 2026-09-01 en in de Wayback Machine. Ook zijn alle 1.502 door de modellen verstrekte vendor-homepages opgehaald om te controleren of deze nog bestaan.

Google is buiten beschouwing gelaten. Het uitvoeren van een grounding voor een Gemini-model op OpenRouter betekent dat het via de eigen web-search plugin van OpenRouter verloopt, waardoor de citaties die plugin zouden beschrijven in plaats van de retrieval van Google. Alleen Perplexity is gemeten, en niets in dit rapport moet worden gelezen als een bewering over andere engines.

Waar de citaties naartoe leiden

Verdeling van citaties

ModelNiet gerangschikt (buiten Tranco 1M)Gerangschikt slechter dan #100k
perplexity/sonar23,4%59,8%
perplexity/sonar-pro23,5%59,9%
Totaal (Pooled)23,4%59,8%

De mediane Tranco-rang van de 5.768 citaties die naar een gerangschikt domein wijzen, is 71.611. De concentratie aan de top is onopvallend — de tien meest geciteerde domeinen zijn verantwoordelijk voor 17,3% van de citaties — dus het verhaal is niet dat een kartel van beroemde sites de antwoorden levert. Het gaat om wat de overige viervijfde vult: 751 van de 2.055 geciteerde domeinen (36,5%) verschijnen niet in de top miljoen.

Deze domeinen zijn ook nieuwer. De mediane eerste capture in de Wayback Machine is 2020 voor de niet-gerangschikte geciteerde domeinen, tegenover 2011 voor de gerangschikte. Bovendien werden 16,6% van de gearchiveerde niet-gerangschikte domeinen voor het eerst vastgelegd in 2025 of later, tegenover 1,6% van de gerangschikte domeinen.

De tien meest geciteerde domeinen

DomeinCitatiesAandeelTranco rank
g2.com2913,86%4.027
reddit.com2613,46%105
guideflow.com1942,57%177.039
gartner.com1582,10%1.766
zapier.com821,09%2.919
wifitalents.com710,94%105.281
capterra.com680,90%6.387
linkedin.com670,89%18
worldmetrics.org600,80%104.737
gitnux.org500,66%42.759

Ter vergelijking: Wikipedia werd drie keer geciteerd in de 7.534 citaties.

De derde grootste bron is de marketingblog van een leverancier

guideflow.com verkoopt interactieve productdemo's. Het is geen reviewsite, directory of uitgever, en concurreert in geen van de categorieën waar we naar vroegen. Toch werd de blog 194 keer geciteerd over 96 van onze 380 categorieën — een kwart van het totaal — wat het op de derde plaats zet, vóór Gartner. Elke citatie is een verschillende URL: 96 verschillende blog-URL's van guideflow.com, één per categorie, waarvan zes een kopie in het Estisch zijn. De sitemap vermeldt 3.351 blog-URL's, waarvan 2.176 unieke berichten. De site leverde de grounding voor zowel "3D rendering software" als "IVR software", "RFID software" en "architecture practice software".

Er is hier niets misleidends aan; Guideflow publiceert een grote content-marketing blog, zoals duizenden bedrijven doen. De meting gaat over wat de retrieval-laag ermee doet: de lijstjes van een leverancier over markten waarin het bedrijf zelf niet actief is, werden de op twee na grootste bewijslast voor de vraag welk product men moet kopen.

Facts and grounding pages

Drie andere sites in en net onder de top tien zijn wifitalents.com (71 citaties, 27 categorieën), worldmetrics.org (60, 22) en gitnux.org (50, 23). Samen zijn zij verantwoordelijk voor 181 citaties (2,4% van het totaal) en verschijnen ze in 41 van de 380 categorieën.

Ze lijken onderdeel te zijn van één operatie. Alle drie zijn ze geregistreerd via NameCheap tussen december 2023 en mei 2024, delegeren ze DNS naar hetzelfde paar Cloudflare-nameservers (pam.ns.cloudflare.com en sean.ns.cloudflare.com), en gebruiken ze dezelfde paginasjabloon met dezelfde navigatie: Services, Market Data, Software Advice, Editorial Process, Company. Elke site heeft ook een blog van precies zes berichten, en alle achttien berichten gaan over de andere merken in de set: twee berichten over de andere twee sites, en twee over een vierde merk, zipdo.co, dat op hetzelfde nameserver-paar zit en zijn homepage dezelfde titel “Facts & Grounding Page” geeft. Het delen van een nameserver-paar is sterk indirect bewijs voor een gemeenschappelijk Cloudflare-account, maar de sjabloon, de taxonomie en de blogs komen exact overeen.

De schaal is hierbij het belangrijkste punt. Hun sitemaps vermelden respectievelijk 103.578, 107.083 en 105.541 URL's, waarvan 70.731, 71.684 en 72.713 pagina's zijn in het formaat /best/<something>-software/. In totaal zijn er 215.128 gegenereerde koopgidsen over drie merken verspreid, tegenover slechts zes blogberichten per site. Er bestaan simpelweg geen 215.128 softwarecategorieën.

De zelfbeschrijving maakt ze ongebruikelijk. Op 2 september 2026 returneerden worldmetrics.org en gitnux.org beide een HTML-titel in de vorm <Brand> — Facts & Grounding Page, en een identieke meta-omschrijving (op naam na):

Verified facts about [Brand]: an independent market research company publishing industry statistics, custom research, and software Best Lists. Company, legal, methodology, and compliance details in one machine-readable record.

"Grounding" is geen term die kopers gebruiken. Het is de naam van de stap waarin een retrieval-systeem documenten ophaalt om een antwoord op te baseren. Een machineleesbaar record van geverifieerde feiten over jezelf is bovendien geen dienst voor een menselijke lezer. Deze pagina's zijn, in hun titels en beschrijvingen, gericht aan de software die ze leest.

Deze leesbaarheid wordt ook op de gebruikelijke manier verkocht. worldmetrics.org adverteert met op maat gemaakt marktonderzoek "vanaf €5.000", kant-en-klare rapporten "vanaf €499" en leveranciersselectie "vanaf €2.500", vlak boven de taxonomie van gegenereerde "Best Lists" die de modellen ophalen.

Eén template, drie verschillende oordelen

We hebben dezelfde categoriepagina opgehaald van alle drie de merken: "project estimation software". Elke pagina vermeldt zijn rangschikking in JSON-LD, zodat deze zonder interpretatie kan worden gelezen. Elke pagina rangschikt tien tools; de top vijf worden hier getoond:

Site12345
worldmetrics.orgFloatScoroTeamwork.comProcoreWrike
wifitalents.comFloatScoroTeamwork.comBuildertrendApropo
gitnux.orgSaviomMosaicBuildertrendFloatTeamwork.com

De winnaar van Gitnux verschijnt helemaal niet in de top vijf van Worldmetrics. Elke pagina vermeldt drie medewerkers — Worldmetrics noemt Kathryn Blake, Alexander Schmidt en Victoria Marsh; Gitnux noemt Diana Reeves, Helena Kowalczyk en Olivia Thornton; WifiTalents noemt Ryan Gallagher, Isabella Rossi en Natasha Ivanova — negen verschillende mensen voor één vraag. Elke pagina kondigt een redactioneel proces aan; Gitnux labelt zijn resultaat als "AI-verified · Expert reviewed". Alle drie bevatten ze een niet-gerenderde template-variabele in de byline, die op twee sites leest als "Within the next 26 days" en op de derde als "Within the next 40 days".

Waar de aanbevelingen naartoe wijzen

De 1.502 vendor-homepages die de modellen leverden, zijn grotendeels correct. We hebben elke site tweemaal gecontroleerd (direct en via een roterende proxy). Een site werd als bereikbaar geteld als een van de twee pogingen lukte, om te voorkomen dat een host die onze IP's blokkeert, als een dood bedrijf wordt geregistreerd.

Tien van de 1.502 resolveerden helemaal niet naar een adres — acht daarvan waren niet gedelegeerd aan een nameserver — waaronder graphiql.com (gepresenteerd als de home van GraphiQL, die geen dergelijke site heeft), todo.com (voor Microsoft To Do) en aquasecurity.io (voor Trivy). Vier anderen resolveerden wel, maar gaven nooit antwoord. Samen met de 404-fouten zijn 17 domeinen (1,1%) verdwenen of onbereikbaar. Andere 92 (6,1%) leiden naar een ander registreerbaar domein; de meeste hiervan zijn normale overnames en rebrandingacties.

Twee gevallen zijn anders, en hier waren de twee tiers het oneens. Bij de vraag naar research data management platforms noemden beiden Dryad: sonar-pro gaf het echte repository op datadryad.org, terwijl sonar dryad.co gaf, wat redirect naar een Indonesisch online gokportaal met de titel “BIGSLOT288 | Portal Game Online”. Bij de vraag naar data quality tools noemden beiden Monte Carlo: sonar gaf montecarlodata.com, terwijl sonar-pro montecarlo.com gaf, wat redirect naar Monte-Carlo Société des Bains de Mer, de hotel- en casinogroep in Monaco.

Wat dit onderzoek niet aantoont

De twee modellen zijn geen onafhankelijke metingen. Ze leverden een byte-identieke citatielijst in 289 van de 380 categorieën en hun URL-sets overlappen met een Jaccard-index van 0,898. De Perplexity-tiers delen dus een retrieval-laag en moeten worden gezien als één search stack die tweemaal is gesampled. Hun overeenstemming over de topkeuze — hetzelfde product staat in 290 van de 380 categorieën op één — is een feit over die gedeelde retrieval, niet een bewijs dat onafhankelijke systemen convergeren.

Het resultaat is uitsluitend van toepassing op Perplexity. We hebben ChatGPT, Gemini, Copilot of de AI-modus van Google niet gemeten, en er is geen reden om aan te nemen dat hun retrieval-mixen overeenkomen.

De 380 categorieën zijn onze eigen constructie en geen steekproef van wat kopers daadwerkelijk vragen. Een lijst die zwaarder weegt op niche-verticalen zal meer long-tail bronnen naar boven halen dan een lijst met veelvoorkomende queries.

Elke pagina-fetch verliep via een roterende datacentre-proxy onder een benoemde research user-agent. Wat deze sites aan ons terugstuurden, is dus niet noodzakelijkerwijs wat ze terugsturen naar een retrieval-crawler of een browser.

Vier van de zeventien onbereikbare vendor-domeinen zijn grote sites, waaronder nasdaq.com en solidworks.com, die overduidelijk online zijn maar simpelweg nooit antwoordden op een geautomatiseerd verzoek; zij worden geteld als onbereikbaar, niet als dood. De gehele run is een momentopname van een retrieval-index die constant verandert.

Er is één prompt-formulering en één run per categorie gebruikt, zonder herhaalde sampling. Een eerdere pilot suggereerde dat de shortlist van producten merkbaar verschuift wanneer "best" wordt vervangen door "most popular", terwijl de citatie-mix veel minder verschuift, maar deze run meet dat niet.

Tranco-rank is een maatstaf voor populariteit, niet voor kwaliteit, en een lage rank is geen beschuldiging. Het wordt hier uitsluitend gebruikt om het veelbezochte web te scheiden van de rest; elke claim over een specifieke site is gebaseerd op de pagina's van die site zelf.

We hebben niet aangetoond dat dit de antwoorden verandert. We hebben niet getest of het verwijderen van deze bronnen zou leiden tot andere aanbevelingen; Guideflow en de drie "Best List"-merken kunnen best redelijke producten noemen. Wat we hebben gemeten is waaruit de bewijslast is opgebouwd.

Tot slot is het gemeenschappelijk beheer van de drie merken afgeleid van gedeelde infrastructuur en een identieke sjabloon. We weten niet wie ze exploiteert; geen van de drie noemt een eigenaar.

Data en methode

De volledige dataset — elke citatie, elke aanbeveling, de Tranco- en Wayback-lookups en de vendor-liveness checks — en de scripts die de bovenstaande cijfers hebben gegenereerd, zijn beschikbaar op /data/manufactured-sources-behind-ai-recommendations/, samen met de methodologie en kolomdocumentatie. Gepubliceerd onder CC BY 4.0. Een PDF-versie van dit rapport is beschikbaar op trellner.com/data/manufactured-sources-behind-ai-recommendations/manufactured-sources-behind-ai-recommendations.pdf.