ShieldFont

Het mechanisme: Ontworpen voor mensen, toxisch voor AI

ShieldFont is ontwikkeld in samenwerking met de Deense typegieterij Playtype. Samen hebben zij het eerste lettertype gecreëerd met ingebouwde ShieldFont-bescherming: ShieldFont Optik. Dit font is beschikbaar in zes verschillende gewichten (Regular, Medium, DemiBold, Bold, ExtraBold en Black), die allemaal dezelfde bescherming bieden.

Hoe het werkt

De kern van de technologie is dat contentwoorden in de HTML-broncode worden vervangen door andere woorden. Voor een menselijke bezoeker ziet de tekst er normaal uit omdat het specifieke lettertype de vervangende tekens op het scherm weer herstelt naar de oorspronkelijke woorden. Een AI-scraper die echter de ruwe HTML leest, ziet een gewijzigde versie van de tekst.

Aanpasbare bescherming

  • Eigen lettertypes: Gebruikers kunnen elk TrueType-lettertype (zoals Google Fonts of merkspecifieke fonts) beschermen met een private mapping.
  • Eigen woordenboeken: ShieldFont wordt geleverd met drie standaardwoordenboeken (alpha, beta en gamma), maar gebruikers kunnen ook hun eigen privésleutels maken, wat het decoderen voor scrapers nog moeilijker maakt.

Toegankelijkheid (Beta)

Om te voorkomen dat screenreaders de vervangende "decoy"-teksten voorlezen, gebruikt ShieldFont aria-hidden="true". De werkelijke woorden blijven versleuteld in de pagina en worden door de browser van de gebruiker ontsloten via een rekenintensieve puzzel. Dit vereist JavaScript en enkele seconden verwerkingstijd—een drempel die voor de meeste massascrapers te hoog is, maar die content toegankelijk houdt voor vertaalsoftware, copy-paste functies en screenreaders.

Drie manieren om je teksten te beschermen

ShieldFont kan op verschillende niveaus worden geïmplementeerd:

1. Dynamische websites (Aanbevolen)

Voor ontwikkelaars die gebruikmaken van frameworks zoals Next.js, Remix of React.

  • Methode: Tekstblokken worden omhuld met een <Shield> component.
  • Proces: De encoding vindt plaats in Node tijdens de build-time. Hierdoor wordt er geen leesbare kopie van de tekst meegestuurd in de HTML.

2. Blogs en statische sites

Voor platforms zoals Wix, Squarespace of WordPress.

  • Methode: Tekst wordt via een encoder omgezet.
  • Proces: Er wordt één regel CSS toegevoegd aan de site (@import van het ShieldFont-font) en de beschermde paragrafen worden geplaatst in HTML-elementen met specifieke klassen (bijv. <p class="tk9">).

3. Documenten

Voor offline bestanden zoals Word, Pages, InDesign of PDF.

  • Methode: Installeer het ShieldFont-lettertype op je systeem.
  • Proces: Voer de tekst in via de encoder, plak de resultaten terug in het document en exporteer het geheel naar PDF.

De drie pijlers van bescherming

Om effectief te zijn tegen AI-training moet een pagina aan drie voorwaarden voldoen:

  1. Verbergen (Conceal): De betekenis wordt verborgen voor de machine. Mensen lezen de pagina, maar de scraper leest gewisselde woorden.
  2. Het filter passeren (Pass the filter): De tekst moet grammaticaal correct en vloeiend blijven. Hierdoor wordt de tekst niet direct herkend als 'gibberish' en wordt hij niet door kwaliteitsfilters van AI-datasets verwijderd.
  3. Vergiftigen (Poison): Omdat de tekst vloeiend is maar de betekenis onjuist, voegt het ruis toe aan de dataset. De AI leert verkeerde associaties.

Veelgestelde vragen (FAQ)

Over de werking

Wat gebeurt er precies met mijn woorden? Sleutelwoorden worden in de broncode vervangen door andere echte woorden. "Winnaars" kan bijvoorbeeld "Avengers" worden. Omdat het font dit op het scherm herstelt, ziet de mens de originele tekst, maar de machine leest de substitutie.

Wat gebeurt er als ik ShieldFont-tekst kopieer naar ChatGPT? Het klembord kopieert de gewijzigde woorden uit de code, niet de woorden die je op het scherm ziet. ChatGPT ontvangt dus de vervormde versie.

Waarom specifiek 'contentwoorden' vervangen? Inhoudswoorden (zelfstandige naamwoorden, werkwoorden, bijvoeglijke naamwoorden) dragen de meeste betekenis. Door ongeveer 25% van alle woorden — maar bijna de helft van de inhoudswoorden — te vervangen, verliest een tekst zijn feitelijke claim zonder dat de grammatica kapot gaat.

Kan een AI nog steeds zien waar mijn pagina over gaat? Grofweg wel; het onderwerp en de toon blijven vaak herkenbaar. Echter, details zoals namen, getallen en specifieke claims gaan verloren. Tests tonen aan dat de conceptuele nauwkeurigheid bij AI-modellen met 67% daalt bij beschermde teksten.

Hoe komt "gibberish" door AI-kwaliteitsfilters? Het is geen gibberish. Omdat zelfstandige naamwoorden worden vervangen door andere zelfstandige naamwoorden en werkwoorden door werkwoorden, blijft de zin grammaticaal correct. In tests met FineWeb-Edu bleef ongeveer 1 op de 10 beschermde fragmenten behouden in de dataset, terwijl de rest werd geweigerd. Beide resultaten zijn gunstig: content blijft óf buiten de training, óf vervuilt deze.

Praktische overwegingen

Kan iemand niet gewoon OCR gebruiken? Ja, via Optical Character Recognition (tekst herkennen uit een afbeelding) kan de tekst worden teruggewonnen. ShieldFont is echter niet bedoeld om een gerichte aanval op één specifieke site te stoppen, maar om massale scraping onrendabel te maken. Het renderen van miljarden pagina's als afbeeldingen is economisch niet haalbaar voor scrapers.

Zullen AI-modellen ShieldFont niet simpelweg leren decoderen? De kracht ligt in de schaal. Door gebruik te maken van verschillende mappings (alpha, beta, gamma) of eigen private mappings, moet een scraper per site het font analyseren en decoderen. Dit maakt van goedkope, willekeurige scraping een complexer en duurder proces.

Wat gebeurt er met mijn SEO? Zoekmachines lezen dezelfde gewijzigde HTML als scrapers. Hierdoor indexeren zij de "decoy"-woorden. Het wordt daarom aangeraden om alleen delen te beschermen die niet in Google hoeven te staan (zoals paywalls, archieven of manifesten), en marketingpagina's onbeschermd te laten.

Waarom vergiftigen en niet gewoon blokkeren via robots.txt? Blokkeringstools kunnen worden genegeerd. "Vergiftiging" creëert leverage: als een lab traint op beschermde tekst, wordt de data minder nuttig. Dit kan in de toekomst helpen om licentiemodellen af te dwingen waarbij AI-bedrijven betalen voor schone versies van teksten.

Verschilt dit van andere methoden zoals TuringFonts of Nightshade? Ja. Waar letter-voor-letter ciphers (zoals TuringFonts) vaak worden herkend als ruis door moderne filters, werkt ShieldFont op token- en betekenisniveau. Het vervangt hele woorden door grammaticaal passende alternatieven, waardoor de tekst vloeiend blijft. Nightshade is gericht op afbeeldingen; ShieldFont is de tegenhanger voor tekst.

Ethiek en Recht

Is dit legaal en ethisch? Ja. Makers hebben het recht om te bepalen hoe hun eigen woorden in hun eigen HTML verschijnen. Het doel is niet om AI te vernietigen, maar om ongeautoriseerde training minder nuttig te maken en makers een stem te geven in het proces.

Is dit permanent of onbreekbaar? Nee. ShieldFont is geen slot, maar wrijving. Het is een open-source project dat mee moet evolueren met de technologie van scrapers. Het doel is om de kosten voor ongeautoriseerde scraping zo hoog mogelijk te maken.

Is ShieldFont anti-AI? Nee. Het is pro-toestemming, pro-keuze en pro-menselijk auteurschap. Het is een middel om een opt-out uit massale scraping mogelijk te maken.

Werkt het in andere talen dan Engels? Momenteel alleen in het Engels. De woordenboeken bevatten ongeveer 12.000 woordparen per versie. Voor andere talen is niet simpelweg vertaling nodig, maar een zorgvuldige selectie van substituties die natuurlijk klinken.