Dit artikel onderzoekt de impact van grote taalmodellen (LLM's) op de diversiteit van menselijke taal. Aan de hand van drie studies over zeven verschillende datasets en meer dan 880.000 teksten tonen de onderzoekers aan dat de inzet van LLM's als schrijfassistenten leidt tot een homogenisering van schrijfstijlen.
De belangrijkste bevindingen zijn:
- De variantie in schrijfcomplexiteit is met 21% tot 50% afgenomen.
- LLM's versterken dominante linguïstische kenmerken en onderdrukken individualiteit, ook wanneer de kerninhoud van de tekst behouden blijft.
- Deze trend is consistent over verschillende modellen, prompts en contexten.
De auteurs waarschuwen dat deze ontwikkeling belangrijke implicaties heeft voor vakgebieden die afhankelijk zijn van taalanalyse, zoals de psychologie (diagnostische processen), marketing (personalisatie) en het behoud van culturele identiteit.
De krimpende diversiteit van taal in het tijdperk van grote taalmodellen
Samenvatting
Taal is veel meer dan een communicatiemiddel; het codeert een schat aan informatie over de identiteit, psychologische staat en sociale context van een persoon, wat waardevolle inzichten biedt voor diverse vakgebieden waaronder psychologie, marketing en gezondheidszorg. Aan de hand van drie studies, verspreid over zeven datasets in verschillende domeinen en meer dan 880.000 teksten, tonen we aan dat de wijdverbreide adoptie van grote taalmodellen (LLM's) als schrijfassistenten is gekoppeld aan een afname van de linguïstische diversiteit, wat de maatschappelijke en psychologische inzichten die taal biedt, belemmert.
Hoewel de kerninhoud behouden blijft wanneer LLM's teksten polijsten en herschrijven, homogeniseren LLM's ook schrijfstijlen. Dit vermindert de variantie in schrijfcomplexiteit met een statistisch significant percentage van 21–50% over de datasets en modellen heen (P ≤ 0,05). Daarnaast versterken ze patronen die geassocieerd worden met dominante kenmerken, terwijl ze andere onderdrukken, waardoor conformiteit prevaleert boven individualiteit. Deze trends houden stand over verschillende LLM's, prompts en contexten, met potentiële implicaties voor diagnostische processen, personalisatiepogingen, wervingsbeoordelingen en cultureel behoud.
Figuuronderschriften
- Fig. 1: Trends in de variantie van schrijfcomplexiteit en de attributiegraad van teksten als AI-gegenereerd, januari 2018 tot november 2024 (Reddit en arXiv) en november 2023 (Patch News) (maandelijkse intervallen).
- Fig. 2: Distributies van $\Delta$ (een proxy voor onbalans tussen voorspelde klassefrequenties op de originele en door LLM herschreven teksten) per construct, voor teksten herschreven door GPT-3.5.
- Fig. 3: Percentage van de originele teksten met correcte voorspellingen van auteurkenmerken die veranderden na herschrijving door LLM, gegroepeerd naar de richting van de verandering in voorspellingen, met de focus op de door GPT-3.5 gegenereerde teksten.
Beschikbaarheid van gegevens
Van de zeven in dit artikel geanalyseerde datasets zijn zes openbaar beschikbaar en één beperkt toegankelijk.
Openbaar beschikbare datasets:
- Reddit r/WritingPrompts: Berichten verkregen via Project Arctic Shift, dat openbaar toegankelijke Reddit-inhoud spiegelt (exclusief private subreddits en inhoud waarvan de oorspronkelijke poster een verwijderingsverzoek heeft ingediend).
- arXiv: Abstracts verkregen uit de openbaar vrijgegeven metadata-collectie, gedistribueerd onder een Creative Commons CC0 1.0 Universal Public Domain Dedication.
- Patch News: Artikelen benaderd via het openbare Patch.com archief.
- United States Congressional Records: Toespraken uit het openbaar vrijgegeven parsed corpus; de onderliggende toespraken behoren tot het publieke domein als werken van de Amerikaanse federale overheid.
- YourMorals: Facebook-berichten en antwoorden op de Moral Foundations Questionnaire, openbaar vrijgegeven door de oorspronkelijke onderzoekers; data verzameld van deelnemers die vrijwillig zelfrapportages invulden op yourmorals.org.
- Empathic Conversations: Openbaar vrijgegeven door de oorspronkelijke onderzoekers; dataset verzameld via Amazon Mechanical Turk workers.
Beperkt toegankelijke dataset:
- The Essays corpus: Deze dataset is niet openbaar herdistribueerbaar en wordt beheerd onder voorwaarden opgelegd door de eigenaar. Verzoeken kunnen direct worden ingediend bij Prof. James W. Pennebaker (University of Texas at Austin).
Gebruik van Reddit en Patch News inhoud: In lijn met de houding ten aanzien van secundaire analyse van publieke tekstcorpora, is al het gebruik van Reddit- en Patch.com-inhoud in dit artikel beperkt tot geaggregeerde kwantitatieve analyse van linguïstische patronen over tijd. Geen enkel individueel bericht of artikel is gereproduceerd, hergepubliceerd of herdistribueerd. Gebruikersnamen en identifiers zijn niet bewaard gebleven in de analysepijplijn. Het gebruik is academisch en niet-commercieel.
Beschikbaarheid van code
Alle aangepaste code die in dit artikel is gebruikt (geïmplementeerd in Python 3.11.7 en R 4.4.2) is openbaar beschikbaar onder de MIT-licentie op https://doi.org/10.5281/zenodo.21633457. De repository bevat scripts voor data-preprocessing, LLM-herschrijving, classifier-training en evaluatie, statistische analyses en het genereren van figuren. Er is geen propriëtaire software nodig om de analyses te reproduceren.
Referenties
(Lijst van bronnen behouden zoals in het origineel)
- Orwell, G. Nineteen Eighty-Four (Penguin Books, 1949).
- Park, G. et al. Automatic personality assessment through social media language. J. Pers. Soc. Psychol. 108, 934–952 (2015).
- Oberlander, J. & Gill, A. J. Language with character: a stratified corpus comparison of individual differences in e-mail communication. Discourse Process. 42, 239–270 (2006).
(Enzovoort...)
Erkenningen en Financiering
Erkenningen Wij danken James W. Pennebaker voor hun steun en onschatbare inzichten gedurende het onderzoeksproces.
Financiering Dit onderzoek werd gedeeltelijk ondersteund door het Army Research Laboratory onder contract W911NF-23-2-0183, door DARPA INCAS HR001121C0165, en door het Air Force Office of Scientific Research A9550-23-1-0463. De financiers hadden geen rol in het ontwerp van de studie, de gegevensverzameling en analyse, de beslissing om te publiceren of de voorbereiding van het manuscript. De opvattingen en conclusen in dit artikel zijn die van de auteurs en mogen niet noodzakelijkerwijs worden geïnterpreteerd als de officiële beleidslijnen van DARPA, AFOSR of de Amerikaanse overheid.
Auteursinformatie
Auteurs en Affiliaties:
- Department of Computer Science, University of Southern California: Zhivar Sourati, Alireza Ziabari, Ala N. Tak, Fred Morstatter & Morteza Dehghani.
- Center for Computational Language Sciences, University of Southern California: Zhivar Sourati, Farzan Karimi-Malekabadi, Alireza Ziabari, Jackson Trager & Morteza Dehghani.
- Department of Psychology, University of Southern California: Farzan Karimi-Malekabadi, Meltem Ozcan, Colin McDaniel, Jackson Trager, Meng Chen & Morteza Dehghani.
- Information Sciences Institute, University of Southern California: Fred Morstatter.
Bijdragen: Z.S. bedacht de studie, ontwierp de experimentele opzet, verzamelde datasets, voerde experimenten en analyses uit en schreef het manuscript. F.K.-M. droeg bij aan het ontwerp en de uitvoering van de tijdreeksanalyses, de interpretatie van bevindingen en het schrijven van de betreffende secties. M.O. droeg bij aan het ontwerp en de implementatie van Studie 3, de interpretatie van resultaten en het schrijven. C.M. droeg bij aan de implementatie en analyse van Studie 3 en het schrijven. A.Z. droeg bij aan datapreparatie, experimentele ondersteuning en conceptualisatie. J.T. droeg bij aan de conceptualisatie. A.N.T. droeg bij aan conceptualisatie en schrijven. M.C. droeg bij aan het ontwerp en de implementatie van de tijdreeksanalyses. F.M. droeg bij aan de algehele conceptualisatie. M.D. superviseerde het project en droeg bij aan conceptualisatie, dataverzameling en schrijven.
Correspondentie: Zhivar Sourati.
Aanvullende gegevens (Extended Data)
- Extended Data Fig. 1: Semantische gelijkenis tussen originele en door LLM herschreven teksten over verschillende prompts en LLM's. Analyse van cosinus-similariteiten per tekst.
- Extended Data Fig. 2: Voorspellende kracht (gemiddelde F1) van classifiers getraind op originele teksten en toegepast op LLM-herschreven teksten, verdeeld over LLM's, prompts, featurization-technieken en classifier-families.
- Extended Data Fig. 3: Distributies van Delta over subdimensies van persoonlijke kenmerken met gebruik van GPT-3.5, Gemini en Llama 3.
- Extended Data Fig. 4: Richting van voorspellingsveranderingen na LLM-herschrijving, uitgesplitst naar LLM en herschrijfprompt.
- Extended Data Fig. 5: Homogenisering van linguïstische complexiteit na de introductie van ChatGPT. Analyse van maandelijkse variantie van complexiteitskenmerken versus de AI-attributiegraad.
- Extended Data Fig. 6: Lexicale homogenisering over domeinen in originele versus door LLM herschreven teksten. Analyse van relatieve frequenties van representatieve lexicale categorieën.
De krimpende diversiteit van taal in het tijdperk van grote taalmodellen
Samenvatting
Taal is veel meer dan een communicatiemiddel; het codeert een schat aan informatie over de identiteit, psychologische staat en sociale context van een persoon, wat waardevolle inzichten biedt voor diverse vakgebieden waaronder psychologie, marketing en gezondheidszorg. Aan de hand van drie studies, verspreid over zeven datasets in verschillende domeinen en meer dan 880.000 teksten, tonen we aan dat de wijdverbreide adoptie van grote taalmodellen (LLM's) als schrijfassistenten is gekoppeld aan een afname van de linguïstische diversiteit, wat de maatschappelijke en psychologische inzichten die taal biedt, belemmert.
Hoewel de kerninhoud behouden blijft wanneer LLM's teksten polijsten en herschrijven, homogeniseren LLM's ook schrijfstijlen. Dit vermindert de variantie in schrijfcomplexiteit met een statistisch significant percentage van 21–50% over de datasets en modellen heen (P ≤ 0,05). Daarnaast versterken ze patronen die geassocieerd worden met dominante kenmerken, terwijl ze andere onderdrukken, waardoor conformiteit prevaleert boven individualiteit. Deze trends houden stand over verschillende LLM's, prompts en contexten, met potentiële implicaties voor diagnostische processen, personalisatiepogingen, wervingsbeoordelingen en cultureel behoud.
Figuuronderschriften
- Fig. 1: Trends in de variantie van schrijfcomplexiteit en de attributiegraad van teksten als AI-gegenereerd, januari 2018 tot november 2024 (Reddit en arXiv) en november 2023 (Patch News) (maandelijkse intervallen).
- Fig. 2: Distributies van $\Delta$ (een proxy voor onbalans tussen voorspelde klassefrequenties op de originele en door LLM herschreven teksten) per construct, voor teksten herschreven door GPT-3.5.
- Fig. 3: Percentage van de originele teksten met correcte voorspellingen van auteurkenmerken die veranderden na herschrijving door LLM, gegroepeerd naar de richting van de verandering in voorspellingen, met de focus op de door GPT-3.5 gegenereerde teksten.
Beschikbaarheid van gegevens
Van de zeven in dit artikel geanalyseerde datasets zijn zes openbaar beschikbaar en één beperkt toegankelijk.
Openbaar beschikbare datasets:
- Reddit r/WritingPrompts: Berichten verkregen via Project Arctic Shift, dat openbaar toegankelijke Reddit-inhoud spiegelt (exclusief private subreddits en inhoud waarvan de oorspronkelijke poster een verwijderingsverzoek heeft ingediend).
- arXiv: Abstracts verkregen uit de openbaar vrijgegeven metadata-collectie, gedistribueerd onder een Creative Commons CC0 1.0 Universal Public Domain Dedication.
- Patch News: Artikelen benaderd via het openbare Patch.com archief.
- United States Congressional Records: Toespraken uit het openbaar vrijgegeven parsed corpus; de onderliggende toespraken behoren tot het publieke domein als werken van de Amerikaanse federale overheid.
- YourMorals: Facebook-berichten en antwoorden op de Moral Foundations Questionnaire, openbaar vrijgegeven door de oorspronkelijke onderzoekers; data verzameld van deelnemers die vrijwillig zelfrapportages invulden op yourmorals.org.
- Empathic Conversations: Openbaar vrijgegeven door de oorspronkelijke onderzoekers; dataset verzameld via Amazon Mechanical Turk workers.
Beperkt toegankelijke dataset:
- The Essays corpus: Deze dataset is niet openbaar herdistribueerbaar en wordt beheerd onder voorwaarden opgelegd door de eigenaar. Verzoeken kunnen direct worden ingediend bij Prof. James W. Pennebaker (University of Texas at Austin).
Gebruik van Reddit en Patch News inhoud: In lijn met de houding ten aanzien van secundaire analyse van publieke tekstcorpora, is al het gebruik van Reddit- en Patch.com-inhoud in dit artikel beperkt tot geaggregeerde kwantitatieve analyse van linguïstische patronen over tijd. Geen enkel individueel bericht of artikel is gereproduceerd, hergepubliceerd of herdistribueerd. Gebruikersnamen en identifiers zijn niet bewaard gebleven in de analysepijplijn. Het gebruik is academisch en niet-commercieel.
Beschikbaarheid van code
Alle aangepaste code die in dit artikel is gebruikt (geïmplementeerd in Python 3.11.7 en R 4.4.2) is openbaar beschikbaar onder de MIT-licentie op https://doi.org/10.5281/zenodo.21633457. De repository bevat scripts voor data-preprocessing, LLM-herschrijving, classifier-training en evaluatie, statistische analyses en het genereren van figuren. Er is geen propriëtaire software nodig om de analyses te reproduceren.
Referenties
(Lijst van bronnen behouden zoals in het origineel)
- Orwell, G. Nineteen Eighty-Four (Penguin Books, 1949).
- Park, G. et al. Automatic personality assessment through social media language. J. Pers. Soc. Psychol. 108, 934–952 (2015).
- Oberlander, J. & Gill, A. J. Language with character: a stratified corpus comparison of individual differences in e-mail communication. Discourse Process. 42, 239–270 (2006).
(Enzovoort...)
Erkenningen en Financiering
Erkenningen Wij danken James W. Pennebaker voor hun steun en onschatbare inzichten gedurende het onderzoeksproces.
Financiering Dit onderzoek werd gedeeltelijk ondersteund door het Army Research Laboratory onder contract W911NF-23-2-0183, door DARPA INCAS HR001121C0165, en door het Air Force Office of Scientific Research A9550-23-1-0463. De financiers hadden geen rol in het ontwerp van de studie, de gegevensverzameling en analyse, de beslissing om te publiceren of de voorbereiding van het manuscript. De opvattingen en conclusen in dit artikel zijn die van de auteurs en mogen niet noodzakelijkerwijs worden geïnterpreteerd als de officiële beleidslijnen van DARPA, AFOSR of de Amerikaanse overheid.
Auteursinformatie
Auteurs en Affiliaties:
- Department of Computer Science, University of Southern California: Zhivar Sourati, Alireza Ziabari, Ala N. Tak, Fred Morstatter & Morteza Dehghani.
- Center for Computational Language Sciences, University of Southern California: Zhivar Sourati, Farzan Karimi-Malekabadi, Alireza Ziabari, Jackson Trager & Morteza Dehghani.
- Department of Psychology, University of Southern California: Farzan Karimi-Malekabadi, Meltem Ozcan, Colin McDaniel, Jackson Trager, Meng Chen & Morteza Dehghani.
- Information Sciences Institute, University of Southern California: Fred Morstatter.
Bijdragen: Z.S. bedacht de studie, ontwierp de experimentele opzet, verzamelde datasets, voerde experimenten en analyses uit en schreef het manuscript. F.K.-M. droeg bij aan het ontwerp en de uitvoering van de tijdreeksanalyses, de interpretatie van bevindingen en het schrijven van de betreffende secties. M.O. droeg bij aan het ontwerp en de implementatie van Studie 3, de interpretatie van resultaten en het schrijven. C.M. droeg bij aan de implementatie en analyse van Studie 3 en het schrijven. A.Z. droeg bij aan datapreparatie, experimentele ondersteuning en conceptualisatie. J.T. droeg bij aan de conceptualisatie. A.N.T. droeg bij aan conceptualisatie en schrijven. M.C. droeg bij aan het ontwerp en de implementatie van de tijdreeksanalyses. F.M. droeg bij aan de algehele conceptualisatie. M.D. superviseerde het project en droeg bij aan conceptualisatie, dataverzameling en schrijven.
Correspondentie: Zhivar Sourati.
Aanvullende gegevens (Extended Data)
- Extended Data Fig. 1: Semantische gelijkenis tussen originele en door LLM herschreven teksten over verschillende prompts en LLM's. Analyse van cosinus-similariteiten per tekst.
- Extended Data Fig. 2: Voorspellende kracht (gemiddelde F1) van classifiers getraind op originele teksten en toegepast op LLM-herschreven teksten, verdeeld over LLM's, prompts, featurization-technieken en classifier-families.
- Extended Data Fig. 3: Distributies van Delta over subdimensies van persoonlijke kenmerken met gebruik van GPT-3.5, Gemini en Llama 3.
- Extended Data Fig. 4: Richting van voorspellingsveranderingen na LLM-herschrijving, uitgesplitst naar LLM en herschrijfprompt.
- Extended Data Fig. 5: Homogenisering van linguïstische complexiteit na de introductie van ChatGPT. Analyse van maandelijkse variantie van complexiteitskenmerken versus de AI-attributiegraad.
- Extended Data Fig. 6: Lexicale homogenisering over domeinen in originele versus door LLM herschreven teksten. Analyse van relatieve frequenties van representatieve lexicale categorieën.