L’effetto Asburgo e l’AI: quando le macchine si autocannibalizzano

L’effetto Asburgo e l’AI: quando le macchine si autocannibalizzano

Avete presente il ritratto di Carlo II d’Asburgo? Mascella prominente, fronte spaziosa, tratti esasperati. Quello che vedete non è un capriccio della natura: è il risultato di generazioni di incroci tra consanguinei. L’AI rischia lo stesso destino — e prima che pensiate “non è il mio problema”, vi assicuro che lo è.

Un po’ di storia (brevissima)

La casa d’Asburgo era ossessionata dal mantenere il potere all’interno della famiglia. Per secoli, cugini sposarono cugine, zii sposarono nipoti. Il risultato? Un patrimonio genetico che si riduceva progressivamente, amplificando ogni difetto e cancellando ogni variazione. Carlo II di Spagna, l’ultimo della dinastia, era talmente compromesso da non riuscire quasi a masticare o a camminare.

La biologia chiama questo fenomeno depressione da inincrocio. Ma i ricercatori di machine learning lo stanno scoprendo anche nei propri modelli — e lo chiamano model collapse.

Cosa succede tecnicamente

Un modello AI viene addestrato su testo umano. Poi produce testo. Poi quel testo finisce su internet. Poi un nuovo modello viene addestrato su quel testo — che include già output AI. Il ciclo si ripete. Ogni generazione “assorbe” gli errori e le omissioni di quella precedente, amplificandoli.

La coda lunga che sparisce

Uno studio del 2024 pubblicato su Nature ha mostrato qualcosa di inquietante: quando i modelli vengono addestrati su dati che includono output AI precedenti, le distribuzioni statistiche si “appiattiscono”. Le risposte rare, strane, periferiche — quelle che rappresentano la vera diversità del pensiero umano — scompaiono per prime.

Pensateci: un modello addestrato su milioni di testi umani impara anche le opinioni di nicchia, i dialetti locali, le subculture, i dibattiti minoritari. Ma se lo riaddestrate su testi generati da AI, quelle voci spariscono. Il modello converge verso una specie di mediocrità statistica — le risposte più probabili, più comuni, più banali.

Proprio come la famiglia Asburgo perdeva variabilità genetica a ogni generazione, internet sta perdendo variabilità cognitiva man mano che viene riempito di contenuti AI.

Asburgo

Inincrocio genetico

Riduzione della variabilità → amplificazione dei difetti → collasso della dinastia

AI moderna

Inincrocio dei dati

Riduzione della variabilità → amplificazione degli errori → collasso della qualità

Perché dovrebbe interessarvi

Se usate AI per scrivere email, articoli, presentazioni — e poi quei contenuti finiscono online — state contribuendo, inconsapevolmente, al ciclo. Non è colpa vostra. Ma è un fenomeno sistemico che vale la pena capire.

C’è poi un rischio più sottile: l’omogeneizzazione culturale. Se tutti usano gli stessi modelli per scrivere, tradurre, creare, il risultato è una sorta di voce globale unica. Un accento neutro digitale che suona uguale ovunque. Comodo, forse. Ma impoverito.

Esempi concreti

Dove lo vedete già oggi, senza saperlo

Il model collapse non è un problema futuro. È già visibile, in forme sottili ma riconoscibili, nella vita digitale di ogni giorno. Eccone alcuni esempi concreti.

Gli articoli di blog che suonano tutti uguali

Scorrete la vostra feed di LinkedIn o un aggregatore di notizie tech. Noterete una cadenza identica: apertura con una domanda retorica, tre punti elenco con sottotitoli in grassetto, chiusura con una “call to action” motivazionale. Non è una coincidenza stilistica — è il risultato di migliaia di blogger che usano lo stesso modello AI, che a sua volta è stato addestrato su migliaia di post precedenti scritti con lo stesso schema.

Il segnale da cercare: se un articolo potrebbe essere stato scritto da chiunque, su qualsiasi argomento, probabilmente è un prodotto del ciclo.

Le risposte AI sulle notizie recenti che diventano vaghe

Chiedete a un assistente AI un evento molto recente — una legge appena approvata, un libro uscito da pochi mesi, uno scandalo di ieri. Spesso la risposta sarà generica, prudente, piena di “potrebbe”, “generalmente” e “dipende dal contesto”. Parte di questa vaghezza non è solo un limite del training cutoff: è il segnale che il modello sta pescando da dati sempre più diluiti e ripetuti, dove la specificità si è già persa.

Il segnale da cercare: risposte che suonano plausibili ma non dicono nulla di verificabile.

Le immagini AI che convergono verso un’estetica unica

Avete mai notato che le immagini generate da AI — indipendentemente dal prompt — tendono ad avere una certa luce diffusa, pelli lisce quasi plastificate, sfondi con bokeh perfetto? I modelli di image generation vengono riaddestrati su output di modelli precedenti o su dataset sempre più filtrati. Il risultato è una “media visiva” che schiaccia gli stili estremi, gli errori interessanti, le imperfezioni espressive. L’arte AI finisce per assomigliarsi tutta.

Il segnale da cercare: quella sensazione di “già visto” anche davanti a immagini generate su richiesta specifica.

Le recensioni di prodotti che sembrano clonate

Su Amazon, Trustpilot, Google Maps — sempre più recensioni vengono scritte (o riscritte) con l’AI. Anche le recensioni genuine, editate con strumenti di parafasi automatica, perdono i tratti personali. Il risultato è una massa di feedback che si assomiglia: struttura identica, tono sempre positivo-ma-equilibrato, dettagli generici. Per i consumatori, questo rende quasi impossibile capire se un prodotto sia davvero buono — perché la segnale originale è stata levigata via dal processo.

Il segnale da cercare: recensioni che descrivono tutto ma non ricordano niente di specifico.

La perdita delle lingue minoritarie nei modelli multilingua

Questo è forse l’esempio più serio. I modelli multilingua vengono addestrati su dati proporzionali alla presenza online di ogni lingua. L’italiano è già minoritario rispetto all’inglese; il sardo, il friulano, il napoletano sono praticamente assenti. Quando i modelli producono testo in queste varietà e quel testo finisce online, i futuri modelli lo inglobano — ma è un testo già impoverito, già normalizzato verso l’italiano standard. La variazione linguistica reale, quella che porta con sé storia e cultura, scompare silenziosamente.

Il segnale da cercare: chiedete a un’AI di scrivere in dialetto — il risultato sarà un italiano con qualche parola locale sparsa, non una vera varietà linguistica.

Un filo comune

In tutti questi casi, il meccanismo è lo stesso: il contenuto generato da AI rientra nel ciclo di addestramento, e ogni iterazione cancella un po’ di più le sfumature, le eccezioni, le voci marginali. Non è malevolenza — è statistica. La media tende sempre verso il centro.

Ci sono soluzioni?

La risposta biologica all’inincrocio è l’eterozigosi — introdurre nuova variabilità genetica. Nel contesto AI, i ricercatori stanno esplorando strade simili:

1 Watermarking dei contenuti AI — marcare i testi generati in modo che possano essere esclusi dai dataset di addestramento futuri.

2 Dati “freschi” e verificati — investire nella raccolta di testi umani autentici, compresi testi rari, regionali, tecnici.

3 Feedback umano continuo — non abbandonare l’oversight umana nell’addestramento, proprio per mantenere “biodiversità” cognitiva.

La prossima volta che leggete un testo che sembra “quasi perfetto ma un po’ piatto” — quella sensazione ha un nome. E ora sapete da dove viene.

La diversità, biologica o cognitiva, non è un lusso. È la condizione minima per non degenerare.

Comments

No comments yet. Why don’t you start the discussion?

Lascia un commento

Questo sito utilizza Akismet per ridurre lo spam. Scopri come vengono elaborati i dati derivati dai commenti.