Il Web nasceva come rete di documenti collegati. Gli LLM lo stanno trasformando in universo di frammenti semantici da cui generare risposte. Per i sistemi di ricerca basati su LLM, il documento cessa di essere l’unità primaria di interpretazione. Tali sistemi, infatti, tendono a lavorare su frammenti di testo («chunk»), invece di leggere e valutare il documento nel suo insieme. Si tratta forse di una nuova prospettiva epistemica, con conseguenze importanti su giornalismo, editoria e produzione di conoscenza.
Il caso delle AI Overviews di Google
In che modo i sistemi di retrieval e generative search basati su modelli linguistici (LLM) restituiscono una risposta coerente con la nostra richiesta? Sul piano funzionale, il meccanismo è semplice. Tali sistemi segmentano i contenuti in porzioni più piccole, recuperabili in modo indipendente, e quindi procedono a selezionare i frammenti rilevanti rispetto alla query di ricerca, combinandoli per generare una risposta.
Pensiamo, per esempio, a ciò che accade nel caso delle cosiddette AI Overviews di Google Search. Le analisi empiriche mostrano che le risposte restituite all’utente nella SERP sono costruite aggregando informazioni da più fonti e citazioni: spesso con pochi link, ma sintetizzate in un testo unico di alcune centinaia di parole. In altri termini, il sistema estrae elementi informativi da diversi documenti e li integra in una risposta sintetica. Ciò che viene consegnato all’utente da Google non è il documento originale, così come si presenta nella sua integrità all’interno del Web, ma un assemblaggio di frammenti informativi recuperati da più documenti.
Una simile esperienza orienta il modo in cui gli utenti tendono a valutare il risultato della ricerca. Gli utenti consultano meno fonti primarie, in quanto il sistema è percepito come una soluzione unica che integra informazioni provenienti da più documenti. Ciò vale per le AI Overviews di Google, ma a maggior ragione per le ricerche supportate da chatbot che utilizzano LLM. Pensiamo ai casi di Gemini di Google, ChatGPT Search di OpenAI, Claude di Anthropic e Perplexity.
L’impatto dei sistemi RAG
Nei sistemi RAG (retrieval-augmented generation) il fenomeno è particolarmente chiaro. Ricordiamo che un sistema RAG completo ha due fasi principali: indicizzazione del corpus (offline) e generazione della risposta (online, ogni volta che arriva la query). Ora, nella fase di indicizzazione i documenti raccolti sono divisi in frammenti attraverso il processo di chunking. Parliamo di centinaia di token, spesso con sovrapposizione di chunk. Per esempio:
- chunk 1 → paragrafo 1
- chunk 2 → paragrafo 2
- chunk 3 → paragrafo 3
- chunk 4 → paragrafo 4
Oppure:
- chunk 1 → frasi 1–5
- chunk 2 → frasi 4–8
- chunk 3 → frasi 7–12
A questo punto il documento non viene indicizzato come entità unica. Il sistema memorizza semmai una lista di frammenti. Successivamente ogni chunk viene trasformato in un vettore numerico tramite un modello di embedding. I vettori rappresentano il significato semantico del testo: chunk semanticamente simili avranno vettori vicini nello spazio vettoriale. Poi gli embedding vengono salvati in un database vettoriale, il quale non indicizza pagine ma frammenti. Quando arriva una domanda, la query viene trasformata nello stesso tipo di embedding. Il sistema recupera i top-k chunk più simili, anche se sono pezzi di pagine diverse. Infine, i chunk recuperati vengono inseriti nel prompt dell’LLM, che genera la risposta per l’utente ricombinando i frammenti recuperati.
Dalla coesione del testo alla «coesione computazionale»?
Il passaggio dal documento al frammento introduce una tensione teorica rispetto al modo in cui siamo abituati a intendere la coesione testuale. Com’è noto, la tradizione linguistica e semiotica considera la coesione una proprietà fondamentale del testo. Diciamo che un testo è tale perché le sue parti sono collegate da relazioni semantiche e formali. Ciò è vero sia nella prospettiva della linguistica sistemico-funzionale (Ruqaiya Hasan e Michael Halliday), sia in quella dell’analisi del discorso (Gillian Brown, George Yule e Teun van Dijk).
Solo la linguistica pragmatica (Herbert Paul Grice, Dan Sperber, Deirdre Wilson) ridimensiona, almeno in parte, il ruolo della coesione. Nella prospettiva della teoria degli atti linguistici, infatti, gli enunciati non sono solo unità grammaticali, ma anche azioni comunicative, per cui la coesione del discorso dipende dalla sequenza di atti linguistici. E infatti il passaggio dalla coesione testuale (linguistica) alla pragmatica del discorso (inferenza contestuale) è rilevante per comprendere come funzionano gli LLM e in particolare i sistemi RAG. Questi modelli non operano principalmente su regole grammaticali o strutture sintattiche esplicite, ma su processi probabilistici e inferenziali simili a quelli descritti dalle teorie pragmatiche del linguaggio.
Un LLM può produrre testi molto coerenti anche quando non esistono legami coesivi espliciti, mancano connettivi e la struttura sintattica è relativamente semplice. La coerenza è costruita attraverso inferenze probabilistiche. Nei sistemi RAG, come abbiamo detto, accade qualcosa di ancora più interessante: il modello riceve frammenti isolati che spesso provengono da documenti diversi e non sono stati scritti per stare insieme, eppure riesce a produrre un testo coerente. Ciò significa che il sistema RAG deve inferire relazioni tra i frammenti, costruire una struttura discorsiva plausibile e generare un discorso coerente. E questa potrebbe essere definita un’operazione tipicamente pragmatica.
Non a caso, alcuni linguisti ritengono che gli LLM si comportino più come modelli pragmatici della comunicazione che come sistemi puramente sintattici. È il caso di Emily M. Bender e Alexander Koller (Climbing towards NLU: On meaning, form, and understanding in the age of data, in «Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics», 2020, pp. 5185–5198) e soprattutto di Christopher Potts (Pragmatics and large language models, in «Annual Review of Linguistics», 9, 2023, pp. 1–22). Un contributo molto discusso è poi quello del ricercatore di DeepMind Murray Shanahan (Talking about large language models, in «Communications of the ACM», 67(2), 2024, pp. 68–79). Shanahan sostiene che gli LLM non possiedono una rappresentazione simbolica del mondo, ma funzionano come simulatori statistici del discorso umano. Questo implica che riproducono pattern pragmatici di interazione linguistica.
Le implicazioni pratiche
L’avvento della ricerca generativa potrebbe trasformare il Web da un ecosistema di documenti a un ecosistema di unità informative recuperabili e ricombinabili. Tale trasformazione potrebbe avere conseguenze significative su giornalismo, editoria e produzione di conoscenza.
Nel vecchio paradigma, il motore di ricerca trovava pagine pertinenti. E la SEO aveva lo scopo di ottimizzare le pagine, attraverso una serie di azioni al loro interno (titoli, meta tag, struttura, link interni, densità semantica). Il documento restava l’oggetto centrale della comunicazione. Con gli LLM il documento è solo un serbatoio di informazioni. Cambia cioè il livello semantico su cui opera l’intero ecosistema informativo. La SEO deve adeguarsi, perché l’unità operativa diventa il chunk (il paragrafo, la frase informativa).
Gli effetti sul giornalismo potrebbero essere enormi e vanno ben oltre il problema della monetizzazione, preconizzato dallo spettro del fenomeno zero-click del quale oggi tanto si parla. Il punto è che l’articolo rischia di diventare un mero dataset narrativo, perdendo il ruolo di prodotto centrale. Tutto ciò a discapito delle gerarchie di rilevanza costruite dall’ordine delle notizie. La perdita di un’agenda condivisa, tendenza da tempo al centro della riflessione sul modo in cui si forma l’opinione pubblica, potrebbe risultare ancora più evidente (mi accorgo – fra l’altro – di scrivere queste righe mentre mi giunge la notizia della morte di Jürgen Habermas).
Un nuovo tipo di scrittura
Più in generale, potrebbe emergere un nuovo tipo di scrittura, pensata per essere estratta dagli agenti artificiali. Una specie di scrittura per macchine che leggono per umani, il cui contenuto non serve più solo a essere letto, ma anche a nutrire sistemi di risposta. Tale scrittura apparirebbe molto meno coesa di quella che siamo stati educati a praticare, e sarebbe caratterizzata da paragrafi autonomi, micro-spiegazioni, definizioni sintetiche e una struttura modulare. Si badi che non è solo una questione stilistica. Parliamo del modo in cui citiamo le fonti, costruiamo le nostre argomentazioni e, in definitiva, diamo forma alla conoscenza. Un frammento estratto da un documento perde il contesto, l’intenzione dell’autore e il quadro complessivo della sua argomentazione, con il rischio continuo di semplificazioni e distorsioni. Siamo pronti per tutto questo?