Ricerca bibliografica con IA: un test con Semantic Scholar, ChatGPT, Undermind e Elicit. Vantaggi e limiti nei lavori accademici.
L’uso di assistenti basati su modelli linguistici generativi per la ricerca bibliografica e la revisione della letteratura scientifica è sempre più comune. L’obiettivo di tali strumenti è aiutare i ricercatori a trovare contributi scientifici rilevanti, estrarre informazioni chiave e riassumere i risultati in modo efficiente. Possono essere impiegati per analizzare grandi quantità di dati, identificare temi e concetti e generare sintesi di documenti di ricerca.
Un mese fa Yash Panjwani e Samuel Salzer hanno pubblicato per il Nuance AI Lab i risultati di un’analisi condotta su venti sistemi di questo tipo (AI Tools for Literature Reviews Benchmarking Report, 9 aprile 2025). I due autori mettono in evidenza almeno tre gravi limiti riscontrati nel loro utilizzo: i modelli generativi per la ricerca bibliografica possono inventare dati o riferimenti bibliografici inesistenti, selezionano le fonti, elaborano i contenuti in modo non sempre chiaro e forniscono risposte variabili a seconda dei prompt.
Il nostro test su quattro strumenti
Insieme ad alcuni studenti del corso di laurea magistrale dell’Università di Pavia in Filologia Moderna ho voluto testare a mia volta la capacità di alcuni di questi strumenti di produrre una bibliografia di riferimento completa e attendibile su uno specifico argomento. Il tema scelto per l’esperimento è il seguente: neurofisiologia della lettura e possibili impatti della lettura a schermo sulla neuroplasticità del cervello. Per il nostro esperimento abbiamo messo a confronto quattro servizi:
- Semantic Scholar
- ChatGPT
- Undermind
- Elicit
I risultati ottenuti sembrano confermare i dubbi di Panjwani e Salzer: troppe allucinazioni, poca chiarezza sui criteri di selezione e non ripetibilità dei risultati. Di seguito propongo una scheda per ciascuno dei servizi di ricerca bibliografica messi alla prova, con la descrizione dell’approccio di volta in volta seguito per raccogliere la bibliografia desiderata.
Semantic Scholar: bocciato
Semantic Scholar è un motore di ricerca bibliografica che indicizza oltre 214 milioni di documenti accademici, impiegando strumenti di intelligenza artificiale per estrarre il significato e identificare le connessioni all’interno dei documenti. A differenza degli altri servizi provati, non consente all’utente di interagire tramite un chatbot evoluto. Dunque la query può essere svolta solo per parole-chiave, come in un tradizionale motore di ricerca generalista, con l’ausilio di specifici filtri (Field of study, Date range, Has PDF, Author, Journals & Conferences). Per determinare il valore delle citazioni, Semantic Scholar applica un modello di apprendimento automatico che analizza fattori quali il numero di citazioni attribuite a ciascuna pubblicazione e il valore di contesto.
Semantic Scholar permette di organizzare tutti i documenti di interesse in un archivio online personale, accessibile ovunque e in qualsiasi momento. Inoltre, per quasi 60 milioni documenti di informatica, biologia e medicina, genera appositi TLDR: riassunti brevissimi del oggetto di ricerca principale e dei risultati.
Per valutarne la capacità, abbiamo provato a utilizzarlo con chiavi di ricerca quali ‘neurophysiology of reading’, ‘neuroimaging of reading’, ‘impact of screens on reading performance’ e simili. Capire quali fattori influenzino il posizionamento dei risultati e con quale peso relativo non è facile. Però la sensazione è che in gran parte ciò dipenda dalla corrispondenza fra termini di ricerca e parole contenute nei titoli dei documenti selezionati, a prescindere da tutto il resto. Contenuto dell’abstract, numero e peso delle citazioni, data di pubblicazione sembrano avere un peso modesto.
Per esempio, a partire dalla query ‘neuroimaging of reading’, Semantic Scholar restituisce al primo posto un articolo di George R. Beauchamp e Gregory Kosmorsky del 1989, intitolato The neurophysiology of reading; in seconda posizione si posiziona un articolo intitolato When She’s Not Reading EEGs, This Neurophysiology Fellow Weaves Intricate Stained Glass Art, che nulla ha a che vedere con il tema di nostro interesse; solo al terzo e al quarto posto troviamo documenti più interessanti rispetto agli obiettivi della nostra ricerca (quello in quarta posizione, in particolare, sembra il più significativo per il numero di citazioni). In generale, Semantic Scholar ha fallito nell’identificazione dei lavori più significativi degli ultimi anni sul tema della neurofisiologia della lettura.
In sintesi possiamo dire che i risultati di Semantic Scholar sono assai deludenti. Un confronto vero e proprio ha senso solo fra gli altri tre servizi provati, che offrono funzionalità simili fra loro.
ChatGPT o3: rimandato a settembre
Occorre ricordare che ChatGPT è una piattaforma general purpose, non un servizio specializzato per la ricerca bibliografica. Tuttavia aveva senso includerla nel nostro test. Anche perché offre funzionalità in molto utili, in linea di principio, proprio per la revisione della letteratura scientifica. A cominciare dall’opzione Deep Research, progettata per svolgere in autonomia ricerche multi‑step sul Web e riconsegnare un report completo, citato e verificabile.
Va detto peraltro che Deep Research è utilizzabile per un numero massimo di ricerche ogni 30 giorni (10 + 15 lite per le versioni Plus e Team, 125 + 125 lite per quella Pro). In aggiunta, a ChatGPT è possibile anche chiedere di convertire la bibliografia in un file scaricabile in formato BibTeX, uno dei più popolari linguaggi di descrizione di dati bibliografici.
Abbiamo usato il chatbot di OpenAI nella versione che sfrutta il modello o3. OpenAI lo presenta come un modello «con un focus sull’ottimizzazione del ragionamento, della logica e della comprensione contestuale». Dobbiamo sempre ricordare che, quando ci riferiamo al modo in cui le reti neurali artificiali producono i loro output, possiamo parlare di «ragionamento» solo in senso metaforico. Di fatto, ciò che avviene all’interno del modello è molto diverso dal processo che segue il cervello umano per produrre lo stesso risultato. La mechanistic interpretability, che cerca di comprendere le procedure di un modello di rete neurale attraverso il reverse-engineering delle sue computazioni interne, ci sta dando ampie conferme di ciò (ne accenno in un post di LinkedIn).
Per approfondire le questioni relative al «ragionamento» dei modelli linguistici artificiali, consiglio la lettura dei contributi di Melanie Mitchell, che insegna al Santa Fe Institute, New Mexico. In particolare il suo libro Artificial Intelligence: A Guide for Thinking Humans (New York NY, Farrar, Straus, and Giroux, 2019) e gli articoli proposti nella newsletter di Mitchell.
Il prompt di partenza
Siamo partiti dal seguente prompt (in lingua italiana):
Forniscimi una bibliografia di riferimento sugli studi neuroscientifici che indagano il funzionamento della lettura attraverso tecniche di bioimaging. Organizza la bibliografia in modo tale da dare evidenza delle diverse posizioni sul tema. Inoltre approfondisci, creando tre sezioni a parte, i seguenti sottotemi:
- potenziali effetti dell’uso prolungato di dispositivi di lettura digitali (computer, smartphone, e-reader) sulla neurofisiologia del cervello;
- basi neurologiche della dislessia e possibili impatti – positivi o negativi – associati all’uso di dispositivi di lettura digitali;
- implicazioni per la didattica linguistica delle più recenti scoperte in campo neuroscientifico.
L’obiettivo era istruire ChatGPT con una descrizione puntuale della richiesta, dal punto di vista del campo disciplinare («studi neuroscientifici»), dell’oggetto di ricerca («funzionamento della lettura attraverso tecniche di bioimaging») e dei criteri di ordinamento/selezione dei lavori («Organizza la bibliografia in modo tale da dare evidenza delle diverse posizioni sul tema»). Abbiamo anche indicato tre sottotemi di approfondimento.
ChatGPT ha risposto chiedendo alcune precisazioni:
- Qual è l’intervallo temporale di pubblicazione che desidera privilegiare (es. ultimi 10 anni, dal 2000 in poi, senza limiti)?
- Ha una preferenza per articoli peer-reviewed, libri accademici, capitoli in volumi collettanei o anche fonti divulgative sono ammesse?
- C’è una lingua preferita per le fonti (es. solo in inglese, anche in italiano)?
- Intende utilizzare questa bibliografia in un contesto accademico specifico (es. pubblicazione, corso universitario, tesi) così da calibrare livello e profondità?
Abbiamo dunque fornito i seguenti chiarimenti:
Sono interessato solo ai lavori degli ultimi quindici anni. Devono essere solo contributi scientifici (monografie, articoli in volumi collettanee, articoli peer-reviewed). Seleziona i lavori in lingua inglese e in lingua italiana, organizzandoli in vista di un corso universitario.
Gli output eterogenei di ChatGPT
Durante l’elaborazione, che richiede diversi minuti, il modello ci mostra l’elenco delle oltre trenta fonti che sta consultando. Tra queste ScienceDirect, ResearchGate, Nature, PLOS e National Library of Medicine, ma anche alcuni siti web di carattere commerciale e di modesto spessore scientifico.
Abbiamo dunque ottenuto un primo output di ChatGPT. Non contenti, abbiamo poi chiesto a ChatGPT di ripetere il lavoro, estendendo l’intervallo temporale di riferimento fino a includere tutti i lavori pubblicati dal 2000 al 2025. Abbiamo così ottenuto una seconda ricerca bibliografica. Come si può notare, a parte il diverso periodo di riferimento, il risultato è molto difforme rispetto a quello ottenuto con la prima query.
Se, poi, lavoriamo senza attivare la Deep Research, le cose vanno molto anche peggio (ecco l’esito della terza ricerca). Notiamo intanto che in questo caso ChatGPT ha organizzato il materiale bibliografico raggruppandolo in tre filoni, presentati come altrettanti approcci teorici: il modello gerarchico–modulare, il modello interattivo-predittivo e il modello della neurodiversità.
La suddivisione è in parte discutibile, considerando che solo i primi due approcci possono essere definiti neuroscientifici in senso proprio. Il modello della neurodiversità, detto anche della neurodivergenza o neuroatipicità, appare piuttosto come una proposta sociologica e politica, fondata sull’idea che siamo tutti neurodiversi perché, pur appartenendo alla stessa specie, non disponiamo di un cervello uguale a un altro.
Correttamente, il lavoro seminale di Stanislas Dehaene (Reading in the Brain, 2009) è collocato all’interno del primo raggruppamento. Poi, però, troviamo lo stesso Dehaene menzionato per un altro lavoro nella sezione dedicata al modello interattivo-predittivo; il che rischia di confonderci. Come se non bastasse, per un evidente errore il link porta a un articolo diverso da quello cui rimanda il titolo. Manca invece ogni riferimento a un altro contributo importante di Dehaene, pubblicato nel 2013 (Inside the Letterbox: How Literacy Transforms the Human Brain).
Un altro collegamento, un rigo più sotto, rimanda a un articolo attribuito, a sua volta per errore, a Fabio Richlan. In compenso, il link a un lavoro di Richlan sulla dislessia compare più sotto, ma il riferimento è a un autore diverso. Insomma: tanti pasticci e tanta imprecisione.
Undermind: il migliore
Fondata nel 2023 da due ricercatori dell’MIT di Boston, Undermind impiega tecniche di intelligenza artificiale per effettuare ricerche approfondite sull’argomento richiesto dall’utente. Non si limita a una ricerca bibliografica veloce: in alcuni minuti, esamina centinaia di documenti, confronta e classifica le fonti e adatta la sua strategia man mano che impara a conoscere l’argomento.
La base documentale è la stessa di Semantic Scholar. Quindi, se il documento che cerchiamo non è presente nel database di Semantic Scholar, non apparirà fra i risultati di Undermind. La versione gratuita ricerca all’interno di abstract e metadati. La versione Pro, a pagamento, dispone di una maggiore potenza di calcolo per cercare anche all’interno di testi completi di quasi tutti gli articoli open access e preprint.
Per Undermind abbiamo elaborato il seguente prompt (in lingua inglese):
Provide me with a reference bibliography of neuroscientific studies that investigate how reading works through bio-imaging techniques. Organize the bibliography so that the different positions on the topic are clearly highlighted. In addition, create three separate sections to examine the following subtopics:
- the potential effects of prolonged use of digital reading devices (computers, smartphones, e-readers) on the brain’s neurophysiology;
- the neurological bases of dyslexia and the possible—positive or negative—impacts associated with the use of digital reading devices;
- the implications for language teaching of the most recent discoveries in the field of neuroscience.
Undermind ha interagito sottoponendoci alcune richieste di chiarimento/approfondimento:
Are you primarily interested in in studies comparing digital vs. print reading, or also studies looking at just digital immersion per-se? Do you want studies on short-term cognitive effects, or only long-term neuroplasticity/neurophysiological change? Regarding dyslexia, are you most interested in studies involving children (early diagnosis/intervention) or also adults?
Abbiamo dunque specificato:
Focus on long-term effects and provide references about children dyslexia.
Questo tipo di interazione evidenzia l’approccio di Undermind, fondato sul modello dell’albero decisionale. Esso si basa su una struttura gerarchica a forma di albero, appunto, in cui ogni nodo interno rappresenta una condizione o una domanda su un attributo. I rami corrispondono alle possibili risposte o valori dell’attributo, mentre le foglie rappresentano le decisioni finali o le classificazioni. Il processo decisionale avanza dai nodi radice alle foglie seguendo i rami in base ai dati osservati. Questo modello consente di suddividere iterativamente il problema in sottoproblemi più semplici.
L’output di Undermind è disponibile qui. La bibliografia – preceduta da un sommario e articolata in sei sezioni – appare ricca, ben organizzata e molto coerente. Di grande utilità un grafico con la timeline di sviluppo delle idee principali, in cui è evidenziata la distribuzione negli anni – dal 2003 al 2023 – della produzione scientifica sul tema in esame.
Elicit: promosso con riserva
Oltre al motore di ricerca, che abbiamo impiegato per il nostro test, Elicit mette a disposizione anche uno strumento per estrarre le informazioni più rilevanti e riassumere i concetti principali contenuti in specifici contributi scientifici, che l’utente seleziona e carica sulla piattaforma. In aggiunta, come Semantic Scholar, anche Elicit permette di archiviare e organizzare tutti i documenti di interesse in una biblioteca online personale.
Ad Elicit abbiamo fornito il medesimo prompt utilizzato per Undermind (in lingua inglese anche in questo caso). Elicit ha sintetizzato la nostra richiesta nel seguente prompt:
What systematic review methodology can effectively synthesize current neuroscientific evidence on the neurological impacts of digital reading technologies?
La sintesi del nostro prompt operata in prima battuta dalla piattaforma appare alquanto arbitraria e perde per strada il senso della nostra richiesta originaria. Conseguentemente, i risultati restituiti da Elicit non sono particolarmente significativi.
Le cose sono andate un po’ meglio riducendo di volta in volta l’ambito della richiesta a un sottotema molto specifico, come il seguente:
What neural activation patterns are observed in the brain’s language regions during silent reading of different text types using functional magnetic resonance imaging (fMRI)?
In questo caso, Elicit ha prodotto una bibliografia di riferimento più ricca e coerente. A differenza di Undermind, sembra che Elicit sia utile quando si tratta di reperire riferimenti bibliografici su argomenti particolarmente circoscritti. La stessa richiesta rivolta a ChatGPT e Undermind, dunque, deve essere scomposta in una serie di prompt, ciascuno riferito a un perimetro molto limitato. In sostanza, la piattaforma sembra lavorare bene se deve analizzare prompt molto puntuali, relativi ad argomenti ben definiti e circoscritti.
Il risultato della ricerca bibliografica, comunque, non è sempre esaltante. Per esempio, a partire dal prompt ‘What are the neurophysiological changes in the prefrontal cortex associated with prolonged digital reading device use among young adults aged 18-35?’, Elicit ha reperito solo due contributi. Non è facile trovare un punto di equilibrio fra rilevanza rispetto alla query e ampiezza della bibliografia. Con il medesimo prompt, proposto a ChatGPT, si ottiene un elenco di dieci lavori. Ma non tutti sono scientificamente così rilevanti.
Ciò che è sicuramente apprezzabile di Elicit è la descrizione puntuale di tutti i passaggi del processo attraverso il quale lo strumento arriva a generare l’output.