Rappresentazione metaforica di uno smisurato archivio documentale in formato digitale

Deep search e ricerca nel Web con LLM: ottenere risultati più affidabili è possibile?

Riflessioni e qualche modesto consiglio per un uso decente della ricerca online potenziata da modelli linguistici

Le ricerche online che ciascuno di noi effettua quotidianamente passano sempre più spesso da interfacce basate su modelli linguistici come ChatGPT, Gemini e Perplexity. Tali servizi vengono spesso impiegati come se fossero arbitri della verità, perché producono risposte fluide e convincenti. Diciamo addirittura seducenti. Eppure non sono progettati per verificare ciò che dicono. Sappiamo su che cosa si fondano davvero le loro risposte? Sono il risultato di una ricerca affidabile o l’esito di una previsione statistica ben riuscita?

Ho provato a organizzare una serie di criteri operativi e di buone pratiche per usare i suddetti strumenti in modo più affidabile, comprendendone i limiti strutturali e imparando a governare il rapporto tra sintesi generativa, fonti e verità dei contenuti. Pensando sempre alla necessità di distinguere tra velocità e accuratezza, tra plausibilità e verità, quando l’informazione diventa una leva decisionale.

Disclaimer: ambito e limiti

In questo articolo faccio riferimento a pratiche e principi validi alla data del 15 dicembre 2025. Il quadro tecnologico evolve rapidamente e non è escluso che alcune dinamiche qui descritte subiscano variazioni anche significative nel breve periodo. Le indicazioni riguardano esclusivamente i servizi di ricerca online potenziata da LLM tramite interfacce conversazionali: Google Search in AI Mode (basato su Gemini 3.0), il chatbot Google Gemini (sempre Gemini 3.0), ChatGPT Plus (GPT‑5.2, disponibile dall’11 dicembre), Claude (Sonnet 4.5) e Perplexity AI Pro in modalità Search.

Restano fuori dal perimetro della mia analisi gli interventi di sistema. Mi riferisco all’addestramento supervisionato con fact‑checking, e alle modifiche architetturali dei modelli – per esempio l’adozione di retrieval‑augmented generation (RAG) o di forme avanzate di source grounding. Le buone pratiche di prompt engineering che proporrò più avanti sono, di fatto, tentativi manuali di replicare l’efficacia del grounding sistemico.

Non dobbiamo dimenticare, peraltro, il fatto che RAG è considerato oggi il gold standard per mitigare le «allucinazioni» in produzione, nonostante anch’esso non sia privo di difetti, potendo causare «confabulazioni» a causa di fallimenti nel retrieval o nella generazione (si veda il lavoro di Wan Zhang e Jing Zhang, Hallucination Mitigation for Retrieval-Augmented Large Language Models: A Review, in «Mathematics», 13 (5), 856, 4 marzo 2025).

La novità: Deep Research con Gemini 3 Pro

Nel frattempo, arriva un’altra novità importante. Mi riferisco al lancio, l’11 dicembre scorso, della versione potenziata di Gemini Deep Research basata su Gemini 3 Pro. Google lo descrive come un «autonomous researcher». Il suo obiettivo primario non è la velocità, ma la gestione di compiti complessi che richiedono pianificazione e verifica forense, come la due diligence aziendale, l’analisi finanziaria o la ricerca sulla sicurezza dei farmaci. In modo un po’ altisonante, Google suggerisce che il deep search è rapidamente passato da una fase embrionale a una dimensione professionale e operativa.

Sulla distinzione fra ricerca online tradizionale e deep search tornerò più avanti. L’ipotesi è che il mercato della ricerca si sta biforcando in modo significativo: la SERP tradizionale si concentra sul consumo di massa, mentre la ricerca ad alta accuratezza e alta complessità si sta spostando verso strumenti agentici premium.  

L’agente opera attraverso un processo iterativo di ragionamento multi-hop. Invece di rispondere a una singola query, Deep Research genera internamente un piano d’indagine, che definisce i passaggi necessari, esegue query di ricerca sequenziali, analizza i risultati, identifica le lacune informative e ripete il ciclo di ricerca finché non è in grado di produrre un rapporto strutturato. Questo meccanismo simula il lavoro di un ricercatore umano, superando i limiti di coerenza e generalizzazione derivanti dalla singola interrogazione.

Come la GenAI sta trasformando la ricerca online

Deep Research di Google sembra dunque il risultato per ora più avanzato della trasformazione della ricerca online, per come l’abbiamo fin qui conosciuta. È uno scenario che vede la stessa Google in competizione con altri attori. Per oltre venticinque anni la ricerca sul Web è stata dominata dal paradigma dell’indice. Com’è noto, Google Search non conserva i documenti del Web, ma mantiene una struttura che descrive dove si trovano, come sono classificati e quanto sono rilevanti rispetto alle query degli utenti. Questo sistema di indicizzazione resta, tuttora, l’asset competitivo decisivo di Google.

Ancora oggi, quando ChatGPT, Gemini e Perplexity «vanno sul web», non sono del tutto autonomi. Ciò vale ovviamente per Gemini, che non effettua un proprio crawling completo e indipendente del Web come un motore di ricerca autonomo, ma si basa in larga misura sull’indice di Google Search, cioè sui dati già raccolti e indicizzati da Googlebot. Ma vale anche per ChatGPT, che pure utilizza più fonti di recupero di informazioni, inclusi propri metodi di fetching via browser, API di ricerca di terzi o specifici sistemi di retrieval. Ricordiamo inoltre che ChatGPT ha utilizzato in passato Bing di Microsoft per la sua funzionalità di navigazione web. Infine c’è Perplexity, che usa il motore Bing via API come componente chiave di information retrieval, e nel tempo ha sviluppato anche un proprio crawler (PerplexityBot) e un proprio indice, che integra o sostituisce i risultati di Bing in varie situazioni. Ma, al contempo, anche Perplexity si serve di API di Google per integrare i risultati.

Che cosa riassume Gemini: documenti o snippet?

Si potrebbe pensare che Google Search con Gemini goda di un vantaggio competitivo enorme nei confronti dei concorrenti, che utilizzano metodi di fetching proprietari. Nella realtà, il quadro è più complesso. Alcune analisi architetturali, infatti, mettono in discussione l’efficacia del grounding con Google Search integrato in Gemini. RoadRunnerChris, per esempio, suggerisce su Reddit (Gemini 3 Pro Search functionality and Deep Research is by far the worst of any AI Platform, 24 novembre 2025) che lo strumento di ricerca potrebbe essere limitato all’accesso a snippet strutturati forniti dalla SERP, anziché eseguire la lettura completa del contenuto delle pagine web. Se così fosse, si tratterebbe di una potenziale limitazione che potrebbe ostacolare la profondità del retrieval rispetto ad altri operatori.

In ogni caso, per i servizi consumer non esiste un bypass sistematico dell’indice. Almeno non allo stato attuale. Le forme di deep search sono embrionali e non sostituiscono la ricerca tradizionale. In questo contesto, l’introduzione delle AI Overview da parte di Google, tra il 2023 e il 2024, ha segnato una svolta. Al di sopra la SERP, nella parte alta della pagina, compare una sintesi generata dal modello Gemini, che rielabora le informazioni provenienti dai primi risultati indicizzati.

Conferme empiriche della tendenza allo zero-click

Gli effetti sono documentati: si rafforza il fenomeno dello zero‑click, perché molti utenti si fermano alla sintesi senza aprire le fonti, con un impatto diretto sul traffico verso editori e siti indipendenti. Le fonti utilizzate per generare l’overview vengono selezionate, in genere, tra i primi dieci o quindici risultati dell’indice, confermando il ruolo centrale del ranking tradizionale. Resta valido, in proposito, ciò che osservavo alcuni mesi fa (È l’ora della GEO. Che fine fa la SEO?, 11 giugno 2025).

Uno studio del settembre 2025 di Seer Interactive, che ha analizzato milioni di impression, ha documentato che per le query che attivavano le AI Overviews, il Click-Through Rate (CTR) organico è crollato del 65% (da 1,76% a 0,61%). In modo analogo, il CTR a pagamento è precipitato del 68%. Questo dimostra che la sintesi generativa sta assorbendo in modo massiccio il volume di traffico transazionale e informativo, trasformando la SERP da punto di navigazione a punto di risoluzione (Adela, Google AI Overviews: The End of Traditional CTR and How to Adapt in 2025, in «Dataslayer», 13 novembre 2025).

D’altra parte, sebbene il CTR sia in calo, i brand che riescono a essere citati nelle risposte AI guadagnano fino al 35% in più di clic organici e il 91% in più di clic a pagamento. Il successo non dipende più esclusivamente dal posizionamento nella SERP, ma dalla capacità del contenuto di essere riconosciuto, citato e valorizzato dall’intelligenza artificiale come fonte autorevole. Il contenuto deve essere strutturato per l’estrazione e la sintesi, poiché la SERP si è evoluta da un elenco di link a un punto di validazione dell’autorità. Interessanti, a tale proposito, gli spunti del Taining Director di Jellyfish (How Zero-Click Searches are Changing SEO In 2025, 28 luglio 2025)

L’indagine della UE

I cambiamenti sul modo in cui il pubblico si rapporta alle notizie e alle fonti sono oggetto di studi sempre più approfonditi. Per un quadro generale, suggerisco la lettura del Digital News Report 2025, curato dal Reuters Institute for the Study of Journalism (Oxford, University of Oxford, 2024). Al contempo ricordo che, giusto all’inizio della scorsa settimana, la Commissione Europea ha avviato un’indagine formale nei confronti di Google, per verificare se questa abbia violato l’articolo 102 del TFUE, abusando della propria posizione dominante nel mercato della ricerca online.

Al centro dell’indagine c’è l’impiego, da parte di Google, di contenuti online per addestrare i propri modelli di intelligenza artificiale e alimentare funzionalità come AI Overviews e AI Mode. L’ipotesi è che tale pratica causi danni significativi agli editori di notizie, sotto forma di perdita di traffico, lettori e ricavi. D’altronde gli editori, a meno che non siano disposti a scomparire completamente dai risultati di ricerca di Google, non hanno la possibilità di rinunciare all’utilizzo dei loro contenuti nei riassunti generati dall’intelligenza artificiale.

Interfacce diverse, comportamenti diversi

Dietro l’apparente uniformità dell’esperienza utente, i servizi si differenziano per obiettivi e modalità di gestione delle fonti. Google Search in AI Mode punta a riassumere i risultati più rilevanti, mantenendo fonti visibili e tracciabili tramite collegamenti espliciti. Questa scelta non è neutrale: serve a preservare il rapporto economico e informativo con gli editori. Il chatbot Google Gemini, al contrario, è progettato per produrre testo nuovo e strutturato, senza mostrare fonti in modo predefinito, aumentando il rischio di fruizione zero‑click.

ChatGPT adotta una soluzione intermedia: fornisce sintesi e generazione testuale, con fonti accessibili tramite icone o popup, ma resta esposto al rischio di incorporare implicitamente le premesse contenute nella domanda dell’utente. Perplexity, infine, nasce come motore di ricerca LLM‑native: le fonti sono sempre disponibili e spesso più estese di quelle mostrate da Google, con una tendenza a risposte più assertive.

L’orizzonte di aspettative statistico degli LLM

Per capire perché queste differenze contano, bisogna ancora una volta tornare a quanto dicevo all’inizio, ossia a come un modello linguistico genera le risposte. Un LLM non verifica ciò che dice: predice la parola successiva più probabile sulla base di pattern appresi durante l’addestramento. In sostanza, gli LLM operano per predizione statistica e non per verifica dei fatti.

La conseguenza è cruciale. In presenza di lacune informative, il modello tende a colmarle con ciò che appare plausibile, non necessariamente vero. Come mostrato in diversi casi di studio, l’LLM risponde anche quando dovrebbe fermarsi, perché «presuppone» che l’utente voglia comunque una risposta. Senza vincoli espliciti, preferisce generare contenuto piuttosto che dichiarare incertezza. Da qui nasce l’esigenza di pratiche operative che consentano all’utente di controllare e mitigare questo comportamento.

Va chiarito, peraltro, che l’uso di metafore comportamentali come il satisficing – un concetto associato alla scelta umana in condizioni di razionalità limitata – per descrivere la tendenza degli LLM ad agire in questo modo può essere fuorviante. Non si tratta di una decisione del modello, ma del risultato diretto dell’ottimizzazione dell’addestramento e delle scelte di decoding (come Nucleus Sampling o Top-K), che ricompensano la fluidità del testo a scapito della veridicità fattuale. La ricerca conferma che questi modelli sono architetturalmente orientati a generare risposte, anche in assenza di informazioni fondate, perché sono premiati per apparire sicuri.

Effetto oracolo fenomeno della fiducia cieca

Il rischio che gli utenti si fidino ciecamente delle risposte è dimostrato dai benchmark di accuratezza fattuale. Ad esempio, il benchmark TruthfulQA ha rilevato che, in condizioni zero-shot, i migliori modelli valutati mostravano una veridicità di circa il 58% su domande oggettive, un dato significativamente inferiore al 94% di accuratezza mostrata dagli operatori umani. Questi risultati evidenziano la distanza tra l’apparente convinzione del modello e la realtà fattuale, giustificando pienamente la necessità di una verifica manuale costante (ne parla bene Gianluigi Cogo in Il principio (pericoloso) del satisficing! Comprendere l’approssimazione delle risposte («Medium», 24 settembre 2025).

Istruzioni permanenti e controllo epistemico

Una prima linea di difesa consiste nell’impostare istruzioni permanenti, o personalization, che impongano al modello vincoli epistemici forti. Si tratta di chiedere al modello di rispondere solo sulla base di informazioni verificabili, di dichiarare esplicitamente l’incertezza quando le fonti non sono chiare, di evitare la speculazione e di citare sempre le fonti utilizzate.

Dal punto di vista tecnico, queste istruzioni vengono riutilizzate come vincolo di contesto in ogni conversazione. Non trasformano l’LLM in un verificatore, ma riducono la sua libertà di colmare i vuoti probabilistici e aumentano la probabilità che risponda «Non posso confermarlo» quando i dati non sono sufficienti.

Fonti, autorevolezza e livello di confidenza

Un secondo accorgimento consiste nel richiedere sempre non solo la citazione delle fonti, ma anche i criteri con cui sono state selezionate. I modelli non possiedono un concetto intrinseco di autorevolezza, ma possono rendere trasparente la dipendenza dall’indice di Google e spiegare perché una fonte viene considerata affidabile: indipendenza editoriale, reputazione, verificabilità incrociata.

È utile, inoltre, chiedere l’indicazione di un livello di confidenza associato alla risposta. I materiali mostrano che gli LLM possono associare una stima di incertezza ai passaggi logici principali, aiutando l’utente a riconoscere quando una risposta richiede una verifica manuale su fonti primarie.

Prompt engineering: evitare le implicature

Molti errori nascono dalla forma stessa delle domande. Gli LLM tendono a trattare come vere le premesse implicite contenute nel prompt. Se, per esempio, si chiede al modello di elencare cinque errori, il modello presuppone che siano cinque, anche quando non è così. Formulare domande aperte e non presuppositive riduce il rischio di risposte costruite per soddisfare la struttura della domanda, più che la realtà dei fatti.

Un’altra pratica efficace è richiedere un comportamento condizionale esplicito: se non trovi fonti certe e autorevoli, dichiara che non puoi rispondere. In questo modo si costringe il modello a interrompere la generazione quando l’incertezza supera una soglia accettabile.

Fasi distinte, filtri e verifiche

I modelli lavorano meglio quando il compito è suddiviso in fasi: interpretazione della domanda, ricerca, elenco delle fonti, sintesi. Questa scomposizione riduce errori di coerenza e generalizzazioni spurie. Allo stesso modo, l’imposizione di filtri temporali e geografici – per esempio limitare la ricerca a un arco di tempo definito o escludere determinate aree geografiche – consente di controllare meglio il campione di fonti, aumentando la robustezza del risultato.

Per temi controversi o in evoluzione, come conflitti armati o questioni politiche, è essenziale chiedere la variazione tra fonti, distinguere tra fonti indipendenti e di parte ed esplicitare eventuali asimmetrie informative. Anche il controllo di coerenza interna, richiesto esplicitamente, contribuisce a ridurre contraddizioni all’interno della stessa risposta.

Oltre la SERP: deep search e nuovi browser

Quanto fin qui osservato vale per la ricerca supportata da LLM, ma ancora basata sull’indice di un motore di ricerca tradizionale. È l’esperienza che facciamo con le AI Overview di Google, ma anche con ChatGPT in modalità search, con Claude o con Perplexity.  Tuttavia, abbiamo già detto che lo scenario si sta nel frattempo ampliando. E l’avvento di Deep Research di Google è solo la tappa più recente di questa evoluzione.

Le prime forme di deep search utilizzano API agent‑native come Exa, Tavily o Valyu, che restituiscono dati strutturati pensati per le macchine, non per gli esseri umani. Questo consente ragionamenti multi‑hop e rappresenta – secondo alcuni analisti – il primo strato di un nascente machine‑web, distinto ma complementare al web tradizionale. Si può vedere, in proposito, l’articolo Why Google is Being Replaced by AI Agents (And What’s Taking Its Place), pubblicato il 3 dicembre 2025 su Meidum da di M. Huzafa Rizwan.

In parallelo emergono browser con LLM integrati: Comet di Perplexity, le sperimentazioni di Arc e l’integrazione di Gemini Nano in Chrome. Questi strumenti riducono ulteriormente la distanza tra domanda e risposta generativa, automatizzano compiti complessi e rendono l’esperienza di ricerca sempre meno dipendente dalla SERP tradizionale.

Una competenza critica da coltivare

Usare oggi strumenti come ChatGPT, Gemini, Claude o Perplexity richiede una competenza critica specifica. Significa conoscere i limiti strutturali degli LLM, configurare correttamente le istruzioni permanenti, progettare prompt accurati e controllare sempre le fonti. Ma significa anche prepararsi a un ecosistema ibrido, in cui la ricerca per gli umani e la deep search per gli agenti convivranno. La domanda, a questo punto, non è se queste tecnologie diventeranno pervasive. È se saremo in grado di usarle senza rinunciare alla distinzione fondamentale tra ciò che appare plausibile e ciò che possiamo considerare vero.