AI · CX Operations
La cosa più importante che la tua AI può dire è «non lo so»
Questo mese ho messo un assistente su questo sito. Ogni risposta l’ho approvata io. La parte su cui ho lavorato di più è quella in cui dice «non lo so».
Quando una domanda esce da quelle risposte, lo dice e ripete la domanda. Poi propone due modi per raggiungermi: una call, oppure un’email che contiene già la domanda. Dopo due tentativi a vuoto smette di provarci e passa la mano.
Sembra un dettaglio. È la parte che la maggior parte dei progetti di AI nel customer service sbaglia, e la ricerca recente spiega perché.
Le macchine sono addestrate a tirare a indovinare
A settembre 2025 OpenAI ha pubblicato uno studio sul perché i modelli linguistici hanno le allucinazioni. La risposta è meno misteriosa di quanto sembri. I modelli vengono valutati soprattutto sull’accuratezza, cioè sulla quota di domande a cui rispondono giusto. Con questo punteggio, tirare a indovinare conviene sempre più che ammettere di non sapere, come a uno studente non conviene mai lasciare in bianco una domanda a risposta multipla.
I numeri dello studio lo mostrano bene. Sullo stesso test di domande fattuali, un modello più vecchio (o4-mini) si è astenuto solo nell’1% dei casi e ha sbagliato il 75% delle risposte. Uno più nuovo (gpt-5-thinking-mini) ha scelto di non rispondere nel 52% dei casi e ha sbagliato il 26%. L’accuratezza era quasi identica: 24% contro 22%. Il modello più vecchio sembrava migliore in classifica perché tirava a indovinare.
La soluzione proposta da OpenAI riguarda la classifica: penalizzare gli errori detti con sicurezza più dell’incertezza, e dare un credito parziale a un «non lo so» onesto.
Il «non lo so» c’era già, di default
Anthropic ha guardato lo stesso problema dall’interno del modello. A marzo 2025 ha pubblicato una ricerca che traccia come Claude decide se rispondere. Ha trovato un circuito acceso di default, che porta il modello a dire che non ha abbastanza informazioni. Quando il modello riconosce qualcosa che conosce, un altro segnale spegne quel default.
Le allucinazioni nascono quando quell’interruttore scatta per sbaglio. Il modello riconosce un nome già visto, il «non lo so» di default viene spento, e il vuoto si riempie con qualcosa di plausibile e falso.
Quindi, in un certo senso, il «non lo so» è il punto di partenza. Quello che costruiamo intorno al modello decide se sopravvive.
Quanto costa una risposta sbagliata detta con sicurezza
A febbraio 2024 un tribunale canadese ha dato torto ad Air Canada. Il chatbot del suo sito aveva detto a un cliente che poteva chiedere lo sconto per lutto anche dopo il viaggio. La policy della compagnia diceva altro. Air Canada ha sostenuto che il chatbot fosse responsabile delle proprie azioni. Il tribunale non le ha dato ragione: l’azienda risponde di tutte le informazioni sul suo sito, chatbot compreso. Il risarcimento era di poche centinaia di dollari canadesi. Il principio vale molto di più: quello che dice il tuo bot, l’hai detto tu.
Ad aprile 2025 Cursor, un’azienda software in forte crescita, ha visto il suo bot di supporto inventarsi una policy. Gli utenti chiedevano perché venivano disconnessi quando cambiavano dispositivo, e il bot ha spiegato una regola che non esisteva. Alcuni hanno disdetto l’abbonamento. Il co-fondatore ha dovuto rispondere in pubblico: «We have no such policy», non abbiamo nessuna policy del genere. Da allora, le risposte AI del loro supporto via email sono segnalate come AI.
A maggio 2025 il CEO di Klarna ha detto a Bloomberg che il costo era stato «un fattore di valutazione troppo predominante» nel modo in cui avevano organizzato il customer service con l’AI, e che «alla fine ottieni una qualità più bassa». La nuova linea: i clienti devono sapere che ci sarà sempre una persona, se la vogliono.
Di cosa hanno davvero paura i clienti
Gartner ha intervistato 5.728 clienti a fine 2023. Il 64% ha detto che preferirebbe che le aziende non usassero l’AI nel customer service. La preoccupazione principale era che l’AI renda più difficile parlare con una persona. Nella lista c’erano anche le risposte sbagliate.
Messi insieme, questi casi puntano nella stessa direzione. I clienti accettano che un bot abbia dei limiti. Reagiscono male quando li nasconde e sbarra la strada verso una persona.
Ammettere l’incertezza costa fiducia?
Un po’, ed è utile. In uno studio del 2024 di ricercatori di Princeton e Microsoft Research, 404 persone hanno usato uno strumento di ricerca con AI per rispondere a domande mediche. Quando l’AI diceva «non ne sono sicuro, ma…», le persone erano d’accordo con lei meno spesso (dall’80,9% al 74,8%) e si fidavano meno delle sue risposte. In compenso rispondevano giusto più spesso, perché si appoggiavano meno a quelle sbagliate.
La fiducia è scesa un po’. L’accuratezza è salita. Nel customer service farei questo scambio ogni volta. Voglio che i clienti si fidino delle risposte giuste e mettano in dubbio quelle traballanti.
Le persone le abbiamo addestrate noi a indovinare
Niente di tutto questo è nuovo per chi ha lavorato al telefono. Ho iniziato come agente, misurato sui tempi di gestione, senza che nessuno mi spiegasse perché. Quando il KPI è il cronometro, «verifico e ti richiamo» sembra un fallimento. Una risposta sicura chiude il contatto.
È lo stesso incentivo che OpenAI descrive nei suoi modelli. Se la scheda di valutazione premia la chiusura e ignora l’errore, le persone imparano a tirare a indovinare, e le macchine anche. La felicità del cliente dipende dalla felicità dell’organizzazione. Qui dipende anche da cosa scegliamo di misurare.
Come progettare un buon «non lo so»
È quello che ho messo nell’assistente di questo sito, ed è quello che chiederei a qualsiasi AI in un’operation di supporto.
- Dirlo presto. Le linee guida di Microsoft per gli agenti conversazionali suggeriscono non più di due tentativi di recupero prima di indirizzare l’utente altrove. Dopo due tentativi a vuoto, basta.
- Far vedere cosa hai capito. Ripetere la domanda del cliente, così sa che è stata letta.
- Passare la mano con la domanda allegata. Nessuno dovrebbe spiegare il proprio problema due volte.
- Dare un’aspettativa. Dire chi risponderà, e più o meno quando.
- Misurarlo. Contare quante volte l’AI dice «non lo so», leggere quelle domande ogni settimana e trasformare le più frequenti in nuove risposte approvate.
L’ultimo punto è quello che la maggior parte dei team salta. La quota di conversazioni chiuse senza operatore, da sola, dice poco. Io guarderei quante di quelle conversazioni tornano il giorno dopo.
Sai quante volte al giorno la tua AI dice «non lo so»? E quante volte avrebbe dovuto dirlo?
Fonti
- OpenAI, Why language models hallucinate, settembre 2025
- Anthropic, Tracing the thoughts of a large language model, marzo 2025
- American Bar Association, BC tribunal confirms companies remain liable for information provided by AI chatbot (Moffatt v. Air Canada), febbraio 2024
- The Register, Cursor AI’s own support bot hallucinated its usage policy, aprile 2025
- Fortune, Klarna su AI e customer service umano, che riprende Bloomberg, maggio 2025
- Gartner, Survey finds 64% of customers would prefer that companies didn’t use AI for customer service, luglio 2024
- Kim, Liao, Vorvoreanu, Ballard, Wortman Vaughan, “I’m Not Sure, But…”: Examining the Impact of Large Language Models’ Uncertainty Expression on User Reliance and Trust, FAccT 2024
- Microsoft, Progettare i fallback degli agenti conversazionali, linee guida Copilot Studio
Da leggere anche: L’AI deflection fallisce quando viene implementata sotto pressione · Il tuo CSAT potrebbe mentirti
Stai valutando di portare dentro un fractional CX director che segua questo lavoro end to end?