Sempre più persone chiedono all’intelligenza artificiale di cercare prodotti, confrontare prezzi o suggerire caratteristiche tecniche. Ma un nuovo studio dedicato allo shopping online mostra che alcuni chatbot, in particolare Gemini di Google, tendono a restituire informazioni inesatte con una frequenza tutt’altro che trascurabile, con potenziali ripercussioni dirette sul portafoglio degli utenti.

Gemini in difficoltà su prezzi e informazioni sui prodotti

Il benchmark, realizzato da Product.ai, ha sottoposto a Gemini, Claude, ChatGPT e Perplexity domande relative a 9 categorie di e-commerce, ripetendo ogni quesito cinque volte per verificarne anche la coerenza delle risposte.

Secondo i risultati, nella versione a pagamento di Gemini il 21% delle risposte conteneva informazioni potenzialmente inesatte, come prodotti inventati, specifiche errate o nomi di modelli inesistenti. Ancora più rilevante, il 54% delle risposte includeva errori capaci di avere un impatto economico diretto sull’utente. Nella versione gratuita le percentuali erano rispettivamente del 20% e del 56%.

Per confronto, ChatGPT ha fatto segnare il 6% (gratuito) e il 7% (a pagamento) di risposte con informazioni inventate, con errori di impatto economico rispettivamente del 19% e del 17%. Claude si è fermato al 12% nella versione a pagamento, con il 21% di errori economicamente rilevanti, mentre Perplexity ha registrato il 3% e il 14%.

Risposte incoerenti anche a distanza di pochi minuti

Un altro aspetto interessante riguarda la coerenza delle risposte nel tempo: ripetendo la stessa domanda a distanza di pochi minuti, Gemini ha fornito risposte diverse rispetto a quelle precedenti nel 29% dei casi in versione gratuita e nel 27% in versione a pagamento. ChatGPT si è attestato al 22% e 18%, Claude al 26% e 17%.

In altre parole, anche quando un’AI fornisce un nome di prodotto o un prezzo apparentemente plausibile, non è detto che quella stessa informazione resti stabile a un secondo tentativo.

Perplexity il più affidabile, ma con qualche cautela

Tra i servizi testati, Perplexity ha mostrato la maggiore accuratezza, con solo il 3% di risposte contenenti informazioni inventate e il 14% di errori a impatto economico nella versione a pagamento. Va però considerato che Perplexity si affida sempre alla ricerca web in tempo reale, un fattore che può influenzare il confronto diretto con gli altri chatbot, i quali utilizzano approcci e modelli differenti.

Product.ai consiglia di usare l’AI come punto di partenza per farsi un’idea generale su un prodotto, ma di verificare sempre prezzo, specifiche tecniche e disponibilità sui siti ufficiali dei produttori o dei rivenditori prima di procedere all’acquisto. Non a caso, secondo un’indagine della stessa Product.ai, l’86% degli utenti che utilizza l’AI per cercare prodotti verifica comunque le informazioni ricevute su un’altra fonte prima di completare l’acquisto: un’abitudine che, alla luce di questi numeri, sembra tutt’altro che superflua.