Un'AI che risponde ripete quello che trova. È il suo scopo, attenersi alle tue pagine invece di inventare, ed è anche il suo limite. Nel benchmark ClashEval (NeurIPS 2024), a sei modelli di punta sono stati dati documenti con dentro una risposta sbagliata di proposito. In più del 60% dei casi hanno preferito il contenuto sbagliato a quello che sapevano già, e che era giusto.
Ed erano domande di cultura generale, su cui un modello ha almeno qualcosa di suo a cui appoggiarsi. Sulle date, i responsabili e le decisioni della tua azienda non ha niente: la pagina è la sua unica fonte.
Quando due pagine trovate dalla ricerca sono in conflitto, uno studio di Google Research sulle fonti in conflitto nei modelli con ricerca integrata ha rilevato che i modelli faticano spesso a risolvere il conflitto in modo appropriato; chiedere loro di ragionarci esplicitamente aiuta, ma non basta.
Anche un modello che gestisce il conflitto alla perfezione può solo dirti che due pagine non sono d'accordo. Quale delle due vale è stato deciso in un posto che l'assistente non può leggere.