Les chatbots d'intelligence artificielle ne sont pas parfaits
Les chatbots d'intelligenceartificielle (IA) ne sont pas parfaits. Ils peuvent parfois halluciner, ce qui signifie afficher des réponses fausses même si elles adoptent un sens logique.
Comment les chatbots d'ia hallucinent
Les modèles de langage avancés (LLMs) sont entraînés pour prédire le mot suivant en fonction des patterns qu'ils ont appris. Lorsqu'ils ne trouvent pas de patron spécifique pour répondre à une question, ils tenteront de répondre en assemblant des mots qui font sens statistiquement, même si cela est incorrect en fait.
C'est pourquoi les modèles d'IA ont toujours besoin d'une vérification humaine pour des informations telles que les cours de bourse, les noms et les dates.

Les chatbots d'ia les plus propens à halluciner
Une enquête menée par Legal Guardian Digital, une entreprise de SEO spécialisée dans les cabinets d'avocats, a révélé les chatbots d'IA les plus propens à fournir des informations fausses.
Le chatbot Google Gemini a été jugé le plus susceptible à l'hallucination, avec un taux de 32% de réponses erronées. Ce résultat pourrait inquiéter Apple, qui verse au moins 1 milliard de dollars par an à Google pour utiliser un modèle LLM custom de 1,2 milliard de paramètres, baptisé Gemini, pour alimenter le chatbot Siri attendu avec iOS 27 cette année.
ChatGPT, le deuxième chatbot le plus susceptible à l'hallucination, a produit des erreurs dans un tiers des réponses. Perplexity AI a été le moins apte à fournir des réponses fausses, avec un taux de 13%.
Les scores d'index des autres modèles ont varié de 14% à 15% pour DeepSeek et Grok, les deux chatbots les moins propens à l'erreur.

Les chatbots d'ia les plus fiables
Les modèles qui ont obtenu les meilleurs scores global ont été Perplexity AI, Grok et DeepSeek. Ils ont également été les plus rares à être en panne, avec des taux d'uptime de 99,68% à 99,98%.
Les scores d'index, qui allent de 0 à 100, prennent en compte la précision, la satisfaction du client et la disponibilité des modèles.
ChatGPT, qui a obtenu un score d'index de 50, a terminé à la sixième place, tandis que Gemini a obtenu un score de 41, le plaçant à la huitième place. Meta AI, le moins performant, a obtenu un score de 37.
