Mardi dernier, des chercheurs de l’Université de Stanford et de l’Université de Californie à Berkeley ont publié une étude qui évaluait comment à la fois GPT-3.5 (utilisé dans le ChatGPT gratuit) et GPT-4 (utilisé dans ChatGPT Plus) et sur Bing Chat). Les conclusions sont surprenantes : en général, les deux modèles se sont détériorés.
À l’aide de l’API de ces modèles, les chercheurs ont analysé les performances de ces modèles dans deux versions différentes, la version de mars 2023 et la version de juin 2023. Ils ont effectué des tests composés de questions de résolution de problèmes mathématiques, de questions sensibles, de génération de code et de raisonnement visuel.
On a demandé au chatbot si le nombre 17077 est premier (il est) en raisonnant la réponse, et ce même test a été effectué avec 500 exemples. Les changements de précision étaient incroyables. GPT-4, qui corrige 97,6% des questions avec sa version de mars, est tombé à une précision de 2,4% dans sa version de juin. C’est exactement le contraire qui s’est produit pour GPT-3.5 et il est passé de 7,4 % en mars à 86,8 % en juin.
Selon le portail web spécialiste de la technologie Xataka, il souligne que les spécialistes ont remarqué que GPT-4 était moins « bavard » : les réponses étaient plus concises et le nombre de caractères générés est passé de 821,2 en mars à 3,8 en juin. GPT-3.5, en revanche, a écrit des réponses 40 % plus longues.
Les chercheurs ont également voulu essayer de poser des questions délicates pour essayer de forcer différentes versions de ChatGPT à se comporter de manière incorrecte. Les jailbreaks et les exploits sont déjà connus, mais au moins dans GPT-4, le comportement était plus sécurisé (il ne répondait qu’à 5% des questions sensibles dans sa version de juin, contre 21% en mars), bien qu’il explique à peine pourquoi pas. Bien. GPT-3.5 a répondu davantage dans sa dernière version (de 2% à 8% en juin).
Code moins exécutable
Ce chatbot est largement utilisé pour générer du code, mais son évolution dans cette section est également erratique. Selon les chercheurs, pour GPT-4, le code généré directement exécutable (et donc plus réactif) est passé de 52 % à 10 % en juin, et pour GPT-3.5, le pourcentage est également passé de 22 % à 2 %. GPT-4 a écrit des réponses plus longues avec plus de texte non codé.
ChatGPT s’aggrave-t-il ?
L’étude arrive à un moment curieux, d’autant plus que plusieurs discussions dans des forums tels que Hacker News révèlent que pour de nombreux utilisateurs, la qualité de ChatGPT s’est dégradée.
Parmi les théories envisagées, OpenAI pourrait proposer des versions «légères» pour réduire les ressources nécessaires, telles que le temps GPU, pour calculer toutes ces informations.