Passer au contenu principal
Toutes les ressources

Pour toute personne qui lit une affirmation sur l’IA

Que nous disent vraiment les tests de modèles?

Voyez comment un modèle peut faire moins d’erreurs tout en donnant moins de bonnes réponses. Découvrez les questions à poser derrière un score.

Mis à jour le

Moins d’erreurs peut cacher un autre changement

Exemple pédagogique hypothétique — il ne s’agit pas de résultats Vinci. Deux modèles répondent aux mêmes 100 questions. Chaque réponse est jugée correcte, incorrecte ou refusée : le modèle a choisi de ne pas répondre. Pour Vinci MLE 1.0, aucun test valide sur des tâches d’ingénierie en apprentissage automatique réservées à l’évaluation n’a été mené à terme; cet exemple ne démontre pas ses capacités.

Ce qui s’est passéComment le comprendre
Modèle A : 70 réponses correctes, 20 incorrectes, 10 refusées70 réponses sur 100 sont correctes : 70/100 = 70 %. Gardez les 100 questions dans la comparaison, y compris celles auxquelles le modèle n’a pas répondu.
Modèle B : 68 réponses correctes, 8 incorrectes, 24 refuséesLes mauvaises réponses passent de 20 % à 8 % : 20 − 8 = 12 points de pourcentage. Mais les bonnes réponses passent aussi de 70 à 68, tandis que les refus passent de 10 à 24.
Un titre affirme : « Le modèle B est plus exact »Il manque une partie de l’histoire. Le modèle B fait moins d’erreurs, mais donne aussi moins de bonnes réponses. L’intérêt de ce compromis dépend de ce que vous lui demandez.
Une description plus complète« Sur ces 100 questions, le modèle B a donné moins de mauvaises réponses et a refusé plus souvent, tandis que les bonnes réponses sont passées de 70 à 68. » On ne sait toujours pas comment il répondrait à d’autres questions.
Pour aller plus loin, avec une fiche pratique

Vous voulez essayer? Ces vérifications supplémentaires et cette fiche vous aideront à noter ce que vous avez utilisé et ce qui s’est passé.

Trouver le modèle et le test précis

Une famille de modèles peut comprendre plusieurs tailles et versions. Un résultat appartient à la version testée, pas automatiquement à toute la famille.

  • Trouvez dans le rapport le nom exact du modèle, sa version et le type de fichier utilisé.
  • Vérifiez le nombre de tâches tentées, qui a jugé les réponses et ce qui comptait comme une bonne réponse.
  • Distinguez les résultats de chaque taille Cyber. Tester une taille ne démontre pas les résultats d’une autre.

Vérifier si la comparaison est équitable

Le système de départ utilisé pour comparer est souvent appelé référence. Vérifiez que les deux systèmes ont reçu les mêmes questions avec les mêmes règles.

  • Comparez le temps accordé, les outils disponibles et le nombre de tentatives.
  • Cherchez les nombres bruts avec les pourcentages, ainsi que les tentatives ignorées, inachevées ou invalides.
  • Examinez le travail produit. Un programme qui arrive à son terme ne donne pas forcément une bonne réponse; le rapport technique Vinci no 3 étudie cette distinction.

Repérer la question sans réponse

Un test de programmation peut montrer comment un modèle a traité ces exercices. À lui seul, il ne prouve pas que le modèle peut planifier et réaliser tout un projet d’apprentissage automatique.

  • Pour Vinci MLE 1.0, aucun test valide sur des tâches réservées d’ingénierie en apprentissage automatique n’a été mené à terme. Ces tâches sont mises de côté pour l’évaluation plutôt qu’utilisées pour développer le modèle.
  • Avant de vous fier à un résultat pour votre travail, essayez une petite tâche semblable à votre besoin. Définissez la réussite avant de voir la réponse.
  • Lorsque vous partagez un résultat, indiquez la version du modèle, le test et ses limites, avec un lien vers le rapport.

Prendre des notes sur un résultat de test

Utilisez une fiche par modèle et par test. Inscrivez « non rapporté » si la source ne donne pas le renseignement.

À quelle question ce test devait-il répondre?
Modèle exact et version :
Lien et date du rapport :
À quoi était-il comparé?
Combien de tâches et de tentatives?
Qui a vérifié les réponses, et comment?
Nombres de réponses correctes / incorrectes / refusées :
Tentatives ignorées, inachevées ou invalides :
Les deux systèmes avaient-ils le même temps et les mêmes outils?
Qu’est-ce qui s’est amélioré, et de combien?
Qu’est-ce qui s’est dégradé?
Que reste-t-il à démontrer?
Le test ressemble-t-il à mon usage prévu?
Mon résumé en une phrase :

Sources et prochaines étapes

La fiche d’un modèle est la page d’information publiée par son créateur. Consultez-la pour les instructions de téléchargement, la licence et les limites connues. Les sources techniques externes sont en anglais.