Recherche · IA digne de confiance pour le commandement et le contrôle

Intégrité des essais de l’évaluation de Gridnorth

Les résultats d’un modèle de langage se prêtent facilement à la flatterie. Ce texte énumère les précautions prises lors de l’évaluation en laboratoire et les faiblesses qui subsistent.

Ce que nous avons fait

  1. Généré le jeu de test à partir d’une valeur d’initialisation fixe. Les 120 entrées ne dépendent pas de l’invite et peuvent être régénérées à l’identique.
  2. Tiré les réponses de référence du générateur, jamais du modèle. Ce que dit le modèle est jugé d’après ce que le générateur a mis.
  3. Contrôlé les fuites de manière automatisée. Un script a confirmé qu’aucune valeur du jeu de test n’apparaissait dans une invite.
  4. Séparé les données de mise au point et les données d’essai. Nous avons construit et réglé sur un jeu et mesuré sur un autre.
  5. Réglé le seuil de signalement sur la moitié des éléments et mesuré sur l’autre moitié. Un seuil choisi sur les données mêmes qui servent à le noter flatte le résultat.
  6. Utilisé une référence de comparaison. Le même modèle et la même invite, sans décodage contraint.
  7. Fixé les versions et compilé la mise en œuvre de l’EXI à partir des sources, afin que le résultat puisse être reproduit.
  8. Présenté seulement l’essai final. Notre essai de mise au point a révélé deux défauts, dans le format des indicatifs et dans une mesure de confiance. Nous avons corrigé les deux avant l’essai final, et nous le disons.

Ce que ces précautions ne couvrent pas

  • Les données sont synthétiques et nous avons écrit le générateur. Si notre générateur écrit des messages plus proprement que ne le font les gens, les résultats sont optimistes. Ce sont de vrais messages qui feront la preuve.
  • Toutes les entrées étaient du texte. La reconnaissance vocale ajoute ses propres erreurs et n’a pas été mise à l’essai.
  • Un modèle, un essai. Nous n’avons pas mesuré de combien les chiffres bougent d’un essai à l’autre ou d’un modèle à l’autre.
  • Les schémas sont des substituts, et non des définitions de l’APP-11.
  • L’échantillon est petit. La moitié du jeu de test étant dans chaque langue, l’écart d’environ quatre points entre l’anglais et le français est une indication, non une conclusion.

La suite

Des données d’essai rédigées par des personnes extérieures à l’équipe, de la parole de vrais locuteurs, de vrais schémas de messages, et assez d’essais répétés pour assortir chaque chiffre d’une marge d’erreur. La page des résultats sera mise à jour à mesure que chacun arrivera, et les anciens chiffres resteront visibles pour comparaison.

Dernière révision 29 septembre 2026