Gridnorth

Évaluation en laboratoire : résultats à l’appui du TRL 3

En bref : sur un jeu de test synthétique réservé de 120 entrées, l’extraction contrainte a produit chaque fois un enregistrement structurellement valide, l’exactitude des champs était de 84,4 %, et les signalements ont permis de repérer 64,4 % des erreurs. Des lacunes subsistent pour le texte de style radio et la couverture des signalements. Les conditions, les constatations et les points ouverts suivent.

Portée et état

Cette page rend compte d’une évaluation en laboratoire de chaque fonction critique de Gridnorth, menée en septembre 2026. Les résultats appuient le niveau de maturité technologique (TRL) 3 : preuve de concept démontrée en laboratoire sur des données représentatives. Le TRL est une cote de maturité de la technologie. Les données qui l’appuient sont des résultats de laboratoire sur des messages synthétiques, et non des données de terrain.

Conditions d’essai

  • Modèle : Mistral-7B-Instruct, quantifié sur 4 bits, exécuté localement sans service externe.
  • Messages : trois types fondés sur des formats publics : une demande d’évacuation sanitaire en 9 lignes adaptée, un compte rendu de contact SALUTE et un compte rendu de situation logistique. Ce sont des substituts. Ce ne sont pas des définitions de l’APP-11.
  • Jeu de test : 120 entrées, moitié en français et moitié en anglais, générées à partir d’une valeur d’initialisation fixe et indépendantes de l’invite. Les réponses de référence venaient du générateur, jamais du modèle. Une vérification automatisée a confirmé qu’aucune valeur du jeu de test n’apparaissait dans une invite. Les entrées variaient selon la langue, le style, la mise en page et les corrections en cours de message.
  • Styles d’entrée : texte de style saisi, et texte de style radio, écrit comme les messages sont énoncés à la radio. Aucun enregistrement audio n’a été utilisé.
  • Référence de comparaison : le même modèle et la même invite, sans décodage contraint.
  • Seuil de signalement : réglé sur la moitié des éléments et mesuré sur l’autre moitié.
  • Encodage : EXIficient, une mise en œuvre de la norme EXI du W3C, compilée à partir des sources à des versions fixes.

Un essai de mise au point sur un jeu de test distinct a révélé deux défauts, l’un dans le format des indicatifs, l’autre dans une mesure de confiance. Les deux ont été corrigés avant cet essai-ci, et seul celui-ci est présenté. L’intégrité des essais de l’évaluation donne le raisonnement.

Constatations

Structure

MesureRésultat
Enregistrements structurellement valides, décodage contraint100 %
Enregistrements structurellement valides, même modèle sans contrainte60,8 %

Exactitude de l’extraction

MesureRésultat
Exactitude des champs, tous champs confondus84,4 %
Exactitude des champs, texte de style saisi94,3 %
Exactitude des champs, texte de style radio74,5 %
Exactitude des champs, anglais86,4 %
Exactitude des champs, français82,3 %

Confirmation par l’opérateur

MesureRésultat
Champs signalés pour confirmation15,3 %
Erreurs repérées par les signalements64,4 %
Champs critiques erronés et non signalés2,9 %
Mesuré sur la moitié des éléments qui n’a pas servi à régler le seuil de signalement.

Encodage

MesureRésultat
Taille moyenne d’un message, XML texte brut328 octets
Taille moyenne d’un message, gzip202 octets
Taille moyenne d’un message, EXI sans le schéma190 octets
Taille moyenne d’un message, EXI guidé par le schéma19 octets
Aller-retour EXI100 % sans perte

Durée

MesureRésultat
Temps d’extraction médian7,7 s sur un seul processeur graphique (GPU) NVIDIA T4, un composant de centre de données

Appréciation

Contraindre la sortie du modèle est ce qui le rend utilisable pour la messagerie de machine à machine : sans la contrainte, quatre sorties sur dix ne pouvaient pas du tout être traitées. Le texte de style saisi dépasse 94 % d’exactitude des champs. L’écart entre l’anglais et le français est d’environ quatre points.

Limites et points ouverts

  • Champs critiques en style radio. Les références de quadrillage, les heures et les indicatifs énoncés chiffre par chiffre sont la principale source d’erreurs. La prochaine étape confie leur analyse à du code déterministe.
  • Couverture des signalements. Les signalements repèrent environ les deux tiers des erreurs. La cible est d’au moins 80 %.
  • Parole. Toutes les entrées étaient du texte. La parole de vrais locuteurs n’a pas été mise à l’essai.
  • Schémas. Les schémas sont représentatifs. Les résultats sur les schémas de l’APP-11 différeront, et la réduction obtenue avec l’EXI sera probablement moindre sur des messages contenant plus de texte libre.
  • Matériel. Le temps a été mesuré sur un GPU de centre de données, et non sur du matériel de périphérie.

Dernière révision 29 septembre 2026