L’essentiel
- La valeur d’un deuxième contrôle par l’IA s’évalue à travers les erreurs détectées et acceptées.
- La proportion d’erreurs manquées et le taux d’erreur parmi les documents acceptés ont des dénominateurs différents.
- Une comparaison utile relève aussi les signalements inutiles, les cas non résolus et le travail de vérification.
Une entreprise ajoute un deuxième modèle d’IA pour contrôler le travail du premier. L’un rédige une note de décision, l’autre l’approuve. La décision d’achat dépend alors d’une question apparemment simple : quelles preuves montrent que cette étape supplémentaire détecte les erreurs qui peuvent avoir des conséquences ?
Imaginons une note d’investissement interne qui confond une capacité actuelle d’un fournisseur avec une fonction annoncée pour l’année suivante. Deux présentations convaincantes de la même hypothèse erronée laissent la décision exposée. Cet exemple est fictif. Pour la direction, la question utile consiste à déterminer comment évaluer le dispositif de contrôle avant de se fier à son approbation.
Ce que mesure réellement la recherche
L’étude de Kim et ses collègues, publiée à ICML en 2025, analyse 71 modèles dans son jeu de données HELM. Lorsque deux modèles se trompent, leurs réponses incorrectes coïncident en moyenne dans environ 60 % des cas. Ce résultat conditionnel sur des questions à choix multiple ne prédit les erreurs ni d’un contrôle documentaire opérationnel ni des modèles actuels.[1]
Pour une décision d’achat, je considérerais l’accord comme une observation à examiner davantage. Une deuxième réponse peut apporter des informations utiles. Sa valeur comme contrôle dépend des erreurs qu’elle détecte et de celles qu’elle laisse passer. Compter les approbations ne permet pas de répondre à cette question.
Commencer par les documents acceptés
Prenons un test entièrement fictif de 100 notes. Des personnes qualifiées, à partir des documents de référence, établissent que 20 contiennent une erreur factuelle importante pour la décision. Le deuxième modèle signale 15 de ces notes erronées, ainsi que cinq notes correctes. Il accepte les 80 autres.
Cinq notes incorrectes ont donc passé le contrôle. Elles représentent 25 % des erreurs initiales : cinq divisé par 20 égale un quart. Parmi les 80 notes acceptées, le taux d’erreur est de 6,25 % : cinq divisé par 80 égale 0,0625. Ces pourcentages répondent à des questions différentes. Aucun ne provient de l’étude.
Le contrôle a repéré des erreurs utiles à corriger dans cet exemple. Il a aussi renvoyé 20 notes pour examen supplémentaire, dont cinq étaient correctes. Son intérêt dépend des conséquences des erreurs restantes et du travail nécessaire pour traiter les signalements. Nous n’avons mesuré ni le temps gagné ni la qualité d’une éventuelle correction ultérieure.
Ce calcul explique aussi pourquoi une proportion élevée d’approbations peut induire en erreur. Un système qui accepte tout atteint 100 % sans détecter aucune erreur. L’évaluation porte donc aussi sur ce qui subsiste après son approbation.
Définir le travail du deuxième contrôle
Le cadre volontaire de gestion des risques de l’IA de NIST, version 1.0, prévoit d’évaluer les contrôles et de tester dans des conditions proches de l’utilisation. Ses recommandations de mesure incluent la documentation des méthodes et de leurs limites. C’est un point de départ utile pour examiner cette étape supplémentaire.[2]
La démarche suivante est mon application proposée de ce principe. L’efficacité de cette procédure particulière n’a pas été évaluée ici.
D’abord, définir l’erreur susceptible de changer une décision. Pour une note d’investissement, il pourrait s’agir d’un chiffre d’affaires sans justification, d’une capacité mal datée ou d’une réserve omise. Distinguer les erreurs importantes des préférences stylistiques. Confier la responsabilité de cette définition à une personne identifiée.
Ensuite, réunir des cas pour lesquels des personnes compétentes peuvent établir des réponses de référence à partir de documents faisant autorité. Conserver les désaccords non résolus, sans imposer artificiellement une réponse correcte ou incorrecte. Inclure des cas ordinaires et des exceptions plausibles, comme des versions contradictoires d’un document. Documenter leur proximité avec le travail prévu.
Puis tester le dispositif réel. Garder fixes les versions des modèles, les consignes et les sources disponibles. Préciser si le contrôleur voit immédiatement la première réponse ou examine d’abord les pièces. Comparer les résultats sur les mêmes cas avec et sans contrôle supplémentaire. Modifier ce dispositif revient à changer le test.
Le compte rendu présente les effectifs derrière les pourcentages : documents erronés détectés, documents erronés acceptés, documents corrects signalés et cas non résolus. Il indique également la part acceptée, la gravité des erreurs et le travail de vérification. Un petit test sans échec observé laisse subsister une incertitude sur les échecs rares ; il ne constitue aucun certificat général de sécurité.
Enfin, conserver des cas nouveaux pour l’évaluation après le développement. Refaire les vérifications lorsque les modèles, les documents ou les tâches changent. Un résultat favorable étaye une décision circonscrite au dispositif étudié.
Comme fondateur d’aiomics, cette approche m’aide à préciser la question de direction : qui définit l’erreur résiduelle acceptable et quelles preuves cette personne examinera-t-elle ? Le prochain échange avec un fournisseur peut demander une comparaison cas par cas : ce que le deuxième contrôle a détecté, ce qu’il a manqué et le travail supplémentaire créé par ses signalements.
Sources et lectures complémentaires
- Kim : erreursPMLR
Accord conditionnel.
- NIST : gestion des risques, version 1.0NIST
Évaluation des contrôles.
Le point de départ de cette réflexion
Perspective et intérêts
Cet article a été élaboré avec l’aide de l’IA. Les deux exemples d’entreprise et tous les chiffres du calcul sont fictifs. La procédure d’évaluation proposée constitue une déduction méthodologique originale ; son efficacité n’a pas été évaluée ici.
Je suis fondateur et dirigeant d’aiomics et j’ai un intérêt économique dans une adoption responsable de l’IA en médecine.



