AI Foundations
D6 · Verifying and Evaluating Output
Un protocole de vérification proportionnel aux enjeux, le test de provenance, la vérification des citations, et décider quand une revue humaine est requise avant d’agir sur une sortie de ChatGPT.
Ce domaine pèse 14 % de l’examen blanc — soit environ 8 des 60 items. C’est là que l’avertissement du domaine 2 (« la fluidité n’est pas l’exactitude ») devient une routine. Il teste si vous traitez chaque sortie exploitable comme un brouillon à vérifier, si vous ajustez la vérification aux enjeux, et si vous savez remonter une affirmation jusqu’à sa source et vérifier une citation correctement. Presque chaque item se ramène à une seule question : qu’est-ce qui pourrait être faux ici, et comment le saurais-je ?
Ce qu’il faut savoir
Parce que le modèle génère du texte probable plutôt qu’une vérité vérifiée, vous êtes responsable de l’exactitude de tout ce sur quoi vous agissez. La vérification devrait être proportionnelle aux enjeux : un brouillon à faibles enjeux nécessite une lecture de bon sens, une sortie à forts enjeux, externe ou réglementée nécessite une vérification ligne par ligne et une étape de revue humaine. Le test de provenance demande d’où vient chaque affirmation et choisit le contrôle suffisant le moins coûteux. Les citations doivent être ouvertes, non crues sur la foi d’un nom au son réaliste. Les erreurs de cohérence interne (totaux, contradictions) sont les moins coûteuses à détecter et ne nécessitent jamais de source externe.
Objectifs d’apprentissage
À la fin de cette page, vous devriez être capable de :
- Appliquer un protocole de vérification proportionnel aux enjeux.
- Utiliser le test de provenance pour choisir le contrôle suffisant le moins coûteux pour une affirmation.
- Vérifier les citations correctement au lieu de faire confiance à leur apparence.
- Détecter les défaillances de cohérence interne sans sources externes.
- Décider quand une revue humaine est obligatoire avant d’agir.
- Éviter les faibles méthodes de « vérification » qui ne sont que des simulacres de contrôle.
6.1 Vérification proportionnelle aux enjeux
Toutes les sorties n’exigent pas la même rigueur. Ajustez l’effort aux conséquences.
Stakes ───────────────────────────────────────────────────────►Low Medium Highbrainstorm, first internal memo, customer external publication,draft, personal note email draft, slide deck legal/medical/financial, regulatory filing, pricingSanity-read; fix Verify every number, name, Line-by-line check;obvious errors date, citation; check independent expert review; internal consistency documented sign-offSignaux dans un énoncé qui poussent vers une rigueur élevée : « sera publié », « régulateur », « destiné au client », « contrat », « conformité », « médical », « chiffres financiers », « communiqué de presse », « irréversible », « décision d’embauche ».
Signal d’évaluation
La bonne réponse choisit le contrôle le moins coûteux qui est suffisant pour les enjeux. Sur-vérifier un brouillon jetable et sous-vérifier un dossier de conseil d’administration sont tous deux erronés ; l’examen récompense la proportionnalité.
6.2 Le test de provenance
Pour toute affirmation qui compte, demandez d’où cela vient-il ? — puis utilisez le contrôle le moins coûteux adapté à la source.
| Source de l’affirmation | Contrôle suffisant le moins coûteux |
|---|---|
| Citée/paraphrasée d’un document que vous avez fourni | Localiser la phrase justificative ; confirmer la paraphrase |
| Récupérée avec une citation (Search / deep research) | Ouvrir la source ; confirmer qu’elle dit ce que le modèle affirme |
| Issue de la connaissance propre du modèle, sans source | La traiter comme une piste ; vérifier contre une source indépendante |
| Un nombre calculé par le modèle | Recalculer avec un outil ou à la main |
| Interne (totaux, renvois) | Recalculer ou comparer des sections — aucune source externe requise |
a claim you will act on │ ├─ came from supplied text? ── check the passage ├─ came with a citation? ───── open the source ├─ came from model memory? ─── verify independently ├─ was computed? ──────────── recompute with a tool └─ internal (totals)? ─────── recompute; no web neededLe test de provenance prévient deux erreurs opposées : recourir au web pour vérifier une arithmétique (sur-ingénierie), et faire confiance à une affirmation de mémoire du modèle sans aucune source indépendante (sous-vérification).
6.3 Vérifier les citations
Une citation hallucinée mélange des éléments au son réaliste — un titre plausible, des auteurs d’apparence réelle, un nom de revue réel — autour d’une affirmation que la source peut ne pas étayer, ou qui peut ne pas exister du tout. Le seul contrôle valide est d’ouvrir la source et de confirmer qu’elle existe et dit réellement ce que le modèle affirme.
| Faux « contrôle » | Pourquoi il échoue | Contrôle valide |
|---|---|---|
| Le nom de la revue est réel | Les fabrications réutilisent des noms réels | Ouvrir l’élément cité |
| Demander le DOI dans la même conversation | Le DOI peut aussi être fabriqué | Rechercher la source indépendamment |
| Il apparaît deux fois dans la réponse | La répétition n’est pas une preuve | L’ouvrir une fois, correctement |
| Régénérer et voir s’il réapparaît | Teste la stabilité, pas l’existence | Confirmer qu’il existe et étaye l’affirmation |
Une seule citation fabriquée est un drapeau rouge pour l’ensemble de la sortie : dès qu’une échoue, passez du contrôle par sondage à la vérification de chaque citation et de toute affirmation qui en dépend.
6.4 Cohérence interne — le contrôle le moins coûteux
Certaines erreurs ne nécessitent aucune source externe : vous comparez seulement la sortie avec elle-même et ses entrées.
| Incohérence | Comment elle se cache | Détection |
|---|---|---|
| Les lignes du tableau ne totalisent pas le total annoncé | La prose se lit bien | Recalculer les lignes |
| Le résumé recommande A ; le corps privilégie B | Les deux parties paraissent raisonnables | Comparer le résumé au corps |
| Un terme défini rendu de trois façons | Chaque occurrence paraît correcte | Comparer les occurrences ; fournir un glossaire |
| La liste « trois risques » comporte quatre éléments | Facile à survoler | Compter au regard de l’affirmation |
| Une chronologie où l’effet précède la cause | Récit fluide | Vérifier l’ordre |
Comme ces contrôles sont gratuits et rapides, ils sont généralement le premier geste sur toute sortie sur laquelle vous allez agir — les attraper avant de dépenser de l’effort en vérification externe.
6.5 Quand une revue humaine est requise
La revue humaine est obligatoire, non optionnelle, dès que l’une de ces conditions est vraie :
- Irréversibilité — envoyer, publier, payer, supprimer.
- Domaine réglementé — conseil juridique, médical, financier, RH/embauche, instructions critiques pour la sécurité.
- Public externe — clients, presse, régulateurs, le public.
- Données personnelles ou caractéristiques protégées — tout ce qui touche aux PII ou à l’équité.
- La politique organisationnelle l’exige — de nombreuses politiques d’usage de l’IA nomment des étapes de revue.
- Contenu nouveau ou à forte incertitude — le modèle opère hors des sentiers battus.
La revue humaine est optionnelle pour le brainstorming interne, les premiers brouillons que vous réécrirez, et la remise en forme de votre propre contenu.
Signal d’évaluation
Les options qui sautent la revue pour une sortie irréversible, réglementée, externe ou à données personnelles sont fausses quelle que soit la confiance de la lecture. Cherchez « human-in-the-loop », « étape de revue », « validation d’expert » dans les bonnes réponses.
6.6 Faibles contrôles qui ne font que ressembler à une vérification
Plusieurs « contrôles » populaires ne font rien et apparaissent constamment comme distracteurs.
Demander « en êtes-vous sûr ? » dans la même conversation réutilise le raisonnement qui a produit l’erreur. Utilisez un contrôle indépendant : une nouvelle conversation, une source ou un humain.
Deux modèles donnant la même réponse sont une preuve faible — ils peuvent partager le même a priori erroné. Vérifiez contre une source autoritaire, pas un second modèle.
Réexécuter le prompt teste la stabilité, pas la vérité. Une erreur répétée avec assurance reste une erreur.
Réduit la variance, pas l’absence d’ancrage. Cela ne rend pas une affirmation vraie.
Cadre de décision
Utilisez le protocole enjeux-et-provenance : fixez d’abord les enjeux, puis, pour chaque affirmation, appliquez le test de provenance au niveau suffisant le moins coûteux, et acheminez les sorties à forts enjeux par une étape humaine.
| Étape | Action | Sortie |
|---|---|---|
| 1. Fixer les enjeux | Est-ce irréversible, réglementé, externe ou à données personnelles ? | Rigueur faible / moyenne / élevée |
| 2. Contrôles gratuits d’abord | Recalculer les totaux ; comparer résumé vs corps ; compter les affirmations | Cohérence interne réussite/échec |
| 3. Provenance par affirmation | Texte fourni → passage ; citation → l’ouvrir ; mémoire → source indépendante ; calculé → recalculer | Chaque affirmation vérifiable vérifiée |
| 4. Étape de contrôle | Forts enjeux → validation humaine/experte avant d’agir | Revue documentée |
| 5. Consigner | Noter ce qui a été vérifié si d’autres s’y fient | Piste auditable |
La valeur : il stoppe à la fois la sous-vérification (livrer une sortie à forts enjeux non vérifiée) et la sur-vérification (chercher sur le web pour vérifier une arithmétique), et il commence toujours par les contrôles internes gratuits.
Erreurs fréquentes
| Erreur | Pourquoi elle survient | Que faire à la place |
|---|---|---|
| Transmettre une sortie soignée sans la vérifier | La fluidité se lit comme de l’exactitude | Vérifier tout ce sur quoi vous agissez, proportionnellement aux enjeux |
| Faire confiance à une citation parce que le nom paraît réel | Éléments au son réaliste | Ouvrir la source et confirmer qu’elle étaye l’affirmation |
| Chercher sur le web pour vérifier l’arithmétique d’un tableau | Excès de prudence | Recalculer en interne ; la cohérence ne nécessite pas de source externe |
| Sauter la revue pour un chiffre « interne » alimentant une décision | L’étiquette « interne » | Les enjeux suivent l’usage en aval ; le vérifier |
| Demander « en êtes-vous sûr ? » dans la même conversation | Cela ressemble à un contrôle | Utiliser un contrôle indépendant |
| Traiter l’accord de deux IA comme une confirmation | L’accord paraît fort | Vérifier contre une source autoritaire |
| Ne corriger que le paragraphe avec une mauvaise citation | Cela semble circonscrit | Une fabrication invalide l’échantillon ; vérifier tout |
| Sur-vérifier un brainstorm jetable | Habitude de prudence | Ajuster la rigueur aux faibles enjeux ; lecture de bon sens seulement |
Mise en situation
Scénario. Lena rédige un rapport trimestriel destiné au client avec ChatGPT. Il se lit magnifiquement : un tableau récapitulatif des revenus par segment, une recommandation de miser sur le segment B, et quatre sources sectorielles citées. Elle remarque que les lignes des segments totalisent un chiffre différent du total en tête, et que l’une des quatre citations est un rapport qu’elle ne parvient à localiser nulle part. Un coéquipier dit : « ça se lit super bien et on est en retard — envoie-le simplement. » Le rapport part au client et éclaire ses dépenses.
Trace de raisonnement d’expert.
- Fixer les enjeux. Destiné au client, orientant une décision, difficile à rétracter — c’est une rigueur élevée avec une étape de revue humaine obligatoire. « Ça se lit bien, envoie-le » est le piège de la fluidité et est rejeté d’emblée.
- Faire d’abord les contrôles gratuits. Le fait que les lignes ne totalisent pas le total en tête est une défaillance de cohérence interne, vérifiable sans source externe — recalculer. À lui seul, cela signifie que le tableau ne peut pas être cru tel quel.
- Appliquer le test de provenance aux citations. Le rapport introuvable est une probable fabrication ; parce qu’une citation a échoué, la confiance fondée sur l’échantillon s’effondre, donc chaque citation et les affirmations qui en dépendent doivent être vérifiées — pas seulement le mauvais paragraphe.
- Rejeter les faibles contrôles. Demander au chat « êtes-vous sûr des chiffres ? » réutilise le raisonnement biaisé ; régénérer teste la stabilité, pas la vérité ; baisser la température change la variance, pas l’ancrage.
- Acheminer l’étape de contrôle. Même après correction, un rapport destiné au client nécessite une validation humaine/experte avant diffusion, et Lena devrait consigner ce qu’elle a vérifié car le client s’y fiera.
Résultat conforme à l’examen : recalculer les totaux, vérifier chaque citation (en traitant toute la sortie comme non vérifiée dès qu’une a échoué), corriger ou retirer les affirmations non étayées, et passer une étape de revue humaine avant l’envoi — sans faire confiance à la fluidité, à une auto-vérification en même conversation, ou à une régénération.
Pièges de l’évaluation
| Piège | Pourquoi il est tentant | Le discriminant |
|---|---|---|
| « C’est détaillé et bien mis en forme, donc envoie-le » | Le vernis se lit comme de la qualité | La fluidité n’est pas l’exactitude ; vérifiez avant d’agir |
| « Le nom de revue de la citation est réel, donc elle est valide » | Les noms réels paraissent légitimes | Les fabrications réutilisent des noms réels ; ouvrez la source |
| « Demande-lui dans la même conversation s’il est sûr » | Cela ressemble à une vérification | L’auto-revue en même conversation hérite du biais |
| « Deux IA concordent, donc c’est confirmé » | L’accord paraît fort | Elles peuvent partager un a priori erroné ; utilisez une source autoritaire |
| « C’est interne, pas besoin de vérifier le chiffre » | L’étiquette « interne » | Les enjeux suivent l’usage en aval |
| « Cherche sur le web pour vérifier les maths du tableau » | Vouloir être exhaustif | La cohérence interne se recalcule, ne se recherche pas |
| « Corrige juste le paragraphe à la mauvaise citation » | Cela semble circonscrit | Une fabrication invalide l’échantillon ; vérifiez tout |
Questions d’entraînement
Q1 · ChatGPT renvoie cinq statistiques de marché précises et non sourcées pour un segment de niche. Quelle est la meilleure étape suivante (BEST) ? (Sélectionnez une réponse)
A. Les utiliser ; elles sont cohérentes en interne. B. Les traiter comme des pistes, demander des sources, et vérifier chacune contre une source indépendante avant usage. C. Demander dans la même conversation s’il est confiant. D. Baisser la température et régénérer.
Réponse : B. Des nombres précis et non sourcés sur un sujet de niche sont la signature de l’hallucination ; la provenance dit de vérifier indépendamment. A confond cohérence et vérité. C réutilise le raisonnement biaisé. D change la variance, pas l’ancrage.
Q2 · Un résumé de contrat dit que le préavis est de 60 jours. Le contrat a été téléversé. Qu’est-ce qui valide cela le plus adéquatement (MOST appropriately) ? (Sélectionnez une réponse)
A. L’accepter ; le fichier a été fourni. B. Demander la clause exacte, puis ouvrir le contrat et la confirmer. C. Poser la même question à une seconde IA. D. Résumer le contrat à nouveau et comparer.
Réponse : B. Test de provenance : une affirmation issue d’un texte fourni se vérifie en localisant le passage justificatif. A fait trop confiance à l’extraction. C est un faible accord inter-modèles. D teste la stabilité, pas l’exactitude.
Q3 · Quel contrôle est GRATUIT et devrait généralement venir en PREMIER (FIRST) sur une sortie sur laquelle vous agirez ? (Sélectionnez une réponse)
A. Ouvrir chaque citation web. B. Recalculer les totaux et comparer le résumé au corps pour la cohérence interne. C. Demander à un second modèle. D. Régénérer la réponse.
Réponse : B. Les contrôles de cohérence interne ne nécessitent aucune source externe et sont rapides, donc ils viennent en premier. A est utile mais plus coûteux et vient plus tard. C et D sont de faibles contrôles.
Q4 · Une citation a un titre plausible, des auteurs d’apparence réelle et un nom de revue réel. Comment la validez-vous ? (Sélectionnez une réponse)
A. L’accepter ; la revue est réelle. B. Ouvrir la source citée et confirmer qu’elle existe et étaye l’affirmation. C. Demander le DOI dans la même conversation et l’accepter. D. Régénérer pour voir si elle réapparaît.
Réponse : B. Les citations fabriquées réutilisent des éléments au son réaliste, donc seule l’ouverture de la source la valide. A fait confiance à l’apparence. C peut aussi être fabriqué. D teste la récurrence, pas l’existence.
Q5 · Un mémo interne contient un chiffre de revenu qui alimentera le plan d’embauche de l’an prochain. Un collègue dit « c’est interne, saute le contrôle ». Quelle est la meilleure réponse (BEST) ? (Sélectionnez une réponse)
A. Approuver ; le contenu interne ne nécessite aucun contrôle. B. Vérifier le chiffre, car son usage en aval dans une décision d’embauche le rend conséquent. C. Ne vérifier que le ton. D. Demander au modèle s’il est confiant.
Réponse : B. Les enjeux suivent l’usage en aval, non l’étiquette ; un chiffre alimentant une embauche doit être vérifié. A ignore les enjeux en aval. C vérifie la mauvaise chose. D est un faible contrôle en même conversation.
Q6 · Un résumé de recherche a huit citations ; l’analyste en ouvre deux et l’une n’existe pas. Que devrait-il faire ? (Sélectionnez une réponse)
A. L’utiliser ; la moitié de l’échantillon était correcte. B. Écarter seulement le paragraphe avec la mauvaise citation. C. Traiter tout le résumé comme non vérifié : vérifier chaque citation et re-vérifier les affirmations reposant sur celles qui ont échoué. D. Demander au modèle de remplacer la citation manquante.
Réponse : C. Une fabrication invalide l’échantillon, donc la vérification doit devenir exhaustive. A ignore l’échantillon défaillant. B laisse d’autres risques. D masque le problème.
Q7 · Quelle action correspond correctement à la provenance d’un nombre CALCULÉ par le modèle ? (Sélectionnez une réponse)
A. Ouvrir une citation web. B. Le recalculer avec un outil ou à la main. C. Demander à un second modèle. D. Baisser la température.
Réponse : B. Un nombre calculé se vérifie par recalcul, non par recherche web ni accord inter-modèles. A est pour les affirmations citées. C et D sont de faibles contrôles.
Q8 · Quelle sortie requiert le plus clairement (MOST clearly) une étape de revue humaine obligatoire avant d’agir ? (Sélectionnez une réponse)
A. Une liste de brainstorming que vous réécrirez. B. Un communiqué de presse nommant un tiers, destiné aux médias aujourd’hui. C. Une ébauche de plan pour vos propres notes. D. Une remise en forme de votre propre paragraphe.
Réponse : B. Une publication externe, irréversible, nommant un tiers, est à forts enjeux et requiert une revue. A, C et D sont des tâches à faibles enjeux, internes ou réversibles.
Q9 · Deux collègues vérifient un chiffre à forts enjeux en interrogeant deux outils d’IA différents ; les deux concordent, donc ils l’acceptent. Quelle est la FAILLE ? (Sélectionnez une réponse)
A. Aucune ; l’accord confirme l’exactitude. B. Les deux outils peuvent partager le même a priori erroné, donc l’accord est faible ; vérifiez contre une source autoritaire. C. Ils auraient dû utiliser un outil deux fois. D. Ils auraient dû demander à une troisième IA.
Réponse : B. L’accord inter-modèles n’est pas une vérification indépendante. A est faux. C et D ne rendent pas le contrôle autoritaire.
Q10 · Quels DEUX (TWO) contrôles ne nécessitent AUCUNE source externe ? (Sélectionnez deux réponses)
A. Confirmer que les lignes d’un tableau totalisent le total annoncé. B. Vérifier que la recommandation du résumé correspond au corps de l’analyse. C. Confirmer qu’un article cité existe. D. Vérifier une statistique de marché issue de la mémoire du modèle. E. Confirmer un prix cité contre une liste publique.
Réponse : A et B. Les deux sont des contrôles de cohérence interne contre la sortie elle-même. C, D et E nécessitent tous une source externe ou autoritaire.
Q11 · Une liste de brainstorming interne jetable est produite pour votre propre usage. Quelle vérification est appropriée ? (Sélectionnez une réponse)
A. Vérification ligne par ligne avec validation d’expert. B. Une lecture de bon sens rapide, en corrigeant les erreurs évidentes. C. Rechercher chaque élément sur le web. D. L’acheminer vers une revue juridique.
Réponse : B. Une sortie à faibles enjeux, réversible et interne justifie une vérification proportionnelle (légère). A, C et D sur-vérifient une liste jetable.
Q12 · Quels DEUX (TWO) sont de faibles « contrôles » qui ne vérifient pas l’exactitude ? (Sélectionnez deux réponses)
A. Demander « en êtes-vous sûr ? » dans la même conversation. B. Régénérer la réponse et voir le même résultat. C. Ouvrir une source citée pour la confirmer. D. Recalculer un total avec un tableur. E. Comparer la paraphrase au document fourni.
Réponse : A et B. L’auto-revue en même conversation hérite du biais et la régénération teste la stabilité, pas la vérité. C, D et E sont de véritables méthodes de vérification.
Q13 · Un dossier de conseil d’administration doit être validé dans une heure ; il se lit avec fluidité mais les lignes ne correspondent pas au total en tête et une citation est introuvable. Que devriez-vous faire en PREMIER (FIRST) ? (Sélectionnez une réponse)
A. L’envoyer ; il se lit bien et le temps presse. B. Recalculer les totaux à partir des lignes, puisque ce contrôle interne gratuit montre que le tableau ne peut être cru tel quel. C. Demander au chat si les nombres sont justes. D. Baisser la température et régénérer le dossier.
Réponse : B. Le premier geste le moins coûteux et à plus forte valeur est le recalcul interne, sans source externe. A est le piège de la fluidité. C réutilise le raisonnement biaisé. D change la variance, pas l’ancrage.
Q14 · Un dashboard affiche 92 % d’exactitude globale pour une tâche d’étiquetage assistée par IA et un manager veut l’étendre. Quels DEUX (TWO) contrôles comptent le plus (MOST) en premier ? (Sélectionnez deux réponses)
A. Décomposer l’exactitude par catégorie pour trouver un segment défaillant. B. Confirmer que les défaillances ne se concentrent pas dans les catégories à plus forts enjeux. C. Ne rapporter que l’en-tête de 92 %. D. Supposer que les 92 % valent partout. E. Passer à un modèle moins cher pour réduire le coût.
Réponse : A et B. Les agrégats cachent un segment gravement défaillant, donc une décomposition par catégorie et la vérification de la concentration dans les forts enjeux sont essentielles. C et D masquent le risque. E est sans rapport avec la validation.
À retenir
- Vous êtes responsable de l’exactitude de tout ce sur quoi vous agissez ; vérifiez proportionnellement aux enjeux.
- Faites d’abord les contrôles de cohérence interne gratuits — recalculez les totaux, comparez le résumé au corps.
- Utilisez le test de provenance : texte fourni → passage ; citation → l’ouvrir ; mémoire → source indépendante ; calculé → recalculer.
- Ouvrez les citations ; un nom au son réaliste ne prouve rien, et une fabrication invalide l’échantillon.
- Les sorties irréversibles, réglementées, externes ou à données personnelles requièrent une étape de revue humaine.
- L’auto-revue en même conversation, deux IA qui concordent, la régénération et la baisse de température ne sont pas des vérifications.
- Les enjeux suivent l’usage en aval, non l’étiquette « interne » ; sur-vérifier les jetables est aussi une erreur.
Dernière mise à jour le 18 sept. 2026