Domaines
D2 · Output Evaluation and Validation
Évaluer l’exactitude et la complétude, détecter les hallucinations, l’incohérence et le biais, vérifier les faits, décider quand une revue humaine est requise et adapter les sorties au public et au format.
C’est le domaine le plus lourd de l’examen Associate — environ 13 items sur 60. Il évalue si vous traitez la sortie de Claude comme un brouillon à vérifier plutôt que comme un fait à transmettre. Presque chaque item repose sur une question : qu’est-ce qui pourrait être faux ici, et comment le saurais-je ?
Objectifs d’apprentissage
À la fin de cette page, vous devriez être capable de :
- Évaluer une sortie sur son exactitude, sa complétude, sa pertinence et sa cohérence.
- Reconnaître les signatures de l’hallucination, de l’incohérence interne et du biais.
- Choisir une stratégie de vérification des faits proportionnée aux enjeux.
- Décider quand la revue humaine est obligatoire plutôt que facultative.
- Adapter une sortie à un public précis et choisir le bon format de sortie (texte en ligne, artifact, données structurées).
2.1 The four evaluation lenses
Toute sortie peut être auditée sur quatre axes. Les items d’examen ciblent généralement un axe et utilisent les autres comme distracteurs.
| Prisme | Question à poser | Défaillance typique | Tactique de détection |
|---|---|---|---|
| Exactitude | Les faits, chiffres, noms, dates et citations sont-ils vrais ? | Statistique hallucinée ; citation mal attribuée ; URL inventée | Vérifier par sondage tout ce qui est vérifiable ; demander des sources ; recouper |
| Complétude | Couvre-t-elle tout ce que la tâche exigeait ? | Répond à 3 questions sur 4 ; abandonne silencieusement un cas limite | Relire le brief d’origine ; utiliser une checklist |
| Pertinence | Répond-elle à cette question pour ce public ? | Essai générique quand une note de décision était attendue | Comparer à l’objectif énoncé |
| Cohérence | Les parties de la sortie s’accordent-elles entre elles et avec les entrées ? | Les totaux du tableau ne correspondent pas ; la conclusion contredit le corps | Recalculer ; comparer les sections ; comparer au document source |
Signal d’examen
Quand un énoncé dit qu’une sortie « paraît soignée », « se lit avec assurance » ou « a été produite rapidement », l’item teste si vous allez tout de même la vérifier. La fluidité n’est pas une preuve d’exactitude.
2.2 Hallucination – what it is and how it looks
Une hallucination est un contenu fluide et plausible mais non ancré dans l’entrée ni dans la réalité. Les LLM génèrent la continuation la plus probable, pas la plus vérifiée. Les hallucinations se regroupent dans des endroits prévisibles :
- Valeurs numériques précises — pourcentages, dates, prix, décomptes, surtout pour des sujets de niche.
- Citations — titres d’articles, auteurs, URL, jurisprudence, ISBN. Souvent un mélange à consonance réelle d’éléments réels.
- Noms propres — noms de produits, de personnes, de projets internes que le modèle n’a jamais vus.
- Faits de longue traîne — tout ce qui est rare dans les données d’entraînement.
- Combler les lacunes — quand le document source ne contient pas la réponse, le modèle peut malgré tout en produire une.
Le test de provenance
Pour toute affirmation qui compte, demandez : d’où vient-elle ?
| Source de l’affirmation | Posture de confiance |
|---|---|
| Citée ou paraphrasée d’un document que vous avez fourni | Vérifiez la paraphrase par rapport au document ; généralement fiable |
| Récupérée avec une citation en research mode | Ouvrez la citation ; confirmez qu’elle dit ce que Claude affirme qu’elle dit |
| Issue des connaissances du modèle sans source | À traiter comme une piste, pas un fait ; vérifiez indépendamment avant usage |
| Un nombre que le modèle a calculé | Recalculez vous-même ou demandez à Claude de montrer son calcul, puis vérifiez |
Heuristiques pratiques de détection
- Demandez des sources, puis vérifiez-les. Une citation fabriquée est un signal d’alerte pour le paragraphe environnant aussi.
- Posez la même question de deux façons. Des réponses divergentes indiquent un faible ancrage.
- Demandez « qu’est-ce que la matière fournie soutient cela ? » Un modèle ancré pointe vers le texte ; un modèle non ancré répète l’affirmation.
- Cherchez une précision excessive sur des sujets obscurs. « L’adoption a augmenté de 37,4 % au T3 2019 » à propos d’une petite entreprise est suspect.
- Comparez les dates à la date de coupure des connaissances du modèle. Les affirmations sur des événements très récents sans recherche web sont suspectes.
N’utilisez pas Claude pour vérifier Claude dans la même session
Demander à la même conversation « es-tu sûr ? » conserve le raisonnement qui a produit l’erreur. Utilisez une vérification indépendante : une nouvelle session, une source différente ou un humain. C’est le même principe que l’examen Architect appelle le « biais d’auto-revue en même session ».
2.3 Internal inconsistency
L’incohérence est moins coûteuse à détecter que l’hallucination car vous n’avez pas besoin de sources externes — il suffit de comparer la sortie avec elle-même et avec ses entrées.
Motifs fréquents :
- Un tableau récapitulatif dont les totaux ne sont pas égaux à la somme des lignes.
- Un résumé exécutif recommandant l’option A alors que le corps de l’analyse favorise l’option B.
- Un document traduit où un terme défini est rendu de trois façons différentes.
- Une chronologie où un effet précède sa cause.
- Une liste de « trois risques » comportant quatre items ou deux.
Tactique : demandez à Claude de produire un tableau d’auto-vérification (affirmations vs emplacement des preuves) puis vérifiez ce tableau vous-même. Le tableau rend les incohérences visibles ; votre vérification boucle la boucle.
2.4 Bias
Le biais dans les sorties se manifeste par un cadrage biaisé, des exemples non représentatifs, des hypothèses stéréotypées ou un traitement asymétrique des groupes, fournisseurs ou options.
| Type de biais | Exemple | Mitigation |
|---|---|---|
| Biais de cadrage | Avantages listés pour un fournisseur, inconvénients pour un autre | Demander un tableau avantages/inconvénients symétrique et de profondeur égale |
| Biais démographique | Les personas prennent par défaut un genre ou une culture | Spécifier des attributs divers et représentatifs ; réviser avant publication |
| Biais de confirmation (le vôtre) | Vous avez demandé « explique pourquoi le plan A est le meilleur » | Demandez de façon neutre : « comparez A et B selon les critères X, Y, Z » |
| Biais de récence/disponibilité | Surpondère ce qui était dans le document collé | Fournir des sources équilibrées ; demander ce qui manque |
| Complaisance (sycophancy) | Le modèle est d’accord avec votre point de vue exprimé | Demandez le contre-argument le plus fort ; utilisez une nouvelle session |
L’examen attend de vous que vous sachiez que la mitigation du biais est une responsabilité partagée : la conception du prompt le réduit, la revue humaine capte le reste, et des processus de revue organisationnels existent pour le contenu destiné à l’externe.
2.5 Fact-checking proportional to stakes
Toutes les sorties n’exigent pas la même rigueur. Faites correspondre l’effort aux conséquences.
Enjeux ────────────────────────────────────────────────────►Faibles Moyens Élevésbrainstorm, premier note interne, jeu de publication externe,jet, chat interne diapositives, brouillon juridique/médical/financier, d’e-mail client dépôt réglementaire, tarifsSondage des erreurs Vérifier tous les chiffres Vérification ligne par ligne,évidentes ; lecture et noms ; ouvrir 1–2 sources revue SME indépendante,de bon sens validation documentéeSignaux dans un énoncé qui poussent vers une rigueur élevée : « sera publié », « régulateur », « destiné au client », « contrat », « conformité », « médical », « chiffres financiers », « communiqué de presse », « irréversible ».
2.6 When human review is required
La revue humaine est obligatoire (pas simplement conseillée) dès que l’une de ces conditions est vraie :
- Irréversibilité — l’action ne peut être annulée (envoyer, publier, payer, supprimer).
- Domaine réglementé — conseil juridique, médical, financier, décisions RH, instructions critiques pour la sécurité.
- Public externe — clients, presse, régulateurs, grand public.
- Données personnelles ou caractéristiques protégées — tout ce qui touche aux PII ou à l’équité.
- La politique de l’organisation l’exige — beaucoup de politiques d’usage de l’IA nomment explicitement des points de contrôle de revue.
- Contenu nouveau ou à forte incertitude — le modèle opère hors des connaissances bien établies.
La revue humaine est facultative pour : le brainstorming interne, les premiers jets que vous réécrirez, le formatage ou la restructuration de votre propre contenu, l’analyse exploratoire que vous relancerez.
La formulation de l’examen
Cherchez « human-in-the-loop » (humain dans la boucle), « point de contrôle de revue », « validation » ou « expert métier (SME) » dans les bonnes options. Les options qui sautent la revue pour des actions irréversibles ou réglementées sont fausses, quel que soit l’assurance de la sortie.
2.7 Adapting output for an audience
La même analyse a besoin de formes différentes pour des lecteurs différents. L’évaluation inclut la vérification de l’adéquation.
| Public | Ce dont il a besoin | Ce qu’il faut retirer | Levier de prompt |
|---|---|---|---|
| Dirigeants | Décision, options, risque, demande ; une page | Détail de méthode, atténuations | « Rédigez une note de décision d’une page avec la recommandation en tête » |
| Ingénieurs | Spécification précise, cas limites, contraintes | Ton marketing | « Utilisez une terminologie précise ; listez hypothèses et cas limites » |
| Clients | Langage simple, empathie, étapes suivantes | Jargon interne, reproches | « Langage simple, niveau de lecture accessible, chaleureux mais direct » |
| Régulateurs / juridique | Termes exacts, citations, pas de surenchère | Superlatifs | « Ton neutre ; citez la clause ; évitez les affirmations absolues » |
| Nouvelles recrues | Contexte, définitions, pourquoi | Connaissances supposées | « Définissez chaque acronyme à la première utilisation » |
Questions d’évaluation à poser : le niveau de lecture est-il correct ? Le ton est-il correct ? La longueur est-elle correcte ? L’appel à l’action est-il clair ? Y a-t-il surenchère ?
2.8 Choosing the output format
À utiliser quand : la réponse est courte, conversationnelle ou sera copiée dans un autre outil. Rapide à itérer ; pas de persistance.
À éviter quand : vous réviserez le livrable plusieurs fois, ou il a une structure (code, long document, tableau) qui gagne à avoir une vue dédiée.
À utiliser quand : la sortie est un livrable autonome sur lequel vous allez itérer — un document, un plan de diapositives, un graphique, une maquette, un script, un tableau de type tableur. Les artifacts persistent à côté de la conversation, peuvent être versionnés par itération, et sont faciles à copier ou télécharger.
À éviter quand : vous avez juste besoin d’un fait rapide ou d’une réécriture d’une ligne.
À utiliser quand : le résultat sera consommé par un autre système ou collé dans un tableur — listes d’enregistrements, JSON, CSV, tableaux Markdown à colonnes fixes. Demandez le schéma exact et l’ordre de colonnes dont vous avez besoin.
À éviter quand : la nuance compte plus que la lisibilité machine ; forcer la structure peut faire perdre des qualificatifs.
Règle empirique pour l’examen : livrable itératif → artifact ; consommé par une machine → données structurées ; conversationnel → en ligne.
2.9 A repeatable evaluation checklist
Utilisez-la sur tout ce sur quoi vous allez agir :
- Relisez le brief. La sortie a-t-elle traité chaque partie ? (Complétude)
- Entourez chaque nombre, nom, date, citation et référence. Vérifiez chacun contre une source proportionnée aux enjeux. (Exactitude)
- Vérifiez l’accord interne — totaux, résumé vs corps, termes définis. (Cohérence)
- Vérifiez l’adéquation — public, ton, longueur, format, appel à l’action. (Pertinence)
- Vérifiez l’équité — traitement symétrique, exemples représentatifs. (Biais)
- Décidez le point de contrôle de revue — est-ce irréversible, réglementé, externe ou porteur de données personnelles ? Si oui, routez vers une revue humaine avant usage.
- Consignez ce que vous avez vérifié si la sortie alimente une décision sur laquelle d’autres s’appuieront.
2.10 A verification decision tree
Face à une sortie, un expert la fait passer par un petit nombre de questions. L’arbre ci-dessous transforme les quatre prismes en un tri reproductible.
Vais-je AGIR sur cette sortie (envoyer, publier, décider, payer) ?│├─ Non ─► Enjeux faibles. Lecture de bon sens ; corriger les erreurs évidentes ; continuer.│└─ Oui ─► L’action est-elle irréversible, réglementée, externe, ou touchant des données personnelles / caractéristiques protégées ? │ ├─ Oui ─► Enjeux ÉLEVÉS : vérifier chaque affirmation ; router vers un │ point de contrôle de revue humain/SME ; documenter la validation. │ └─ Non ─► Enjeux MOYENS : vérifier tous les nombres, noms, dates, citations ; vérifier la cohérence interne ; un second relecteur pour le ton.Ensuite, pour chaque affirmation vérifiable, appliquez le test de provenance :
| D’où vient l’affirmation ? | Vérification la moins coûteuse et suffisante |
|---|---|
| Un document que vous avez fourni | Localiser la phrase justificative ; confirmer la paraphrase |
| Une citation en research mode | Ouvrir la source ; confirmer qu’elle dit ce que Claude affirme |
| Les connaissances propres du modèle | À traiter comme une piste ; vérifier contre une source indépendante |
| Un nombre que le modèle a calculé | Recalculer indépendamment (calculatrice/tableur/outil d’analyse) |
| Interne (totaux, renvois) | Recalculer ou comparer les sections — aucune source externe nécessaire |
Signal d’examen
La bonne réponse choisit la vérification la moins coûteuse qui suffit aux enjeux. Les défaillances de cohérence interne (totaux, contradictions) n’exigent jamais de sources externes — les options qui recourent au web pour vérifier de l’arithmétique sont des distracteurs surdimensionnés.
2.11 Completeness and relevance in depth
L’exactitude attire l’attention, mais les défaillances de complétude et de pertinence sont tout aussi fréquentes et plus faciles à manquer parce que le texte se lit bien.
| Défaillance | Comment elle se cache | Détection |
|---|---|---|
| A répondu à 3 sous-questions sur 4 | Les trois traitées sont approfondies | Relire le brief comme une checklist ; cocher chaque partie |
| A abandonné un cas limite ou une exclusion | Le cas principal est traité avec assurance | Demander « qu’est-ce que la tâche listait qui n’est pas ici ? » |
| Bons faits, mauvais public | Fluide mais calibré pour le mauvais lecteur | Comparer ton/niveau au public énoncé |
| A répondu à une question liée mais différente | Plausible et dans le sujet | Reformuler la question exacte et comparer |
| A enterré la recommandation | Tout est présent mais inexploitable | Vérifier la demande : décision en tête pour les dirigeants ? |
Avant/après — un brief exécutif exact mais non pertinent :
Avant : Une analyse de 3 pages, lourde en méthode, avec la recommandation en page 3. Chaque fait est correct, mais le CFO ne trouve pas la décision.Contrôle : échec de pertinence + adéquation au public — l’exactitude passe mais pas l’utilité.Après : Une page, recommandation et demande dans les deux premières lignes, trois puces d’appui, méthode en courte annexe. Mêmes faits, exploitable.Signal d’examen
Une sortie peut être parfaitement exacte et pourtant fausse pour la tâche si elle est incomplète ou mal calibrée. Méfiez-vous des options qui ne vérifient que les faits alors que le problème de l’énoncé est une sous-réponse manquante ou le mauvais public.
2.12 Common misconceptions
| Idée reçue | Réalité | Pourquoi cela compte à l’examen |
|---|---|---|
| « Une sortie assurée, fluide et bien formatée est exacte. » | La fluidité est une propriété des modèles de langage, pas un signal de vérité. | Le piège central de D2 : transmettre une sortie soignée mais non vérifiée. |
| « Si j’ai donné le document à Claude, son résumé doit être juste. » | L’extraction peut mal lire ou fabriquer ; vérifiez contre le texte. | Test de provenance sur les documents fournis. |
| « Demander « es-tu sûr ? » dans le même chat le vérifie. » | L’auto-revue en même session porte le biais d’origine. | Distracteur d’auto-déclaration / même session. |
| « Deux modèles d’accord signifient que la réponse est correcte. » | Les deux peuvent partager le même a priori erroné. | Distracteur de vérification faible. |
| « Un nom de revue à consonance réelle prouve la validité de la citation. » | Les citations fabriquées mêlent des éléments réels ; ouvrez la source. | Item de vérification de citation. |
| « Une température plus basse supprime l’hallucination. » | Elle réduit la variance, pas le manque d’ancrage. | Distracteur du paramètre-comme-correction. |
| « Le contenu interne n’a pas besoin d’être vérifié. » | Les chiffres internes alimentent des décisions externes. | Item « les enjeux suivent l’usage aval ». |
| « Une exactitude globale élevée signifie que l’affirmation précise est correcte. » | Les agrégats cachent l’erreur précise qui compte. | Distracteur de métrique agrégée. |
2.13 Scenario walkthrough – a board pack under time pressure
Scénario. Marcus a 90 minutes avant la remise d’un dossier de conseil d’administration. Claude a produit une analyse de marché soignée : un tableau récapitulatif des tailles de segments, cinq sources citées et une recommandation d’entrer sur le Segment C. La prose est fluide et les totaux « ont l’air justes ». Deux des cinq citations renvoient à des rapports à consonance sérieuse. Un collègue dit « ça se lit très bien, envoie-le simplement ». Marcus remarque que les lignes du tableau de segments donnent un total différent du chiffre en tête, et qu’une citation renvoie à un rapport qu’il ne trouve nulle part.
Trace de raisonnement d’expert.
- Poser les enjeux. C’est destiné à l’externe, cela oriente une décision, et c’est difficile à annuler une fois que le conseil agit. Cela impose une vérification à rigueur ÉLEVÉE et un point de contrôle de revue — « ça se lit très bien, envoie » (le piège de la fluidité) est rejeté d’emblée.
- Attaquer d’abord la cohérence interne — c’est gratuit. Le fait que les lignes ne totalisent pas le chiffre en tête est une défaillance de cohérence vérifiable sans aucune source : recalculez. Cela seul signifie que le tableau ne peut être cru tel quel.
- Appliquer le test de provenance aux citations. Le rapport introuvable est une fabrication probable ; une citation fabriquée invalide la confiance par échantillonnage, donc chaque citation et les affirmations qui en dépendent doivent être vérifiées, pas seulement le mauvais paragraphe (rejet de « retirer seulement le mauvais paragraphe »).
- Rejeter l’auto-vérification en même session. Demander au chat « es-tu sûr de ces chiffres ? » réutilise le raisonnement qui les a produits ; la vérification doit être indépendante (recalculer, ouvrir les sources).
- Rejeter « baisser la température et régénérer ». Cela change la variance, pas l’ancrage, et gaspille les 90 minutes.
- Router le point de contrôle. Parce que c’est destiné au conseil, le dossier corrigé nécessite encore une validation humaine/SME avant diffusion.
Décision correcte à l’examen : recalculer les totaux indépendamment, vérifier chaque citation (en traitant toute la sortie comme non vérifiée dès qu’une échoue), corriger ou retirer les affirmations non étayées, et passer un point de contrôle de revue humaine avant l’envoi. Pas faire confiance à la fluidité, pas une auto-vérification en même session, pas un changement de température, pas une correction partielle du seul paragraphe signalé.
Pièges de l’examen dans ce domaine
| Piège | Pourquoi c’est faux |
|---|---|
| « La sortie était détaillée et bien formatée, on peut donc l’envoyer » | Fluidité ≠ exactitude |
| « Demander à Claude dans le même chat s’il est sûr » | L’auto-revue en même session porte le même biais |
| « La citation avait un vrai nom de revue, elle est donc valide » | Les citations fabriquées mêlent des éléments réels ; ouvrez la source |
| « L’exactitude globale paraissait élevée » | Les impressions agrégées cachent des erreurs précises ; vérifiez les affirmations précises qui comptent |
| « Ce n’est qu’une note interne, pas besoin de vérifier les chiffres » | Les chiffres internes alimentent des décisions externes ; vérifiez les nombres proportionnellement à l’usage aval |
| « Publier, puis corriger si quelqu’un se plaint » | La publication est irréversible ; un point de contrôle de revue est requis |
| « Utiliser température 0 / demander « seulement des faits » pour éliminer l’hallucination » | Réduit la variance, ne garantit pas l’ancrage |
| « Deux outils d’IA sont d’accord, la réponse est donc vérifiée » | Les deux peuvent partager le même a priori erroné ; utilisez une vérification indépendante et faisant autorité |
| « Retirer seulement le paragraphe à la mauvaise citation » | Une citation fabriquée invalide l’échantillon ; vérifiez toute la sortie |
| « Les faits sont tous corrects, la sortie est donc bonne » | Elle peut encore être incomplète ou mal calibrée pour le public ; vérifiez pertinence et complétude |
| « Recalculer le tableau en cherchant sur le web » | Les erreurs de cohérence interne se vérifient par recalcul, pas par des sources externes |
Questions d’entraînement
Chaque item indique combien de réponses sélectionner. Tentez avant de révéler.
Q1 · Une analyste marketing demande à Claude des statistiques de taille de marché pour un segment B2B de niche. Claude renvoie cinq pourcentages précis avec des taux de croissance annuels mais sans sources. Quelle est la MEILLEURE étape suivante ? (Sélectionnez une réponse)
A. Utiliser les chiffres ; ils sont cohérents entre eux. B. Demander à Claude, dans la même conversation, s’il est confiant dans les chiffres. C. Traiter les chiffres comme des pistes, demander des sources et vérifier chacun contre une source indépendante avant usage. D. Baisser la température du modèle et régénérer pour obtenir des chiffres plus exacts.
Réponse : C. Des valeurs numériques précises et sans source sur un sujet de niche sont la signature classique de l’hallucination. La cohérence interne (A) n’est pas une preuve de vérité. L’auto-vérification en même session (B) partage le biais de raisonnement d’origine. La température (D) affecte la variance, pas l’ancrage.
Q2 · Un responsable des opérations utilise Claude pour résumer un contrat fournisseur de 40 pages. Le résumé indique que le préavis de résiliation est de 60 jours. Quelle action valide le PLUS correctement cette affirmation ? (Sélectionnez une réponse)
A. L’accepter ; le contrat a été fourni dans le prompt, Claude avait donc le texte. B. Demander à Claude de citer la clause et la page exactes, puis ouvrir le contrat et confirmer. C. Poser la même question à un second outil d’IA et accepter la réponse si elle correspond. D. Demander à Claude de résumer à nouveau le contrat et comparer.
Réponse : B. Test de provenance : l’affirmation vient d’un document fourni, la bonne vérification est donc de localiser le texte justificatif et de le confirmer. Fournir le document (A) ne garantit pas une extraction correcte. Deux modèles d’accord (C) est une preuve faible. Régénérer (D) vérifie la stabilité, pas l’exactitude.
Q3 · Claude rédige un e-mail destiné au client expliquant une panne de service et inclut une phrase attribuant la cause à un fournisseur tiers nommé. Quelles DEUX actions sont requises avant l’envoi ? (Sélectionnez deux réponses)
A. Vérifier l’attribution au fournisseur auprès du responsable de l’incident. B. Faire passer le brouillon par la revue des communications externes de l’organisation. C. Demander à Claude de rendre le ton plus contrit. D. Envoyer immédiatement pour minimiser la confusion du client. E. Régénérer l’e-mail à une température plus basse.
Réponse : A et B. Une communication externe, irréversible et nommant un tiers est à enjeux élevés : vérifiez l’affirmation factuelle et passez le point de contrôle de revue organisationnel. Le ton (C) est une amélioration facultative. Envoyer immédiatement (D) saute la revue obligatoire. La température (E) est sans rapport avec le risque.
Q4 · Un chef de projet demande à Claude de comparer deux fournisseurs de logiciels. La sortie liste six forces pour le fournisseur A et six faiblesses pour le fournisseur B. Quel est le problème le PLUS probable et le meilleur remède ? (Sélectionnez une réponse)
A. Hallucination — demander des sources pour chaque point. B. Biais de cadrage — demander une comparaison symétrique avec des avantages et inconvénients de profondeur égale pour les deux fournisseurs selon les mêmes critères. C. Incomplétude — demander plus de forces pour le fournisseur A. D. Incohérence — demander à Claude de recalculer les totaux.
Réponse : B. Le traitement asymétrique des options est un biais de cadrage, souvent déclenché par la façon dont la question a été posée. Le remède est une structure neutre, fondée sur des critères et symétrique. Les sources (A) peuvent aussi aider mais ne corrigent pas l’asymétrie.
Q5 · Un chef d’équipe veut un brief d’une page pour le comité exécutif à partir d’une analyse de 15 pages produite par Claude. Quel choix de sortie et quelle vérification sont les PLUS appropriés ? (Sélectionnez une réponse)
A. Coller les 15 pages en ligne et laisser les dirigeants parcourir. B. Demander un artifact d’une page avec la recommandation en premier, puis vérifier que la recommandation correspond au corps de l’analyse et que chaque chiffre remonte à la source. C. Demander un résumé JSON pour le charger dans un dashboard. D. Demander à Claude de rendre l’analyse plus détaillée.
Réponse : B. Adéquation au public (les dirigeants veulent la décision en tête, une page), adéquation au format (livrable itératif → artifact), et une vérification de cohérence entre résumé et corps plus une vérification d’exactitude sur les chiffres.
Q6 · Une coordinatrice RH rédige avec Claude des synthèses de retours d’entretien pour six candidats. Avant que les synthèses soient utilisées dans des décisions d’embauche, qu’est-ce qui est REQUIS ? (Sélectionnez une réponse)
A. Rien de plus ; les synthèses sont internes. B. Une revue humaine par le jury de recrutement pour l’exactitude et pour un langage qui pourrait refléter un biais sur des caractéristiques protégées. C. Demander à Claude de noter chaque candidat numériquement pour supprimer la subjectivité. D. Régénérer chaque synthèse deux fois et garder la version la plus longue.
Réponse : B. Les décisions d’embauche sont réglementées, à enjeux élevés et touchent des caractéristiques protégées — un point de contrôle de revue humaine obligatoire. Les notes numériques (C) ne suppriment pas le biais et peuvent le blanchir. « Interne » (A) n’exempte pas les décisions réglementées.
Q7 · Claude produit une synthèse de recherche en research mode avec huit citations. L’analyste en ouvre deux au hasard ; l’une soutient l’affirmation, l’autre n’existe pas. Que doit faire l’analyste ? (Sélectionnez une réponse)
A. Utiliser la synthèse ; 50 % de l’échantillon était bon. B. Écarter seulement le paragraphe à la mauvaise citation. C. Traiter toute la synthèse comme non vérifiée : vérifier chaque citation et revérifier indépendamment toute affirmation dont la citation échoue. D. Demander à Claude de remplacer la citation manquante.
Réponse : C. Une citation fabriquée est un signal d’alerte pour toute la sortie. Un échantillonnage aléatoire qui trouve un échec invalide la confiance par échantillonnage ; passez à une vérification exhaustive. Remplacer une citation (D) ne traite pas les autres.
Q8 · Un analyste financier demande à Claude de calculer des totaux trimestriels à partir d’un tableau collé. Claude renvoie un total qui paraît raisonnable. Quelle est la vérification la PLUS appropriée ? (Sélectionnez une réponse)
A. Lui faire confiance ; l’arithmétique est déterministe. B. Demander à Claude de montrer son calcul et recalculer le total indépendamment (tableur ou calculatrice). C. Demander à Claude « es-tu sûr ? » D. Arrondir le total pour réduire l’erreur.
Réponse : B. Les LLM peuvent faire des erreurs d’arithmétique, surtout sur de longs tableaux. Les chiffres financiers sont à enjeux moyens à élevés ; recalculez indépendamment. L’arithmétique n’est pas fiablement déterministe pour un modèle de langage (A).
Q9 · Quel format de sortie est le PLUS approprié pour une liste de 200 enregistrements clients à champs fixes qui seront importés dans un CRM ? (Sélectionnez une réponse)
A. De la prose en ligne B. Un artifact contenant une synthèse narrative C. Des données structurées (CSV ou JSON) avec un schéma et un ordre de colonnes spécifiés D. Un jeu de diapositives
Réponse : C. Données à champs fixes consommées par une machine → format structuré avec le schéma exact demandé.
Q10 · Un membre de l’équipe communication demande à Claude de traduire une politique de 20 pages en espagnol. À la revue, le terme clé « data controller » apparaît sous trois rendus espagnols différents. Quel prisme a détecté cela, et quelle est la correction ? (Sélectionnez une réponse)
A. Exactitude — demander des sources. B. Cohérence — fournir un glossaire de termes définis et demander un tableau de vérification terminologique avant la revue finale. C. Pertinence — raccourcir le document. D. Biais — demander un ton neutre.
Réponse : B. Le rendu incohérent d’un terme défini est une défaillance de cohérence interne. Fournir un glossaire et demander un tableau terminologique donne un artefact vérifiable.
Q11 · Lesquels des indicateurs suivants sont des indices fiables qu’une sortie devrait recevoir une vérification humaine ligne par ligne ? (Sélectionnez deux réponses)
A. Elle sera déposée auprès d’un régulateur. B. Elle a été générée en moins de dix secondes. C. Elle contient un langage de posologie ou de responsabilité juridique. D. Elle utilise des puces. E. Elle fait plus d’une page.
Réponse : A et C. Un dépôt réglementaire et un contenu médical/juridique sont des déclencheurs à enjeux élevés. La vitesse, le formatage et la longueur sont sans rapport avec les enjeux.
Q12 · Un utilisateur remarque que Claude tend à être d’accord avec la position qu’il énonce dans le prompt. Quel est ce comportement et la MEILLEURE mitigation lors de l’évaluation d’un plan ? (Sélectionnez une réponse)
A. Hallucination ; demander des citations. B. Complaisance (sycophancy) ; demander de façon neutre les arguments les plus forts des deux côtés, ou demander une critique dans une nouvelle session avant de révéler votre préférence. C. Incohérence ; demander un tableau. D. Cadrage ; rendre le prompt plus long.
Réponse : B. L’accord avec la position exprimée par l’utilisateur est de la complaisance. Un cadrage neutre et une critique indépendante la contrent.
Q13 · Un analyste doit valider un dossier de conseil dans une heure. Il se lit avec fluidité, mais les lignes du tableau de segments ne totalisent pas le chiffre en tête et l’une des cinq citations est introuvable. Que doit faire l’analyste en PREMIER ? (Sélectionnez une réponse)
A. L’envoyer ; il se lit bien et le temps est court. B. Recalculer les totaux à partir des lignes (une vérification interne gratuite), car une défaillance de cohérence signifie que le tableau ne peut être cru tel quel. C. Demander à Claude dans le même chat si les chiffres sont corrects. D. Baisser la température et régénérer tout le dossier.
Réponse : B. Le premier geste le moins coûteux et le plus utile est le recalcul de cohérence interne, qui n’a besoin d’aucune source externe. Envoyer sur la fluidité (A) est le piège de la fluidité ; une auto-vérification en même session (C) réutilise le raisonnement biaisé ; régénérer à température plus basse (D) change la variance, pas l’ancrage.
Q14 · Claude répond en profondeur à trois questions sur quatre d’un brief pour parties prenantes et omet la quatrième, mais le brief se lit comme complet. Quel prisme d’évaluation détecte cela et comment ? (Sélectionnez une réponse)
A. Exactitude ; ouvrir des sources externes. B. Complétude ; relire le brief d’origine comme une checklist et cocher chaque partie requise. C. Biais ; équilibrer les exemples. D. Pertinence ; changer le public.
Réponse : B. Une sous-question abandonnée silencieusement est une défaillance de complétude, détectée en vérifiant la sortie contre le brief comme une checklist. Le sourçage d’exactitude (A), l’équilibrage de biais (C) et les changements de public (D) ne détectent pas une partie manquante.
Q15 · Une analyse de 3 pages parfaitement exacte est remise à une CFO qui se plaint qu’elle est inutile car elle ne trouve pas la décision. Quelles DEUX corrections traitent cela ? (Sélectionnez deux réponses)
A. Restructurer pour placer la recommandation et la demande dans les deux premières lignes. B. Réduire le détail de méthode à une courte annexe et commencer par trois puces d’appui. C. Ajouter plus de données d’appui partout. D. Passer à un modèle plus performant. E. Demander à Claude s’il est sûr que les faits sont justes.
Réponse : A et B. Le problème est la pertinence/l’adéquation au public, pas l’exactitude : un dirigeant a besoin de la décision d’abord et de la méthode réduite. Ajouter des données (C) aggrave la situation ; un modèle plus gros (D) ne change pas l’adéquation ; revérifier les faits (E) traite le mauvais prisme.
Q16 · Claude cite une étude avec un titre plausible, des auteurs à consonance réelle et un nom de revue, à l’appui d’une affirmation clé. Quelle est la validation la PLUS appropriée avant de s’y fier ? (Sélectionnez une réponse)
A. L’accepter ; le nom de la revue est réel. B. Ouvrir la source citée et confirmer qu’elle existe et dit bien ce que Claude affirme. C. Demander à Claude de fournir le DOI dans le même chat et l’accepter. D. Régénérer pour voir si la même citation apparaît.
Réponse : B. Les citations fabriquées mêlent des éléments à consonance réelle ; la seule vérification valide est d’ouvrir la source et de confirmer qu’elle soutient l’affirmation. Un vrai nom de revue (A) ne prouve rien ; un DOI dans le même chat (C) peut aussi être fabriqué ; la régénération (D) teste la stabilité, pas l’existence.
Q17 · Deux collègues vérifient un chiffre à enjeux élevés en interrogeant deux outils d’IA différents ; les deux donnent le même nombre, ils le considèrent donc confirmé. Quelle est la FAILLE ? (Sélectionnez une réponse)
A. Aucune ; l’accord confirme l’exactitude. B. Les deux outils peuvent partager le même a priori erroné, donc l’accord est une preuve faible ; vérifiez contre une source indépendante faisant autorité. C. Ils auraient dû utiliser le même outil deux fois. D. Ils auraient dû interroger une troisième IA.
Réponse : B. Deux modèles d’accord n’est pas une vérification indépendante car ils peuvent se tromper de la même façon ; une source faisant autorité ou un humain est nécessaire. L’accord n’est pas une confirmation (A) ; répéter un outil (C) ou ajouter une troisième IA (D) ne rend pas la vérification faisant autorité.
Q18 · Un dashboard rapporte 92 % d’exactitude globale pour une tâche d’étiquetage assistée par Claude, et un manager veut l’étendre. Quelle vérification est la PLUS importante avant l’extension ? (Sélectionnez deux réponses)
A. Décomposer l’exactitude par catégorie pour trouver un segment défaillant. B. Confirmer que les catégories défaillantes ne sont pas celles à plus forts enjeux. C. Ne rapporter que le titre de 92 % à la direction. D. Supposer que 92 % convient partout. E. Passer à un modèle moins cher pour économiser.
Réponse : A et B. Un agrégat peut cacher une catégorie qui échoue gravement, donc la décomposition par segment et la vérification que les échecs ne se concentrent pas dans les catégories à enjeux élevés sont essentielles. Ne rapporter que le titre (C) et supposer l’uniformité (D) masquent le risque ; le coût (E) est sans rapport avec la question de validation.
Q19 · Une note purement interne contient un chiffre de revenu qui alimentera le plan d’embauche de l’an prochain. Un collègue dit « c’est interne, pas besoin de vérifier le chiffre ». Quelle est la MEILLEURE réponse ? (Sélectionnez une réponse)
A. Être d’accord ; le contenu interne n’a pas besoin de vérification. B. Vérifier le chiffre, car son usage aval dans une décision d’embauche le rend conséquent, quelle que soit l’étiquette « interne ». C. Ne vérifier que le ton. D. Demander à Claude s’il est confiant.
Réponse : B. Les enjeux suivent l’usage aval, pas l’étiquette « interne » ; un chiffre alimentant l’embauche doit être vérifié. « Interne » ne l’en exempte pas (A) ; le ton (C) est le mauvais prisme ; une vérification de confiance dans le même chat (D) n’est pas une vérification.
À retenir
- La fluidité n’est pas l’exactitude. Vérifiez tout ce sur quoi vous allez agir, proportionnellement aux enjeux.
- Les hallucinations se regroupent dans les nombres, les citations, les noms propres et les faits de longue traîne.
- Utilisez le test de provenance : document fourni → vérifier le texte ; citation de recherche → l’ouvrir ; connaissances du modèle → vérifier indépendamment.
- Vérifiez la cohérence par rapport aux entrées et au sein de la sortie ; c’est la vérification la moins coûteuse.
- Le biais se mitige par un prompting neutre, des structures symétriques et une revue humaine.
- Les sorties irréversibles, réglementées, externes ou porteuses de données personnelles exigent une revue humaine.
- Le format suit l’usage : artifact pour les livrables itératifs, données structurées pour les machines, en ligne pour la conversation.
- Choisissez la vérification la moins coûteuse et suffisante ; les erreurs de cohérence interne n’ont jamais besoin de sources externes.
- Une sortie exacte peut tout de même échouer sur la complétude ou la pertinence — vérifiez contre le brief et le public.
- Les enjeux suivent l’usage aval ; deux outils d’IA d’accord n’est pas une vérification indépendante.
Dernière mise à jour le 18 sept. 2026