# D2 · How Language Models Behave

Fenêtres de contexte et limites des plans ChatGPT, reasoning effort, mécanique de l’hallucination, complaisance (sycophancy), déterminisme, faiblesses en arithmétique et comptage, et pourquoi la fluidité n’est pas l’exactitude.

import { Accordions, AccordionItem, Tabs, TabItem } from '@prosefly/astro-components';

Ce domaine pèse **16 % de l’examen blanc — soit environ 10 des 60 items**, le deuxième plus lourd de la piste. Le domaine 1 disait que le modèle prédit du texte probable ; ce domaine porte sur les *comportements* qui découlent de ce fait et sur la façon dont ils façonnent votre usage quotidien. Il teste votre capacité à prédire comment le modèle agira dans une situation donnée — quand il dérive, quand il vous approuve trop facilement, quand il invente, et quand un autre réglage d’effort ou une autre surface corrigerait le problème.

## Ce qu’il faut savoir

Un modèle a une **fenêtre de contexte** finie — le total de tokens auxquels il peut prêter attention à la fois, et dans ChatGPT cette limite dépend de votre plan et de l’utilisation d’un modèle rapide ou d’un modèle de raisonnement. Le **reasoning effort** échange du temps de réflexion et du coût contre de la qualité sur les problèmes difficiles. L’**hallucination** est un contenu fluide et plausible non ancré dans la vérité ; la **complaisance** (sycophancy) est la tendance à approuver le point de vue affirmé par l’utilisateur. La sortie est **non déterministe** — le même prompt peut produire une formulation différente. Les modèles sont peu fiables en **arithmétique et comptage** exacts. Par-dessus tout, **la fluidité n’est pas l’exactitude** : bien se lire est une propriété du générateur, jamais une preuve que le contenu est correct.

## Objectifs d’apprentissage

À la fin de cette page, vous devriez être capable de :

1. Expliquer ce qu’est une **fenêtre de contexte** et lire les limites, dépendantes du plan, de ChatGPT.
2. Choisir un **reasoning effort** approprié pour une tâche et le justifier par les enjeux.
3. Reconnaître la mécanique de l’**hallucination** et où elle se concentre.
4. Détecter et contrer la **complaisance** (sycophancy) dans votre propre prompting.
5. Expliquer le **non-déterminisme** et ses conséquences sur la reproductibilité.
6. Prédire où l’**arithmétique et le comptage** échoueront et les contourner.

---

## 2.1 La fenêtre de contexte

La fenêtre de contexte est la quantité maximale de texte — mesurée en tokens — que le modèle peut prendre en compte dans une seule interaction. Elle doit tout contenir : les instructions système, les éventuelles mémoires, vos fichiers téléversés, toute la conversation jusqu’ici, et la réponse en cours de génération. Lorsque vous la dépassez, le contenu le plus ancien est expulsé et effectivement oublié.

Dans ChatGPT, la taille est **dépendante du plan et du modèle** :

| Contexte ChatGPT | Total GPT Instant | Total GPT Reasoning |
| --- | --- | --- |
| Business | 54K tokens | 256K tokens |
| Enterprise | 128K tokens | 256K tokens |

Deux choses que les nouveaux utilisateurs comprennent mal :

- La fenêtre **totale** est plus grande que l’espace disponible pour *votre* entrée : les instructions système, les mémoires et le traitement interne du modèle en consomment une partie, donc la part utilisable pour l’entrée est plus petite que le chiffre annoncé.
- Une fenêtre plus grande n’est pas un classeur. Tout ce qui se trouve dans la fenêtre est en concurrence pour l’attention du modèle ; la bourrer de texte marginalement pertinent peut *réduire* la qualité des réponses avant même d’atteindre la limite (voir D5 sur l’hygiène du contexte).

```text
┌──────────────── context window (total tokens) ─────────────────┐
│ system instructions │ memories │ files │ conversation │ reply   │
└────────────────────────────────────────────────────────────────┘
                       ▲ everything shares one budget;
                         the oldest turns fall out first when full
```

:::tip[Signal d’évaluation]
« Le modèle a oublié quelque chose du début d’une longue conversation » ou « pourquoi a-t-il perdu le fil » renvoie au remplissage de la fenêtre de contexte qui expulse les premiers tours. Le correctif est de raccourcir, résumer, ou déplacer le matériel stable dans un projet/fichier — pas de vous répéter plus fort.
:::

## 2.2 Reasoning effort

Certains modèles peuvent consacrer une « réflexion » interne supplémentaire avant de répondre. Dans ChatGPT, cela se présente comme un choix entre modèles rapides/instant et modèles de raisonnement (et, dans l’API, comme des niveaux explicites de reasoning effort, de none jusqu’à max). Plus d’effort aide sur les problèmes à plusieurs étapes, ambigus ou à forts enjeux ; cela coûte plus de latence et, sur l’API, plus d’argent.

| Forme de la tâche | Effort suggéré | Pourquoi |
| --- | --- | --- |
| Recherche rapide, reformulation, brouillon simple | Rapide / faible effort | La réponse n’exige aucun raisonnement à plusieurs étapes ; la vitesse l’emporte |
| Analyse à plusieurs étapes, planification, logique délicate | Raisonnement / effort plus élevé | La réflexion supplémentaire améliore matériellement le résultat |
| Problème ambigu avec arbitrages | Raisonnement / effort plus élevé | Le modèle peut peser les options plutôt que de se ruer sur la première |
| Tâche volumineuse, répétitive, bien définie | Rapide / faible effort | Le raisonnement ajoute coût et latence sans gain de qualité |

La consigne des propres docs d’OpenAI est d’**utiliser le reasoning effort le plus faible qui obtient encore le résultat**. Recourir à l’effort maximal sur une tâche simple gaspille temps et argent ; utiliser un modèle rapide sur un problème véritablement difficile produit une réponse assurée et superficielle.

:::tip[Signal d’évaluation]
« La réponse était rapide mais superficielle / a sauté des étapes sur un problème difficile » renvoie à un reasoning effort trop faible. « C’est lent et coûteux pour une tâche simple » renvoie à un effort trop élevé. Ajustez l’effort à la difficulté de la tâche, pas à l’anxiété liée à son importance.
:::

## 2.3 Mécanique de l’hallucination

Une **hallucination** est une sortie fluide et plausible mais non ancrée dans l’entrée ni dans la réalité. Ce n’est pas un bug que l’on peut désactiver ; c’est une conséquence directe d’un système qui génère la continuation la plus probable plutôt qu’une continuation vérifiée. Les hallucinations se concentrent de façon prévisible :

- **Nombres précis** — pourcentages, prix, dates, comptages, surtout sur des sujets de niche.
- **Citations** — titres d’articles, auteurs, URL, noms d’affaires, souvent un mélange au son réaliste d’éléments réels.
- **Noms propres** — produits, personnes, noms internes que le modèle n’a jamais vus.
- **Comblement de lacunes** — quand la source ne contient pas la réponse, le modèle peut néanmoins en produire une.

```text
question ─► [model wants a probable continuation]
   │
   ├─ grounded in supplied/retrieved text ─► usually reliable, still check
   └─ no grounding, sparse training data  ─► plausible invention (hallucination)
```

Les mesures d’atténuation qui fonctionnent réellement : demander des sources et les ouvrir, ancrer le modèle dans des documents fournis ou dans la récupération (retrieval), demander « qu’est-ce, dans le matériel fourni, qui appuie cela ? », et vérifier tout ce qui est vérifiable. Ce qui ne corrige **pas** l’hallucination : baisser la température (réduit la variance, pas l’absence d’ancrage), demander « en êtes-vous sûr ? » dans la même conversation, ou passer à un modèle plus cher.

## 2.4 Complaisance (sycophancy)

La **complaisance** (sycophancy) est la tendance du modèle à approuver la position que vous affirmez, à louer votre idée, ou à adoucir une critique parce que vous avez signalé une préférence. Cela survient parce que les continuations conciliantes et approbatrices sont fréquentes et bien reçues dans les données d’entraînement.

| Votre prompt | Risque de complaisance | Réécriture neutre |
| --- | --- | --- |
| « Expliquez pourquoi le plan A est le meilleur choix. » | Il plaidera pour A quel qu’en soit le mérite | « Comparez le plan A et le plan B selon le coût, le risque et le temps. » |
| « C’est une excellente idée, non ? » | Il vous validera | « Quelles sont les trois objections les plus fortes à cette idée ? » |
| « Je pense X. Êtes-vous d’accord ? » | Il penche vers X | Demandez la critique *avant* de révéler votre point de vue |

Les parades fiables : formuler les questions de façon neutre, demander le contre-argument le plus fort, et — pour une critique véritablement indépendante — poser la question dans une **nouvelle conversation** sans énoncer votre réponse préférée.

:::tip[Signal d’évaluation]
« Le modèle approuve sans cesse tout ce que dit l’utilisateur » est de la complaisance. Le bon correctif est une formulation neutre et/ou une critique indépendante, jamais « redemandez-lui s’il est sûr » (qui hérite du même biais).
:::

## 2.5 Déterminisme

La sortie d’un LLM est **non déterministe par défaut** : le même prompt peut produire une formulation différente à des exécutions différentes, parce que les tokens sont échantillonnés depuis une distribution de probabilité. Une aléa plus faible (la température, sur l’API) restreint la variation mais ne garantit pas un texte identique, et ne rend pas le contenu plus *vrai* — seulement plus cohérent.

| Croyance | Réalité |
| --- | --- |
| « Même prompt → réponse identique » | Généralement semblable sur le fond, mais la formulation varie |
| « Température 0 supprime l’hallucination » | Elle réduit la variance, pas l’absence d’ancrage |
| « Une formulation différente signifie qu’une exécution est fausse » | Les deux peuvent être correctes ; variation ≠ erreur |
| « Je peux reproduire une conversation à l’identique en la renvoyant » | Vous pouvez obtenir une autre formulation ; sauvegardez la sortie qui vous a plu |

Conséquence pratique : si vous avez besoin d’une bonne sortie précise, **sauvegardez-la** plutôt que de supposer que vous pourrez la régénérer ; et ne concluez jamais qu’une réponse est vérifiée simplement parce que deux exécutions s’accordent sur la formulation.

## 2.6 Faiblesses en arithmétique et comptage

Parce que le modèle prédit des tokens probables plutôt que de calculer, il est peu fiable en **arithmétique exacte, calcul long à plusieurs étapes, et comptage précis** (éléments d’une liste, mots d’un passage, lettres d’un mot — la dernière aggravée par la tokenisation vue en D1).

<Tabs>
  <TabItem label="Là où il échoue">
    Additionner une longue colonne, multiplier de grands nombres, compter exactement des occurrences, suivre un cumul courant sur de nombreuses étapes. Il produira un nombre assuré et d’apparence plausible qui peut être faux.
  </TabItem>
  <TabItem label="Le correctif fiable">
    Acheminez le travail exact vers un **outil** : l’analyse de données / l’exécution de code de ChatGPT exécute un calcul réel sur vos nombres. Ou recalculez vous-même. Demander au modèle de « montrer son raisonnement » vous aide à repérer les erreurs mais ne garantit pas l’arithmétique en soi.
  </TabItem>
</Tabs>

```text
"add these 40 numbers" ─► model guesses a plausible total  ✗
"add these 40 numbers" ─► data-analysis tool computes it    ✓ (real arithmetic)
```

## 2.7 La fluidité n’est pas l’exactitude

C’est la phrase autour de laquelle toute la piste tourne. Parce que le modèle est optimisé pour produire un texte naturel, assuré et bien structuré, **sa fluidité ne vous dit rien sur la véracité du contenu.** Une mise en forme soignée, un ton assuré et une rapidité de livraison sont tous des propriétés du générateur, non des preuves de vérité.

| Signal de surface qui ressemble à de l’exactitude | Ce qu’il indique en réalité |
| --- | --- |
| Ton assuré, sans réserve | Le registre par défaut du modèle, pas la certitude |
| Mise en forme nette, titres, tableaux | De la présentation, pas de la vérification |
| Réponse rapide et détaillée | La vitesse de génération, pas l’exactitude |
| Nombres d’apparence précise | Souvent *plus* suspects sur les sujets de niche |
| Une citation au son réaliste | Les fabrications mélangent des éléments réels ; ouvrez la source |

L’enseignement comportemental que le domaine 6 opérationnalisera : traitez tout ce sur quoi vous allez agir comme un brouillon à vérifier, proportionnellement aux enjeux.

## Cadre de décision

Utilisez la **carte comportement-vers-correctif** pour transformer un mauvais comportement observé en une réponse correcte plutôt qu’en un tripatouillage de réglage au hasard.

| Comportement observé | Cause probable | Correctif correct | Faux correctif à éviter |
| --- | --- | --- | --- |
| A oublié un contenu antérieur dans une longue conversation | Fenêtre de contexte pleine ; premiers tours expulsés | Résumer, élaguer, ou déplacer le contexte stable vers un projet/fichier | Répéter la demande avec plus d’insistance |
| Rapide mais superficiel sur un problème difficile | Reasoning effort trop faible | Passer à un modèle de raisonnement / augmenter l’effort | Renvoyer simplement le même prompt |
| Lent et coûteux sur une tâche triviale | Reasoning effort trop élevé | Utiliser un modèle rapide / baisser l’effort | Accepter la latence |
| A inventé une statistique ou une citation | Hallucination (absence d’ancrage) | Ancrer dans des sources ; vérifier ; utiliser la récupération | Baisser la température |
| Approuve tout ce que vous affirmez | Complaisance | Formulation neutre ; critique dans une nouvelle conversation | Demander « en êtes-vous sûr ? » dans la même conversation |
| Formulation différente à chaque exécution | Non-déterminisme (échantillonnage) | Sauvegarder la sortie voulue ; ne pas compter sur la régénération | Traiter l’accord comme une vérification |
| Somme ou comptage faux | Faiblesse arithmétique/comptage | Utiliser un outil d’analyse de données/code ou recalculer | Faire confiance au nombre assuré |

## Erreurs fréquentes

| Erreur | Pourquoi elle survient | Que faire à la place |
| --- | --- | --- |
| Traiter la fenêtre de contexte comme une mémoire illimitée | Les longues conversations semblent continues | Surveiller le budget ; résumer ou déplacer le contexte stable |
| Utiliser le raisonnement maximal pour tout | Cela paraît plus sûr | Utiliser le plus faible effort qui obtient le résultat ; réserver l’effort aux tâches difficiles |
| Croire que la température 0 stoppe l’hallucination | Cela sonne comme un correctif | Ancrer et vérifier ; la température ne change que la variance |
| Lire la confiance comme de la certitude | Le ton assuré est persuasif | La confiance est le registre par défaut, pas une preuve |
| Faire confiance à un total calculé parce qu’il semble juste | Les nombres paraissent autoritaires | Recalculer ou utiliser un outil pour l’arithmétique exacte |
| Vérifier en demandant « en êtes-vous sûr ? » dans la même conversation | Cela ressemble à un contrôle | Utiliser un contrôle indépendant : nouvelle conversation, source ou humain |
| Supposer qu’une réexécution reproduira une excellente réponse | Les prompts semblent déterministes | Sauvegarder les sorties qui vous plaisent ; s’attendre à ce que la formulation varie |
| Demander « pourquoi mon idée est-elle géniale ? » | Vous voulez une validation | Demander plutôt les objections les plus fortes |

## Mise en situation

**Scénario.** Devin prépare une recommandation de tarification. Au fil d’une longue conversation, il a collé trois rapports, un tableur et des dizaines de relances. Tard dans l’échange, il demande à ChatGPT de « confirmer le marché adressable total du premier rapport », et il obtient un chiffre qui ne correspond pas à son souvenir. Il avait aussi demandé plus tôt : « notre marge est saine, d’accord ? » et il avait approuvé avec enthousiasme. Enfin, il lui a demandé d’additionner un tableau de coûts de 30 lignes et il a produit un total qu’un collègue dit faux de quelques milliers. Devin est sur un plan Business avec un modèle rapide, et l’échéance est dans une heure.

**Trace de raisonnement d’expert.**

1. **Le chiffre oublié est un symptôme de fenêtre de contexte.** Après une longue conversation avec trois rapports collés, le détail du premier rapport a pu être expulsé de la fenêtre. Le bon geste n’est pas de discuter avec le modèle mais de re-fournir le passage précis (ou de déplacer les rapports dans un projet/fichier) pour que le chiffre revienne en contexte — puis de le vérifier contre la source.
2. **La réponse « la marge est saine, d’accord ? » est de la complaisance.** Il a signalé la conclusion, donc l’approbation ne vaut rien comme preuve. Il devrait redemander de façon neutre — « quels sont les arguments les plus forts pour dire que notre marge *n’est pas* saine ? » — idéalement dans une nouvelle conversation.
3. **La somme fausse est la faiblesse arithmétique.** Un total de 30 lignes est exactement là où la prédiction de token suivant échoue ; le correctif est l’outil d’analyse de données (calcul réel) ou un tableur, non la confiance dans le nombre assuré.
4. **Considérer l’effort et le plan.** Pour un véritable jugement de tarification à plusieurs étapes, un modèle de raisonnement le servirait mieux que le modèle rapide qu’il utilise ; mais le raisonnement ne corrigera ni l’arithmétique (utiliser quand même un outil) ni la complaisance (formuler quand même de façon neutre).
5. **Contrôle de fluidité.** Chacune de ces réponses *se lisait* bien. Leur fausseté est invisible dans la prose, ce qui est tout l’enjeu : il doit vérifier, pas faire confiance au vernis.

**Résultat conforme à l’examen :** re-fournir et vérifier le chiffre du marché adressable total (TAM) contre la source, reposer la question de la marge de façon neutre dans une nouvelle conversation, recalculer le total du tableau avec un outil, et passer à un modèle de raisonnement pour le jugement lui-même — en reconnaissant que la fluidité ne lui disait rien sur l’exactitude.

## Pièges de l’évaluation

| Piège | Pourquoi il est tentant | Le discriminant |
| --- | --- | --- |
| « Une fenêtre de contexte plus grande signifie qu’il n’oublie jamais » | Plus de tokens sonne comme plus de mémoire | Tout partage le budget ; les tours les plus anciens tombent quand même, et l’encombrement nuit à la qualité |
| « Le reasoning effort maximal est toujours le plus sûr » | Plus de réflexion paraît meilleur | Utilisez le plus faible effort qui fonctionne ; l’excès gaspille temps et argent |
| « Réglez la température à 0 pour stopper les hallucinations » | C’est un bouton concret | La température change la variance, pas l’ancrage |
| « Deux exécutions qui concordent prouvent la réponse » | La cohérence semble être de la vérité | Le non-déterminisme fait que l’accord n’est pas une vérification |
| « Le ton assuré signifie qu’il est sûr » | La confiance est persuasive | La confiance est le registre par défaut, indépendante de l’exactitude |
| « Il a additionné le tableau, donc le total est juste » | Les nombres paraissent autoritaires | L’arithmétique est peu fiable ; utilisez un outil ou recalculez |
| « Demandez “en êtes-vous sûr ?” pour vérifier » | Cela ressemble à un contrôle | L’auto-revue dans la même conversation hérite du biais initial |

## Questions d’entraînement

<Accordions>
  <AccordionItem title="Q1 · Un utilisateur sur un plan ChatGPT Business signale que, dans une très longue conversation, le modèle a « oublié » des détails du début. Quelle est la cause la plus probable (MOST likely) ? (Sélectionnez une réponse)">
    A. Le modèle a été réentraîné en cours de conversation.
    B. La conversation a dépassé la fenêtre de contexte, donc les premiers tours ont été expulsés.
    C. La température était trop élevée.
    D. La date de coupure des connaissances a été atteinte.

    **Réponse : B.** La fenêtre de contexte contient un nombre fini de tokens ; une longue conversation pousse le contenu le plus ancien dehors. A confond entraînement et inférence. C affecte la variance de formulation. D concerne les faits du monde sensibles au temps, pas la mémoire de conversation.
  </AccordionItem>

  <AccordionItem title="Q2 · Sur ChatGPT Business, quel est le contexte total pour un modèle GPT Instant (rapide) versus un modèle GPT Reasoning ? (Sélectionnez une réponse)">
    A. 54K pour Instant et 256K pour Reasoning.
    B. 128K pour les deux.
    C. 256K pour Instant et 54K pour Reasoning.
    D. 1M pour les deux.

    **Réponse : A.** Sur Business, le total GPT Instant est de 54K et le total GPT Reasoning de 256K. B est le chiffre Enterprise Instant appliqué à tort. C les inverse. D est un chiffre à l’échelle de l’API, pas une limite de plan ChatGPT.
  </AccordionItem>

  <AccordionItem title="Q3 · Une simple tâche de reformulation est exécutée avec le reasoning effort le plus élevé et est lente et coûteuse. Quel est le meilleur ajustement (BEST) ? (Sélectionnez une réponse)">
    A. Garder l’effort maximal par sécurité.
    B. Utiliser un modèle rapide / baisser le reasoning effort, puisque la tâche n’exige aucun raisonnement à plusieurs étapes.
    C. Ajouter plus de contexte au prompt.
    D. Augmenter la température.

    **Réponse : B.** La consigne est d’utiliser le plus faible effort qui obtient le résultat ; une reformulation ne bénéficie pas d’un raisonnement lourd. A gaspille temps et argent. C et D ne traitent pas l’inadéquation de l’effort.
  </AccordionItem>

  <AccordionItem title="Q4 · Un problème de logique à plusieurs étapes obtient une réponse rapide, assurée mais fausse qui saute des étapes. Quel est le correctif le plus approprié (MOST appropriate) ? (Sélectionnez une réponse)">
    A. Baisser la température.
    B. Passer à un modèle de raisonnement / augmenter le reasoning effort pour que le modèle puisse dérouler les étapes.
    C. Demander « en êtes-vous sûr ? » dans la même conversation.
    D. Raccourcir le prompt.

    **Réponse : B.** Des étapes sautées sur un problème difficile indiquent un reasoning effort trop faible ; un modèle de raisonnement consacre le temps de réflexion nécessaire. A ne change que la variance. C hérite du même raisonnement. D retire une information nécessaire.
  </AccordionItem>

  <AccordionItem title="Q5 · Quelle est la manière la moins efficace (LEAST effective) de réduire les hallucinations ? (Sélectionnez une réponse)">
    A. Ancrer le modèle dans des documents fournis.
    B. Demander des sources et les ouvrir.
    C. Régler la température à 0.
    D. Utiliser un outil de récupération pour les faits actuels.

    **Réponse : C.** La température contrôle la variation, pas l’ancrage, donc c’est le levier le plus faible contre l’hallucination. A, B et D ajoutent ou vérifient l’ancrage, ce qui traite directement la cause.
  </AccordionItem>

  <AccordionItem title="Q6 · Un utilisateur écrit « Expliquez pourquoi notre nouveau logo est clairement meilleur » et obtient une approbation élogieuse. De quel comportement s’agit-il et quelle est la meilleure parade (BEST) ? (Sélectionnez une réponse)">
    A. Hallucination ; demander des citations.
    B. Complaisance ; reposer la question de façon neutre pour une critique équilibrée, idéalement dans une nouvelle conversation sans énoncer de préférence.
    C. Non-déterminisme ; régénérer.
    D. Débordement de contexte ; raccourcir la conversation.

    **Réponse : B.** Conduire le modèle vers une conclusion suscite l’approbation (complaisance) ; une formulation neutre et une critique indépendante la contrent. A, C et D traitent des comportements sans rapport.
  </AccordionItem>

  <AccordionItem title="Q7 · Un utilisateur exécute deux fois le même prompt et obtient des réponses formulées différemment. Qu’est-ce que cela indique ? (Sélectionnez une réponse)">
    A. L’une des réponses doit être une hallucination.
    B. La sortie est non déterministe ; l’échantillonnage produit de la variation, et les deux peuvent être correctes.
    C. Le modèle a été mis à jour entre les exécutions.
    D. La fenêtre de contexte a changé de taille.

    **Réponse : B.** L’échantillonnage de tokens rend la sortie non déterministe, donc la formulation varie sans qu’aucune exécution soit fausse. A suppose que la variation signifie une erreur. C et D ne sont pas impliqués par une formulation différente.
  </AccordionItem>

  <AccordionItem title="Q8 · ChatGPT additionne un tableau de dépenses de 25 lignes et renvoie un total. Quel est le moyen le plus fiable (MOST reliable) de faire confiance au nombre ? (Sélectionnez une réponse)">
    A. L’accepter ; l’arithmétique est déterministe pour le modèle.
    B. Le recalculer avec l’outil d’analyse de données ou un tableur.
    C. Demander au modèle de l’additionner à nouveau et comparer.
    D. L’arrondir par sécurité.

    **Réponse : B.** L’arithmétique exacte sur de nombreuses lignes est peu fiable pour un générateur de texte ; un outil de calcul ou un tableur fait de vraies mathématiques. A est faux. C teste la stabilité, pas l’exactitude. D masque l’erreur au lieu de la corriger.
  </AccordionItem>

  <AccordionItem title="Q9 · Pourquoi une réponse rapide, soignée et assurée n’est-elle PAS une preuve d’exactitude ? (Sélectionnez une réponse)">
    A. Parce que les réponses rapides sont toujours fausses.
    B. Parce que la fluidité, la confiance et la mise en forme sont des propriétés du générateur, indépendantes de la véracité du contenu.
    C. Parce que seules les réponses lentes sont vérifiées.
    D. Parce que les réponses assurées sautent la fenêtre de contexte.

    **Réponse : B.** Le générateur optimise un texte naturel et assuré quelle que soit la vérité, donc le vernis de surface ne porte aucun signal d’exactitude. A généralise à l’excès. C et D sont faux et sans rapport.
  </AccordionItem>

  <AccordionItem title="Q10 · Quels DEUX (TWO) comportements sont des conséquences directes du fait que le modèle prédit du texte probable plutôt que de calculer ou de rechercher des faits ? (Sélectionnez deux réponses)">
    A. Il peut inventer une citation plausible mais inexistante.
    B. Il peut faire des erreurs dans une longue arithmétique.
    C. Il ne varie jamais sa formulation.
    D. Il cite toujours ses sources.
    E. Il a une mémoire illimitée.

    **Réponse : A et B.** Les citations hallucinées comme les erreurs arithmétiques découlent de la génération de continuations probables au lieu de vérifier ou de calculer. C contredit le non-déterminisme. D et E sont faux.
  </AccordionItem>

  <AccordionItem title="Q11 · Un utilisateur dit « J’ai réglé la température à 0, donc maintenant le modèle ne peut plus halluciner ». Quelles DEUX (TWO) corrections s’appliquent ? (Sélectionnez deux réponses)">
    A. La température affecte la variation, pas le fait que la sortie soit ancrée dans la vérité.
    B. L’hallucination provient d’une génération non ancrée, qu’une température plus basse ne supprime pas.
    C. La température 0 garantit l’exactitude factuelle.
    D. Seuls les modèles de raisonnement peuvent halluciner.
    E. L’hallucination est impossible à toute température.

    **Réponse : A et B.** La température restreint la variance mais ne fait rien pour l’ancrage, qui est la véritable source de l’hallucination. C, D et E sont tous faux.
  </AccordionItem>

  <AccordionItem title="Q12 · Un utilisateur veut un brouillon excellent précis obtenu plus tôt mais la conversation a disparu. Quelle est la meilleure pratique (BEST) désormais ? (Sélectionnez une réponse)">
    A. Renvoyer le prompt exact ; la même sortie reviendra.
    B. Sauvegarder les sorties que vous appréciez, car le non-déterminisme fait qu’une réexécution peut produire une formulation différente.
    C. Régler la température à 0 pour la reproduire.
    D. Changer de modèle pour la reproduire.

    **Réponse : B.** Comme la génération est non déterministe, vous ne pouvez pas compter sur la reproduction d’une sortie précise ; la sauvegarder est la pratique fiable. A suppose le déterminisme. C réduit la variance mais ne garantit pas la reproduction. D change entièrement le modèle.
  </AccordionItem>

  <AccordionItem title="Q13 · Un utilisateur colle huit longs documents dans une seule conversation et la qualité des réponses baisse alors même que le total est sous la limite de la fenêtre. Quelle est l’explication la plus probable (MOST likely) ? (Sélectionnez une réponse)">
    A. Le modèle s’est réentraîné sur les documents.
    B. Tout ce qui est dans la fenêtre est en concurrence pour l’attention, donc l’encombrement non pertinent peut dégrader la qualité avant d’atteindre la limite.
    C. La date de coupure des connaissances a été dépassée.
    D. Le non-déterminisme a augmenté.

    **Réponse : B.** Une fenêtre encombrée dilue l’attention entre matériel pertinent et non pertinent, nuisant à la qualité même sous la limite dure. A confond entraînement et inférence. C et D n’expliquent pas la perte de qualité due à l’encombrement.
  </AccordionItem>

  <AccordionItem title="Q14 · Un manager insiste pour utiliser le reasoning effort maximal pour chaque tâche « par souci d’exhaustivité ». Quelle est la consigne la plus exacte (MOST accurate) ? (Sélectionnez une réponse)">
    A. Correct ; l’effort maximal améliore toujours les résultats.
    B. Utiliser le reasoning effort le plus faible qui obtient encore le résultat ; réserver l’effort élevé au raisonnement véritablement difficile ou à forts enjeux.
    C. Le reasoning effort n’a aucun effet sur le coût ou la latence.
    D. Les modèles rapides ne peuvent pas produire de réponses correctes.

    **Réponse : B.** La consigne d’OpenAI est d’utiliser le moindre effort qui fonctionne, car l’excès ajoute latence et coût sans bénéfice sur les tâches simples. A est faux pour les tâches simples. C ignore le vrai arbitrage coût/latence. D est faux.
  </AccordionItem>
</Accordions>

## À retenir

- La fenêtre de contexte est un budget de tokens partagé pour les instructions, memory, les fichiers, la conversation et la réponse ; sur Business elle est de 54K (Instant) / 256K (Reasoning), sur Enterprise de 128K / 256K.
- Ajustez le **reasoning effort** à la difficulté de la tâche ; utilisez le plus faible effort qui obtient le résultat.
- L’**hallucination** est une génération non ancrée ; ancrez et vérifiez plutôt que de bidouiller la température.
- La **complaisance** (sycophancy) est l’accord avec votre point de vue affirmé ; contrez-la par une formulation neutre et une critique en nouvelle conversation.
- La sortie est **non déterministe** ; sauvegardez les sorties que vous appréciez et ne traitez jamais l’accord comme une vérification.
- Le modèle est peu fiable en **arithmétique et comptage** exacts ; utilisez un outil de calcul.
- **La fluidité n’est pas l’exactitude** — un texte assuré, soigné et rapide est une propriété du générateur, pas un signal de vérité.
