AI Cert Prep
Saisissez un mot-clé pour rechercher dans la documentation.

Parcours API Developer

API Developer Path – Examen blanc 2

Un examen blanc indépendant plus difficile de 60 items pour le parcours développeur API OpenAI, avec des items à contraintes multiples et de jugement, explications complètes et lecture de préparation.

Ceci est le second examen blanc indépendant complet pour le parcours développeur API, construit à partir des objectifs d’apprentissage OpenAI et de la documentation produit accessibles au public. Il n’est pas une évaluation officielle OpenAI : les badges Academy et les certificats de parcours ne sont pas des certifications. L’Examen blanc 2 est délibérément plus difficile que l’Examen blanc 1 — plus d’énoncés à contraintes multiples, plus de qualificatifs FIRST / BEST / MOST cost-effective / TWO, et davantage de mises en situation. Traitez-le comme votre test de préparation : les 60 items sont inédits et distincts de l’Examen blanc 1 et des pages de domaine.

Consignes

  • Durée : 90 minutes pour 60 items — le rythme qu’utilise notre examen blanc ; OpenAI ne publie pas de durée d’examen publique.
  • Items : 60, à réponse unique et à réponses multiples. Chaque item indique combien de réponses sélectionner.
  • Sélection : pour un item Sélectionnez deux réponses, vous devez choisir les deux bonnes options et aucune mauvaise pour obtenir le point. Il n’y a aucune pénalité pour les mauvaises réponses, alors répondez à chaque question.
  • Objectif : visez au moins 80 % brut (environ 48 sur 60) ici avant de passer la véritable évaluation Academy, qui réussit à la même barre de 80 %. Réussir cet examen blanc plus difficile à 80 %+ est un signe fort de préparation.
  • Traitez chaque question avant de déployer la réponse.

Répartition par domaine

#DomaineItems ici
D1Scoping AI Solutions7
D2The Responses API and Model Selection11
D3Evaluating AI Applications10
D4Designing and Building Agentic Systems11
D5Retrieval-Augmented Generation9
D6Performance, Latency and Cost7
D7Production Safety and Operations5

Total : 7 + 11 + 10 + 11 + 9 + 7 + 5 = 60 items.

Interprétation de la préparation

Ceci est un indicateur de préparation indépendant, pas un score officiel.

Score brut (sur 60)PalierInterprétation
54–60 (90 %+)Forte préparationBonne maîtrise des items à contraintes multiples les plus difficiles
48–53 (80–89 %)Prêt pour l’évaluationAu niveau ou au-dessus de la barre Academy des 80 % sur la série plus difficile
42–47 (70–79 %)Confiance en constructionProche ; entraînez-vous sur les items de jugement et d’arithmétique des coûts
moins de 42 (moins de 70 %)Continuez à apprendreRevoyez les pages de domaine et repassez d’abord l’Examen blanc 1

Passer l’examen blanc

Deux façons d’utiliser les questions ci-dessous : le mode interactif lance une session chronométrée, une question à la fois, et se termine par votre score, une ventilation par domaine et une correction complète ; le mode révision en dessous liste chaque question avec ses options une par ligne et la réponse masquée jusqu’à ce que vous la demandiez.

Mode interactif

Passer l’examen d’entraînement

60 questions · une à la fois · compte à rebours de 90 minutes · résultats avec répartition par domaine et correction complète à la fin. Votre progression est enregistrée dans ce navigateur si vous quittez la page.

Toutes les questions (mode révision)

Les options sont présentées une par ligne. La réponse et l’explication restent masquées jusqu’à ce que vous cliquiez sur Afficher la réponse. Utilisez le mode interactif ci-dessus pour une session chronométrée.

  1. Q1D1 · Cadrage des solutions d’IASélectionnez une réponse

    Un VP veut un système de gestion d’incidents entièrement autonome en production sous une semaine, sans incidents étiquetés et avec l’exigence qu’aucune action visible par le client ne se déclenche sans validation. Quelle est la PREMIÈRE étape la plus appropriée ?

    • A. Cadrer une tranche étroite assistée (réponses en brouillon avec approbation humaine) dotée d’une mesure mesurable, et n’augmenter l’autonomie que lorsque les évaluations le justifient
    • B. Livrer le système autonome complet et l’encadrer plus tard
    • C. Faire du fine-tuning sur des incidents synthétiques pour atteindre l’autonomie immédiatement
    • D. Choisir gpt-6-astra et laisser la capacité compenser l’absence de données
    Afficher la réponse

    Réponse : A.

    Sans données étiquetées et avec une exigence stricte de validation humaine, la première étape responsable est une tranche étroite assistée dotée d’une mesure, l’autonomie se gagnant par les évaluations. B contredit l’exigence de validation et livre du risque. C fabrique des données qui peuvent ne pas refléter la réalité et fait toujours l’impasse sur l’évaluation. D s’appuie sur la taille du modèle pour masquer une absence de données et de mesures, ce que la capacité ne peut corriger.

  2. Q2D1 · Cadrage des solutions d’IASélectionnez deux réponses

    Vous cadrez une fonctionnalité et voulez recueillir uniquement les exigences qui CHANGERAIENT l’architecture. Lesquelles, parmi ces DEUX, en font partie ?

    • A. Si les sorties alimentent une action irréversible qui nécessite une porte humaine
    • B. Si la charge est interactive ou une file de masse
    • C. Les couleurs de marque préférées de l’entreprise
    • D. La police utilisée par le rapport
    • E. Le nom du canal de projet dans la messagerie
    Afficher la réponse

    Réponse : A et B.

    L’irréversibilité impose des portes d’approbation et une préparation, et le caractère interactif ou de masse guide les choix de modèle, de palier et de streaming : les deux changent l’architecture. C, D et E sont des détails cosmétiques ou organisationnels qui n’affectent pas la façon dont le système est construit.

  3. Q3D1 · Cadrage des solutions d’IASélectionnez une réponse

    Deux mesures candidates sont proposées pour un classifieur de tri : (i) « les utilisateurs sont plus contents » et (ii) « macro-F1 ≥ 0,85 sur un jeu étiqueté tenu à l’écart, avec un taux de mauvais aiguillage inférieur à 3 % ». Laquelle est la MEILLEURE mesure de succès, et pourquoi ?

    • A. (ii), parce qu’elle est spécifique, mesurable face à des données étiquetées et liée à un taux d’erreur pertinent pour le métier
    • B. (i), parce que la satisfaction des utilisateurs est l’objectif ultime
    • C. Ni l’une ni l’autre ; les classifieurs ne peuvent pas être mesurés
    • D. Les deux sont équivalentes
    Afficher la réponse

    Réponse : A.

    Une bonne mesure est spécifique et mesurable face à la vérité terrain, avec un seuil pertinent pour le métier, ce que fournit (ii). (i) n’est pas mesurable telle quelle et ne peut pas conditionner une mise en production. C est faux. D ignore que seule (ii) peut réellement être calculée et exploitée.

  4. Q4D1 · Cadrage des solutions d’IASélectionnez une réponse

    Une charge de travail effectue 90 000 classifications par jour à 800 tokens d’entrée et 120 de sortie. Sur gpt-5.6-luna ($0.20/$1.20 par M) elle passe l’évaluation ; un directeur préfère gpt-5.6-terra ($2/$12 par M). Combien Terra coûte-t-il approximativement de PLUS par jour pour la même charge ?

    • A. Environ $247 de plus par jour (environ $27 sur Luna contre $274 sur Terra)
    • B. Environ $25 de plus par jour
    • C. Rien ; les prix sont identiques
    • D. Environ $2,470 de plus par jour
    Afficher la réponse

    Réponse : A.

    Entrée quotidienne 90 000 x 800 = 72M tokens ; sortie 90 000 x 120 = 10,8M tokens. Luna : 72 x $0.20 + 10,8 x $1.20 = $14.40 + $12.96 = ~$27. Terra : 72 x $2 + 10,8 x $12 = $144 + $129.60 = ~$274. L’écart est d’environ $247/jour, donc A. B correspond à peu près au total Luna, pas à l’écart ; C est faux puisque Terra est dix fois plus cher par token ; D est dix fois trop élevé.

  5. Q5D1 · Cadrage des solutions d’IASélectionnez une réponse

    Pendant le cadrage, vous découvrez que la sortie de la tâche annule automatiquement des expéditions, une action irréversible. Comment le plan de solution devrait-il le MIEUX refléter cela ?

    • A. Le consigner comme une contrainte stricte exigeant une porte d’approbation ou une préparation réversible avant toute annulation validée
    • B. Le noter comme un « nice-to-have » à revisiter après le lancement
    • C. S’appuyer sur un modèle plus capable pour éviter les erreurs
    • D. Journaliser les annulations après coup à des fins d’audit
    Afficher la réponse

    Réponse : A.

    L’irréversibilité est une contrainte stricte qui doit façonner la conception, avec une porte d’approbation ou une préparation réversible avant validation. B reporte une exigence critique de sécurité. C ne peut rendre une action irréversible sûre par la seule capacité. D ne fait qu’enregistrer les dégâts après coup, sans les prévenir.

  6. Q6D1 · Cadrage des solutions d’IASélectionnez une réponse

    Une capacité banalisée avec un produit hébergé mature existe, votre équipe est petite et la rapidité de mise en valeur importe, mais les données sont très sensibles et ne doivent jamais quitter votre réseau. Qu’est-ce que cela change LE PLUS probablement à la décision d’achat ?

    • A. Cela fait pencher la balance vers le développement ou un déploiement qui garde les données sur le réseau, car la contrainte de résidence des données peut l’emporter sur l’argument de banalisation
    • B. Rien ; il faut toujours acheter les capacités banalisées
    • C. Cela signifie que vous devez faire du fine-tuning de votre propre modèle, quoi qu’il arrive
    • D. Cela signifie que la qualité n’a plus d’importance
    Afficher la réponse

    Réponse : A.

    Une contrainte stricte de résidence des données peut l’emporter sur l’heuristique habituelle « acheter le banalisé », en faveur du développement ou d’un déploiement sur le réseau. B ignore la contrainte qui change le calcul. C saute au fine-tuning, que la résidence n’exige pas. D est un non-sequitur.

  7. Q7D1 · Cadrage des solutions d’IASélectionnez une réponse

    Quel élément relève spécifiquement de la ligne « Mesure de succès » d’un plan de solution, plutôt que des lignes exigences ou risques ?

    • A. Macro-F1 égal ou supérieur à 0,85 sur un jeu tenu à l’écart, mesuré chaque semaine
    • B. Les données doivent rester dans l’UE
    • C. Une attaque par prompt injection pourrait exfiltrer des données
    • D. La fonctionnalité doit répondre en moins de deux secondes
    Afficher la réponse

    Réponse : A.

    Une mesure de succès énonce le seuil de qualité mesurable et sa méthode de mesure, ce que fait A. B est une exigence/contrainte, C est un risque et D est une exigence de latence, aucune n’étant la mesure de succès en qualité.

  8. Q8D2 · La Responses API et la sélection du modèleSélectionnez une réponse

    Un pipeline a besoin d’une sortie à schéma strict ET d’un appel d’outil en direct ET de persister l’état de conversation entre les tours, le tout sur l’interface principale. Quelle unique API prend en charge les trois directement ?

    • A. La Responses API, qui prend en charge les structured outputs, le function calling et l’état de conversation côté serveur
    • B. La Chat Completions API, l’interface principale recommandée
    • C. L’Assistants API, le choix par défaut actuel
    • D. La Batch API
    Afficher la réponse

    Réponse : A.

    La Responses API est l’interface principale et prend en charge ensemble les structured outputs, le function calling et l’état de conversation. B relève du legacy pour les nouveaux travaux. C est regroupée sous les Legacy APIs. D est un palier de traitement hors ligne, non une interface interactive dotée de ces fonctionnalités.

  9. Q9D2 · La Responses API et la sélection du modèleSélectionnez deux réponses

    Un scénario indique : « le modèle doit renvoyer le taux de change du jour et le solde actuel du client ». Quels DEUX signaux orientent vers des appels d’outil plutôt que vers la mémoire du modèle ?

    • A. Le taux de change change constamment et n’est pas dans les données d’entraînement du modèle
    • B. Le solde du client est un état privé en direct que le modèle ne peut pas connaître
    • C. La demande est formulée poliment
    • D. Le prompt est long
    • E. Un modèle plus grand est utilisé
    Afficher la réponse

    Réponse : A et B.

    Des données externes en changement constant et un état privé en direct sont tous deux hors de la connaissance du modèle et doivent provenir d’outils. C, D et E sont des caractéristiques de surface qui ne disent rien sur l’existence de l’information nécessaire à l’intérieur du modèle.

  10. Q10D2 · La Responses API et la sélection du modèleSélectionnez une réponse

    Une équipe est sur gpt-5.6-sol à l’effort high. La latence est inacceptable et leur évaluation passe à medium. Quel est le changement correct le PLUS économique qui préserve la qualité ?

    • A. Descendre à l’effort medium, puisqu’il passe l’évaluation et réduit latence et coût
    • B. Passer à gpt-6-astra en xhigh
    • C. Garder l’effort high mais ajouter des sous-agents
    • D. Augmenter la température pour accélérer la génération
    Afficher la réponse

    Réponse : A.

    Le plus faible effort qui passe l’évaluation est la cible, et medium passe tout en réduisant latence et coût. B augmente à la fois le coût et la latence. C ajoute du travail parallèle sans rapport avec la latence liée à l’effort par appel. D ne réduit pas la latence de raisonnement et nuit au déterminisme.

  11. Q11D2 · La Responses API et la sélection du modèleSélectionnez une réponse

    Une application parse output_text et plante par intermittence quand le modèle émet un appel d’outil avant tout message. Quel est le correctif RACINE, et non un contournement ?

    • A. Parcourir les éléments de sortie typés et traiter explicitement les éléments d’appel d’outil et les éléments de message, plutôt que de supposer qu’un message texte arrive toujours en premier
    • B. Envelopper le parsing dans un try/except et ignorer les échecs
    • C. Désactiver les outils pour qu’aucun élément d’appel d’outil n’apparaisse
    • D. Réessayer la requête jusqu’à obtenir une réponse commençant par du texte
    Afficher la réponse

    Réponse : A.

    La cause racine est de traiter la sortie comme commençant par du texte alors qu’il s’agit d’une séquence d’éléments typés ; traiter chaque type d’élément corrige le problème structurellement. B masque les erreurs et perd les résultats d’outil. C supprime une capacité nécessaire. D est un contournement instable qui gaspille des appels.

  12. Q12D2 · La Responses API et la sélection du modèleSélectionnez une réponse

    Une conversation approche de la fenêtre de contexte de 1,05M de tokens en plein milieu d’une tâche et doit continuer. Quelle est l’action appropriée ?

    • A. Appliquer la compaction pour résumer le contexte plus ancien tout en conservant ce dont la tâche a encore besoin
    • B. Tronquer les plus anciens messages à l’aveugle en espérant ne rien perdre d’important
    • C. Passer à un modèle avec une fenêtre plus petite
    • D. Augmenter le nombre maximal de tokens de sortie
    Afficher la réponse

    Réponse : A.

    La compaction résume le contexte périmé afin que la tâche se poursuive dans la fenêtre tout en préservant l’information nécessaire. B risque d’écarter du contexte essentiel. C aggrave le problème. D concerne la longueur de sortie, non la pression sur le contexte d’entrée.

  13. Q13D2 · La Responses API et la sélection du modèleSélectionnez une réponse

    Une tâche est complexe, ouverte et constitue le flux de travail à la plus forte valeur du produit, exigeant un raisonnement multi-outils soutenu et du jugement, à faible volume. Quel modèle convient le MIEUX ?

    • A. gpt-6-astra, conçu pour le travail de bout en bout le plus difficile, à raisonnement soutenu et multi-outils
    • B. gpt-5.6-luna, pour minimiser le coût
    • C. gpt-5.6-terra, le polyvalent pragmatique
    • D. gpt-5.5, la génération précédente
    Afficher la réponse

    Réponse : A.

    Astra est positionné pour le travail le plus difficile à raisonnement soutenu, jugement et multi-outils, et le faible volume rend son prix tolérable. B est destiné aux tâches claires à fort volume, C est un polyvalent intermédiaire susceptible d’être insuffisant sur le travail le plus difficile, et D recule d’une génération.

  14. Q14D2 · La Responses API et la sélection du modèleSélectionnez une réponse

    Un agent de recherche de longue durée doit survivre bien au-delà d’une seule requête HTTP ET livrer une progression incrémentale à une interface. Quelle combinaison est correcte ?

    • A. Le background mode pour l’exécution détachée, plus le streaming (ou les webhooks) pour la progression
    • B. Le prompt caching plus les predicted outputs
    • C. Une fenêtre de contexte plus grande plus du fine-tuning
    • D. Un effort plus élevé plus davantage de tokens de sortie
    Afficher la réponse

    Réponse : A.

    Le background mode détache l’exécution et le streaming ou les webhooks transportent la progression incrémentale, ce qui répond aux deux besoins. B optimise coût et vitesse d’édition, pas la durée de vie de l’exécution. C et D traitent la capacité et la longueur, non le détachement ni le rapport de progression.

  15. Q15D2 · La Responses API et la sélection du modèleSélectionnez une réponse

    Quelle affirmation sur la famille GPT-5.6 est exacte ?

    • A. Sol, Terra et Luna partagent un contexte de 1,05M de tokens et 128K de sortie maximale, et Astra est le plus cher à $10/$50 par M
    • B. Luna a la plus grande fenêtre de contexte de la famille
    • C. Terra est plus cher que Sol
    • D. Astra est moins cher que Terra
    Afficher la réponse

    Réponse : A.

    La gamme montre les quatre avec un contexte de 1,05M et 128K de sortie maximale, Astra étant le plus cher à $10/$50. B est faux : ils partagent le même contexte. C est faux : Terra ($2/$12) est moins cher que Sol ($4/$20). D est faux : Astra est le plus cher, non moins cher que Terra.

  16. Q16D2 · La Responses API et la sélection du modèleSélectionnez une réponse

    Une équipe entretient une conversation à deux tours en renvoyant l’intégralité du texte du premier tour à chaque relance « par prudence », et ses coûts d’entrée grimpent. Quelle est la MEILLEURE correction ?

    • A. Utiliser l’état de conversation côté serveur pour que la relance référence la réponse précédente sans en renvoyer le texte
    • B. Passer à un modèle moins cher et continuer à tout renvoyer
    • C. Abaisser le reasoning effort pour compenser le coût de renvoi
    • D. Accepter le coût comme inévitable
    Afficher la réponse

    Réponse : A.

    L’état de conversation supprime le besoin de renvoyer le texte antérieur, réduisant directement le coût d’entrée croissant. B traite un symptôme tout en conservant le schéma dispendieux. C ne s’attaque pas aux tokens d’entrée. D suppose à tort que le coût est inévitable.

  17. Q17D2 · La Responses API et la sélection du modèleSélectionnez une réponse

    Vous devez choisir le polyvalent pragmatique qui est le remplaçant naturel des charges GPT-5.5 existantes, à coût modéré. Quel modèle est-ce ?

    • A. gpt-5.6-terra
    • B. gpt-6-astra
    • C. gpt-5.6-luna
    • D. gpt-5.5-pro
    Afficher la réponse

    Réponse : A.

    Terra est décrit comme le polyvalent pragmatique et le remplaçant naturel des charges GPT-5.5. B est le fleuron de gamme pour le travail le plus difficile. C est destiné aux tâches claires à fort volume. D est un modèle de génération précédente plus coûteux, non le remplaçant.

  18. Q18D2 · La Responses API et la sélection du modèleSélectionnez une réponse

    Il faut garantir qu’une réponse soit analysable par machine ET qu’un champ enum précis ne contienne jamais qu’une des trois valeurs autorisées. Qu’est-ce qui applique le PLUS fiablement les deux ?

    • A. Un schéma de structured output qui contraint le champ à l’enum
    • B. Un system prompt très détaillé décrivant l’enum
    • C. Une validation a posteriori qui rejette les mauvaises valeurs et réessaie
    • D. Abaisser uniquement la température
    Afficher la réponse

    Réponse : A.

    Un schéma avec contrainte d’enum garantit à la fois l’analysabilité et l’ensemble de valeurs restreint. B est une consigne que le modèle peut enfreindre. C détecte les erreurs après coup et gaspille des appels. D réduit la variance mais n’impose pas d’enum.

  19. Q19D3 · Évaluation des applications d’IASélectionnez une réponse

    Après une mise à niveau de modèle, le score d’évaluation baisse sur un groupe de questions à longue entrée mais reste stable ailleurs. Quelle est la réponse la PLUS appropriée ?

    • A. Enquêter spécifiquement sur le groupe à longue entrée, puisque la régression est localisée, avant de décider d’ajuster ou de revenir en arrière
    • B. Revenir en arrière immédiatement sans diagnostic
    • C. L’ignorer parce que le score global est bon
    • D. Supprimer les questions à longue entrée du jeu de données
    Afficher la réponse

    Réponse : A.

    Une régression localisée doit être diagnostiquée sur le groupe affecté pour en comprendre la cause avant d’agir. B écarte une amélioration potentielle sans preuve. C ignore une régression réelle. D masque le problème en retirant les cas mêmes qui le révèlent.

  20. Q20D3 · Évaluation des applications d’IASélectionnez deux réponses

    Une modification de prompt corrige l’unique plainte reçue, mais vous n’avez pas de jeu de données. Avant de livrer, quelles DEUX étapes sont les PLUS sûres ?

    • A. Construire un petit jeu d’évaluation représentatif incluant le cas défaillant et des variations similaires
    • B. Exécuter les prompts nouveau et ancien sur ce jeu et comparer
    • C. Livrer immédiatement puisque l’unique plainte est résolue
    • D. Monter le palier de modèle par prudence
    • E. Demander au plaignant de retester en production
    Afficher la réponse

    Réponse : A et B.

    Créer un petit jeu représentatif avec le cas défaillant et comparer les deux prompts fournit la preuve que le correctif se généralise sans régression. C livre sur une seule anecdote. D change le coût sans preuve. E teste en production, précisément ce qu’une évaluation évite.

  21. Q21D3 · Évaluation des applications d’IASélectionnez une réponse

    On choisit un évaluateur pour un classifieur de tri de support. La tâche a des catégories correctes connues. Quelle approche de notation est la PLUS appropriée et la moins chère ?

    • A. Une comparaison déterministe des étiquettes face aux catégories de vérité terrain
    • B. Un LLM-as-judge notant l’utilité globale
    • C. Une revue humaine de chaque prédiction
    • D. Une similarité sémantique avec un paragraphe de référence
    Afficher la réponse

    Réponse : A.

    Avec des catégories connues, comparer l’étiquette prédite à l’étiquette réelle est déterministe, précis et peu coûteux. B introduit le bruit d’un juge pour une tâche à réponses définies. C ne passe pas à l’échelle. D est destiné au texte libre, non à des catégories fixes.

  22. Q22D3 · Évaluation des applications d’IASélectionnez une réponse

    Une équipe veut faire confiance à un LLM-as-judge pour la fidélité à grande échelle. Quel est l’ORDRE correct des opérations ?

    • A. Annoter un échantillon à la main, mesurer l’accord juge-humain, puis n’utiliser le juge à grande échelle que si l’accord est suffisant
    • B. Utiliser le juge à grande échelle, puis vérifier quelques désaccords
    • C. Sauter les annotations humaines et faire confiance au plus grand modèle
    • D. Utiliser le générateur comme son propre juge
    Afficher la réponse

    Réponse : A.

    La calibration précède la confiance : annoter un échantillon, vérifier l’accord, puis passer à l’échelle uniquement s’il est suffisant. B met d’abord à l’échelle un juge non validé. C saute entièrement la calibration. D risque un biais d’auto-préférence sans contrôle indépendant.

  23. Q23D3 · Évaluation des applications d’IASélectionnez une réponse

    Quelle est la raison la PLUS FORTE pour laquelle l’évaluation en ligne est nécessaire même quand les évaluations hors ligne passent ?

    • A. Le trafic de production contient des entrées et des formulations que le jeu de données figé n’a jamais anticipées
    • B. Les évaluations en ligne sont moins chères que les hors ligne
    • C. Les évaluations hors ligne ne peuvent pas utiliser d’évaluateurs
    • D. Les évaluations en ligne suppriment le besoin d’une référence
    Afficher la réponse

    Réponse : A.

    Le trafic réel fait apparaître des distributions que le jeu hors ligne ne pouvait prévoir, ce que détecte précisément l’évaluation en ligne. B n’est pas la raison et n’est généralement pas vrai. C est faux. D est faux : les références comptent toujours en ligne.

  24. Q24D3 · Évaluation des applications d’IASélectionnez une réponse

    Le prompt optimizer est proposé pour améliorer un prompt. De quoi a-t-il BESOIN pour être vraiment utile ?

    • A. Une évaluation avec des exemples et des évaluateurs, pour que les améliorations soient mesurées et non devinées
    • B. Un seul exemple de prompt
    • C. Un modèle plus grand
    • D. Un incident de production pour le déclencher
    Afficher la réponse

    Réponse : A.

    Optimiser un prompt de façon signifiante nécessite une évaluation avec exemples et évaluateurs pour mesurer si les changements aident. B est un signal trop faible pour optimiser. C est sans rapport avec le retour d’optimisation. D n’est pas un prérequis de l’optimisation.

  25. Q25D3 · Évaluation des applications d’IASélectionnez une réponse

    Un jeu d’évaluation de 12 éléments donne des scores qui sautent entre 58 % et 83 % sur des exécutions identiques. Quel est le problème LE PLUS probable et le correctif ?

    • A. Le jeu de données est trop petit pour une estimation stable ; l’agrandir pour réduire la variance
    • B. Le modèle est non déterministe et doit être remplacé
    • C. Les évaluateurs devraient être supprimés
    • D. Le reasoning effort doit être poussé au maximum
    Afficher la réponse

    Réponse : A.

    Sur 12 éléments, chaque basculement déplace le score d’environ huit points : les variations sont donc un artefact de petit échantillon, corrigé en agrandissant le jeu. B attribue à tort une variance normale à un modèle cassé. C supprime la mesure. D ne traite pas la taille d’échantillon.

  26. Q26D3 · Évaluation des applications d’IASélectionnez une réponse

    Compte tenu de la documentation OpenAI actuelle, quelle affirmation sur les évaluations et le fine-tuning est exacte ?

    • A. L’Evals API et le fine-tuning sont regroupés sous les Legacy APIs, pourtant les évaluations restent conceptuellement essentielles pour livrer en toute sécurité
    • B. Les évaluations ont été retirées de la plateforme
    • C. Le fine-tuning est la surface recommandée la plus récente
    • D. Les évaluations font partie du cœur de l’Agents API
    Afficher la réponse

    Réponse : A.

    La documentation regroupe les Evals et le fine-tuning sous les Legacy APIs tandis que les évaluations comptent toujours sur le plan conceptuel. B confond regroupement legacy et retrait. C se trompe sur le statut du fine-tuning. D place à tort les évaluations au cœur de l’Agents API.

  27. Q27D3 · Évaluation des applications d’IASélectionnez une réponse

    Une évaluation de réponses ancrées passe au lancement. Quel changement devrait déclencher sa ré-exécution AVANT de livrer le changement ?

    • A. Tout changement de chunking, de récupération, de prompt ou de modèle
    • B. Un changement du thème de couleur de l’interface
    • C. Renommer le projet
    • D. Ajouter un nouveau membre à l’équipe
    Afficher la réponse

    Réponse : A.

    L’ancrage dépend du chunking, de la récupération, du prompt et du modèle : chacun de ces changements justifie donc de ré-exécuter l’évaluation. B, C et D ne touchent pas au pipeline qui détermine si les réponses restent étayées par le contexte.

  28. Q28D3 · Évaluation des applications d’IASélectionnez une réponse

    Une équipe optimise le coût en passant de Sol à Luna mais ne ré-exécute pas l’évaluation. Quelle est la MEILLEURE description du risque ?

    • A. La qualité peut avoir silencieusement régressé sous le seuil, parce que le changement n’a jamais été mesuré
    • B. La latence augmentera nécessairement
    • C. La fenêtre de contexte se réduit sous une taille utilisable
    • D. Il n’y a aucun risque ; moins cher est toujours sûr
    Afficher la réponse

    Réponse : A.

    Changer de modèle sans réévaluer signifie qu’une éventuelle régression de qualité passe inaperçue jusqu’à ce que les utilisateurs la ressentent. B n’est pas nécessairement vrai et manque l’essentiel. C est faux ; la famille partage un contexte de 1,05M. D ignore que des économies de coût peuvent se faire au détriment de la qualité.

  29. Q29D4 · Conception et construction de systèmes agentiquesSélectionnez une réponse

    Une start-up a besoin du chemin le PLUS RAPIDE vers un agent cloud durable avec exécution hébergée en sandbox et artefacts de longue durée, et n’a besoin ni de résidence dans l’UE ni de ZDR. Quel runtime convient le MIEUX ?

    • A. Le harnais géré de l’Agents API
    • B. L’Agents SDK auto-hébergé
    • C. La Responses API avec une boucle écrite à la main
    • D. Chat Completions avec cron
    Afficher la réponse

    Réponse : A.

    L’Agents API offre des sessions durables gérées par OpenAI, des sandbox hébergés et des artefacts sans auto-hébergement, et la contrainte « États-Unis uniquement / sans ZDR » est ici acceptable. B exige de construire et d’héberger le runtime. C et D n’ont pas la durabilité gérée, les sandbox ni la reprise.

  30. Q30D4 · Conception et construction de systèmes agentiquesSélectionnez deux réponses

    Quelles DEUX capacités font de l’Agents SDK le bon choix pour une entreprise qui doit garder TOUT le traitement sous sa propre gouvernance et infrastructure ?

    • A. Une exécution auto-hébergée où l’entreprise exécute la boucle de l’agent
    • B. Une orchestration code-first et des garde-fous dans l’environnement propre de l’entreprise
    • C. Une reprise de session gérée par OpenAI
    • D. Des sandbox hébergés automatiques facturés comme des conteneurs
    • E. Un harnais géré qui exécute la session à votre place
    Afficher la réponse

    Réponse : A et B.

    L’exécution auto-hébergée et l’orchestration/les garde-fous code-first gardent le traitement sous le contrôle de l’entreprise. C, D et E décrivent tous l’Agents API géré par OpenAI, à l’opposé du fait de tout garder sous la propre gouvernance de l’entreprise.

  31. Q31D4 · Conception et construction de systèmes agentiquesSélectionnez une réponse

    Un prestataire de santé de l’UE veut des agents cloud durables mais a un mandat ferme de résidence dans l’UE et de ZDR. Quelle est la conclusion correcte sur l’Agents API, même avec un sandbox auto-hébergé ?

    • A. Elle n’est pas éligible, car l’Agents API est à résidence aux États-Unis uniquement, sans ZDR, et le choix du sandbox n’y change rien
    • B. Elle est éligible s’ils auto-hébergent le sandbox dans l’UE
    • C. Elle est éligible avec Private Link
    • D. Elle est éligible une fois mTLS activé
    Afficher la réponse

    Réponse : A.

    L’Agents API est à résidence aux États-Unis uniquement, sans ZDR, et un sandbox auto-hébergé n’y remédie pas ; le mandat l’exclut. B interprète à tort le choix du sandbox comme modifiant la résidence. C et D traitent la sécurité réseau, non la résidence ni la rétention.

  32. Q32D4 · Conception et construction de systèmes agentiquesSélectionnez une réponse

    Dans une session d’agent gérée, pourquoi devriez-vous borner max_concurrent_subagents plutôt que le laisser non borné ?

    • A. Pour plafonner l’usage de ressources en parallèle, le coût et le rayon d’impact du travail délégué
    • B. Parce que les sous-agents ne peuvent pas du tout s’exécuter en parallèle
    • C. Pour augmenter la fenêtre de contexte
    • D. Pour désactiver l’observabilité
    Afficher la réponse

    Réponse : A.

    Borner la concurrence plafonne l’usage de ressources en parallèle, le coût et le rayon d’impact du travail délégué. B est faux puisque les sous-agents peuvent s’exécuter en concurrence. C confond concurrence et taille de contexte. D est sans rapport et indésirable.

  33. Q33D4 · Conception et construction de systèmes agentiquesSélectionnez une réponse

    Une charge utile de prompt injection cachée dans un document récupéré tente de faire appeler à un agent un outil qui exfiltre des données. Quel contrôle limite le PLUS directement les dégâts si l’injection réussit ?

    • A. Des portées d’outils au moindre privilège, pour que l’agent ne puisse pas atteindre le chemin d’exfiltration
    • B. Un modèle plus grand
    • C. Un reasoning effort plus élevé
    • D. Un system prompt plus long lui demandant d’être prudent
    Afficher la réponse

    Réponse : A.

    Si les outils sont restreints au moindre privilège, un agent détourné ne peut tout simplement pas atteindre la capacité d’exfiltration, ce qui contient les dégâts. B et C peuvent réduire, mais non garantir, la résistance à l’injection. D est une consigne qu’une injection peut passer outre.

  34. Q34D4 · Conception et construction de systèmes agentiquesSélectionnez deux réponses

    Vous construisez un système d’agents de tri et de spécialistes. Quels DEUX éléments de conception correspondent correctement à leur rôle ?

    • A. Un handoff transfère le contrôle de l’agent de tri à un agent de facturation pour les questions de facturation
    • B. Un sous-agent se voit déléguer une sous-tâche de recherche bornée et renvoie son résultat au parent
    • C. Un handoff supprime définitivement l’agent de tri
    • D. Un sous-agent remplace l’orchestrateur de plus haut niveau
    • E. Les handoffs ne fonctionnent que sous la Batch API
    Afficher la réponse

    Réponse : A et B.

    Un handoff transfère le contrôle à un spécialiste, et un sous-agent traite une sous-tâche bornée et revient au parent. C et D décrivent mal la mécanique, et E place les handoffs dans une API hors ligne sans rapport.

  35. Q35D4 · Conception et construction de systèmes agentiquesSélectionnez une réponse

    Un développeur choisit l’Agents API pour un assistant simple qui effectue un seul appel de fonction interne, a besoin d’un contrôle complet à chaque étape et n’a aucune exigence de session ni de sandbox. Pourquoi est-ce le MAUVAIS runtime ?

    • A. Il ajoute des sessions gérées et une mécanique de harnais dont la tâche n’a pas besoin ; la Responses API avec function calling est plus simple et suffisante
    • B. L’Agents API ne peut pas appeler de fonctions
    • C. La Responses API ne peut pas appeler d’outils
    • D. Le function calling nécessite du fine-tuning
    Afficher la réponse

    Réponse : A.

    Pour un appel d’outil unique avec un contrôle complet et sans besoin de session/sandbox, le harnais géré est surdimensionné ; la Responses API avec function calling est l’outil approprié et plus simple. B et C sont faux. D lie à tort le function calling à l’entraînement.

  36. Q36D4 · Conception et construction de systèmes agentiquesSélectionnez une réponse

    Un agent effectue une action erronée occasionnelle et l’équipe ne peut pas reconstituer le cheminement de décision ensuite. Quelle capacité comble le MIEUX cette lacune ?

    • A. Le traçage et l’observabilité enregistrant chaque étape, appel d’outil et ses entrées et sorties
    • B. Une fenêtre de contexte plus grande
    • C. Davantage de sous-agents pour la redondance
    • D. Une limite de dépense plus élevée
    Afficher la réponse

    Réponse : A.

    Reconstituer une décision passée exige des traces des étapes, des appels d’outil et de leurs entrées/sorties. B, C et D ajoutent de la capacité, du parallélisme ou du budget, mais aucun ne produit la piste d’audit nécessaire pour expliquer une action passée.

  37. Q37D4 · Conception et construction de systèmes agentiquesSélectionnez une réponse

    Une équipe veut qu’OpenAI résume le contexte et reprenne les sessions après interruptions pour un agent de plusieurs heures. Quel runtime fournit ces éléments comme fonctionnalités gérées ?

    • A. L’Agents API, qui fournit une synthèse de contexte gérée et une reprise de session
    • B. L’Agents SDK, qui exige que vous les construisiez
    • C. La Responses API avec une boucle manuelle
    • D. La Batch API
    Afficher la réponse

    Réponse : A.

    Le harnais géré de l’Agents API fournit la synthèse de contexte et la reprise de session prêtes à l’emploi. B vous laisse les implémenter. C exige de construire la durabilité à la main. D est un palier de masse hors ligne dépourvu de ces éléments.

  38. Q38D4 · Conception et construction de systèmes agentiquesSélectionnez une réponse

    Pour un agent pouvant entreprendre des actions irréversibles, quelle combinaison est OBLIGATOIRE avant qu’il n’agisse de façon autonome en production ?

    • A. Des portées d’outils au moindre privilège plus une porte d’approbation humaine sur l’étape irréversible
    • B. Un modèle plus grand plus un effort plus élevé
    • C. Davantage de sous-agents plus une fenêtre de contexte plus grande
    • D. Un system prompt plus aimable plus davantage de tokens de sortie
    Afficher la réponse

    Réponse : A.

    Les actions irréversibles exigent des portées au moindre privilège pour limiter la portée et une porte humaine pour prévenir des validations non souhaitées. B, C et D ajustent la capacité, le parallélisme ou la verbosité, mais aucun n’empêche une action irréversible non souhaitée.

  39. Q39D4 · Conception et construction de systèmes agentiquesSélectionnez une réponse

    Comment une session Agents API à sandbox hébergé est-elle facturée par rapport à l’usage d’un sandbox auto-hébergé, à modèle et outils constants ?

    • A. Elle ajoute des tarifs de conteneur pour le sandbox hébergé, en plus des tarifs de modèle et d’outils
    • B. Elle coûte pareil car le sandbox est gratuit
    • C. Elle remplace les tarifs de modèle par un forfait fixe
    • D. Elle supprime entièrement les tarifs d’outils
    Afficher la réponse

    Réponse : A.

    Les sandbox hébergés ajoutent des tarifs de conteneur en plus des tarifs de modèle et d’outils, ce que l’auto-hébergement évite. B ignore les frais de conteneur. C et D se trompent sur le modèle de facturation, qui conserve les tarifs de modèle et d’outils et n’ajoute que le coût du conteneur.

  40. Q40D5 · Génération augmentée par récupération (RAG)Sélectionnez une réponse

    Les protocoles sont révisés chaque mois et la version précédente ne doit JAMAIS être citée. Réindexer la nouvelle version ne suffit pas. Que faut-il en plus ?

    • A. Retirer ou remplacer l’ancienne version dans l’index pour que la récupération ne puisse plus la renvoyer
    • B. Demander au modèle de ne pas citer les anciennes versions
    • C. Augmenter le chevauchement des chunks
    • D. Utiliser un modèle de génération plus grand
    Afficher la réponse

    Réponse : A.

    Si l’ancienne version reste récupérable, elle peut encore être citée : il faut donc la retirer ou la remplacer dans l’index. B repose sur l’obéissance du modèle et est contournable. C et D affectent la granularité de récupération et la génération, non la présence de contenu périmé.

  41. Q41D5 · Génération augmentée par récupération (RAG)Sélectionnez une réponse

    Le rappel de récupération est élevé (les bons chunks sont rapportés) mais la fidélité est faible (les réponses ajoutent des affirmations non étayées). Qu’est-ce que cela indique LE PLUS probablement ?

    • A. L’étape de génération n’est pas contrainte au contexte récupéré ; renforcer les instructions d’ancrage et évaluer la fidélité
    • B. Le récupérateur est cassé
    • C. Les chunks sont trop petits
    • D. Le modèle d’embeddings doit être remplacé
    Afficher la réponse

    Réponse : A.

    Un rappel élevé avec une faible fidélité isole le problème à une génération qui ne respecte pas le contexte : il faut donc renforcer et évaluer l’ancrage. B contredit le rappel élevé. C et D ciblent la récupération, qui fonctionne déjà.

  42. Q42D5 · Génération augmentée par récupération (RAG)Sélectionnez deux réponses

    Quelles DEUX raisons sont les PLUS FORTES pour préférer le RAG au fine-tuning pour une tâche de connaissances internes qui change fréquemment et doit citer les sources ?

    • A. Le contenu se met à jour par réindexation, sans réentraînement
    • B. Les réponses peuvent citer les passages sources récupérés
    • C. Le fine-tuning est toujours plus précis
    • D. Le RAG supprime le besoin de toute évaluation
    • E. Le RAG garantit zéro hallucination
    Afficher la réponse

    Réponse : A et B.

    Le RAG gère le changement fréquent par réindexation et peut citer les sources récupérées, deux atouts décisifs ici. C est faux en tant qu’affirmation générale. D est erroné : le RAG nécessite encore des évaluations d’ancrage. E surpromet ; l’ancrage réduit l’hallucination mais ne peut garantir zéro.

  43. Q43D5 · Génération augmentée par récupération (RAG)Sélectionnez une réponse

    Un assistant ancré cite la mauvaise section pour une réponse qui « sonne » correcte. Quelle est la MEILLEURE étape de diagnostic ?

    • A. Inspecter quels chunks ont été récupérés et si le chunk cité étaye réellement l’affirmation
    • B. Passer immédiatement à un modèle plus grand
    • C. Augmenter le nombre maximal de tokens de sortie
    • D. Désactiver les citations
    Afficher la réponse

    Réponse : A.

    Diagnostiquer une mauvaise citation consiste à examiner les chunks récupérés et à vérifier si le chunk cité étaye l’affirmation, ce qui localise le défaut entre récupération et génération. B et C changent le comportement sans diagnostic. D masque le signal même qui expose le problème.

  44. Q44D5 · Génération augmentée par récupération (RAG)Sélectionnez une réponse

    La récupération sémantique fonctionne pour la prose mais échoue sur les requêtes contenant des SKU exacts comme SKU-88231. Quel est le remède le PLUS direct ?

    • A. Ajouter une correspondance lexicale/par mots-clés pour former un récupérateur hybride
    • B. Réentraîner le modèle d’embeddings sur les SKU
    • C. Augmenter uniquement le nombre de chunks récupérés
    • D. Abaisser la température
    Afficher la réponse

    Réponse : A.

    Les identifiants exacts sont trouvés par une recherche lexicale : un récupérateur hybride corrige donc directement les échecs sur les SKU. B est lourd et reste biaisé vers le sens. C récupère plus de chunks mais pas la bonne correspondance exacte. D affecte la génération, non la récupération.

  45. Q45D5 · Génération augmentée par récupération (RAG)Sélectionnez une réponse

    Une équipe valide la qualité du RAG uniquement en lisant une poignée de réponses qui « sonnent » correctes. Quelle est la MEILLEURE description de ce qui manque ?

    • A. Une évaluation de réponses ancrées mesurant la qualité de récupération et la fidélité sur un jeu représentatif
    • B. Un vector store plus grand
    • C. Des embeddings plus coûteux
    • D. Une fenêtre de contexte plus grande
    Afficher la réponse

    Réponse : A.

    « Sonner correct » n’est pas de l’ancrage mesuré ; une évaluation de réponses ancrées sur un jeu représentatif est ce qui manque. B, C et D changent l’infrastructure mais aucun ne mesure si les réponses sont réellement étayées par le contexte récupéré.

  46. Q46D5 · Génération augmentée par récupération (RAG)Sélectionnez une réponse

    Les réponses sont gonflées de texte sans rapport après que la taille de chunk a été portée à 5 000 tokens. Quel est le MEILLEUR premier ajustement ?

    • A. Réduire la taille des chunks vers des passages plus ciblés pour que chaque chunk récupéré soit dans le sujet
    • B. Augmenter encore la taille des chunks
    • C. Passer à un modèle de génération plus grand
    • D. Désactiver le chevauchement
    Afficher la réponse

    Réponse : A.

    Des chunks surdimensionnés transportent du contenu sans rapport : les réduire vers des passages ciblés diminue le bruit. B aggrave le problème. C change la génération, non l’entrée de récupération bruitée. D risque de couper des réponses à cheval sur les frontières sans corriger le gonflement.

  47. Q47D5 · Génération augmentée par récupération (RAG)Sélectionnez une réponse

    Un système RAG destiné aux cliniciens doit restreindre chaque utilisateur aux protocoles de son propre service. Un développeur propose d’appliquer cela dans le system prompt. Pourquoi est-ce insuffisant ?

    • A. Les instructions de prompt sont contournables ; l’autorisation doit filtrer les documents dans la couche de récupération pour que le contenu hors périmètre ne soit jamais rapporté
    • B. Les prompts sont trop courts pour contenir la règle
    • C. Le modèle ne peut pas lire les system prompts
    • D. Cela ralentirait la récupération
    Afficher la réponse

    Réponse : A.

    Le contrôle d’accès est une frontière de sécurité qui doit vivre dans la récupération ; une règle de prompt peut être contournée et les documents hors périmètre resteraient récupérables. B et C sont faux. D n’est pas la raison ; la justesse et la sécurité le sont.

  48. Q48D5 · Génération augmentée par récupération (RAG)Sélectionnez une réponse

    Un développeur veut fourrer un manuel entier de 900 pages dans chaque prompt parce qu’il tient dans 1,05M de tokens. Quel est l’argument le PLUS FORT en faveur du RAG à la place ?

    • A. N’envoyer que les passages pertinents réduit le coût et la latence par requête et limite la distraction due au texte non pertinent
    • B. Le manuel ne tient pas dans la fenêtre
    • C. Les prompts ne peuvent pas contenir de longs documents
    • D. Le RAG garantit des réponses parfaites
    Afficher la réponse

    Réponse : A.

    Même s’il tient, payer pour traiter le manuel entier à chaque appel est dispendieux et peut distraire le modèle ; le RAG n’envoie que ce dont la requête a besoin. B est faux puisqu’il tient. C est inexact. D surpromet la perfection.

  49. Q49D6 · Performance, latence et coûtSélectionnez une réponse

    Une fonctionnalité est à la fois trop lente et trop coûteuse sur gpt-5.6-sol à l’effort high. Quel est l’ORDRE correct des opérations pour la corriger ?

    • A. Mesurer où passent le temps et le coût, puis abaisser l’effort/le modèle au minimum qui passe l’évaluation, puis appliquer le caching ou le batching là où ils conviennent
    • B. Déplacer immédiatement tout vers la Batch API
    • C. Passer à Luna et sauter l’évaluation
    • D. Augmenter l’effort pour réduire les réessais
    Afficher la réponse

    Réponse : A.

    Mesurer d’abord, puis réduire l’effort/le modèle au moins cher qui passe encore l’évaluation, puis appliquer caching ou batching lorsque c’est approprié. B ignore les besoins d’interactivité et saute la mesure. C change de modèle sans contrôle de qualité. D ajoute de la latence et du coût.

  50. Q50D6 · Performance, latence et coûtSélectionnez deux réponses

    Une évaluation montre que gpt-5.6-luna atteint la même cible que gpt-5.6-sol atteint actuellement sur une tâche à fort volume. Quelles DEUX actions sont les PLUS économiques et sûres ?

    • A. Basculer la charge sur Luna puisqu’il passe l’évaluation
    • B. Continuer à surveiller l’évaluation après la bascule pour détecter toute régression
    • C. Rester sur Sol par prudence
    • D. Passer à Astra pour une marge supplémentaire
    • E. Désactiver les évaluations après la bascule
    Afficher la réponse

    Réponse : A et B.

    Luna passe : basculer réduit donc le coût, et un suivi continu prémunit contre la régression, ce qui est à la fois économique et sûr. C continue de payer davantage sans gain de qualité. D augmente encore le coût. E supprime le contrôle même qui rend la bascule sûre.

  51. Q51D6 · Performance, latence et coûtSélectionnez une réponse

    Quelle charge de travail est le MAUVAIS choix pour la Batch API ?

    • A. Une fonctionnalité de chat synchrone où les utilisateurs attendent chaque réponse
    • B. Une exécution nocturne de classification de documents
    • C. Un grand travail d’embeddings hors ligne
    • D. Un résumé de masse hebdomadaire de tickets archivés
    Afficher la réponse

    Réponse : A.

    Batch échange la latence contre le coût et ne convient pas à une fonctionnalité synchrone où les utilisateurs attendent en temps réel. B, C et D sont des travaux hors ligne tolérants à la latence, exactement ce à quoi Batch est destiné.

  52. Q52D6 · Performance, latence et coûtSélectionnez une réponse

    Une charge de travail exécute 500 000 requêtes par jour à 1 500 tokens d’entrée et 500 de sortie sur gpt-5.6-terra ($2/M en entrée, $12/M en sortie). Quel est approximativement le coût quotidien ?

    • A. Environ $4,500 par jour
    • B. Environ $450 par jour
    • C. Environ $1,500 par jour
    • D. Environ $45,000 par jour
    Afficher la réponse

    Réponse : A.

    Entrée : 500 000 x 1 500 = 750M x $2/M = $1,500. Sortie : 500 000 x 500 = 250M x $12/M = $3,000. Total ~$4,500/jour, donc A. B est dix fois trop petit, C omet le coût de sortie et D est dix fois trop élevé.

  53. Q53D6 · Performance, latence et coûtSélectionnez une réponse

    Un service tolérant à la latence veut un traitement moins cher que le standard mais ne peut accepter le délai de plusieurs heures de Batch. Quel palier convient le MIEUX, et pourquoi ?

    • A. Le Flex processing, qui abaisse le coût pour un travail tolérant à la latence sans le long délai de Batch
    • B. Le fast mode, qui privilégie la vitesse à un coût plus élevé
    • C. La Realtime API, pour l’audio interactif
    • D. Le traitement synchrone standard, le coût de référence
    Afficher la réponse

    Réponse : A.

    Le Flex processing est le palier intermédiaire qui réduit le coût pour un travail tolérant à la latence sans l’attente de plusieurs heures de Batch. B optimise la vitesse et coûte plus cher. C vise l’interaction en temps réel. D est le palier de référence que le service cherche à battre sur le prix.

  54. Q54D6 · Performance, latence et coûtSélectionnez deux réponses

    Le time-to-first-token est le terme de latence dominant pour une fonctionnalité interactive sur un modèle de raisonnement à l’effort high. Quels DEUX leviers aident le PLUS directement ?

    • A. Abaisser le reasoning effort au minimum qui passe encore l’évaluation
    • B. Mettre en cache le grand préfixe de prompt partagé pour qu’il ne soit pas retraité à chaque appel
    • C. Augmenter le nombre maximal de tokens de sortie
    • D. Ajouter davantage de contexte récupéré à chaque requête
    • E. Passer à la Batch API
    Afficher la réponse

    Réponse : A et B.

    Un effort plus bas raccourcit la réflexion avant le premier token, et mettre en cache le préfixe partagé supprime le temps de retraitement, tous deux réduisant le time-to-first-token. C rallonge la sortie. D ajoute de l’entrée à traiter. E est hors ligne et sans rapport avec la latence interactive.

  55. Q55D6 · Performance, latence et coûtSélectionnez une réponse

    Une fonctionnalité d’édition de documents régénère un document de 20 000 tokens dont environ 97 % est inchangé. Quelle fonctionnalité réduit le PLUS la latence, et pourquoi ?

    • A. Les predicted outputs, parce que l’essentiel de la sortie est déjà connu et peut être accéléré
    • B. Le prompt caching, parce que le préfixe d’entrée se répète
    • C. La Batch API, parce que le travail est volumineux
    • D. Une fenêtre de contexte plus grande, parce que le document est long
    Afficher la réponse

    Réponse : A.

    Les predicted outputs accélèrent la génération quand l’essentiel de la sortie est identique à une référence connue, exactement le cas d’édition quasi identique. B aide les entrées répétées, non les sorties quasi identiques. C est hors ligne. D ajoute de la capacité mais pas de la vitesse de génération pour une sortie connue.

  56. Q56D7 · Sécurité et exploitation en productionSélectionnez une réponse

    Sous charge soutenue, votre service reçoit de fréquentes réponses 429. Au-delà du backoff exponentiel, quel contrôle prévient le MIEUX le dépassement de votre allocation ?

    • A. Une limitation de débit côté client alignée sur vos limites de débit de compte
    • B. Réessayer instantanément sans limite
    • C. Augmenter le reasoning effort
    • D. Augmenter le nombre maximal de tokens de sortie
    Afficher la réponse

    Réponse : A.

    Modeler le trafic sortant selon vos limites de débit empêche d’emblée de heurter à répétition des 429, en complément du backoff. B intensifie la surcharge. C et D affectent la qualité et la longueur, non le débit des requêtes.

  57. Q57D7 · Sécurité et exploitation en productionSélectionnez une réponse

    Une charge de travail sensible doit atteindre l’API SANS traverser l’Internet public. Quel contrôle convient le MIEUX ?

    • A. Private Link, pour un chemin réseau privé vers l’API
    • B. Une liste d’autorisation d’IP
    • C. Une limite de dépense
    • D. Une limite de débit plus élevée
    Afficher la réponse

    Réponse : A.

    Private Link fournit un chemin réseau privé qui évite l’Internet public. B restreint quelles IP publiques peuvent se connecter mais utilise toujours l’Internet public. C plafonne le coût. D change le débit, aucun des deux ne fournissant un chemin privé.

  58. Q58D7 · Sécurité et exploitation en productionSélectionnez deux réponses

    Vous rédigez une checklist d’avant-lancement pour un agent qui peut entreprendre des actions irréversibles sur des comptes clients. Quels DEUX éléments DOIVENT y figurer ?

    • A. Une porte d’approbation humaine sur chaque action irréversible
    • B. Des portées d’outils au moindre privilège et une limite de dépense
    • C. La plus grande fenêtre de contexte disponible
    • D. Le modèle le plus coûteux à chaque appel
    • E. Désactiver la journalisation pour réduire le bruit
    Afficher la réponse

    Réponse : A et B.

    Une porte d’approbation empêche les actions irréversibles non souhaitées, et les portées au moindre privilège plus les limites de dépense contiennent la portée et le coût. C et D augmentent la capacité ou le coût sans traiter la sécurité. E supprime l’observabilité nécessaire pour enquêter sur les incidents.

  59. Q59D7 · Sécurité et exploitation en productionSélectionnez une réponse

    Quelle est la différence clé entre le red teaming et la surveillance du désalignement (misalignment monitoring) ?

    • A. Le red teaming sonde de façon proactive les faiblesses avant le lancement ; la surveillance du désalignement observe un système déployé pour repérer un comportement qui s’éloigne de l’intention
    • B. Ce sont la même activité
    • C. Le red teaming ne s’exécute qu’en production ; la surveillance uniquement avant le lancement
    • D. Les deux sont des contrôles de facturation
    Afficher la réponse

    Réponse : A.

    Le red teaming est une sonde proactive d’avant-lancement des faiblesses, tandis que la surveillance du désalignement est une veille continue du comportement déployé. B nie une distinction réelle. C inverse leur temporalité. D catégorise à tort des pratiques de sécurité comme de la facturation.

  60. Q60D7 · Sécurité et exploitation en productionSélectionnez une réponse

    Un travail de reporting en lecture seule utilise une clé d’API qui porte aussi la permission de supprimer des ressources. Quel principe est violé et quel est le correctif ?

    • A. Le moindre privilège ; émettre une clé restreinte avec des permissions en lecture seule pour le travail
    • B. L’idempotence ; rendre le travail sûr aux réessais
    • C. La contre-pression ; réguler le travail
    • D. L’absence d’état ; retirer l’état serveur
    Afficher la réponse

    Réponse : A.

    Un travail de reporting détenant des droits de suppression viole le moindre privilège ; le correctif est une clé restreinte en lecture seule. B, C et D sont des concepts légitimes mais aucun ne décrit le fait d’accorder plus de permissions que la tâche n’en a besoin.

Dernière mise à jour le 18 sept. 2026