Parcours API Developer
API Developer Path – Examen blanc 2
Un examen blanc indépendant plus difficile de 60 items pour le parcours développeur API OpenAI, avec des items à contraintes multiples et de jugement, explications complètes et lecture de préparation.
Ceci est le second examen blanc indépendant complet pour le parcours développeur API, construit à partir des objectifs d’apprentissage OpenAI et de la documentation produit accessibles au public. Il n’est pas une évaluation officielle OpenAI : les badges Academy et les certificats de parcours ne sont pas des certifications. L’Examen blanc 2 est délibérément plus difficile que l’Examen blanc 1 — plus d’énoncés à contraintes multiples, plus de qualificatifs FIRST / BEST / MOST cost-effective / TWO, et davantage de mises en situation. Traitez-le comme votre test de préparation : les 60 items sont inédits et distincts de l’Examen blanc 1 et des pages de domaine.
Consignes
- Durée : 90 minutes pour 60 items — le rythme qu’utilise notre examen blanc ; OpenAI ne publie pas de durée d’examen publique.
- Items : 60, à réponse unique et à réponses multiples. Chaque item indique combien de réponses sélectionner.
- Sélection : pour un item Sélectionnez deux réponses, vous devez choisir les deux bonnes options et aucune mauvaise pour obtenir le point. Il n’y a aucune pénalité pour les mauvaises réponses, alors répondez à chaque question.
- Objectif : visez au moins 80 % brut (environ 48 sur 60) ici avant de passer la véritable évaluation Academy, qui réussit à la même barre de 80 %. Réussir cet examen blanc plus difficile à 80 %+ est un signe fort de préparation.
- Traitez chaque question avant de déployer la réponse.
Répartition par domaine
| # | Domaine | Items ici |
|---|---|---|
| D1 | Scoping AI Solutions | 7 |
| D2 | The Responses API and Model Selection | 11 |
| D3 | Evaluating AI Applications | 10 |
| D4 | Designing and Building Agentic Systems | 11 |
| D5 | Retrieval-Augmented Generation | 9 |
| D6 | Performance, Latency and Cost | 7 |
| D7 | Production Safety and Operations | 5 |
Total : 7 + 11 + 10 + 11 + 9 + 7 + 5 = 60 items.
Interprétation de la préparation
Ceci est un indicateur de préparation indépendant, pas un score officiel.
| Score brut (sur 60) | Palier | Interprétation |
|---|---|---|
| 54–60 (90 %+) | Forte préparation | Bonne maîtrise des items à contraintes multiples les plus difficiles |
| 48–53 (80–89 %) | Prêt pour l’évaluation | Au niveau ou au-dessus de la barre Academy des 80 % sur la série plus difficile |
| 42–47 (70–79 %) | Confiance en construction | Proche ; entraînez-vous sur les items de jugement et d’arithmétique des coûts |
| moins de 42 (moins de 70 %) | Continuez à apprendre | Revoyez les pages de domaine et repassez d’abord l’Examen blanc 1 |
Passer l’examen blanc
Deux façons d’utiliser les questions ci-dessous : le mode interactif lance une session chronométrée, une question à la fois, et se termine par votre score, une ventilation par domaine et une correction complète ; le mode révision en dessous liste chaque question avec ses options une par ligne et la réponse masquée jusqu’à ce que vous la demandiez.
Mode interactif
Passer l’examen d’entraînement
60 questions · une à la fois · compte à rebours de 90 minutes · résultats avec répartition par domaine et correction complète à la fin. Votre progression est enregistrée dans ce navigateur si vous quittez la page.
Par domaine
| Domaine | Correctes | Score |
|---|
Correction
Toutes les questions (mode révision)
Les options sont présentées une par ligne. La réponse et l’explication restent masquées jusqu’à ce que vous cliquiez sur Afficher la réponse. Utilisez le mode interactif ci-dessus pour une session chronométrée.
Un VP veut un système de gestion d’incidents entièrement autonome en production sous une semaine, sans incidents étiquetés et avec l’exigence qu’aucune action visible par le client ne se déclenche sans validation. Quelle est la PREMIÈRE étape la plus appropriée ?
Afficher la réponse
Réponse : A.
Sans données étiquetées et avec une exigence stricte de validation humaine, la première étape responsable est une tranche étroite assistée dotée d’une mesure, l’autonomie se gagnant par les évaluations. B contredit l’exigence de validation et livre du risque. C fabrique des données qui peuvent ne pas refléter la réalité et fait toujours l’impasse sur l’évaluation. D s’appuie sur la taille du modèle pour masquer une absence de données et de mesures, ce que la capacité ne peut corriger.
Vous cadrez une fonctionnalité et voulez recueillir uniquement les exigences qui CHANGERAIENT l’architecture. Lesquelles, parmi ces DEUX, en font partie ?
Afficher la réponse
Réponse : A et B.
L’irréversibilité impose des portes d’approbation et une préparation, et le caractère interactif ou de masse guide les choix de modèle, de palier et de streaming : les deux changent l’architecture. C, D et E sont des détails cosmétiques ou organisationnels qui n’affectent pas la façon dont le système est construit.
Deux mesures candidates sont proposées pour un classifieur de tri : (i) « les utilisateurs sont plus contents » et (ii) « macro-F1 ≥ 0,85 sur un jeu étiqueté tenu à l’écart, avec un taux de mauvais aiguillage inférieur à 3 % ». Laquelle est la MEILLEURE mesure de succès, et pourquoi ?
Afficher la réponse
Réponse : A.
Une bonne mesure est spécifique et mesurable face à la vérité terrain, avec un seuil pertinent pour le métier, ce que fournit (ii). (i) n’est pas mesurable telle quelle et ne peut pas conditionner une mise en production. C est faux. D ignore que seule (ii) peut réellement être calculée et exploitée.
Une charge de travail effectue 90 000 classifications par jour à 800 tokens d’entrée et 120 de sortie. Sur
gpt-5.6-luna($0.20/$1.20 par M) elle passe l’évaluation ; un directeur préfèregpt-5.6-terra($2/$12 par M). Combien Terra coûte-t-il approximativement de PLUS par jour pour la même charge ?Afficher la réponse
Réponse : A.
Entrée quotidienne 90 000 x 800 = 72M tokens ; sortie 90 000 x 120 = 10,8M tokens. Luna : 72 x $0.20 + 10,8 x $1.20 = $14.40 + $12.96 = ~$27. Terra : 72 x $2 + 10,8 x $12 = $144 + $129.60 = ~$274. L’écart est d’environ $247/jour, donc A. B correspond à peu près au total Luna, pas à l’écart ; C est faux puisque Terra est dix fois plus cher par token ; D est dix fois trop élevé.
Pendant le cadrage, vous découvrez que la sortie de la tâche annule automatiquement des expéditions, une action irréversible. Comment le plan de solution devrait-il le MIEUX refléter cela ?
Afficher la réponse
Réponse : A.
L’irréversibilité est une contrainte stricte qui doit façonner la conception, avec une porte d’approbation ou une préparation réversible avant validation. B reporte une exigence critique de sécurité. C ne peut rendre une action irréversible sûre par la seule capacité. D ne fait qu’enregistrer les dégâts après coup, sans les prévenir.
Une capacité banalisée avec un produit hébergé mature existe, votre équipe est petite et la rapidité de mise en valeur importe, mais les données sont très sensibles et ne doivent jamais quitter votre réseau. Qu’est-ce que cela change LE PLUS probablement à la décision d’achat ?
Afficher la réponse
Réponse : A.
Une contrainte stricte de résidence des données peut l’emporter sur l’heuristique habituelle « acheter le banalisé », en faveur du développement ou d’un déploiement sur le réseau. B ignore la contrainte qui change le calcul. C saute au fine-tuning, que la résidence n’exige pas. D est un non-sequitur.
Quel élément relève spécifiquement de la ligne « Mesure de succès » d’un plan de solution, plutôt que des lignes exigences ou risques ?
Afficher la réponse
Réponse : A.
Une mesure de succès énonce le seuil de qualité mesurable et sa méthode de mesure, ce que fait A. B est une exigence/contrainte, C est un risque et D est une exigence de latence, aucune n’étant la mesure de succès en qualité.
Un pipeline a besoin d’une sortie à schéma strict ET d’un appel d’outil en direct ET de persister l’état de conversation entre les tours, le tout sur l’interface principale. Quelle unique API prend en charge les trois directement ?
Afficher la réponse
Réponse : A.
La Responses API est l’interface principale et prend en charge ensemble les structured outputs, le function calling et l’état de conversation. B relève du legacy pour les nouveaux travaux. C est regroupée sous les Legacy APIs. D est un palier de traitement hors ligne, non une interface interactive dotée de ces fonctionnalités.
Un scénario indique : « le modèle doit renvoyer le taux de change du jour et le solde actuel du client ». Quels DEUX signaux orientent vers des appels d’outil plutôt que vers la mémoire du modèle ?
Afficher la réponse
Réponse : A et B.
Des données externes en changement constant et un état privé en direct sont tous deux hors de la connaissance du modèle et doivent provenir d’outils. C, D et E sont des caractéristiques de surface qui ne disent rien sur l’existence de l’information nécessaire à l’intérieur du modèle.
Une équipe est sur
gpt-5.6-solà l’efforthigh. La latence est inacceptable et leur évaluation passe àmedium. Quel est le changement correct le PLUS économique qui préserve la qualité ?Afficher la réponse
Réponse : A.
Le plus faible effort qui passe l’évaluation est la cible, et medium passe tout en réduisant latence et coût. B augmente à la fois le coût et la latence. C ajoute du travail parallèle sans rapport avec la latence liée à l’effort par appel. D ne réduit pas la latence de raisonnement et nuit au déterminisme.
Une application parse
output_textet plante par intermittence quand le modèle émet un appel d’outil avant tout message. Quel est le correctif RACINE, et non un contournement ?Afficher la réponse
Réponse : A.
La cause racine est de traiter la sortie comme commençant par du texte alors qu’il s’agit d’une séquence d’éléments typés ; traiter chaque type d’élément corrige le problème structurellement. B masque les erreurs et perd les résultats d’outil. C supprime une capacité nécessaire. D est un contournement instable qui gaspille des appels.
Une conversation approche de la fenêtre de contexte de 1,05M de tokens en plein milieu d’une tâche et doit continuer. Quelle est l’action appropriée ?
Afficher la réponse
Réponse : A.
La compaction résume le contexte périmé afin que la tâche se poursuive dans la fenêtre tout en préservant l’information nécessaire. B risque d’écarter du contexte essentiel. C aggrave le problème. D concerne la longueur de sortie, non la pression sur le contexte d’entrée.
Une tâche est complexe, ouverte et constitue le flux de travail à la plus forte valeur du produit, exigeant un raisonnement multi-outils soutenu et du jugement, à faible volume. Quel modèle convient le MIEUX ?
Afficher la réponse
Réponse : A.
Astra est positionné pour le travail le plus difficile à raisonnement soutenu, jugement et multi-outils, et le faible volume rend son prix tolérable. B est destiné aux tâches claires à fort volume, C est un polyvalent intermédiaire susceptible d’être insuffisant sur le travail le plus difficile, et D recule d’une génération.
Un agent de recherche de longue durée doit survivre bien au-delà d’une seule requête HTTP ET livrer une progression incrémentale à une interface. Quelle combinaison est correcte ?
Afficher la réponse
Réponse : A.
Le background mode détache l’exécution et le streaming ou les webhooks transportent la progression incrémentale, ce qui répond aux deux besoins. B optimise coût et vitesse d’édition, pas la durée de vie de l’exécution. C et D traitent la capacité et la longueur, non le détachement ni le rapport de progression.
Quelle affirmation sur la famille GPT-5.6 est exacte ?
Afficher la réponse
Réponse : A.
La gamme montre les quatre avec un contexte de 1,05M et 128K de sortie maximale, Astra étant le plus cher à $10/$50. B est faux : ils partagent le même contexte. C est faux : Terra ($2/$12) est moins cher que Sol ($4/$20). D est faux : Astra est le plus cher, non moins cher que Terra.
Une équipe entretient une conversation à deux tours en renvoyant l’intégralité du texte du premier tour à chaque relance « par prudence », et ses coûts d’entrée grimpent. Quelle est la MEILLEURE correction ?
Afficher la réponse
Réponse : A.
L’état de conversation supprime le besoin de renvoyer le texte antérieur, réduisant directement le coût d’entrée croissant. B traite un symptôme tout en conservant le schéma dispendieux. C ne s’attaque pas aux tokens d’entrée. D suppose à tort que le coût est inévitable.
Vous devez choisir le polyvalent pragmatique qui est le remplaçant naturel des charges GPT-5.5 existantes, à coût modéré. Quel modèle est-ce ?
Afficher la réponse
Réponse : A.
Terra est décrit comme le polyvalent pragmatique et le remplaçant naturel des charges GPT-5.5. B est le fleuron de gamme pour le travail le plus difficile. C est destiné aux tâches claires à fort volume. D est un modèle de génération précédente plus coûteux, non le remplaçant.
Il faut garantir qu’une réponse soit analysable par machine ET qu’un champ enum précis ne contienne jamais qu’une des trois valeurs autorisées. Qu’est-ce qui applique le PLUS fiablement les deux ?
Afficher la réponse
Réponse : A.
Un schéma avec contrainte d’enum garantit à la fois l’analysabilité et l’ensemble de valeurs restreint. B est une consigne que le modèle peut enfreindre. C détecte les erreurs après coup et gaspille des appels. D réduit la variance mais n’impose pas d’enum.
Après une mise à niveau de modèle, le score d’évaluation baisse sur un groupe de questions à longue entrée mais reste stable ailleurs. Quelle est la réponse la PLUS appropriée ?
Afficher la réponse
Réponse : A.
Une régression localisée doit être diagnostiquée sur le groupe affecté pour en comprendre la cause avant d’agir. B écarte une amélioration potentielle sans preuve. C ignore une régression réelle. D masque le problème en retirant les cas mêmes qui le révèlent.
Une modification de prompt corrige l’unique plainte reçue, mais vous n’avez pas de jeu de données. Avant de livrer, quelles DEUX étapes sont les PLUS sûres ?
Afficher la réponse
Réponse : A et B.
Créer un petit jeu représentatif avec le cas défaillant et comparer les deux prompts fournit la preuve que le correctif se généralise sans régression. C livre sur une seule anecdote. D change le coût sans preuve. E teste en production, précisément ce qu’une évaluation évite.
On choisit un évaluateur pour un classifieur de tri de support. La tâche a des catégories correctes connues. Quelle approche de notation est la PLUS appropriée et la moins chère ?
Afficher la réponse
Réponse : A.
Avec des catégories connues, comparer l’étiquette prédite à l’étiquette réelle est déterministe, précis et peu coûteux. B introduit le bruit d’un juge pour une tâche à réponses définies. C ne passe pas à l’échelle. D est destiné au texte libre, non à des catégories fixes.
Une équipe veut faire confiance à un LLM-as-judge pour la fidélité à grande échelle. Quel est l’ORDRE correct des opérations ?
Afficher la réponse
Réponse : A.
La calibration précède la confiance : annoter un échantillon, vérifier l’accord, puis passer à l’échelle uniquement s’il est suffisant. B met d’abord à l’échelle un juge non validé. C saute entièrement la calibration. D risque un biais d’auto-préférence sans contrôle indépendant.
Quelle est la raison la PLUS FORTE pour laquelle l’évaluation en ligne est nécessaire même quand les évaluations hors ligne passent ?
Afficher la réponse
Réponse : A.
Le trafic réel fait apparaître des distributions que le jeu hors ligne ne pouvait prévoir, ce que détecte précisément l’évaluation en ligne. B n’est pas la raison et n’est généralement pas vrai. C est faux. D est faux : les références comptent toujours en ligne.
Le prompt optimizer est proposé pour améliorer un prompt. De quoi a-t-il BESOIN pour être vraiment utile ?
Afficher la réponse
Réponse : A.
Optimiser un prompt de façon signifiante nécessite une évaluation avec exemples et évaluateurs pour mesurer si les changements aident. B est un signal trop faible pour optimiser. C est sans rapport avec le retour d’optimisation. D n’est pas un prérequis de l’optimisation.
Un jeu d’évaluation de 12 éléments donne des scores qui sautent entre 58 % et 83 % sur des exécutions identiques. Quel est le problème LE PLUS probable et le correctif ?
Afficher la réponse
Réponse : A.
Sur 12 éléments, chaque basculement déplace le score d’environ huit points : les variations sont donc un artefact de petit échantillon, corrigé en agrandissant le jeu. B attribue à tort une variance normale à un modèle cassé. C supprime la mesure. D ne traite pas la taille d’échantillon.
Compte tenu de la documentation OpenAI actuelle, quelle affirmation sur les évaluations et le fine-tuning est exacte ?
Afficher la réponse
Réponse : A.
La documentation regroupe les Evals et le fine-tuning sous les Legacy APIs tandis que les évaluations comptent toujours sur le plan conceptuel. B confond regroupement legacy et retrait. C se trompe sur le statut du fine-tuning. D place à tort les évaluations au cœur de l’Agents API.
Une évaluation de réponses ancrées passe au lancement. Quel changement devrait déclencher sa ré-exécution AVANT de livrer le changement ?
Afficher la réponse
Réponse : A.
L’ancrage dépend du chunking, de la récupération, du prompt et du modèle : chacun de ces changements justifie donc de ré-exécuter l’évaluation. B, C et D ne touchent pas au pipeline qui détermine si les réponses restent étayées par le contexte.
Une équipe optimise le coût en passant de Sol à Luna mais ne ré-exécute pas l’évaluation. Quelle est la MEILLEURE description du risque ?
Afficher la réponse
Réponse : A.
Changer de modèle sans réévaluer signifie qu’une éventuelle régression de qualité passe inaperçue jusqu’à ce que les utilisateurs la ressentent. B n’est pas nécessairement vrai et manque l’essentiel. C est faux ; la famille partage un contexte de 1,05M. D ignore que des économies de coût peuvent se faire au détriment de la qualité.
Une start-up a besoin du chemin le PLUS RAPIDE vers un agent cloud durable avec exécution hébergée en sandbox et artefacts de longue durée, et n’a besoin ni de résidence dans l’UE ni de ZDR. Quel runtime convient le MIEUX ?
Afficher la réponse
Réponse : A.
L’Agents API offre des sessions durables gérées par OpenAI, des sandbox hébergés et des artefacts sans auto-hébergement, et la contrainte « États-Unis uniquement / sans ZDR » est ici acceptable. B exige de construire et d’héberger le runtime. C et D n’ont pas la durabilité gérée, les sandbox ni la reprise.
Quelles DEUX capacités font de l’Agents SDK le bon choix pour une entreprise qui doit garder TOUT le traitement sous sa propre gouvernance et infrastructure ?
Afficher la réponse
Réponse : A et B.
L’exécution auto-hébergée et l’orchestration/les garde-fous code-first gardent le traitement sous le contrôle de l’entreprise. C, D et E décrivent tous l’Agents API géré par OpenAI, à l’opposé du fait de tout garder sous la propre gouvernance de l’entreprise.
Un prestataire de santé de l’UE veut des agents cloud durables mais a un mandat ferme de résidence dans l’UE et de ZDR. Quelle est la conclusion correcte sur l’Agents API, même avec un sandbox auto-hébergé ?
Afficher la réponse
Réponse : A.
L’Agents API est à résidence aux États-Unis uniquement, sans ZDR, et un sandbox auto-hébergé n’y remédie pas ; le mandat l’exclut. B interprète à tort le choix du sandbox comme modifiant la résidence. C et D traitent la sécurité réseau, non la résidence ni la rétention.
Dans une session d’agent gérée, pourquoi devriez-vous borner
max_concurrent_subagentsplutôt que le laisser non borné ?Afficher la réponse
Réponse : A.
Borner la concurrence plafonne l’usage de ressources en parallèle, le coût et le rayon d’impact du travail délégué. B est faux puisque les sous-agents peuvent s’exécuter en concurrence. C confond concurrence et taille de contexte. D est sans rapport et indésirable.
Une charge utile de prompt injection cachée dans un document récupéré tente de faire appeler à un agent un outil qui exfiltre des données. Quel contrôle limite le PLUS directement les dégâts si l’injection réussit ?
Afficher la réponse
Réponse : A.
Si les outils sont restreints au moindre privilège, un agent détourné ne peut tout simplement pas atteindre la capacité d’exfiltration, ce qui contient les dégâts. B et C peuvent réduire, mais non garantir, la résistance à l’injection. D est une consigne qu’une injection peut passer outre.
Vous construisez un système d’agents de tri et de spécialistes. Quels DEUX éléments de conception correspondent correctement à leur rôle ?
Afficher la réponse
Réponse : A et B.
Un handoff transfère le contrôle à un spécialiste, et un sous-agent traite une sous-tâche bornée et revient au parent. C et D décrivent mal la mécanique, et E place les handoffs dans une API hors ligne sans rapport.
Un développeur choisit l’Agents API pour un assistant simple qui effectue un seul appel de fonction interne, a besoin d’un contrôle complet à chaque étape et n’a aucune exigence de session ni de sandbox. Pourquoi est-ce le MAUVAIS runtime ?
Afficher la réponse
Réponse : A.
Pour un appel d’outil unique avec un contrôle complet et sans besoin de session/sandbox, le harnais géré est surdimensionné ; la Responses API avec function calling est l’outil approprié et plus simple. B et C sont faux. D lie à tort le function calling à l’entraînement.
Un agent effectue une action erronée occasionnelle et l’équipe ne peut pas reconstituer le cheminement de décision ensuite. Quelle capacité comble le MIEUX cette lacune ?
Afficher la réponse
Réponse : A.
Reconstituer une décision passée exige des traces des étapes, des appels d’outil et de leurs entrées/sorties. B, C et D ajoutent de la capacité, du parallélisme ou du budget, mais aucun ne produit la piste d’audit nécessaire pour expliquer une action passée.
Une équipe veut qu’OpenAI résume le contexte et reprenne les sessions après interruptions pour un agent de plusieurs heures. Quel runtime fournit ces éléments comme fonctionnalités gérées ?
Afficher la réponse
Réponse : A.
Le harnais géré de l’Agents API fournit la synthèse de contexte et la reprise de session prêtes à l’emploi. B vous laisse les implémenter. C exige de construire la durabilité à la main. D est un palier de masse hors ligne dépourvu de ces éléments.
Pour un agent pouvant entreprendre des actions irréversibles, quelle combinaison est OBLIGATOIRE avant qu’il n’agisse de façon autonome en production ?
Afficher la réponse
Réponse : A.
Les actions irréversibles exigent des portées au moindre privilège pour limiter la portée et une porte humaine pour prévenir des validations non souhaitées. B, C et D ajustent la capacité, le parallélisme ou la verbosité, mais aucun n’empêche une action irréversible non souhaitée.
Comment une session Agents API à sandbox hébergé est-elle facturée par rapport à l’usage d’un sandbox auto-hébergé, à modèle et outils constants ?
Afficher la réponse
Réponse : A.
Les sandbox hébergés ajoutent des tarifs de conteneur en plus des tarifs de modèle et d’outils, ce que l’auto-hébergement évite. B ignore les frais de conteneur. C et D se trompent sur le modèle de facturation, qui conserve les tarifs de modèle et d’outils et n’ajoute que le coût du conteneur.
Les protocoles sont révisés chaque mois et la version précédente ne doit JAMAIS être citée. Réindexer la nouvelle version ne suffit pas. Que faut-il en plus ?
Afficher la réponse
Réponse : A.
Si l’ancienne version reste récupérable, elle peut encore être citée : il faut donc la retirer ou la remplacer dans l’index. B repose sur l’obéissance du modèle et est contournable. C et D affectent la granularité de récupération et la génération, non la présence de contenu périmé.
Le rappel de récupération est élevé (les bons chunks sont rapportés) mais la fidélité est faible (les réponses ajoutent des affirmations non étayées). Qu’est-ce que cela indique LE PLUS probablement ?
Afficher la réponse
Réponse : A.
Un rappel élevé avec une faible fidélité isole le problème à une génération qui ne respecte pas le contexte : il faut donc renforcer et évaluer l’ancrage. B contredit le rappel élevé. C et D ciblent la récupération, qui fonctionne déjà.
Quelles DEUX raisons sont les PLUS FORTES pour préférer le RAG au fine-tuning pour une tâche de connaissances internes qui change fréquemment et doit citer les sources ?
Afficher la réponse
Réponse : A et B.
Le RAG gère le changement fréquent par réindexation et peut citer les sources récupérées, deux atouts décisifs ici. C est faux en tant qu’affirmation générale. D est erroné : le RAG nécessite encore des évaluations d’ancrage. E surpromet ; l’ancrage réduit l’hallucination mais ne peut garantir zéro.
Un assistant ancré cite la mauvaise section pour une réponse qui « sonne » correcte. Quelle est la MEILLEURE étape de diagnostic ?
Afficher la réponse
Réponse : A.
Diagnostiquer une mauvaise citation consiste à examiner les chunks récupérés et à vérifier si le chunk cité étaye l’affirmation, ce qui localise le défaut entre récupération et génération. B et C changent le comportement sans diagnostic. D masque le signal même qui expose le problème.
La récupération sémantique fonctionne pour la prose mais échoue sur les requêtes contenant des SKU exacts comme
SKU-88231. Quel est le remède le PLUS direct ?Afficher la réponse
Réponse : A.
Les identifiants exacts sont trouvés par une recherche lexicale : un récupérateur hybride corrige donc directement les échecs sur les SKU. B est lourd et reste biaisé vers le sens. C récupère plus de chunks mais pas la bonne correspondance exacte. D affecte la génération, non la récupération.
Une équipe valide la qualité du RAG uniquement en lisant une poignée de réponses qui « sonnent » correctes. Quelle est la MEILLEURE description de ce qui manque ?
Afficher la réponse
Réponse : A.
« Sonner correct » n’est pas de l’ancrage mesuré ; une évaluation de réponses ancrées sur un jeu représentatif est ce qui manque. B, C et D changent l’infrastructure mais aucun ne mesure si les réponses sont réellement étayées par le contexte récupéré.
Les réponses sont gonflées de texte sans rapport après que la taille de chunk a été portée à 5 000 tokens. Quel est le MEILLEUR premier ajustement ?
Afficher la réponse
Réponse : A.
Des chunks surdimensionnés transportent du contenu sans rapport : les réduire vers des passages ciblés diminue le bruit. B aggrave le problème. C change la génération, non l’entrée de récupération bruitée. D risque de couper des réponses à cheval sur les frontières sans corriger le gonflement.
Un système RAG destiné aux cliniciens doit restreindre chaque utilisateur aux protocoles de son propre service. Un développeur propose d’appliquer cela dans le system prompt. Pourquoi est-ce insuffisant ?
Afficher la réponse
Réponse : A.
Le contrôle d’accès est une frontière de sécurité qui doit vivre dans la récupération ; une règle de prompt peut être contournée et les documents hors périmètre resteraient récupérables. B et C sont faux. D n’est pas la raison ; la justesse et la sécurité le sont.
Un développeur veut fourrer un manuel entier de 900 pages dans chaque prompt parce qu’il tient dans 1,05M de tokens. Quel est l’argument le PLUS FORT en faveur du RAG à la place ?
Afficher la réponse
Réponse : A.
Même s’il tient, payer pour traiter le manuel entier à chaque appel est dispendieux et peut distraire le modèle ; le RAG n’envoie que ce dont la requête a besoin. B est faux puisqu’il tient. C est inexact. D surpromet la perfection.
Une fonctionnalité est à la fois trop lente et trop coûteuse sur
gpt-5.6-solà l’efforthigh. Quel est l’ORDRE correct des opérations pour la corriger ?Afficher la réponse
Réponse : A.
Mesurer d’abord, puis réduire l’effort/le modèle au moins cher qui passe encore l’évaluation, puis appliquer caching ou batching lorsque c’est approprié. B ignore les besoins d’interactivité et saute la mesure. C change de modèle sans contrôle de qualité. D ajoute de la latence et du coût.
Une évaluation montre que
gpt-5.6-lunaatteint la même cible quegpt-5.6-solatteint actuellement sur une tâche à fort volume. Quelles DEUX actions sont les PLUS économiques et sûres ?Afficher la réponse
Réponse : A et B.
Luna passe : basculer réduit donc le coût, et un suivi continu prémunit contre la régression, ce qui est à la fois économique et sûr. C continue de payer davantage sans gain de qualité. D augmente encore le coût. E supprime le contrôle même qui rend la bascule sûre.
Quelle charge de travail est le MAUVAIS choix pour la Batch API ?
Afficher la réponse
Réponse : A.
Batch échange la latence contre le coût et ne convient pas à une fonctionnalité synchrone où les utilisateurs attendent en temps réel. B, C et D sont des travaux hors ligne tolérants à la latence, exactement ce à quoi Batch est destiné.
Une charge de travail exécute 500 000 requêtes par jour à 1 500 tokens d’entrée et 500 de sortie sur
gpt-5.6-terra($2/M en entrée, $12/M en sortie). Quel est approximativement le coût quotidien ?Afficher la réponse
Réponse : A.
Entrée : 500 000 x 1 500 = 750M x $2/M = $1,500. Sortie : 500 000 x 500 = 250M x $12/M = $3,000. Total ~$4,500/jour, donc A. B est dix fois trop petit, C omet le coût de sortie et D est dix fois trop élevé.
Un service tolérant à la latence veut un traitement moins cher que le standard mais ne peut accepter le délai de plusieurs heures de Batch. Quel palier convient le MIEUX, et pourquoi ?
Afficher la réponse
Réponse : A.
Le Flex processing est le palier intermédiaire qui réduit le coût pour un travail tolérant à la latence sans l’attente de plusieurs heures de Batch. B optimise la vitesse et coûte plus cher. C vise l’interaction en temps réel. D est le palier de référence que le service cherche à battre sur le prix.
Le time-to-first-token est le terme de latence dominant pour une fonctionnalité interactive sur un modèle de raisonnement à l’effort
high. Quels DEUX leviers aident le PLUS directement ?Afficher la réponse
Réponse : A et B.
Un effort plus bas raccourcit la réflexion avant le premier token, et mettre en cache le préfixe partagé supprime le temps de retraitement, tous deux réduisant le time-to-first-token. C rallonge la sortie. D ajoute de l’entrée à traiter. E est hors ligne et sans rapport avec la latence interactive.
Une fonctionnalité d’édition de documents régénère un document de 20 000 tokens dont environ 97 % est inchangé. Quelle fonctionnalité réduit le PLUS la latence, et pourquoi ?
Afficher la réponse
Réponse : A.
Les predicted outputs accélèrent la génération quand l’essentiel de la sortie est identique à une référence connue, exactement le cas d’édition quasi identique. B aide les entrées répétées, non les sorties quasi identiques. C est hors ligne. D ajoute de la capacité mais pas de la vitesse de génération pour une sortie connue.
Sous charge soutenue, votre service reçoit de fréquentes réponses
429. Au-delà du backoff exponentiel, quel contrôle prévient le MIEUX le dépassement de votre allocation ?Afficher la réponse
Réponse : A.
Modeler le trafic sortant selon vos limites de débit empêche d’emblée de heurter à répétition des 429, en complément du backoff. B intensifie la surcharge. C et D affectent la qualité et la longueur, non le débit des requêtes.
Une charge de travail sensible doit atteindre l’API SANS traverser l’Internet public. Quel contrôle convient le MIEUX ?
Afficher la réponse
Réponse : A.
Private Link fournit un chemin réseau privé qui évite l’Internet public. B restreint quelles IP publiques peuvent se connecter mais utilise toujours l’Internet public. C plafonne le coût. D change le débit, aucun des deux ne fournissant un chemin privé.
Vous rédigez une checklist d’avant-lancement pour un agent qui peut entreprendre des actions irréversibles sur des comptes clients. Quels DEUX éléments DOIVENT y figurer ?
Afficher la réponse
Réponse : A et B.
Une porte d’approbation empêche les actions irréversibles non souhaitées, et les portées au moindre privilège plus les limites de dépense contiennent la portée et le coût. C et D augmentent la capacité ou le coût sans traiter la sécurité. E supprime l’observabilité nécessaire pour enquêter sur les incidents.
Quelle est la différence clé entre le red teaming et la surveillance du désalignement (misalignment monitoring) ?
Afficher la réponse
Réponse : A.
Le red teaming est une sonde proactive d’avant-lancement des faiblesses, tandis que la surveillance du désalignement est une veille continue du comportement déployé. B nie une distinction réelle. C inverse leur temporalité. D catégorise à tort des pratiques de sécurité comme de la facturation.
Un travail de reporting en lecture seule utilise une clé d’API qui porte aussi la permission de supprimer des ressources. Quel principe est violé et quel est le correctif ?
Afficher la réponse
Réponse : A.
Un travail de reporting détenant des droits de suppression viole le moindre privilège ; le correctif est une clé restreinte en lecture seule. B, C et D sont des concepts légitimes mais aucun ne décrit le fait d’accorder plus de permissions que la tâche n’en a besoin.
Dernière mise à jour le 18 sept. 2026