Parcours API Developer
API Developer Path – Examen blanc 1
Un examen blanc indépendant de 60 items pour le parcours développeur API OpenAI, pondéré selon le blueprint sur sept domaines, avec explications complètes et lecture de préparation.
Ceci est un examen blanc indépendant complet, pondéré selon le blueprint, pour le parcours développeur API, construit à partir des objectifs d’apprentissage OpenAI et de la documentation produit accessibles au public. Il n’est pas une évaluation officielle OpenAI et n’est pas l’évaluation Academy : les badges Academy et les certificats de parcours ne sont pas des certifications. Les 60 items sont inédits et ne reprennent pas les questions des pages de domaine. Utilisez-le comme session diagnostique avant l’Examen blanc 2 plus difficile.
Consignes
- Durée : 90 minutes pour 60 items — le rythme qu’utilise notre examen blanc ; OpenAI ne publie pas de durée d’examen publique.
- Items : 60, à réponse unique et à réponses multiples. Chaque item indique combien de réponses sélectionner.
- Sélection : pour un item Sélectionnez deux réponses, vous devez choisir les deux bonnes options et aucune mauvaise pour obtenir le point. Il n’y a aucune pénalité pour les mauvaises réponses, alors répondez à chaque question.
- Objectif : visez au moins 80 % brut (environ 48 sur 60) avant de passer la véritable évaluation Academy, qui réussit à la même barre de 80 %.
- Traitez chaque question avant de déployer la réponse.
Répartition par domaine
| # | Domaine | Items ici |
|---|---|---|
| D1 | Scoping AI Solutions | 7 |
| D2 | The Responses API and Model Selection | 11 |
| D3 | Evaluating AI Applications | 10 |
| D4 | Designing and Building Agentic Systems | 11 |
| D5 | Retrieval-Augmented Generation | 9 |
| D6 | Performance, Latency and Cost | 7 |
| D7 | Production Safety and Operations | 5 |
Total : 7 + 11 + 10 + 11 + 9 + 7 + 5 = 60 items.
Interprétation de la préparation
Ceci est un indicateur de préparation indépendant, pas un score officiel.
| Score brut (sur 60) | Palier | Interprétation |
|---|---|---|
| 54–60 (90 %+) | Forte préparation | À l’aise sur tous les domaines |
| 48–53 (80–89 %) | Prêt pour l’évaluation | Au niveau ou au-dessus de la barre Academy des 80 % ; peaufinez les domaines faibles |
| 42–47 (70–79 %) | Confiance en construction | Proche ; ciblez les domaines qui vous ont coûté des points |
| moins de 42 (moins de 70 %) | Continuez à apprendre | Revoyez les pages de domaine avant de recommencer |
Passer l’examen blanc
Deux façons d’utiliser les questions ci-dessous : le mode interactif lance une session chronométrée, une question à la fois, et se termine par votre score, une ventilation par domaine et une correction complète ; le mode révision en dessous liste chaque question avec ses options une par ligne et la réponse masquée jusqu’à ce que vous la demandiez.
Mode interactif
Passer l’examen d’entraînement
60 questions · une à la fois · compte à rebours de 90 minutes · résultats avec répartition par domaine et correction complète à la fin. Votre progression est enregistrée dans ce navigateur si vous quittez la page.
Par domaine
| Domaine | Correctes | Score |
|---|
Correction
Toutes les questions (mode révision)
Les options sont présentées une par ligne. La réponse et l’explication restent masquées jusqu’à ce que vous cliquiez sur Afficher la réponse. Utilisez le mode interactif ci-dessus pour une session chronométrée.
Un décideur décrit un objectif ainsi : « rendre le chatbot plus intelligent ». Avant d’écrire la moindre ligne de code, qu’est-ce qui transforme cela en un problème cadrable ?
Afficher la réponse
Réponse : A.
Le cadrage transforme un souhait vague en une tâche dotée d’une entrée, d’une sortie, d’un utilisateur et d’une mesure de succès mesurable définis, ce dont dépend chaque décision ultérieure. B saute au modèle avant que le problème ne soit connu et gaspille le budget. C présume que le fine-tuning est nécessaire avant même qu’une définition de tâche existe. D fait l’impasse sur la définition que le prototype servirait justement à tester, si bien que les retours seraient sans cap.
Parmi les besoins suivants, lequel est une exigence déterministe qui ne devrait PAS s’appuyer sur un modèle de langage comme source de vérité ?
Afficher la réponse
Réponse : A.
Un solde exact doit provenir d’un calcul arithmétique sur des données faisant autorité, et non d’un modèle qui peut approximer ; le modèle peut le présenter ou l’expliquer, mais pas le calculer comme vérité. B, C et D sont des tâches de jugement ou de langage où une sortie approximative et révisable est acceptable, ce qui est précisément là où les modèles trouvent leur place.
Une équipe doit choisir entre construire une chaîne de transcription sur mesure et acheter un produit hébergé pour la transcription des appels de support. Quel facteur favorise LE PLUS l’achat ?
Afficher la réponse
Réponse : A.
On achète lorsque la capacité est banalisée, n’apporte aucune différenciation et qu’il existe des produits matures, afin que l’effort porte sur le produit. B est une préférence, pas une raison métier. C est une contrainte qui plaiderait contre l’achat, non en sa faveur. D évoque une capacité à construire, mais une capacité n’est pas une raison de construire quelque chose sans valeur de différenciation.
Vous cadrez un outil de résumé pour 40 000 documents par jour, à environ 1 200 tokens d’entrée et 200 tokens de sortie chacun ;
gpt-5.6-lunaatteint le seuil de qualité. Luna coûte $0.20 par million de tokens d’entrée et $1.20 par million de tokens de sortie. Quel est approximativement le coût quotidien ?Afficher la réponse
Réponse : A.
Entrée : 40 000 x 1 200 = 48M tokens x $0.20/M = $9.60. Sortie : 40 000 x 200 = 8M tokens x $1.20/M = $9.60. Total ~$19.20/jour, donc A. B sous-estime d’un ordre de grandeur, C applique des tarifs de type Terra et D est dix fois trop élevé.
Un décideur veut une fonctionnalité d’IA qui approuve automatiquement les notes de frais et les enregistre au grand livre sans revue humaine. Quels DEUX points doivent façonner votre cadrage ?
Afficher la réponse
Réponse : A et B.
A reconnaît qu’une action irréversible exige une porte ou une préparation réversible, et B maintient l’arithmétique déterministe : les deux redessinent la conception. C est faux : un modèle plus grand ne rend pas l’arithmétique générée digne de foi. D est erroné car l’automatisation renforce, et non supprime, le besoin d’une mesure. E écarte l’évaluation, ce qu’exige précisément une fonctionnalité qui déplace de l’argent.
Un directeur veut imposer
gpt-6-astrapour chaque fonctionnalité « par prudence ». Une tâche d’extraction à fort volume passe votre évaluation à 96 % surgpt-5.6-luna. Quelle est la MEILLEURE réponse ?Afficher la réponse
Réponse : A.
La sélection du modèle se fait par tâche et se pilote sur les résultats d’évaluation face au seuil de qualité et au coût ; présenter les preuves permet à l’équipe de choisir Luna là où il suffit. B gaspille de larges multiples de coût sans gain de qualité. C est disproportionné. D double le coût et la latence sur chaque requête sans valeur en production.
Pendant le cadrage, vous apprenez qu’une fonctionnalité doit répondre pendant qu’un utilisateur attend ET qu’une autre doit résorber une file nocturne de 3M d’éléments. Que conclut un cadrage correct ?
Afficher la réponse
Réponse : A.
Les charges interactives et de masse ont des profils de latence opposés : le cadrage les traite donc séparément et peut retenir Batch pour la file et un traitement à faible latence pour le chemin interactif. B impose un seul palier à des besoins incompatibles. C rendrait la fonctionnalité interactive inutilisablement lente. D gaspillerait de l’argent et n’apporterait aucun bénéfice sur la file.
Pour une nouvelle intégration d’API en septembre 2026, sur quelle interface bâtir sur le long terme ?
Afficher la réponse
Réponse : A.
La Responses API est l’interface principale pour les nouveaux travaux ; Chat Completions relève du legacy pour les nouvelles constructions. B présente à tort Chat Completions comme récente. C et D sont fausses : Assistants et Agent Builder sont regroupés sous les Legacy APIs, et non le choix par défaut recommandé.
Vous devez faire tourner
gpt-5.6-terraavec le moins de « réflexion » possible tout en passant votre évaluation. Quel principe s’applique ?Afficher la réponse
Réponse : A.
La consigne documentée est d’utiliser le plus faible reasoning effort qui produit le résultat, car un effort plus élevé ajoute de la latence et du coût. B surdépense par défaut. C est faux : il n’existe pas de correspondance exacte entre les efforts de GPT-5.5 et ceux de GPT-5.6. D est faux puisque davantage de raisonnement signifie généralement plus de tokens, de latence et de coût.
Un service de classification doit émettre
{"queue": "...", "priority": 1}que le code en aval parse sans nettoyage défensif. Quel est le MEILLEUR mécanisme ?Afficher la réponse
Réponse : A.
Des structured outputs liés à un schéma garantissent la forme parsable. B est une demande que le modèle peut tout de même enfreindre. C est fragile et échoue sur les cas limites. D rend la sortie moins prévisible, à l’opposé du besoin.
Un assistant doit récupérer, pour répondre, le palier d’abonnement en direct d’un client auprès d’un service de facturation interne. Quel est le mécanisme correct ?
Afficher la réponse
Réponse : A.
Des données en direct, propres à chaque client, doivent être récupérées au moment de la requête via un outil appelé par le modèle, c’est-à-dire du function calling. B est impossible : le modèle ne connaît pas l’état en direct d’un compte. C est irréalisable et présente un risque d’exposition de données. D confond la longueur de sortie avec l’accès aux données.
Une tâche d’extraction à fort volume s’exécute 3M de fois par jour et
gpt-5.6-lunapasse votre évaluation à 97 %. Quel modèle déployer ?Afficher la réponse
Réponse : A.
Luna est conçu pour les tâches claires, répétables et à fort volume, et il atteint déjà le seuil de qualité : c’est donc le choix correct le moins cher. B, C et D coûtent tous des multiples de plus pour une tâche que Luna réussit, sans justification de qualité, et D choisit en outre un modèle de génération précédente plus coûteux.
Vous devez maintenir une conversation à deux tours sans renvoyer le texte du premier tour au second appel. Quelle fonctionnalité de la Responses API le permet ?
Afficher la réponse
Réponse : A.
La Responses API prend en charge l’état de conversation côté serveur, si bien qu’une relance référence la réponse précédente sans en renvoyer le texte. B est sans rapport avec l’état. C est précisément ce que l’état de conversation existe pour éviter. D est une opération d’entraînement, non un moyen de porter une conversation unique.
Une exécution doit se poursuivre après la fin d’une unique requête HTTP et signaler sa progression via streaming ou webhooks. Quelle fonctionnalité de la Responses API convient ?
Afficher la réponse
Réponse : A.
Le background mode permet à une tâche de longue durée de se poursuivre au-delà d’une requête HTTP et d’être suivie via streaming ou webhooks. B réduit le coût sur les préfixes répétés mais ne détache pas l’exécution. C accélère les éditions, sans rapport avec la durée de vie. D n’affecte que la longueur de la réponse.
Quelles DEUX pratiques réduisent le coût des tokens d’entrée sur une conversation multi-tours très longue sans supprimer le contexte nécessaire ?
Afficher la réponse
Réponse : A et B.
La compaction résume l’historique périmé et l’état de conversation évite de renvoyer le texte antérieur, tous deux réduisant les tokens d’entrée. C augmente la dépense et la latence. D change l’aléa, pas les tokens. E relève le prix par token, aggravant le coût.
Quand vous lisez un résultat de la Responses API issu d’un modèle de raisonnement qui a aussi appelé un outil, pourquoi indexer le premier élément de sortie peut-il être peu fiable pour le texte de réponse ?
Afficher la réponse
Réponse : A.
Une réponse est une liste d’éléments typés ; des éléments de raisonnement et d’appel d’outil peuvent précéder le message, donc le code doit utiliser l’assistant de texte de sortie agrégé plutôt qu’un index fixe. B, C et D sont des généralisations fausses qui casseraient dans le cas courant où texte et éléments d’outil coexistent.
Une analyse complexe, ouverte et à forte valeur échoue sur
gpt-5.6-terradans votre évaluation, et le volume est faible. Quel est le MEILLEUR modèle à essayer ensuite ?Afficher la réponse
Réponse : A.
Sol est positionné pour le travail complexe, ouvert et à forte valeur, et constitue la montée en gamme naturelle depuis Terra, d’autant qu’à faible volume son prix pèse moins. B descend l’échelle de capacité pour une tâche que Terra a déjà échouée. C recule d’une génération. D change l’aléa, pas la capacité.
Qu’est-ce qui est VRAI à propos des niveaux de reasoning effort de la famille GPT-5.6 ?
Afficher la réponse
Réponse : A.
D’après le tableau des modèles, les modèles GPT-5.6 prennent en charge de none à max, et Astra offre en plus xhigh. B est faux puisque Sol, Terra et Luna acceptent aussi l’effort. C est explicitement démenti par la documentation. D est inventé ;
noneetlowsont disponibles.Un développeur modifie un prompt, vérifie deux exemples qui semblent meilleurs, et veut livrer. Que doit-il faire D’ABORD ?
Afficher la réponse
Réponse : A.
Deux exemples ne peuvent montrer si une modification aide globalement ; une évaluation représentative comparée à une référence le peut. B livre à l’aveugle. C est anecdotique. D change le coût sans preuve que la modification du prompt est même bonne.
Vous devez noter si des champs de facture extraits correspondent exactement à la vérité terrain. Quel évaluateur est le MEILLEUR ?
Afficher la réponse
Réponse : A.
La correspondance exacte de champs face à la vérité terrain est un contrôle déterministe : un évaluateur de chaîne/correspondance exacte est donc précis et peu coûteux. B ajoute du bruit et du coût pour une tâche à réponse définie. C ne passe pas à l’échelle. D laisserait passer des quasi-correspondances qui doivent être exactes.
Quelle est la différence entre évaluation hors ligne et évaluation en ligne ?
Afficher la réponse
Réponse : A.
L’évaluation hors ligne utilise un jeu de données constitué avant la mise en production ; l’évaluation en ligne observe le trafic réel pour détecter des entrées que le jeu de données ne contenait pas. B se trompe sur leurs finalités. C nie une distinction réelle. D est faux : l’en ligne complète les jeux hors ligne, sans les remplacer.
Avant de faire confiance à un évaluateur LLM-as-judge qui note la fidélité de résumés, que devez-vous faire ?
Afficher la réponse
Réponse : A.
Un juge automatique n’est digne de confiance qu’une fois calibré par rapport à des annotations humaines sur un échantillon. B est une confiance non méritée. C risque de faire favoriser au juge son propre style sans vérification. D supprime la comparaison contrôlée dont la calibration a besoin.
Une équipe n’exécute que des évaluations hors ligne et subit sans cesse des échecs en production sur des formulations jamais présentes dans son jeu de données. Que manque-t-il ?
Afficher la réponse
Réponse : A.
Les échecs sur des formulations inédites sont exactement ce que l’évaluation en ligne et l’échantillonnage du trafic détectent, en réinjectant de nouveaux cas dans le jeu de données. B, C et D changent le comportement du modèle mais ne font rien pour faire apparaître les entrées que le jeu hors ligne ne couvrait pas.
Quelles DEUX raisons sont légitimes pour inclure une revue humaine dans un processus d’évaluation ?
Afficher la réponse
Réponse : A et B.
La revue humaine calibre les juges et tranche les cas à fort enjeu ou ambigus. C ne passe pas à l’échelle et n’est pas le but de la revue. D écarte le jeu de données réutilisable que les humains aident à construire. E n’est pas une raison du tout.
Quels DEUX objectifs sert le fait de conserver un score d’évaluation de référence ?
Afficher la réponse
Réponse : A et B.
Une référence est le repère qui permet de voir à la fois les améliorations et les régressions apportées par une modification. C invente une exigence de plateforme. D est cosmétique. E est faux : les références et l’évaluation en ligne répondent à des besoins différents, l’une ne remplaçant pas l’autre.
Comment décrire l’Evals API compte tenu de la structure actuelle de la documentation OpenAI ?
Afficher la réponse
Réponse : A.
La documentation regroupe les Evals sous les Legacy APIs tandis que les évaluations restent conceptuellement importantes ; A est donc le cadrage exact. B surestime son statut. C est faux : legacy ne signifie pas retiré. D la place à tort au cœur de la Responses.
Votre jeu d’évaluation compte 10 éléments et les scores varient fortement d’une exécution à l’autre. Quel est le problème LE PLUS probable ?
Afficher la réponse
Réponse : A.
Avec seulement 10 éléments, un seul basculement déplace fortement le pourcentage : l’instabilité est donc un problème de taille d’échantillon ; agrandissez le jeu. B, C et D sont possibles en général, mais le symptôme décrit — de fortes variations sur un jeu minuscule — pointe clairement vers des données insuffisantes.
Une évaluation de réponses ancrées vérifie si les réponses sont étayées par le contexte récupéré. Quand doit-elle être ré-exécutée ?
Afficher la réponse
Réponse : A.
Tout changement de récupération, de chunking, de prompt ou de modèle peut altérer l’ancrage : l’évaluation est donc ré-exécutée à chacun de ces changements. B et C figent l’évaluation pendant que le système évolue. D est réactif et laisse des régressions être livrées inaperçues.
Vous voulez qu’OpenAI exécute et reprenne une session d’agent durable, de plusieurs heures, avec compaction du contexte gérée. Quel runtime convient le MIEUX ?
Afficher la réponse
Réponse : A.
L’Agents API est le harnais géré par OpenAI qui exécute les sessions, l’orchestration, la compaction du contexte et la reprise, ce qui correspond à un travail durable de plusieurs heures. B et C font peser sur vous la charge de la durabilité et de la reprise. D n’a aucune mécanique de session, de reprise ni de compaction.
Une équipe veut un contrôle code-first sur une orchestration multi-étapes sur mesure qu’elle exécute sur ses propres serveurs. Quel runtime convient le MIEUX ?
Afficher la réponse
Réponse : A.
L’Agents SDK offre une orchestration code-first auto-hébergée et des garde-fous, ce qui correspond au besoin d’exécution sur leurs propres serveurs. B est géré par OpenAI, non auto-hébergé. C sert aux traitements de masse hors ligne. D n’a pas les primitives d’orchestration et de garde-fous que le SDK fournit.
Une banque de l’UE exige une résidence des données dans l’UE et une rétention nulle des données. L’Agents API est-elle éligible ?
Afficher la réponse
Réponse : A.
L’Agents API n’offre qu’une résidence des données aux États-Unis, sans ZDR, et choisir un sandbox auto-hébergé ne lève pas ces contraintes. B invente un en-tête de région. C est faux ; le ZDR n’est pas proposé. D confond confidentialité réseau avec résidence et rétention.
Quelle est la bonne façon de permettre à un agent de lire un dépôt interne via un protocole standard ?
Afficher la réponse
Réponse : A.
MCP est le protocole standard pour connecter des outils et des sources de données à un agent : un serveur MCP est donc le mécanisme correct. B ne passe pas à l’échelle et gaspille le budget de contexte. C est coûteux et périmé entre les exécutions. D est un anti-modèle de gestion de secrets, non sécurisé.
Un agent peut émettre des remboursements. Quel contrôle est OBLIGATOIRE avant qu’il n’agisse sur un remboursement de forte valeur ?
Afficher la réponse
Réponse : A.
Les actions irréversibles à forte valeur exigent une porte d’approbation humaine avant exécution. B, C et D peuvent influer sur la qualité ou la capacité, mais aucun n’empêche l’agent de commettre une action irréversible non souhaitée.
Quelles DEUX affirmations sur le harnais géré de l’Agents API sont VRAIES ?
Afficher la réponse
Réponse : A et B.
Le harnais géré exécute le cycle de vie de la session et prend en charge la délégation à des sous-agents via
multi_agentavecmax_concurrent_subagents. C est faux : c’est aux États-Unis uniquement, sans ZDR. D contredit la reprise gérée qu’il fournit. E décrit l’Agents SDK, pas l’Agents API.Un assistant simple doit appeler une seule fonction interne et renvoyer une réponse, avec un contrôle complet de chaque étape et sans session ni sandbox. Quel runtime est le plus simple et correct ?
Afficher la réponse
Réponse : A.
Pour un appel d’outil unique avec un contrôle complet étape par étape et sans besoin de session ni de sandbox, la Responses API avec function calling est le choix le plus simple. B et C ajoutent des sessions gérées ou une mécanique de framework dont la tâche n’a pas besoin. D est une opération d’entraînement, pas un runtime pour l’usage d’outils.
Quelle est la différence entre les handoffs multi-agents et les sous-agents ?
Afficher la réponse
Réponse : A.
Un handoff passe le contrôle à un agent différent, tandis qu’un sous-agent se voit déléguer une portion de travail bornée et renvoie son résultat au parent. B nie une distinction réelle. C décrit mal la délégation. D place les handoffs dans une API sans rapport.
Un agent de support doit lire des commandes, mais un développeur lui accorde un accès en écriture à la facturation « au cas où ». Quel principe est violé ?
Afficher la réponse
Réponse : A.
Accorder plus d’accès que la tâche n’en a besoin viole le moindre privilège ; le correctif est un accès en lecture seule aux commandes. B, C et D sont de vrais concepts d’ingénierie mais aucun ne décrit des permissions trop larges.
Comment un sandbox hébergé dans l’Agents API est-il facturé, par rapport à un sandbox auto-hébergé ?
Afficher la réponse
Réponse : A.
La facturation de l’Agents API correspond aux tarifs du modèle, plus les tarifs standard des outils, plus des tarifs de conteneur pour les sandbox hébergés. B ignore les frais de conteneur. C invente un forfait fixe. D est faux car le tarif de conteneur est précisément ce qu’un sandbox hébergé ajoute par rapport à l’auto-hébergement.
Un agent effectue occasionnellement une mauvaise action d’outil et, ensuite, personne ne peut dire pourquoi. Que manque-t-il ?
Afficher la réponse
Réponse : A.
Ne pas pouvoir expliquer une action passée est une lacune d’observabilité ; tracer les étapes et les appels d’outil fournit la piste d’audit. B, C et D ajoutent de la capacité, du parallélisme ou du budget, mais aucun n’enregistre ce qui s’est passé pour un diagnostic ultérieur.
Une base de connaissances de 50 000 documents internes change chaque semaine et les réponses doivent citer les sources. Quelle est la MEILLEURE approche ?
Afficher la réponse
Réponse : A.
Le RAG récupère les documents à jour au moment de la requête et peut y attacher des citations, gérant à faible coût un changement hebdomadaire. B est coûteux, lent à mettre à jour et difficile à citer. C est irréalisable et dispendieux. D ne peut connaître un contenu interne privé et changeant.
Les utilisateurs recherchent par codes d’erreur exacts comme
ERR-4021et la récupération purement sémantique les manque sans cesse. Quel est le correctif ?Afficher la réponse
Réponse : A.
Les tokens exacts comme les codes d’erreur sont trouvés par une recherche lexicale : une récupération hybride combinant rappel par mots-clés et sémantique corrige donc les échecs. B ajuste les embeddings mais privilégie encore le sens sur les chaînes exactes. C et D changent la génération, pas la récupération.
Les cliniciens ne doivent récupérer que les protocoles de leur propre service. Où cette restriction doit-elle être appliquée ?
Afficher la réponse
Réponse : A.
L’autorisation doit être appliquée dans la récupération afin que les documents hors périmètre ne soient jamais rapportés ; une demande de prompt est contournable. B repose sur le bon comportement du modèle, ce qui n’est pas un contrôle de sécurité. C et D affectent la qualité ou le coût, pas l’accès.
Un chunk récupéré ne contient pas la réponse, pourtant le modèle répond par un chiffre affirmé avec assurance issu de sa connaissance d’entraînement. Comment empêcher cela ?
Afficher la réponse
Réponse : A.
L’ancrage exige d’instruire le modèle de répondre uniquement à partir du contexte et de s’abstenir sinon, le tout vérifié par une évaluation d’ancrage. B peut toujours halluciner. C affecte la longueur, pas l’ancrage. D supprime le contexte même qui ancre la réponse.
Les chunks sont réglés à 4 000 tokens chacun et les réponses incluent maintenant beaucoup de texte non pertinent. Quelle est la cause LA PLUS probable ?
Afficher la réponse
Réponse : A.
Des chunks surdimensionnés regroupent des passages sans rapport, si bien que la récupération apporte du bruit ; des chunks plus petits et ciblés aident. B se manifesterait peu par une récupération volumineuse mais pertinente. C et D n’expliquent pas pourquoi le texte récupéré est hors sujet.
Pourquoi ajoute-t-on un chevauchement entre chunks adjacents lors de l’indexation ?
Afficher la réponse
Réponse : A.
Le chevauchement préserve le contexte qui enjambe une frontière de chunk afin qu’une réponse à cheval reste récupérable. B est faux ; le chevauchement augmente le stockage. C et D sont sans rapport avec le rôle du chevauchement.
Quelles DEUX métriques une évaluation de réponses ancrées devrait-elle mesurer ?
Afficher la réponse
Réponse : A et B.
Une évaluation de réponses ancrées mesure si la récupération a rapporté le bon contexte et si la réponse lui est fidèle. C est une statistique de débit, non une mesure de qualité de réponse. D est sans rapport. E est une métrique de stockage, non de qualité.
Un développeur propose de mettre un manuel entier de 900 pages dans le prompt à chaque requête parce que la fenêtre est de 1,05M de tokens. Pourquoi le RAG est-il généralement préférable ici ?
Afficher la réponse
Réponse : A.
Même si le manuel tient, le fourrer à chaque requête fait payer et traiter des tokens non pertinents à chaque appel ; le RAG ne récupère que ce dont la requête a besoin. B surestime une précision universelle. C est faux puisque 900 pages tiennent dans 1,05M de tokens. D est inexact.
Que vous offre file search sur un vector store géré, prêt à l’emploi ?
Afficher la réponse
Réponse : A.
Le file search géré fournit le chunking, l’embedding, l’indexation et la récupération hébergés, exposés comme un outil. B est une opération d’entraînement différente. C n’est pas quelque chose qu’une couche de récupération puisse garantir. D invente une affirmation tarifaire.
De nombreuses requêtes partagent un system prompt de 5 000 tokens suivi d’un court message utilisateur. Qu’est-ce qui réduit le plus directement le coût et la latence ?
Afficher la réponse
Réponse : A.
Un préfixe volumineux et répété est exactement ce que vise le prompt caching, en réduisant le coût et le temps de retraitement. B et C augmentent la dépense et la latence. D affecte la longueur de sortie, pas l’entrée répétée.
Une tâche nocturne classe 5M de documents et la latence n’a pas d’importance. Quel choix de traitement est le PLUS économique ?
Afficher la réponse
Réponse : A.
Le travail de masse insensible à la latence est la raison d’être de la Batch API, et c’est le palier le moins cher pour cela. B paie un modèle premium en synchrone. C et D optimisent une interactivité dont la tâche n’a pas besoin, à un coût plus élevé.
Un outil de résumé s’exécute 200 000 fois par jour à 1 000 tokens d’entrée et 200 de sortie sur
gpt-5.6-luna($0.20/M en entrée, $1.20/M en sortie). Quel est approximativement le coût quotidien ?Afficher la réponse
Réponse : A.
Entrée : 200 000 x 1 000 = 200M x $0.20/M = $40. Sortie : 200 000 x 200 = 40M x $1.20/M = $48. Total ~$88/jour, donc A. B est un dixième du chiffre réel, C applique des tarifs à l’échelle de Terra et D est bien trop élevé.
Une fonctionnalité interactive « semble lente ». Avant de rien changer, que devez-vous faire D’ABORD ?
Afficher la réponse
Réponse : A.
On ne peut optimiser ce qu’on n’a pas mesuré : profiler la latence et le time-to-first-token vient donc en premier. B, C et D sont des changements à l’aveugle qui peuvent ne pas toucher le vrai goulot d’étranglement et l’aggraver.
Le time-to-first-token domine la latence d’une fonctionnalité interactive tournant sur
gpt-5.6-solà l’efforthigh. Quels DEUX leviers aident le plus directement ?Afficher la réponse
Réponse : A et B.
Un effort plus bas réduit la réflexion qui retarde le premier token, et le streaming montre la sortie à mesure qu’elle arrive, améliorant la latence perçue. C rallonge la génération. D est destiné au travail de masse hors ligne, pas à la latence interactive. E ajoute du traitement d’entrée, augmentant la latence.
Vous éditez un long document où environ 95 % de la sortie est identique à l’entrée. Quelle fonctionnalité réduit le PLUS la latence ?
Afficher la réponse
Réponse : A.
Les predicted outputs accélèrent la génération quand l’essentiel de la sortie est déjà connu, précisément le cas de l’édition à faibles changements. B est destiné aux travaux de masse hors ligne. C ajoute de la latence. D affecte la capacité, pas la vitesse de génération d’une sortie quasi identique.
Une charge tolérante à la latence veut un coût inférieur au traitement standard mais ne peut pas attendre les heures que prend la Batch API. Quel palier convient ?
Afficher la réponse
Réponse : A.
Le Flex processing échange un peu de latence contre un coût plus faible, sans le délai de plusieurs heures de Batch, ce qui convient à une charge tolérante à la latence mais non hors ligne. B optimise la vitesse à un coût plus élevé. C vise l’interaction en temps réel. D est le palier standard que l’on cherche à battre sur le coût.
Un appel d’API renvoie un
429. Quel est le traitement correct ?Afficher la réponse
Réponse : A.
Un 429 est un signal de limitation de débit géré par un backoff exponentiel avec jitter. B aggrave la surcharge. C réagit de façon excessive à une condition transitoire. D ne traite pas la limitation de débit et pourrait simplement déplacer le problème.
Quelle erreur ne devriez-vous PAS réessayer automatiquement ?
Afficher la réponse
Réponse : A.
Un 400 signifie que la requête elle-même est erronée : réessayer la même charge utile échouera de nouveau ; corrigez plutôt la requête. B, C et D sont des conditions transitoires ou de throttling où temporisation et réessai sont appropriés.
Une équipe craint qu’une boucle d’agent incontrôlée génère une facture énorme. Quel contrôle plafonne le PLUS directement le coût en dollars ?
Afficher la réponse
Réponse : A.
Les limites de dépense plafonnent directement l’exposition en dollars, quel que soit le comportement de la boucle. B, C et D n’ont aucune incidence sur la dépense totale, et D l’augmenterait. Les limites de débit aident à réguler, mais les limites de dépense plafonnent l’argent le plus directement.
Une charge Kubernetes doit appeler l’API sans détenir de clé d’API à longue durée de vie. Quelles DEUX pratiques sont correctes ?
Afficher la réponse
Réponse : A et B.
La workload identity federation évite les clés à longue durée de vie en émettant des identifiants à courte durée de vie, et une restriction au moindre privilège limite ce que ces identifiants peuvent faire. C intègre un secret dans une image qui peut fuir. D élargit le rayon d’impact et complique la rotation. E supprime l’observabilité et ne fait rien contre la clé elle-même.
Un agent traite des messages clients non fiables et peut entreprendre des actions. Quels DEUX contrôles traitent LE MIEUX le risque de prompt injection ?
Afficher la réponse
Réponse : A et B.
Le moindre privilège limite le rayon d’impact d’une injection réussie et les portes d’approbation empêchent les actions irréversibles de se déclencher automatiquement. C change l’aléa, D n’empêche pas l’injection, et E n’affecte que la longueur de sortie.
Dernière mise à jour le 18 sept. 2026