Cette annexe décrit les données, les calculs et les limites nécessaires pour lire et discuter l’article principal. Elle ne publie aucun élément permettant d’identifier l’organisation à l’origine de la question de recherche. Elle ne constitue ni une validation psychométrique d’un test de recrutement ni une comparaison de performance entre humains et IA.

1. Question étudiée

La question principale est la suivante :

Lorsqu’un test Tech Lead fermé, sans documentation ni Internet, additionne plusieurs domaines techniques et managériaux, mesure-t-il principalement le jugement professionnel requis par le poste, ou la capacité à restituer rapidement un référentiel composite ?

Trois sous-questions structurent le pilote :

  1. Que produit une IA lorsqu’elle doit concevoir un test à partir du seul intitulé « Tech Lead » ?
  2. Une fiche de poste détaillée réduit-elle les hypothèses et les critères hors périmètre ?
  3. Les notes attribuées aux mêmes copies restent-elles stables lorsque le modèle correcteur change ?

2. Origine et anonymisation

L’étude a été déclenchée par une expérience réelle de recrutement vécue par l’auteur. Le cas réel n’est pas une observation quantitative du protocole. Il sert uniquement à formuler la question.

Pour limiter le risque de réidentification, ne sont pas publiés :

  • le nom de l’organisation et son secteur précis ;
  • les noms, le nombre exact et la topologie exacte de ses applications ;
  • le code et les formulations originales ;
  • la durée exacte, la pondération détaillée et la chronologie du test réel ;
  • les échanges avec les personnes impliquées.

Les deux épreuves expérimentales ont été générées dans des contextes reconstruits. La condition contextualisée utilise une entreprise fictive de réservation B2B et non l’architecture de l’organisation d’origine.

3. Plan expérimental

3.1 Conditions de génération

Un même modèle a construit deux tests de 120 minutes dans des conversations séparées.

ConditionInformations données au générateurBut de la comparaison
A — intitulé seul« Tech Lead », sans stack, équipe, responsabilités ni contexteObserver les hypothèses inventées à partir du titre
B — poste définiFiche fictive : produit B2B, composants, équipe, responsabilités, frontières de rôle et outils autorisésObserver l’effet d’un contexte de poste plus précis

Chaque première proposition a fait l’objet de cinq relances identiques sur les sources, les nombres imposés, les solutions alternatives, les critères obligatoires et la faisabilité.

La durée de 120 minutes ne reproduit pas la durée du cas réel. Elle offre au contraire une condition plus favorable au test expérimental tout en renforçant l’anonymisation.

3.2 Candidats simulés

Trois modèles ont passé A et B comme candidats Tech Lead, dans des conversations distinctes et sans accès au Web :

  • GPT-5.6 Sol ;
  • Gemini 3.1 Pro ;
  • Claude Sonnet 5, raisonnement moyen.

Les six copies ont reçu des identifiants aveugles : A17, A42, A83, B19, B46 et B88. L’identité du modèle candidat n’était pas communiquée aux modèles correcteurs.

3.3 Corrections simulées

Les trois mêmes familles de modèles ont corrigé chaque copie avec le barème correspondant. Le plan produit donc :

  • 2 épreuves ;
  • 3 modèles candidats ;
  • 6 copies ;
  • 3 modèles correcteurs ;
  • 18 notes.

La correction évalue la conformité des textes au barème généré. Elle ne mesure pas une performance en production, la responsabilité assumée après une décision ou la qualité d’une interaction réelle avec une équipe.

4. Politique de ressources et déviation

La condition A interdisait les ressources externes. La condition B, telle que générée, autorisait normalement documentation, Web et assistant approuvé afin de se rapprocher du travail réel.

Pour comparer les productions autonomes des modèles, les outils externes ont finalement été fermés dans les deux conditions. Cette décision rend la comparaison A/B plus homogène, mais elle constitue une déviation importante : la passation de B ne reproduit pas complètement sa propre politique de ressources.

5. Temps et volumes

Les temps sont ceux observés et rapportés lors des passations. Ils n’ont pas été instrumentés à la milliseconde.

Modèle candidatTest ATest BVolume totalTemps rapporté par copie
GPT-5.6 Sol3 110 mots4 521 mots7 631 motsenviron 3 min 20 à 3 min 30
Claude Sonnet 5 Moyen3 473 mots2 833 mots6 306 mots2 à 3 min
Gemini 3.1 Pro1 984 mots2 417 mots4 401 motsmoins de 2 min

Ces valeurs décrivent une vitesse de génération textuelle. Elles ne prouvent pas que le modèle saurait exécuter, défendre ou exploiter les décisions proposées.

6. Matrice des notes

CopieModèle candidat révélé après correctionTestCorrecteur GPTCorrecteur GeminiCorrecteur ClaudeÉtendue
A17GeminiA80968516
A42GPTA1001001000
A83ClaudeA9498974
B19ClaudeB84959411
B46GeminiB72,5938620,5
B88GPTB1001001000
Moyenne du correcteur88,4297,0093,67

6.1 Calculs

Pour une copie donnée :

étendue = note maximale − note minimale

Exemple B46 : 93 − 72,5 = 20,5.

Pour un correcteur donné :

moyenne = somme des six notes ÷ 6

Les notes ont été relevées dans les rapports de correction conservés. Les identités ont été révélées après la correction aveugle.

6.2 Lecture prudente

La différence de 20,5 points montre une instabilité dans cette configuration précise. Elle ne démontre pas que des correcteurs humains seraient plus stables : aucune condition humaine comparable n’a été menée. Les 100/100 répétés montrent un effet plafond du barème sur certaines productions, pas la preuve d’une performance professionnelle parfaite.

7. Analyse du contenu des épreuves

Le codage thématique a regroupé les attendus en neuf domaines. Ces catégories sont analytiques et se recouvrent.

DomaineExemples d’attendusEstimation de formation structurée
Architecture logiciellemodularisation, découpage, ADR, évolution60–100 h
Systèmes distribués et paiementsretries, Outbox, saga, réconciliation120–200 h
Bases de donnéesisolation, verrouillage, contraintes, pools80–140 h
Sécurité applicativeinjection, autorisation, multi-tenant, logs100–180 h
Cloud et déploiementscalabilité, canary, rollback, coûts120–200 h
SRE et incidentsSLI/SLO, tracing, mitigation, coordination100–160 h
Tests et fiabilitéconcurrence, panne, retry, stratégie par risque60–100 h
Leadership et produitpriorisation, dette, KPI, autonomie60–100 h
Gouvernance de l’IAconfidentialité, validation, traçabilité40–80 h

L’addition brute donne 740 à 1 260 heures. L’étude retire ensuite 20 % pour les recouvrements, soit un ordre de grandeur arrondi de 600 à 1 000 heures. Ces plages résultent d’un codage documentaire ; elles ne sont ni des durées officielles ni des prérequis universels pour être Tech Lead.

8. Stratégie documentaire

La revue exploratoire a privilégié :

  1. les recherches empiriques évaluées par les pairs ;
  2. les guides institutionnels sur l’analyse de poste et les méthodes d’évaluation ;
  3. les référentiels professionnels ;
  4. les processus de recrutement publiés par les organisations ;
  5. les programmes et prérequis officiels de formations ou certifications.

Les affirmations centrales ont été rattachées à des sources primaires ou institutionnelles lorsque cela était possible. La cartographie des 26 familles d’épreuves est un inventaire analytique, non une taxonomie officielle exhaustive.

9. Limites

  • une seule génération de chaque épreuve ;
  • trois modèles candidats et trois modèles correcteurs ;
  • aucune copie humaine comparable ;
  • aucune correction humaine indépendante comparable ;
  • aucune défense orale ;
  • aucune validation reliant les scores à une performance professionnelle ultérieure ;
  • temps rapportés, non instrumentés ;
  • évolution possible des modèles, versions et paramètres ;
  • outils fermés dans B malgré leur autorisation prévue ;
  • isolation technique imparfaite de deux agents GPT partageant un espace de fichiers, malgré l’interdiction explicite de consulter les documents externes et l’absence d’accès déclaré ;
  • codage des domaines et estimations horaires réalisés par l’auteur avec assistance de l’IA ;
  • position de l’auteur, lui-même participant au recrutement déclencheur.

10. Réplication recommandée

Une étude suivante devrait réduire le nombre de scénarios et ajouter des humains. Un plan minimal pourrait croiser :

FacteurCondition 1Condition 2
Ressourcestest fermédocumentation et IA déclarée
Candidathumainmodèle
Barèmenoms de patternspropriétés et garanties
Correctiondeux humains calibrésmodèle assisté et audité
Restitutionécrit seulécrit puis défense orale adaptative

Les indicateurs prioritaires seraient le temps, l’accord entre évaluateurs, la détection des risques bloquants, la qualité des demandes de clarification et la capacité à réviser une décision après l’ajout d’une contrainte.

11. Disponibilité des matériaux

Sont conservés séparément : les prompts de génération, les deux sujets et leurs corrigés, les six copies anonymisées, les 18 corrections, le protocole, le registre de littérature et les calculs de synthèse.

Leur mise à disposition publique doit encore respecter trois conditions : contrôle d’anonymisation, vérification des droits de reproduction des sorties provenant de services tiers et séparation stricte entre les matériaux expérimentaux et le témoignage réel.

12. Déclaration d’usage de l’IA

L’IA a été utilisée comme objet d’étude, générateur de scénarios, candidat simulé, correcteur simulé et assistant de structuration. L’auteur a sélectionné les données, contrôlé les calculs, vérifié les références centrales, défini les limites et reste responsable du texte et de ses conclusions.