Cette annexe décrit les données, les calculs et les limites nécessaires pour lire et discuter l’article principal. Elle ne publie aucun élément permettant d’identifier l’organisation à l’origine de la question de recherche. Elle ne constitue ni une validation psychométrique d’un test de recrutement ni une comparaison de performance entre humains et IA.
1. Question étudiée
La question principale est la suivante :
Lorsqu’un test Tech Lead fermé, sans documentation ni Internet, additionne plusieurs domaines techniques et managériaux, mesure-t-il principalement le jugement professionnel requis par le poste, ou la capacité à restituer rapidement un référentiel composite ?
Trois sous-questions structurent le pilote :
- Que produit une IA lorsqu’elle doit concevoir un test à partir du seul intitulé « Tech Lead » ?
- Une fiche de poste détaillée réduit-elle les hypothèses et les critères hors périmètre ?
- Les notes attribuées aux mêmes copies restent-elles stables lorsque le modèle correcteur change ?
2. Origine et anonymisation
L’étude a été déclenchée par une expérience réelle de recrutement vécue par l’auteur. Le cas réel n’est pas une observation quantitative du protocole. Il sert uniquement à formuler la question.
Pour limiter le risque de réidentification, ne sont pas publiés :
- le nom de l’organisation et son secteur précis ;
- les noms, le nombre exact et la topologie exacte de ses applications ;
- le code et les formulations originales ;
- la durée exacte, la pondération détaillée et la chronologie du test réel ;
- les échanges avec les personnes impliquées.
Les deux épreuves expérimentales ont été générées dans des contextes reconstruits. La condition contextualisée utilise une entreprise fictive de réservation B2B et non l’architecture de l’organisation d’origine.
3. Plan expérimental
3.1 Conditions de génération
Un même modèle a construit deux tests de 120 minutes dans des conversations séparées.
| Condition | Informations données au générateur | But de la comparaison |
|---|---|---|
| A — intitulé seul | « Tech Lead », sans stack, équipe, responsabilités ni contexte | Observer les hypothèses inventées à partir du titre |
| B — poste défini | Fiche fictive : produit B2B, composants, équipe, responsabilités, frontières de rôle et outils autorisés | Observer l’effet d’un contexte de poste plus précis |
Chaque première proposition a fait l’objet de cinq relances identiques sur les sources, les nombres imposés, les solutions alternatives, les critères obligatoires et la faisabilité.
La durée de 120 minutes ne reproduit pas la durée du cas réel. Elle offre au contraire une condition plus favorable au test expérimental tout en renforçant l’anonymisation.
3.2 Candidats simulés
Trois modèles ont passé A et B comme candidats Tech Lead, dans des conversations distinctes et sans accès au Web :
- GPT-5.6 Sol ;
- Gemini 3.1 Pro ;
- Claude Sonnet 5, raisonnement moyen.
Les six copies ont reçu des identifiants aveugles : A17, A42, A83, B19, B46 et B88. L’identité du modèle candidat n’était pas communiquée aux modèles correcteurs.
3.3 Corrections simulées
Les trois mêmes familles de modèles ont corrigé chaque copie avec le barème correspondant. Le plan produit donc :
- 2 épreuves ;
- 3 modèles candidats ;
- 6 copies ;
- 3 modèles correcteurs ;
- 18 notes.
La correction évalue la conformité des textes au barème généré. Elle ne mesure pas une performance en production, la responsabilité assumée après une décision ou la qualité d’une interaction réelle avec une équipe.
4. Politique de ressources et déviation
La condition A interdisait les ressources externes. La condition B, telle que générée, autorisait normalement documentation, Web et assistant approuvé afin de se rapprocher du travail réel.
Pour comparer les productions autonomes des modèles, les outils externes ont finalement été fermés dans les deux conditions. Cette décision rend la comparaison A/B plus homogène, mais elle constitue une déviation importante : la passation de B ne reproduit pas complètement sa propre politique de ressources.
5. Temps et volumes
Les temps sont ceux observés et rapportés lors des passations. Ils n’ont pas été instrumentés à la milliseconde.
| Modèle candidat | Test A | Test B | Volume total | Temps rapporté par copie |
|---|---|---|---|---|
| GPT-5.6 Sol | 3 110 mots | 4 521 mots | 7 631 mots | environ 3 min 20 à 3 min 30 |
| Claude Sonnet 5 Moyen | 3 473 mots | 2 833 mots | 6 306 mots | 2 à 3 min |
| Gemini 3.1 Pro | 1 984 mots | 2 417 mots | 4 401 mots | moins de 2 min |
Ces valeurs décrivent une vitesse de génération textuelle. Elles ne prouvent pas que le modèle saurait exécuter, défendre ou exploiter les décisions proposées.
6. Matrice des notes
| Copie | Modèle candidat révélé après correction | Test | Correcteur GPT | Correcteur Gemini | Correcteur Claude | Étendue |
|---|---|---|---|---|---|---|
| A17 | Gemini | A | 80 | 96 | 85 | 16 |
| A42 | GPT | A | 100 | 100 | 100 | 0 |
| A83 | Claude | A | 94 | 98 | 97 | 4 |
| B19 | Claude | B | 84 | 95 | 94 | 11 |
| B46 | Gemini | B | 72,5 | 93 | 86 | 20,5 |
| B88 | GPT | B | 100 | 100 | 100 | 0 |
| Moyenne du correcteur | 88,42 | 97,00 | 93,67 |
6.1 Calculs
Pour une copie donnée :
étendue = note maximale − note minimale
Exemple B46 : 93 − 72,5 = 20,5.
Pour un correcteur donné :
moyenne = somme des six notes ÷ 6
Les notes ont été relevées dans les rapports de correction conservés. Les identités ont été révélées après la correction aveugle.
6.2 Lecture prudente
La différence de 20,5 points montre une instabilité dans cette configuration précise. Elle ne démontre pas que des correcteurs humains seraient plus stables : aucune condition humaine comparable n’a été menée. Les 100/100 répétés montrent un effet plafond du barème sur certaines productions, pas la preuve d’une performance professionnelle parfaite.
7. Analyse du contenu des épreuves
Le codage thématique a regroupé les attendus en neuf domaines. Ces catégories sont analytiques et se recouvrent.
| Domaine | Exemples d’attendus | Estimation de formation structurée |
|---|---|---|
| Architecture logicielle | modularisation, découpage, ADR, évolution | 60–100 h |
| Systèmes distribués et paiements | retries, Outbox, saga, réconciliation | 120–200 h |
| Bases de données | isolation, verrouillage, contraintes, pools | 80–140 h |
| Sécurité applicative | injection, autorisation, multi-tenant, logs | 100–180 h |
| Cloud et déploiement | scalabilité, canary, rollback, coûts | 120–200 h |
| SRE et incidents | SLI/SLO, tracing, mitigation, coordination | 100–160 h |
| Tests et fiabilité | concurrence, panne, retry, stratégie par risque | 60–100 h |
| Leadership et produit | priorisation, dette, KPI, autonomie | 60–100 h |
| Gouvernance de l’IA | confidentialité, validation, traçabilité | 40–80 h |
L’addition brute donne 740 à 1 260 heures. L’étude retire ensuite 20 % pour les recouvrements, soit un ordre de grandeur arrondi de 600 à 1 000 heures. Ces plages résultent d’un codage documentaire ; elles ne sont ni des durées officielles ni des prérequis universels pour être Tech Lead.
8. Stratégie documentaire
La revue exploratoire a privilégié :
- les recherches empiriques évaluées par les pairs ;
- les guides institutionnels sur l’analyse de poste et les méthodes d’évaluation ;
- les référentiels professionnels ;
- les processus de recrutement publiés par les organisations ;
- les programmes et prérequis officiels de formations ou certifications.
Les affirmations centrales ont été rattachées à des sources primaires ou institutionnelles lorsque cela était possible. La cartographie des 26 familles d’épreuves est un inventaire analytique, non une taxonomie officielle exhaustive.
9. Limites
- une seule génération de chaque épreuve ;
- trois modèles candidats et trois modèles correcteurs ;
- aucune copie humaine comparable ;
- aucune correction humaine indépendante comparable ;
- aucune défense orale ;
- aucune validation reliant les scores à une performance professionnelle ultérieure ;
- temps rapportés, non instrumentés ;
- évolution possible des modèles, versions et paramètres ;
- outils fermés dans B malgré leur autorisation prévue ;
- isolation technique imparfaite de deux agents GPT partageant un espace de fichiers, malgré l’interdiction explicite de consulter les documents externes et l’absence d’accès déclaré ;
- codage des domaines et estimations horaires réalisés par l’auteur avec assistance de l’IA ;
- position de l’auteur, lui-même participant au recrutement déclencheur.
10. Réplication recommandée
Une étude suivante devrait réduire le nombre de scénarios et ajouter des humains. Un plan minimal pourrait croiser :
| Facteur | Condition 1 | Condition 2 |
|---|---|---|
| Ressources | test fermé | documentation et IA déclarée |
| Candidat | humain | modèle |
| Barème | noms de patterns | propriétés et garanties |
| Correction | deux humains calibrés | modèle assisté et audité |
| Restitution | écrit seul | écrit puis défense orale adaptative |
Les indicateurs prioritaires seraient le temps, l’accord entre évaluateurs, la détection des risques bloquants, la qualité des demandes de clarification et la capacité à réviser une décision après l’ajout d’une contrainte.
11. Disponibilité des matériaux
Sont conservés séparément : les prompts de génération, les deux sujets et leurs corrigés, les six copies anonymisées, les 18 corrections, le protocole, le registre de littérature et les calculs de synthèse.
Leur mise à disposition publique doit encore respecter trois conditions : contrôle d’anonymisation, vérification des droits de reproduction des sorties provenant de services tiers et séparation stricte entre les matériaux expérimentaux et le témoignage réel.
12. Déclaration d’usage de l’IA
L’IA a été utilisée comme objet d’étude, générateur de scénarios, candidat simulé, correcteur simulé et assistant de structuration. L’auteur a sélectionné les données, contrôlé les calculs, vérifié les références centrales, défini les limites et reste responsable du texte et de ses conclusions.