Aller au contenu

Psychométrie22 min de lecture

10 fausses croyances sur les tests de personnalité dans le recrutement

Fréquemment utilisés, souvent critiqués, les tests de personnalité sont surtout mal compris.

Vincent Berthet— Direction scientifique

Introduction

L’essor des tests psychologiques s’est produit au cours du 20e siècle. Leur utilisation dans le recrutement s’est notamment développée aux Etats-Unis lors des deux Guerres Mondiales. Dans un contexte d’enrôlement massif, des outils permettant d’évaluer rapidement la personnalité et les aptitudes d’une personne ont une valeur pratique indéniable.

En France, les tests ont aussi connu un essor dans le champ professionnel, sous l’impulsion de psychologues comme Henri Piéron et Edouard Toulouse. Une enquête menée par France Travail en 2018 révèle qu’environ 25 % des établissements de plus de 250 salariés ont eu recours à un test de personnalité lors de leur dernier recrutement.

L’usage de tests dans le recrutement a toujours été débattu. Aux Etats-Unis, ce débat est surtout empirique et porte sur leur efficacité prédictive et leur équité. En France, il est essentiellement idéologique. Les tests sont jugés non pertinents, trop rigides, discriminatoires, voire dangereux, mais ces jugements s’appuient rarement sur des données factuelles et probantes.

On ignore souvent que les tests s’appuient sur une discipline scientifique, la psychométrie, qui est enseignée dans les cursus universitaires de psychologie. Les fausses croyances sur les tests prospèrent notamment parce que les spécialistes en psychométrie, certes peu nombreux, font peu de vulgarisation, en particulier sur leur usage dans le recrutement. En l’absence de cette parole experte, le débat est largement occupé par des non-spécialistes – sur LinkedIn notamment – qui, bien souvent, ne savent pas vraiment de quoi ils parlent.

Cet article vise à débunker 10 fausses croyances fréquentes au sujet des tests de personnalité dans le recrutement.

Quelques remarques préliminaires sur les tests

On distingue deux grandes catégories d’outils psychométriques:

Les tests d’efficience évaluent des aptitudes cognitives (par exemple le raisonnement numérique) et sont associés à une notion de performance: chaque question comporte une bonne réponse, et le score reflète un niveau de réussite.

Les tests de personnalité évaluent des composantes non cognitives: traits de personnalité, attitudes, intérêts professionnels ou encore valeurs personnelles. Il n’y a pas ici de bonne ou de mauvaise réponse: ces tests ne mesurent pas une performance, mais des préférences ou tendances individuelles. Les tests de personnalité correspondent souvent à des questionnaires.

Dans la pratique, les tests de personnalité sont très simples à utiliser. La personne évaluée répond à une série d’items (souvent quelques dizaines), à l’aide d’une échelle de réponse – soit dichotomique (Vrai / Faux), soit graduée (par exemple: de “Pas du tout d’accord” à “Tout à fait d’accord” sur une échelle en 5 points). Chaque question contribue à l’évaluation d’un trait de personnalité (ex: Confiance en soi, Sociabilité, Créativité), et le score à chaque trait est obtenu en additionnant les réponses aux items correspondants.

Écran de passation du test PAPI : l’affirmation « Je recherche un changement », suivie d’une échelle de réponse en sept points allant de « Fortement en désaccord » à « Fortement d’accord ».
Un item du test PAPI.

Ces scores sont ensuite situés dans un échantillon de référence, appelé échantillon d’étalonnage, ce qui permet de les interpréter en termes relatifs (score faible, moyen, élevé, etc.). Ce point est essentiel: un test mal étalonné, ou étalonné sur un échantillon inadapté, produit des interprétations faussées (voir les fausses croyances #6 et #7).

Derrière cette simplicité apparente, se cache un travail de recherche et développement conséquent. Un bon test doit:

  • avoir été étalonné sur un échantillon représentatif de la population cible,
  • présenter une erreur de mesure acceptable (fidélité)
  • mesurer ce qu’il prétend mesurer (validité)

Ce travail qui consiste à établir les qualités psychométriques d’un test prend au minimum des mois, souvent plusieurs années.

1. “Les tests mettent les personnes dans des cases”

Pour qui connaît un minimum la psychométrie, cette idée reçue est sans doute la plus agaçante, probablement parce qu’elle est aussi la plus répandue, et souvent énoncée avec assurance par des personnes qui pourtant qui ne maîtrisent pas le sujet (merci l’effet Dunning-Kruger).

On constate avec ironie que ceux qui reprochent aux tests de personnalité de “mettre les gens dans des cases” tombent eux-mêmes dans le même travers: ils mettent ces tests dans une même case. Typiquement, un article ou un post LinkedIn critique sur le sujet citera le MBTI ou le DISC comme s’ils étaient représentatifs des tests de personnalité, ce qui est loin d’être le cas.

Un minimum d’honnêteté intellectuelle consisterait à reconnaître la diversité des tests de personnalité et le fait qu’ils n’ont ni les mêmes usages, ni les mêmes qualités scientifiques. Mais il serait naïf d’attendre cette honnêteté de la part de personnes dont la critique des tests est en réalité idéologique ou dont les investigations consistent en réalité à confirmer leurs croyances personnelles.

En réalité, les tests de personnalité ne forment pas une catégorie homogène. Il faut distinguer deux grandes familles.

Les tests typologiques décrivent la personnalité au travers de catégories prédéfinies appelées types, et permettent à une personne d’identifier son type. Il s’agit par exemple du MBTI (16 types), du DISC ou encore d’Insights Discovery (4 types matérialisés par 4 couleurs).

Ce sont ces tests qui mettent littéralement les gens dans des cases. Leur popularité auprès du grand public alimente l’amalgame entre test de personnalité et test typologique.

Le modèle DISC en quatre quadrants colorés — Dominant, Influent, Consciencieux, Stable — croisant un axe Tâches / Personnes et un axe Extraverti / Introverti. Chaque quadrant est accompagné d’une liste d’adjectifs.
Le modèle du test DISC. Source : Profil4

Les tests dimensionnels décrivent la personnalité à l’aide de dimensions. Par exemple, au lieu de classer une personne comme extravertie ou introvertie, on évalue son niveau sur un continuum Introversion–Extraversion. C’est comme décrire une personne comme “grande” ou “petite” vs indiquer sa taille en cm: la seconde option est bien plus informative.

Les tests dimensionnels s’appuient généralement sur le modèle des Big Five ou OCEAN (Ouverture à l’expérience, Caractère consciencieux, Extraversion, Agréabilité, et Névrosisme). Les résultats prennent souvent la forme d’un radar illustrant les scores à divers traits.

Roue de résultats du PAPI 3 : vingt échelles graduées de 0 à 10, regroupées en sept domaines (Engagement, Impact et détermination, Organisation et structure, Ouverture d’esprit, Relations, Dynamique de travail, Stabilité émotionnelle), reliées par le tracé du profil.
Résultats au test PAPI 3.

Dans un cours de licence en psychométrie, les étudiants apprennent que la validité d’un test est toujours relative à un usage donné. En contexte de recrutement, on cherche à comparer les candidats entre eux.

Comparer des scores sur des dimensions est tout à fait légitime. Si un candidat a un score de 9 en Extraversion et un autre un score de 5, on peut dire que le premier est plus extraverti que le second. Cette information peut éclairer utilement une décision de recrutement.

En revanche, comparer des types est intellectuellement bancal: un profil “Dominant” n’est ni meilleur ni pire qu’un profil “Stable”. Les tests typologiques ne sont pas conçus pour établir des comparaisons entre personnes et sont donc inappropriés pour le recrutement. On peut ainsi lire sur le site officiel du MBTI:

Generally, personality assessments that measure traits are appropriate for selection purposes (measures of psychological type aren’t designed for selection).

Il faut distinguer les tests de personnalité typologiques et dimensionnels. Seuls les premiers “mettent les gens dans des cases”. Dès lors, critiquer les tests de personnalité en les amalgamant avec les tests typologiques est intellectuellement malhonnête. Car les tests dimensionnels sont tout à fait pertinents et défendables dans un processus de recrutement.

2. “Un test réduit une personne à un chiffre”

Cette critique est aux tests dimensionnels ce que “mettre les gens dans des cases” est aux tests typologiques: un procès d’intention qui repose sur une caricature de ce que sont les tests et de leur usage réel.

Elle renvoie notamment à l’argumentaire développé par Stephen Jay Gould dans son célèbre ouvrage La Mal-mesure de l’homme (1981), dans lequel ce dernier remet en question la possibilité de résumer les capacités cognitives humaines à un seul chiffre, comme le font les tests de QI. Le propos de Gould, s’il est historiquement et politiquement pertinent, est souvent détourné pour alimenter une défiance de principe envers toute forme de mesure psychologique.

Cette posture est révélatrice d’un débat idéologique très français autour des tests. Plutôt que d’évaluer leur utilité concrète dans un contexte donné (par exemple, le recrutement), on préfère les disqualifier a priori au nom de principes abstraits.

Revenons donc à des bases plus saines: un test est un outil d’aide à la décision, rien de plus. Il produit un score sur un aspect donné (par exemple, le niveau d’extraversion, ou la capacité de raisonnement logique). Affirmer qu’un test “réduit une personne à un chiffre”, c’est confondre le test avec l’utilisation qu’on en fait.

Les scores d’une personne à un test ne la résument pas. C’est l’utilisateur du test qui peut éventuellement réduire une personne à ses résultats en leur accordant une importance démesurée. L’enjeu n’est pas tant le test lui-même que la qualité de son usage (formation, interprétation, éthique).

3. “Les tests ne sont pas fiables”

Si une personne passait plusieurs fois le même test, il est peu probable qu’elle obtienne à chaque fois le même score. En effet, tout score à un test est affecté par une erreur de mesure aléatoire. On peut la quantifier, ce qui renvoie à la fiabilité – ou fidélité – du test.

La critique “Les tests ne sont pas fiables” concerne les tests typologiques, elle désigne le fait que le type d’une personne peut changer d’une passation à l’autre. Ce phénomène est effectivement documenté dans le cas du MBTI: une étude de 1983, rapportée dans cette synthèse, montre que seules 47 % des personnes avaient conservé leurs 4 lettres en repassant le test 5 semaines après.

Cette instabilité résulte moins de l’erreur de mesure que de la dichotomisation des traits de personnalité, qui sont pourtant des continuums. Ainsi, les personnes qui sont proches du centre de la distribution peuvent basculer d’un côté ou de l’autre et voir leur type changer entre deux passations.

La fiabilité des tests dimensionnels est bien meilleure. Pour le NEO-PI-R par exemple, la corrélation entre les scores à deux passations espacées d’une semaine est supérieure à 0.90 pour chacun des Big Five. Les différences individuelles dans les scores à ce test sont donc très stables dans le temps.

Les tests typologiques sont relativement peu fiables parce qu’ils dichotomisent les traits de personnalité. En revanche, les tests dimensionnels produisent des scores tout à fait fiables.

4. “Les tests ne prédisent pas la performance au travail”

Les premiers tests de personnalité dimensionnels ont été développés à partir des années 1930-40 par des psychologues de renom comme Raymond B. Cattell qui est l’auteur du test 16PF. Depuis, des milliers d’études ont examiné leur capacité à prédire différents comportements: consommation d’alcool, infractions routières, pratique sportive, réussite scolaire, performance professionnelle, etc.

En 1968, le psychologue Walter Mischel avait semé le doute en montrant que les corrélations entre traits de personnalité et comportements plafonnent à 0.30. Cela signifie qu’au mieux, la variabilité des scores à un test de personnalité rend compte de 9 % de la variabilité observée dans les comportements.

C’est certes peu, mais deux remarques s’imposent.

  1. Les comportements humains sont complexes. La réussite scolaire, la performance au travail ou la fréquence de rencontres amoureuses dépendent de nombreux facteurs individuels et contextuels. Que les réponses à quelques questions auto-rapportées puissent expliquer ne serait-ce que 9 % de ce puzzle est en réalité remarquable.

  2. Dans d’autres disciplines, on travaille aussi sur des corrélations faibles ou modérées. Par exemple:

  • Consommation d’alcool pendant la grossesse et taux de naissance prématurée: r = 0.09
  • Prise d’Ibuprofène et réduction de la douleur: r = 0.14

En science, les corrélations >.50 sont rares. Penser qu’on pourrait trouver de telles valeurs dans le recrutement est faire preuve d’une grande naïveté.

La critique sur la valeur prédictive des traits de personnalité concerne aussi la performance professionnelle. Ce sujet a été largement étudié en psychologie du travail. Plus généralement, on recense de nombreuses méta-analyses sur la validité prédictive des différentes méthodes de recrutement. Nous avons réalisé la figure ci-dessous qui montre les résultats d’une synthèse récente de ces méta-analyses:

Graphique en points comparant la validité prédictive de vingt-cinq méthodes de recrutement selon deux méta-analyses, Sackett et al. (2022) et Schmidt & Hunter (1998). L’entretien structuré arrive en tête à 0,42 ; l’ouverture évaluée de manière générale ferme la marche autour de 0,05.
Les valeurs reportées correspondent à la corrélation entre les résultats des candidats à une méthode de recrutement et leur performance professionnelle une fois en poste (qui correspond souvent à l'évaluation par le manager).

Parmi les méthodes d’évaluation, on trouve les Big Five, évalués soit de manière générale (“J’ai une imagination très active”), soit de manière contextualisée (“Je préfère le travail répétitif au travail créatif”). Le trait le plus prédictif est le caractère consciencieux, avec une validité de 0.25 quand il est évalué dans le contexte professionnel. L’extraversion et l’agréabilité sont aussi des prédicteurs non négligeables.

Là encore, les critiques diront que “ces corrélations sont faibles”. Mais on fera remarquer que:

  1. Aucune méthode n’est très prédictive de la performance professionnelle. Même la meilleure (l’entretien structuré) a une validité de 0.42, ce qui signifie qu’elle explique seulement 18 % de la variabilité de la performance professionnelle.

Comment pourrait-il en être autrement? La performance professionnelle d’un salarié dépend d’une multitude de facteurs (qualité de l’intégration, entente avec le manager, relations avec les collègues, etc.) qui sont par définition inconnus au moment du recrutement.

  1. Les recruteurs qui critiquent la faible prédictivité des traits de personnalité utilisent probablement l’entretien non structuré, la méthode de recrutement la plus fréquente. Or l’évaluation des candidats avec ce type d’entretien est moins prédictive que trois traits de personnalité (caractère consciencieux, névrosisme et extraversion).

En clair, les réponses à une dizaine de questions de personnalité prédisent mieux la performance professionnelle que l’évaluation d’un recruteur à l’issue d’un entretien au feeling. Ce constat devrait inviter à un peu plus d’humilité.

Les traits de personnalité sont des prédicteurs modestes mais réels des comportements, y compris la performance professionnelle. Certains traits sont plus prédictifs que des méthodes courantes comme l’entretien non structuré. Ce résultat est établi par des milliers d’études. Affirmer que “les tests ne prédisent rien” est donc intellectuellement malhonnête.

5. “Le retour sur investissement des tests est trop faible”

La valeur ajoutée des tests serait trop faible au regard de leur coût: “Un bon recruteur n’a pas besoin de tests”, “Les tests n’ont pas de valeur ajoutée par rapport à un entretien”.

Cette croyance est symptomatique de la confiance excessive de nombreux recruteurs dans leur capacité à évaluer les candidats par leur intuition lors d’un entretien. Ils sous-estiment ainsi la valeur incrémentale que peuvent apporter des outils psychométriques.

La synthèse sur la validité prédictive des méthodes de recrutement discutée ci-dessus indique la validité de chaque méthode prise isolément. Une étude récente rapporte la validité prédictive de différentes combinaisons de méthodes. Par exemple:

  • Entretien structuré seul = 0.42
  • Entretien structuré + Caractère consciencieux = 0.45
  • Entretien structuré + Caractère consciencieux + Aptitude cognitive générale = 0.51

Ces chiffres montrent un point crucial: les tests de personnalité et d’aptitudes augmentent de façon incrémentale la prédiction de la performance professionnelle par rapport à l’entretien.

On remarque par ailleurs que ces résultats concernent l’entretien structuré, qui est la méthode la plus prédictive. Par rapport à un entretien non structuré seul, la valeur ajoutée des tests est encore plus importante.

Les tests apportent une information incrémentale par rapport à l’entretien. Ils n’ont pas vocation à s’y substituer, mais à le compléter intelligemment.

6. “Les tests sont discriminants”

L’article L. 1132-1 du Code du travail interdit toute discrimination fondée notamment sur l’origine, le sexe, l’âge, l’orientation sexuelle, la religion, etc. Une méthode de recrutement est donc considérée comme discriminatoire si elle produit des écarts systématiques défavorables à un groupe protégé par la loi. Par exemple, un test gamifié d’évaluation des compétences comportementales serait discriminant vis-à-vis du genre s’il produisait, à compétences égales, des scores inférieurs pour les femmes.

Voyons si les tests de personnalité sont discriminants au regard de deux critères majeurs: l’origine ethnique et le genre.

Concernant l’origine ethnique, de nombreuses études aux Etats-Unis ont comparé les scores obtenus à des tests de personnalité (mesurant les Big Five) entre candidats Noirs et candidats Blancs. Ces études, difficilement réalisables en France pour des raisons légales, montrent des écarts moyens faibles, bien moindres que ceux observés pour d’autres méthodes d’évaluation comme les tests d’aptitudes cognitives et les mises en situation.

L’existence de différences de genre en matière de personnalité est un fait scientifiquement établi. Les femmes ont en moyenne des scores supérieurs aux hommes sur les dimensions Névrosisme, Extraversion, Agréabilité et Caractère consciencieux des Big Five.

Un test bien conçu intègre ces différences en proposant un étalonnage différencié par genre, c’est-à-dire que:

  • Le score d’une femme est comparé à celui des autres femmes
  • Le score d’un homme est comparé à celui des autres hommes

Prenons l’exemple de la taille: une femme de 160 cm paraît petite si on la compare à la population générale (hommes et femmes confondus) mais elle est dans la moyenne si on la compare à la population féminine. Les tests de personnalité fonctionnent exactement de cette façon: ils évitent toute discrimination en comparant chaque individu à son groupe de référence.

Les tests de personnalité sont moins discriminants que de nombreuses méthodes fréquemment utilisées dans le recrutement. Ils intègrent notamment les différences de genre dans l’étalonnage.

7. “Les candidats peuvent tricher ou fausser leurs réponses”

L’existence de biais de réponse dans les tests de personnalité est un fait largement documenté. Ce phénomène est inhérent au contexte du recrutement qui incite les candidats à se présenter sous leur meilleur jour. Il n’est donc pas spécifique aux tests et concerne toutes les méthodes d’évaluation.

Un biais de réponse bien connu est la désirabilité sociale: la tendance à choisir les réponses qui véhiculent une image de soi socialement valorisée (être rigoureux, autonome, travailleur, empathique, etc.). Ce phénomène peut être vu comme un biais qu’il faut neutraliser ou un trait de personnalité qu’il faut mesurer. Il existe des échelles qui évaluent ce trait, elles sont soit intégrées dans des outils plus larges (comme le MMPI-2) soit indépendantes comme le DS-36.

On distingue deux méthodes pour neutraliser la désirabilité sociale:

  1. Neutraliser le biais en amont en utilisant des questions à choix forcé: le candidat doit choisir ou classer plusieurs affirmations également désirables. Par exemple:
  • J’apprécie les activités qui stimulent l’esprit.
  • Je fais de mon mieux pour livrer un travail de qualité.
  • Il est important pour moi de bénéficier d’un leadership bienveillant.

En principe, les questions à choix forcé ne produisent pas des scores qui permettent de comparer des personnes entre elles – ce qui est pourtant inhérent au recrutement. Faire cela requiert d’utiliser des méthodes psychométriques complexes, qui demeurent aujourd’hui limitées. C’est pourtant la démarche suivie par de nombreux acteurs du marché de l’assessment.

  1. Neutraliser le biais en aval en utilisant un étalonnage adéquat.

Prenons le trait Caractère consciencieux des Big Five qui désigne l’organisation, la discipline ou encore la rigueur. On imagine aisément que les scores à ce trait sont en moyenne plus élevés dans une situation avec enjeu (ex: le recrutement) que dans une situation sans enjeu (ex: l’accompagnement).

Comme le montre la figure ci-dessous, interpréter le score d’une personne à ce trait requiert d’utiliser un étalonnage adéquat. Par exemple, un score de 42 au caractère consciencieux est:

  • élevé si on le situe dans un groupe de personnes ayant passé le test dans une situation sans enjeu (79e percentile)
  • plutôt faible si on le situe dans un groupe de personnes ayant passé le test dans une situation avec enjeu (34e percentile)
Deux courbes de distribution des scores bruts au caractère consciencieux : l’une pour les passations sans enjeu, l’autre pour les passations avec enjeu, décalée vers la droite. Un score de 42 se situe au 78,8ᵉ percentile sans enjeu et au 34,5ᵉ percentile avec enjeu.

Des tests de personnalité comme le NEO-PI-3 ou le PfPI proposent des étalonnages spécifiques au contexte du recrutement.

Les tests de personnalité peuvent être influencés par des biais de réponse, comme toutes les méthodes d’évaluation. Il existe cependant des solutions éprouvées pour évaluer et neutraliser ces biais. Les bons tests intègrent ces solutions. Si ce n’est pas le cas, le problème vient du test utilisé, pas des tests en général.

8. “Les tests sont mal perçus par les candidats”

La perception des différentes méthodes de recrutement par les candidats a largement été étudiée. Les résultats montrent que les méthodes les mieux perçues sont celles qui:

  • évaluent des compétences directement liées au poste
  • offrent aux candidats la possibilité de les démontrer

Cela plaide pour l’usage de tests contextualisés professionnellement, y compris les tests de personnalité (cf. fausse croyance #4).

La figure ci-dessous montre les résultats d’une étude très récente dans laquelle des salariés devaient évaluer diverses méthodes de recrutement sur une échelle de 1 (très défavorable) à 7 (très favorable).

Diagramme en barres classant dix-sept méthodes d’évaluation selon la façon dont des salariés les perçoivent, sur une échelle de 1 à 7. La mise en situation arrive en tête, l’entretien vidéo différé en dernier ; le test de personnalité, passé par 72 % de l’échantillon, se situe au milieu du classement.

Sur les 72 % des salariés interrogés qui rapportent avoir passé un test de personnalité lors d’un recrutement, on voit que ces tests ne sont ni très appréciés ni rejetés. Ils sont notamment mieux perçus que la prise de références, l’entretien téléphonique, les outils gamifiés, et l’entretien vidéo différé.

On notera par ailleurs que la perception des tests est probablement sous-estimée en raison de l’amalgame – présent à la fois chez les recruteurs et les candidats – entre test de personnalité et test typologique (MBTI, DISC, etc.).

Les tests de personnalité ne sont pas mal perçus par les candidats. Ils sont mieux perçus que certaines méthodes couramment utilisées dans le recrutement. Leur acceptabilité dépend surtout de leur contextualisation et de la manière dont ils sont intégrés dans le processus global.

9. “L’interprétation des résultats à un test est trop compliquée”

Cette critique suggère que le rapport de résultats à un test est trop complexe pour être utile ou réservé à des psychologues, ce qui est faux.

Lorsqu’un test de personnalité est intégré dans le processus de recrutement, le recruteur reçoit un rapport clair et structuré pour chaque candidat, élaboré pour faciliter l’interprétation et l’aide à la décision. Depuis le temps que ces outils sont utilisés dans le recrutement, les éditeurs ont veillé à rendre ces rapports accessibles aux non-psychologues.

Le rapport à un test présente généralement:

  • Les scores bruts et étalonnés (percentiles et/ou classes) aux traits mesurés
  • Une interprétation textuelle pour chaque trait
  • Une synthèse graphique

Un extrait du rapport de résultats au PfPI, présentant les scores bruts et étalonnés aux Big Five:

Extrait d’un rapport de résultats au PfPI : tableau des cinq dimensions du Five Factor Model avec note brute, note étalonnée en onze classes et intervalle de confiance à 90 %, accompagné de la courbe de répartition théorique.

Un extrait du rapport de résultats au NEO-PI-3:

Extrait d’un rapport de résultats au NEO-PI-3 pour l’échelle « Recherche de réussite » : note brute de 21, norme de 53, intervalle de confiance [43 – 63], courbe de distribution situant le score, et paragraphe d’interprétation de l’échelle.

Contrairement aux tests typologiques, les tests dimensionnels produisent des scores continus, ce qui offre aux recruteurs la possibilité d’utiliser des règles objectives, qui favorisent la transparence et l’équité dans l’évaluation des candidats. On peut par exemple pondérer les scores aux traits évalués en fonction de leur importance relative – perçue ou documentée – dans la réussite au poste, les combiner, ou encore établir des seuils minimaux.

Les résultats à un test de personnalité sont conçus pour être compris et utilisés par les recruteurs. Ils visent à faciliter l’interprétation et éclairer utilement la prise de décision.

10. “L’IA rend les tests obsolètes”

Dans de nombreux domaines, l’IA offre la possibilité de développer rapidement des outils innovants qui challengent les outils existants. Dans l’assessment, cette innovation renvoie notamment à la gamification et à l’automatisation de l’évaluation. Les nouveaux outils vont-ils remplacer les bons vieux tests? Pas si vite.

Dans une analyse du marché de l’assessment réalisée en janvier 2025, Laurent Brouat écrivait:

Clairement les éditeurs ont du souci à se faire s’ils n’embrassent pas cette technologie et vite. J’ai vu devant moi, un acteur non spécialisé en évaluation, lancer un test de soft skills personnalisé en quelques semaines et d’excellente qualité. Le tout avec de l’IA. Et à un prix ridiculement bas.

Mais de quelle qualité parle-t-on? Certainement pas de qualité scientifique. Rappelons une nouvelle fois que l’évaluation des personnes est une science, la psychométrie. Ce savoir-faire ne s’improvise pas, et n’est pas remplacé par une interface fluide ou une IA générative.

C’est la limite actuelle des outils d’évaluation innovants: soit nous n’en savons pas suffisamment sur leurs qualités psychométriques, soit ce que nous en savons n’est pas satisfaisant. Par exemple:

Une étude de 2025 rapporte que la performance dans un jeu évaluant des aptitudes cognitives corrèle avec la réussite scolaire mais pas avec l’évaluation professionnelle par le manager. Cette performance corrèle par ailleurs avec la pratique des jeux vidéo, ce qui questionne l’équité des outils gamifiés.

Une étude de 2024 menée sur des dizaines de milliers de candidats aux Etats-Unis montre que la validité prédictive d’entretiens structurés différés scorés par l’IA est de 0.24, bien inférieure à celle des entretiens structurés classiques (cf. fausse croyance #4).

L’essor de l’IA polarise aujourd’hui le marché de l’assessment:

  • D’un côté, les éditeurs historiques proposent des tests vieillissants mais dont les qualités psychométriques sont éprouvées.
  • De l’autre, de nouveaux acteurs proposent des outils qui maximisent l’UX, la rapidité et le coût, mais dont la qualité scientifique est souvent faible ou non documentée.

Cette tension révèle un malentendu fondamental sur la finalité de l’évaluation: évaluer un candidat n’est pas (seulement) lui offrir une bonne expérience utilisateur, c’est aussi et surtout prédire sa réussite professionnelle de manière fiable et équitable pour réduire le risque d’erreur.

Si l’IA permet de concevoir rapidement de nouveaux outils d’assessment, leur validité reste à démontrer. Croire que quelques prompts peuvent remplacer des décennies de recherche est une illusion qui trahit une vision simpliste de l’évaluation.

Conclusion

Aucune méthode de recrutement n’est parfaite, mais certaines sont utiles. En répondant point par point à dix fausses croyances fréquentes, cet article montre que les tests de personnalité, lorsqu’ils sont bien conçus et bien utilisés, restent aujourd’hui des outils à la fois utiles, efficaces et équitables.

Parler méthode avec l'équipe

Trente minutes pour comprendre comment vous évaluez aujourd'hui, et vous montrer ce que la structuration change sur un de vos métiers.