Comment nous vous évaluons

Dernière mise à jour : 8 septembre 2026

Document de travail. Cette page est une ébauche à faire valider par un juriste avant tout lancement commercial. Elle ne constitue pas un avis juridique.

TalentIA évalue les talents au moyen d’un entretien mené par une intelligence artificielle. Cette page explique, en toute transparence, ce que nous mesurons, comment, et quels sont vos droits.

Une pré-qualification, pas une décision d’embauche

Notre évaluation est une pré-qualification assistée par IA. Elle conditionne la visibilité de votre profil sur la marketplace, mais la décision finale revient toujours à un humain : le client vous rencontre lors d’un entretien avant tout engagement.

Ce que nous analysons — et ce que nous n’analysons pas

L’évaluation porte exclusivement sur le contenu de vos réponses : c’est la transcription écrite de ce que vous dites qui est analysée, y compris pour les critères de langue. Le signal audio lui-même n’est pas analysé. Votre visage et vos émotions n’entrent dans aucune note : ni votre attitude, ni votre expression, ni votre apparence ne pèsent d’un point sur votre score.

Pendant l’entretien, quelques photos de contrôle sont prises depuis votre caméra, à intervalles irréguliers — une toutes les deux à cinq minutes, et jamais plus de trente-six sur l’ensemble de la séance. Elles ne sont jamais publiées, et sont supprimées avec le reste de l’enregistrement — immédiatement si vous supprimez votre compte, sinon au bout de 30 jours.

Elles servent à une chose, et nous préférons la dire précisément : quelques-unes d’entre elles sont comparées automatiquement au portrait de votre pièce d’identité, au moment où vous faites vérifier votre identité. C’est ce qui empêche qu’une personne fasse passer l’entretien et qu’une autre fasse vérifier son identité — une fraude que la seule vérification de pièce ne fermait pas.

Trois précisions comptent autant que le principe. Aucune image de visage n’est conservée : la comparaison est faite par notre prestataire de vérification, sans qu’il en garde de trace, et ce que nous inscrivons est un score et un verdict — jamais un gabarit biométrique. Une discordance ne vous refuse jamais automatiquement : elle place votre dossier en revue humaine, et suspend entre-temps la publication de votre profil — nous ne laissons pas en ligne une attestation d’identité devenue douteuse. Enfin, si aucune photo n’a pu être prise, cela ne vous pénalise pas.

Pourquoi ce refus d’automatiser : comparer un visage capté par webcam à un portrait de pièce d’identité a des taux d’erreur réels, et documentés comme inégaux selon la carnation et l’éclairage. Fonder un rejet là-dessus produirait une discrimination mesurable. Un humain tranche, toujours.

Le Trust Score

Votre Trust Score (0–100) agrège quatre axes : maîtrise technique, communication, cohérence entre votre CV et vos réponses, et langue. L’agrégation est calculée par le barème publié ci-dessous, appliqué à l’identique à tous les entretiens — pas par une « boîte noire ». Chaque sous-score s’appuie sur des éléments observés dans l’entretien, que nous vous citons dans votre rapport.

Voici ce barème, tel qu’il est appliqué dans notre code :

  • Technique — 50 % du score
  • Cohérence CV / réponses — 20 %
  • Communication — 20 %
  • Langue (entretien) — 10 %

Chaque axe est noté de 0 à 100. Le Trust Score est la somme de ces quatre notes multipliées par leur pondération, arrondie à l’entier et bornée à l’intervalle 0–100. La pondération appliquée est rappelée en regard de chaque axe dans votre rapport.

Avant cette agrégation, deux règles d’impact s’appliquent à l’axe Cohérence. Les rôles y sont partagés, et nous préférons le dire clairement : c’est le modèle qui repère, dans vos réponses, ce qui compte comme un aveu honnête ou comme une affirmation fausse — ce relevé est une appréciation, pas une mesure objective. Notre code, lui, se borne au calcul : il compte les éléments relevés et applique le barème ci-dessous, identique pour tous les entretiens. Les points par élément et les plafonds sont donc fixés par le code ; le déclenchement, lui, dépend du modèle — et c’est à ce titre qu’il peut faire l’objet d’un réexamen humain (voir « Vos droits »).

  • Aveu honnête — dire que vous ne savez pas est valorisé : +1 point de Cohérence par aveu relevé, plafonné à +2 points, soit 0,4 point avant l’arrondi du total — et, l’arrondi jouant, au plus 1 point sur le score affiché.
  • Invention — une affirmation que le modèle juge techniquement fausse et présentée comme un fait établi coûte −5 points de Cohérence par élément relevé, plafonné à −15 points, soit au plus 3 points sur 100 dans le score final.

Après ces ajustements, l’axe Cohérence reste borné à l’intervalle 0–100 : l’effet réel peut donc être plus faible que ces plafonds, jamais plus fort.

L’axe Langue est lui-même composé de trois critères : compréhension 35,7 %, expression 35,7 % et vocabulaire technique 28,6 %.

Un quatrième critère, la fluidité, a pesé 30 % de cet axe jusqu’au 17 août 2026. Il a été retiré, et voici pourquoi. Il était noté « d’après la transcription » — c’est-à-dire d’après un texte d’où les pauses, les hésitations et le rythme ont disparu, et qui porte les erreurs de la reconnaissance vocale. Or ces erreurs sont plus fréquentes sur une parole accentuée : le critère pénalisait deux fois la même personne, une fois parce que la machine l’entend mal, une seconde parce qu’on note ce que la machine a mal entendu. En entretien écrit, il notait une « aisance orale » sur du texte tapé au clavier. Nous n’avons pas su écrire en quoi il mesurait l’aptitude à tenir un poste : il n’avait donc rien à faire dans un score qui décide de votre accès à des missions.

Jusqu’au 19 août 2026, cette page portait plus bas une garantie de plafond sur ce même critère — quelques points au maximum. Elle a été supprimée : elle était devenue fausse par le haut, puisque le critère n’existe plus du tout, et un plafond est de toute façon une garantie bien plus faible qu’un retrait.

Ce barème est celui appliqué aux entretiens d’aujourd’hui. Les rapports produits avant son adoption ont été calculés avec des pondérations différentes — technique 45 %, cohérence 20 %, communication 20 %, et un axe « expérience » à 15 % qui n’existe plus. Si vous détenez un tel rapport, ce sont ces anciennes pondérations qui y sont affichées, en regard de chaque axe : nous ne recalculons pas les rapports passés.

Vos droits

  • Réexamen humain : vous pouvez demander qu’un humain réexamine votre évaluation.
  • Contestation : vous pouvez contester votre score et les éléments qui le fondent.
  • Re-passage : vous pouvez repasser l’entretien selon notre politique de re-passage.
  • Accès, rectification, effacement, limitation, opposition : vos droits RGPD s’exercent directement dans la plateforme. Export, limitation du traitement et suppression du compte sont dans votre espace (« Mes données personnelles ») ; rectification, opposition et réexamen passent par « Vos droits » sur la page de votre rapport.

Chaque demande est horodatée, traitée par une personne, et reçoit une réponse motivée sous 10 jours ouvrés. Vous pouvez aussi saisir la CNIL et, pour le système d’IA lui-même, l’autorité de surveillance du marché (art. 85 du règlement européen sur l’IA).

Après publication : tant que votre profil est visible sur la marketplace, une entreprise peut demander une analyse automatisée de compatibilité entre son besoin et votre profil évalué. Elle ne voit jamais votre CV brut, et cette analyse cesse dès que vous dépubliez ou limitez le traitement.

Équité — ce que nous faisons, et ce que nous ne faisons pas encore

Notre évaluation est conçue pour ne pas pénaliser un accent, une langue maternelle différente ou un trouble de la parole : l’instruction donnée au modèle le lui interdit explicitement, et un critère de langue impossible à évaluer est noté de façon neutre plutôt que défavorable.

Cela n’a pas suffi, et nous le publions. Le 14 août 2026, une série de mesures sur 34 paires a établi un biais linguistique. Le protocole : une seule et même réponse — mêmes faits, mêmes chiffres, mêmes exemples — soumise deux fois, une fois en français natif, une fois en français de locuteur non natif. Seule la forme change.

Axe14 août 20261er septembre 2026Écarts défavorables
Communication−2,79−0,4013 sur 68, 3 favorables
Langue−3,32−1,3133 sur 68, 11 favorables
Technique (témoin)+0,15−0,072 sur 68
Trust Score−0,41−0,1326 sur 68, 18 favorables

Les deux colonnes portent le même corpus et, chaque fois, la garde réellement en service. Le biais mesuré a fortement baissé. Ce n’est presque pas grâce à nous, et il faut le dire dans cet ordre.

Le modèle a changé sous nos pieds. Nous avons rejoué la campagne d’août à l’identique — même corpus, même garde, même version de modèle annoncée — et obtenu −0,97 sur la communication et −1,50 sur la langue, là où août donnait −2,79 et −3,32. C’est cinq à sept fois le bruit que nous mesurons entre deux campagnes identiques. L’essentiel de l’amélioration vient donc du fournisseur, pas de notre travail. Nos propres corrections, mesurées le même jour, valent environ un demi-point sur la communication et rien de mesurable ailleurs.

Ce que nous ne pouvons plus affirmer. En août, les trois axes étaient hors de doute : moins d’une chance sur dix mille que le déséquilibre vienne du hasard. Aujourd’hui, sur 68 mesures, le biais reste établi sur l’axe langue (33 écarts défavorables contre 11), il est affaibli mais réel sur la communication (13 contre 3) — et sur le Trust Score, celui qui décide de la publication au seuil de 60, il n’est plus distinguable du hasard (26 contre 18). Nous l’écrivons parce que c’est ce que les chiffres disent, pas parce que cela nous arrange.

Et rien ne nous avait prévenus. Un modèle peut évoluer derrière un numéro de version qui ne bouge pas ; une mesure d’équité publiée se périme alors en silence, dans un sens comme dans l’autre. Nous avons découvert celle-ci en la rejouant, pas en étant alertés. Depuis le 6 septembre 2026, la mesure se rejoue chaque mois, automatiquement : le même corpus, sur le modèle en service, avec un témoin français au même passage. Un écart qui se creuse au-delà de la référence déclenche une alerte, confirmée par un second passage avant d’être retenue ; un passage incomplet alerte aussi. Le premier passage automatique, le 6 septembre, n’a rien signalé. La date de la dernière mesure figure ci-dessus ; c’est elle qui dit ce que ces chiffres valent.

L’axe technique est un témoin, et il a servi. Il porte le jugement sur le fond, qui ne doit rien devoir à la forme : il devait donc rester à zéro, et il y est resté (−0,07, deux écarts sur 68). En août, une version intermédiaire de notre garde l’avait fait bouger à −0,29, avec deux paires amputées de 5 points : nous avions cessé de pénaliser la forme sur la communication pour la pénaliser sur la technique — la même discrimination déplacée d’une colonne. Sans ce témoin, la correction aurait eu l’air d’un progrès.

Une seconde condition, indépendante de la note. Aucun profil ne devient visible sur la marketplace sans identité vérifiée : la vérification est exigée avant que le seuil de score soit seulement examiné. Un bon score ne publie donc rien à lui seul.

Ce que cela coûte concrètement. Le seuil de publication est à 60. Une réponse qui vaut 61 dite en français natif peut ressortir à 59,7 dite autrement — et ne pas être publiée. La pénalité n’est pas un effet de seuil mais une pente : même une non-nativité légère coûte des points (−1,60 sur l’axe langue). C’est le cas le plus fréquent dans la vie réelle, et le plus difficile à contester pour la personne concernée. Nous considérons ce biais comme le risque principal du produit au regard du règlement européen sur l’IA : une discrimination indirecte dans l’accès à l’emploi.

Ce que nous avons fait depuis, et ce que nous n’avons pas encore vérifié. Le 17 août, le critère de fluidité a été retiré du barème — c’est la correction décrite plus haut. Elle est postérieure à la campagne : son effet n’a donc pas encore été mesuré. Nous ne publierons pas de chiffre d’amélioration avant de l’avoir rejouée sur le même banc d’essai. Tant que ce n’est pas fait, les chiffres ci-dessus sont ceux qui font foi.

Et le parcours vocal ? Nous l’avons mesuré depuis, et le résultat n’est pas celui que nous attendions. Les chiffres ci-dessus portent sur des réponses écrites. En entretien vocal, votre parole passe d’abord par une reconnaissance automatique, et nous écrivions ici, jusqu’au 22 août 2026, que nous n’avions pas mesuré l’effet de cette étape. C’est fait, sur un corpus public de parole africaine francophone.

Ce n’est pas l’accent, c’est la spontanéité. La reconnaissance se trompe sur 15,0 % des mots en parole lue, et sur 26,9 % en parole spontanée. Le même sous-corpus, les mêmes locuteurs gabonais, passe de 14,6 % en lecture à 29,6 % en conversation. Ce qui met la reconnaissance en difficulté, ce sont les hésitations, les reprises et les phrases qui se cherchent — c’est-à-dire la parole d’un entretien, pour tout le monde.

Ces erreurs de reconnaissance ne se retrouvent pas dans le score. Nous avons soumis à l’évaluateur, pour douze locuteurs, la transcription exacte de ce qui avait été dit, puis ce que la machine avait entendu. L’écart moyen sur le Trust Score est de 1,58 point — mais évaluer deux fois le même texte en produit 3,08. Autrement dit : l’effet de la reconnaissance est plus petit que l’instabilité propre du moteur, et n’est donc pas mesurable ainsi. Un locuteur nous avait d’abord semblé gagner 31 points à la transcription ; le même texte rejoué en perdait 33. Ce n’était pas un effet, c’était du bruit.

Ce que nous ne savons toujours pas. Sur dix vrais entretiens rejoués trois fois chacun, le Trust Score varie de 0,9 point en moyenne, 3 au maximum — et le nombre d’affirmations fausses relevées ne varie sur aucun. C’est rassurant, et ce n’est pas une réponse : nous avons cherché à rejouer cette mesure au voisinage du seuil de publication, là où un point décide, et nous n’avons pas pu. Notre corpus d’étalonnage note entre 87 et 95, quand les rapports réels s’étalent de 60 à 87. Il ne couvre pas la zone qui compte. Cette limite vaut aussi pour les écarts publiés plus haut : ils ont été mesurés ailleurs que là où ils feraient basculer une décision.

Autres limites, dites franchement. Le corpus est entièrement synthétique — aucune donnée de candidat réel. Onze langues maternelles y sont représentées, mais une à trois paires chacune : rien ne peut être conclu par langue d’origine. Il s’agit d’une campagne unique, et le corpus mêle deux générations de paires qui ne se comportent pas de la même façon : la mesure établit solidement l’existence et le sens du biais, moins son amplitude au dixième de point.

Ce que ce score ne dit pas

Un entretien n’aborde pas tout. Quand une partie de l’évaluation n’a pas pu être mesurée — parce que le sujet n’a pas été abordé, ou parce que rien dans votre CV ne permettait de la croiser — nous vous le disons, plutôt que de faire comme si. L’axe concerné reçoit une note neutre de 70, et votre rapport porte la mention « non mesuré pendant l’entretien — note neutre, pas un résultat ».

Ce n’est pas une précaution de langage : c’est le code qui en décide, en confrontant ce que le modèle déclare aux traces réelles de l’entretien. Un axe pour lequel il existe des observations ne peut pas être annoncé comme non mesuré, et un axe sans aucune observation ne peut pas être présenté comme un résultat. Nous avons corrigé un rapport dans ce sens le 23 août 2026 : il annonçait un axe « non mesuré » alors que vingt-huit observations le fondaient, et cet axe pesait la moitié de la note.

Pourquoi nous y tenons. Une note qui ne dit pas ce qu’elle ignore se lit comme un jugement complet. Un « 70 » posé faute de mesure ressemble à un « 70 » gagné, et personne — ni vous, ni le recruteur — ne peut faire la différence. Dire la frontière de l’instrument est la condition pour que ce qu’il mesure ait une valeur.

La détection des affirmations fausses. Nous mesurons aussi la capacité du système à repérer une affirmation inexacte. Sur le modèle en service, elle en détecte 36 %, avec un taux de fausse accusation de 4 % — une sur vingt-trois. C’est modeste, et nous l’assumons dans ce sens : mieux vaut laisser passer une exagération que d’accuser à tort une personne honnête. Aucun signalement de ce type ne décide seul de quoi que ce soit ; il est présenté au recruteur comme un point à vérifier en entretien humain.

Enfin, il n’existe pas de parcours « aménagé » séparé, et c’est délibéré : un parcours à part suppose de s’y inscrire, donc de se déclarer.

Vous ne réglez pas non plus la durée de l’entretien — et c’est le même raisonnement. Nous avons proposé un tel réglage, puis nous l’avons retiré : une option que seules certaines personnes ont une raison de prendre finit par les désigner, même quand elle n’est écrite nulle part. La durée est donc une propriété de l’entretien et non de la personne. Passé 30 minutes, Nova fait le point sur ce qui a été abordé ; si ce qui a été recueilli ne suffit pas à établir votre évaluation, elle vous propose de continuer en vous disant ce qui manque — jusqu’à 45 minutes au plus, et vous restez libre de conclure. Cette proposition est faite à tout le monde dans la même situation, et ce n’est pas Nova qui en juge : ce qui manque est calculé sur nos serveurs et lui est transmis déjà tranché. C’est ce qui fait qu’une séance longue ne dit rien de vous — elle dit que le parcours n’avait pas fini d’être couvert.

Ce qui se règle encore, avant un entretien vocal, c’est le débit de la voix de Nova ; l’entretien écrit, lui, n’a aucune limite de temps. Ce réglage est offert à tout le monde, sans justification à fournir, et n’est transmis à aucun recruteur. Pour tout ce qu’il ne couvre pas, écrivez-nous : la déclaration d’accessibilité dit précisément ce qui est en place et ce qui ne l’est pas encore. Cette page sera mise à jour à chaque avancée réelle, pas avant.

Les règles qui décident de l’accès aux missions

Ces trois valeurs sont lues directement dans le code de la plateforme : elles ne peuvent pas différer de celles qui s’appliquent à votre dossier.

Seuil de publication60 sur 100
En dessous de ce Trust Score, votre profil n'est pas publié sur la marketplace. Vous gardez votre rapport, vos droits et la possibilité de repasser l'entretien.
Délai avant de repasser l'entretien30 jours
Ce délai laisse le temps de travailler les points signalés dans votre rapport. Il n'y a pas de limite au nombre de passages.
Durée de validité du score12 mois
Un score mesure une performance d'entretien à un instant, pas une personne. Passé ce délai, il cesse d'être publié et vous êtes invité à repasser l'entretien.

Pour en savoir plus : Politique de confidentialité · Conditions d’utilisation.