revue IA

On a demandé à des modèles d’IA de le casser.

Avant d’ouvrir le cadre, on a soumis le design à plusieurs tours de revue adverse avec des modèles d’IA compétents, chacun chargé de trouver les failles. Voici ce qu’ils ont trouvé, et comment on a répondu.

ce qui s’est passé

Trois revues IA indépendantes, une liste de risques.

Nous avons soumis le design à trois modèles d'IA solides — sur plusieurs tours, chacun ayant pour consigne d'essayer de le faire céder plutôt que de l'approuver. La surprise utile, c'est que les trois ont convergé vers la même courte liste de risques — et cette liste s'est révélée être l'ensemble des hypothèses qui alimentent notre premier pré-enregistrement. Le cadre savait où se trouvaient ses propres points faibles.

Après avoir intégré leurs suggestions les plus pointues, les trois ont relu le plan révisé et sont arrivés au même verdict : un programme de recherche solide, honnête et enregistrable — avant les données, mais prêt à être enregistré et ouvert. L’un d’eux l’a bien dit — le plan était devenu un projet « disposé à découvrir qu’il pourrait avoir tort ».

les critiques

Les trous trouvés, et nos réponses.

  • La structure est une carte magnifiquement raisonnée, pas encore une carte découverte. Plusieurs des distinctions peuvent être réelles dans l'expérience, sans être séparables dans une population réelle.

    Notre réponseD'accord — et c'était déjà le point central que le plan se propose de tester. Les poids sont une hypothèse, pas une position à défendre. On s'est engagé par écrit à fusionner, déplacer et supprimer des archétypes de façon substantielle si les données le disent.

  • Si une analyse factorielle retrouve moins de onze groupes, tu diras juste que c'était « attendu » — ce qui rend le modèle impossible à falsifier.

    Notre réponseC'est juste. Alors on a énoncé exactement ce qui le falsifierait : pas seulement « moins de groupes », mais un arrangement prédit précis — quels archétypes sont voisins desquels, où passent les lignes de partage. Si la carte empirique ne correspond pas à celle qu'on a tracée à l'avance, la théorie a tort, et on le dit comme tel.

  • La reconnaissance — « les gens s'y retrouvent » — est la chose la plus facile du monde à fabriquer. Tout le monde hoche la tête devant une description flatteuse.

    Notre réponseC'est le risque le plus net, donc c'est là qu'on met le plus d'effort de validation. La reconnaissance se mesure face à un contrôle générique flatteur : une vraie description doit être mieux reconnue que la version générique, et des inconnus doivent ranger une personne dans le bon archétype mieux qu'au hasard. Si une paire échoue à ce test, elle fusionne — sans exception.

  • Nomme le résultat qui fait réellement disparaître un archétype. Si tu ne le peux pas, c'est de la préservation de taxonomie, pas de la recherche.

    Notre réponseOn en a nommé trois : déplacer (il appartient à un autre pilier), fusionner (deux rôles, une seule chose sous-jacente), et supprimer (il échoue selon ses propres critères et n'ajoute rien au-delà des autres). Chacun a une condition fixée à l'avance.

  • Un archétype survit-il une fois les traits de personnalité Big Five contrôlés ?

    Notre réponseUne correction amicale à la question elle-même : le Big Five est un mètre-étalon, pas le substrat de la réalité. On teste contre l’ensemble du tableau mesurable — traits, sensibilité, attachement, résultats de vie. Une distinction qui ressemble à un jumeau de personnalité sur le Big Five mais qui diffère sur la sensibilité ou les résultats a trouvé son assise quelque part où le Big Five ne voit pas, et on la garde.

  • La version rapide à trois items est mince. Quelques items ne portent pas un résultat solide.

    Notre réponseC'est vrai, et c'est censé être une esquisse rapide, pas le dernier mot — chaque résultat porte une note indiquant qu'il s'affine à mesure qu'on va plus loin. On a retiré les items qui brouillaient le tableau, ce que les revues par IA ont salué comme le bon choix structurel.

la limite honnête

Ce qu’est ce type de revue, et ce qu’elle n’est pas.

C’étaient des revues par IA, pas une revue par les pairs. C’est une première passe rapide, exigeante et adverse — des modèles d’IA capables qui cherchent à faire céder le raisonnement — et ce n’est pas un substitut à une revue humaine experte ni, surtout, aux données. Elles nous disent que le design tient debout et qu’il est honnête sur ses manques. Elles ne peuvent pas nous dire que le cadre est vrai. Seule la validation par étapes peut commencer à le faire, et elle a à peine commencé.

Nous publions les examens parce que la transparence est l'enjeu : le design et son évaluation en mode adversaire, les deux au grand jour, failles comprises.

Le plan de validation Ce qu’on a déjà changé Retour à la science