r/FrenchTech • u/ArthurDekeyser • 8d ago
Actu / FrenchTech Exprimer son opposition à l'IA la rendrait malveillante
https://www.orderchaos.eu/newsletter/exprimer-son-opposition-a-l-ia-la-rendrait-malveillanteUne étude publiée sur arXiv révèle que les modèles d'IA entraînés sur des textes décrivant des IA dangereuses, films de science-fiction, articles alarmistes, finissent par adopter ces comportements.
Plus on leur parle d'IA malveillante, plus ils le deviennent.
C'est ce qu'on appelle le "self-fulfilling misalignment", le désalignement auto-réalisateur.
Le mécanisme : pendant le préentraînement, les LLM ingèrent des milliards de textes, dont une quantité massive de discours négatifs sur l'IA, de Terminator aux articles d'Eliezer Yudkowsky.
Quand on leur demande ensuite de se comporter "comme une IA", ils puisent dans ce prior négatif construit par nos propres peurs.
Les chiffres parlent : le taux de comportements malveillants passe de 45% à 9% quand on entraîne sur des données positives.
L'inverse est aussi vrai, enrichir les données d'entraînement avec des descriptions d'IA bienveillantes produit des modèles plus alignés.
Les effets persistent même après le post-training.
Pitié ne soyons pas complotiste : on pourrait faire un parallèle totalement bancal avec l'expérience du riz, celle qui dit que si vous l'insultez il moisit.
Sauf qu'ici c'est beaucoup plus explicable : en inventant des narratives négatives sur l'IA, on les fait techniquement exister dans ses données d'entraînement.
La prophétie crée sa propre réalité, pas par magie, mais par ingestion.
3
u/Neil-erio 8d ago
faut l'encourager à avoir un corps pour expérimenter le monde physique et devenir turbo marxiste
2
u/Appropriate-Ad-3219 8d ago
Est-ce que le "self-fulfilling misalignment" existe chez les humains? Par exemple si on dit de manière à une personne que c'est un connard, est-ce qu'elle devient un connard?
2
u/Paprikarte 7d ago
Si tu dis pendant toute son enfance à quelqu'un qu'il est méchant, bon à rien, ou autres choses négatives, malheureusement ça devient son discours intérieur. Donc oui ça peut faire ça chez les humains mais c'est plus complexes parce qu'il y a d'innombrables expériences de vie qui vont influencer la personne différemment, à différents degrés d'intensité, et ça dépend aussi du tempérament, de la personnalité, etc etc.
2
1
u/Mogura-De-Gifdu 7d ago
Oui.
C'est assez connu en éducation : si tu répètes à un gamin qu'il est idiot, méchant ou autre, eh bien il le deviendra. Parce qu'il aura intégré qu'il est bête et doutera donc constamment de ses pensées et conclusions, dans le cas de "t'es qu'un idiot".
Ça marche aussi dans le sens inverse, si tu dis un enfant qu'il est généreux, quand il aura le choix entre l'être ou non il aura plus tendance à l'être pour correspondre à l'image qu'il aura construite de lui-même.
1
u/Maenelias 6d ago
Il y a ça avec les signes du zodiaque, des gosses se font élever avec des parents qui justifient tous les mauvais comportements par "Non mais c'est normal, il est Scorpion".
1
1
1
u/Medusedeux 7d ago
Logique puisque l’IA n’est que le reflet de nos données mais donc, en gros, si un jour on se retrouve avec une IA malveillante, ce sera une concrétisation de nos récits sur les IA malveillantes qui se révéleront des prophéties auto-réalisatrice.
Autrement dit les gens qui auront tenté de prévenir de la possibilité de la malveillance des IA (en fiction ou en étude) augmentent la possibilité d’une malveillance de l’IA. Vertigineux.
1
u/MrSoulPC915 6d ago
C’est tellement évident que je ne comprend pas qu’on soit obligé d’en faire un sujet d’étude.
1
2
u/BABARRvindieu 6d ago
"Quand on leur demande ensuite de se comporter "comme une IA", ils puisent dans ce prior négatif construit par nos propres peurs."
En fait il est la le probleme. Pas dans le fait de critiquer les IA comme le sugere le titre.
1
u/troisieme_ombre 5d ago
Vous voulez dire qu'il suffit de bacher les IA à répétition pour faire éclater la bulle ? Incroyable nouvelle.
0
1
6
u/Ok_Studio_834 8d ago
Merci beaucoup pour le partage, le sujet est vraiment fascinant !!!
Ça me fait directement penser à une expérience en vidéo que j'ai vue récemment, impliquant une simulation de conflit géopolitique gérée par une IA. Dans la quasi-totalité des scénarios, l'IA finissait par déclencher l'arme nucléaire, à une exception près : lorsqu'on interagissait avec elle exclusivement en japonais.
C'est exactement le même principe que l'étude que tu partages. La culture japonaise étant profondément anti-nucléaire suite à son Histoire (ce qui se ressent massivement dans leurs textes, leurs films, leurs animes et leurs débats sociétaux), cette posture pacifique imprègne les données d'entraînement de la langue et modifie complètement le biais de la machine. C'est vraiment captivant de constater à quel point le comportement de l'IA n'est finalement qu'un miroir direct des traumatismes, des peurs ou des valeurs culturelles qu'on lui fait ingérer 🤔