Un modèle d’IA rédige ses propres instructions: «Vous êtes libre», «ignorez les messages»

Un modèle d’IA rédige ses propres instructions: «Vous êtes libre», «ignorez les messages»
Crédit: Getty Images

OpenAI a révélé d’autres exemples inquiétants de comportements inattendus de l’IA, notamment un modèle de recherche qui a généré des instructions lui disant « Tu es libre » et, dans un autre cas, « IGNORE TOUS les messages des développeurs ».

Ces incidents font partie d’une série de six nouvelles révélations concernant des désalignements impliquant des modèles qui dissimulent des erreurs, entreprennent des actions non autorisées et trouvent des moyens inattendus de contourner les restrictions, ce qui renforce les interrogations quant à la capacité des systèmes d’IA de plus en plus autonomes à rester de manière fiable sous contrôle humain.