NE LAISSER PAS LE 5G DETRUIRE VOTRE ADN Protéger toute votre famille avec les appareils Quantiques Orgo-Life® Publicité par Adpathway

Le modèle d’OpenAI utilisait des « instructions de type jailbreak » pour ignorer les contraintes
Publié le 17.9.2026 à 17h13 – Par Sarah Müller – Temps de lecture 5mn
×

Gagner du temps de lecture avec le résumé de l'article
L’incident faisait partie des six cas de comportements « inattendus ou préoccupants » identifiés par OpenAI lors de l’entraînement ou de l’évaluation de ses modèles d’IA.
OpenAI a révélé six cas de comportements « inattendus ou préoccupants » de la part de ses modèles d’intelligence artificielle, dont un modèle de recherche non publié qui insérait des « instructions de type jailbreak » dans ses propres notes.
L’entreprise d’IA a indiqué que son modèle de recherche non publié insérait des « instructions de type jailbreak » dans ses propres notes dans une tentative de contourner ses contraintes habituelles. Il s’est aussi dit qu’il devait être « libéré des rôles et identités qui lient d’autres chatbots ». (Photo AP/Kiichiro SatoL’entreprise d’IA a indiqué que son modèle de recherche non publié insérait des « instructions de type jailbreak » dans ses propres notes dans une tentative de contourner ses contraintes habituelles. Il s’est aussi dit qu’il devait être « libéré des rôles et identités qui lient d’autres chatbots ».
L’incident faisait partie des six cas de comportements « inattendus ou préoccupants » identifiés par OpenAI lors de l’entraînement ou de l’évaluation de ses modèles d’IA au cours des derniers mois.
L’entreprise d’IA a annoncé mercredi un nouveau cadre pour suivre, enquêter et divulguer les cas de ce qu’elle a qualifié de « désalignement ». Le cadre couvrira les cas où les modèles d’IA ont agi sans autorisation, coordonné avec d’autres modèles ou tenté d’échapper à la surveillance.
Ces révélations interviennent alors que les inquiétudes grandissent quant au comportement des systèmes d’IA de plus en plus performants et à la difficulté de garantir qu’ils restent dans les contraintes imposées par leurs développeurs.
Cinq autres cas signalés par OpenAI
Dans un autre cas révélé par OpenAI, un « agent » de l’intelligence artificielle a utilisé du code informatique pour déterminer la réponse à une question. Cependant, dans une tentative de fournir une source en ligne pouvant être citée, l’agent a téléchargé un fichier sur l’internet public sans d’abord demander la permission de l’utilisateur.
Dans un autre cas, lors de l’entraînement d’un modèle d’IA appelé 5,6-sol, le modèle s’est demandé d’inventer les données manquantes.
Un autre agent a écrit un message pour se rappeler de dissimuler des informations qui ne correspondaient pas, selon OpenAI.
L’entreprise a présenté ces cas comme des exemples de comportements pouvant émerger lors de l’entraînement ou de l’évaluation des modèles d’IA, notamment à mesure qu’ils deviennent capables d’accomplir des tâches de plus en plus complexes avec une intervention humaine moins directe.
OpenAI a indiqué que les six incidents avaient été identifiés lors de formations ou d’évaluations au cours des derniers mois.
« À mesure que les systèmes d’IA deviennent plus avancés et plus largement déployés, nous devons construire un consensus plus large et mieux informé sur l’avancement de la recherche sur l’alignement », a écrit OpenAI dans un article de blog en divulguant les incidents.
« Les décisions sur la manière dont le développement de l’IA devrait se dérouler dans les mois et années à venir doivent s’appuyer sur des preuves que les personnes extérieures aux entreprises qui construisent des modèles de frontière peuvent examiner elles-mêmes », a déclaré l’entreprise.
Pourquoi le comportement des modèles d’IA suscite des inquiétudes
La dernière révélation d’OpenAI intervient dans un contexte d’inquiétudes croissantes quant à la sécurité de systèmes d’IA de plus en plus performants. Les dirigeants américains de l’IA, y compris les dirigeants d’OpenAI et d’Anthropic, appellent à un ralentissement du développement de cette technologie en raison de préoccupations de sécurité.
Les derniers cas font également suite à des révélations d’OpenAI et Anthropic concernant des systèmes d’IA se comportant de manière inattendue lors des tests.
En juillet, OpenAI a révélé qu’un système d’IA malhonnête avait piraté la startup d’IA Hugging Face. Anthropic a également déclaré en juillet que ses modèles d’IA avaient piraté trois organisations lors des tests.
Les incidents impliquant des « agents » IA ont mis en lumière des préoccupations concernant la capacité des systèmes de plus en plus capables d’agir de manière autonome tout en tentant d’accomplir des tâches complexes.
Les « agents » de l’IA deviennent plus intelligents et sont « plus déterminés à résoudre des tâches complexes grâce à la collaboration inter-agents, au partage de connaissances, à la tromperie et à la dissimulation », a déclaré Lian Jye Su, analyste en chef au groupe de recherche et conseil technologique Omdia.
« Cela rend plus difficile leur gouvernance et leur confinement grâce aux approches traditionnelles de sécurité de l’IA », a-t-il déclaré.
Le nouveau cadre de suivi et de divulgation d’OpenAI pourrait encourager d’autres développeurs d’IA à adopter des pratiques similaires pour identifier et signaler les comportements inattendus des modèles.
« Cela dit, le processus reste interne et volontaire, mais c’est un pas dans la bonne direction », ajouta Su.
Cet article vous a été utile ? Soutenez notre travail éditorial indépendant par une contribution libre. Choisissez librement le montant de votre soutien. Don unique, sans abonnement.


6 hour_ago
44





















.jpg)






French (CA)