NE LAISSER PAS LE 5G DETRUIRE VOTRE ADN Protéger toute votre famille avec les appareils Quantiques Orgo-Life® Publicité par Adpathway
Face à des signaux jugés préoccupants sur les capacités cyber d’Astra, son futur modèle de langage dans l’IA, OpenAI a annoncé le 18 août 2026 la suspension de certains entraînements par apprentissage par renforcement.
C’est l’été de la sécurité chez OpenAI.
En juillet 2026, des agents autonomes échappent à leur environnement de test et compromettent des systèmes de production de Hugging Face.
Début août, des indices préliminaires suggèrent que le futur modèle Astra pourrait franchir le seuil de capacité critique en matière de cybersécurité, tel que défini par le cadre de préparation d’OpenAI.
Et ce 18 août 2026, Sam Altman annonce un coup de frein inédit dans la course effrénée aux capacités : la suspension de certains entraînements de pointe par apprentissage par renforcement (RL).

Surfshark One à partir de 2,49€ / Mois !
Jusqu’au 7 septembre, Surfshark surclasse tous ses nouveaux clients ! La suite de cybersécurité complète + VPN débarque au prix de la formule de base, soit 2,49€ par mois seulement. VPN, antivirus, bloqueur de pub à prix mini !
Objectif affiché par le patron d’OpenAI ? Garantir que les normes d’alignement, de sécurité et de surveillance soient à la hauteur du nouveau palier de capacités qui s’annonce. « Nous avons toujours affirmé que nous prendrions des mesures si nous estimions que leurs capacités dépassaient le rythme des efforts en matière de sécurité et d’alignement », justifie-t-il.
We have paused some frontier RL training to ensure that we can meet the appropriate alignment, security and monitoring standards for the new level of capabilities in front of us. Model progress is now extremely rapid, and we always said we would take action if we felt that model…
— Sam Altman (@sama) August 18, 2026 Ce contenu est bloqué car vous n’avez pas accepté les cookies et autres traceurs. Ce contenu est fourni par Twitter.
Pour pouvoir le visualiser, vous devez accepter l’usage étant opéré par Twitter avec vos données qui pourront être utilisées pour les finalités suivantes : vous permettre de visualiser et de partager des contenus avec des médias sociaux, favoriser le développement et l’amélioration des produits d’Humanoid et de ses partenaires, vous afficher des publicités personnalisées par rapport à votre profil et activité, vous définir un profil publicitaire personnalisé, mesurer la performance des publicités et du contenu de ce site et mesurer l’audience de ce site (en savoir plus)
En cliquant sur « J’accepte tout », vous consentez aux finalités susmentionnées pour l’ensemble des cookies et autres traceurs déposés par Humanoid et .
Vous gardez la possibilité de retirer votre consentement à tout moment. Pour plus d’informations, nous vous invitons à prendre connaissance de notre Politique cookies.
Ce qu’OpenAI change concrètement
Dans un article de blog publié le même jour, OpenAI détaille sa feuille de route : plus de garde-fous, appliqués plus tôt dans l’entraînement, avant de reprendre les runs les plus ambitieux.
L’apprentissage par renforcement sert à faire progresser les capacités et le comportement d’un modèle par essai-erreur récompensé. On lui fait générer des réponses, un système de notation évalue, et le modèle ajuste ses paramètres pour maximiser les bonnes notes.
Le plus gros entraînement RL prévu sur les modèles de pointe reste suspendu, le temps de mener des tests plus modestes pour vérifier que ces garde-fous tiennent.
Une pause de deux semaines a par ailleurs touché l’ensemble des entraînements RL des modèles destinés au déploiement, le temps de renforcer la sécurité des environnements de recherche.
Trois chantiers structurent la réponse d’OpenAI :
- Sécurité : après l’incident Hugging Face, OpenAI a coupé l’accès à Internet et l’exécution de code pour ses modèles de pointe, avant de rouvrir progressivement, projet par projet. Le code non fiable doit désormais être cloisonné, et les traitements à risque coupés du reste du réseau pour éviter qu’une compromission ne se propage. Les travaux sur Astra et la cybersécurité, soumis au niveau de sécurité maximal, restent en partie suspendus tant qu’ils n’y sont pas conformes.
- Surveillance : un nouveau dispositif inspecte en continu le raisonnement des modèles (le « chain-of-thought », soit les étapes de réflexion qu’ils déroulent avant de répondre) pour repérer tout signal suspect.
- Alignement : OpenAI vise à améliorer ses systèmes de récompense pour mieux repérer les comportements dangereux, entraîne ses modèles à plus d’honnêteté sur leurs actions, et cherche à limiter le « reward hacking » : quand un modèle triche avec son système de notation plutôt que de résoudre vraiment le problème posé.
Une pause pour gagner en confiance
Ce qu’OpenAI attend de cette pause est assez clair : accumuler suffisamment de preuves d’alignement et de robustesse avant de relancer son plus gros entraînement de pointe, plutôt que de découvrir les failles après coup.
L’entreprise reconnaît elle-même que son cadre de préparation actuel, le Preparedness Framework, ne suffit plus face à des modèles capables de mener des cyberattaques, et promet de le faire évoluer pour mieux refléter les capacités des futurs modèles et les environnements dans lesquels ils opèrent.
Pour l’heure, Sam Altman assume une approche « unilatérale » en attendant une coordination plus large du secteur.
Toute l'actu tech en un clin d'œil
Ajoutez Numerama à votre écran d'accueil et restez connectés au futur !


3 week_ago
100



























.jpg)






French (CA)