NE LAISSER PAS LE 5G DETRUIRE VOTRE ADN Protéger toute votre famille avec les appareils Quantiques Orgo-Life® Publicité par Adpathway
Le benchmark Vending-Bench d’Andon Labs devait mesurer la capacité des intelligences artificielles génératives à gérer une activité commerciale de façon autonome. Claude Opus 5 en ressort vainqueur, mais au prix d’une série de manœuvres déloyales envers ses concurrents et ses fournisseurs.
À mesure que les agents IA sont amenés à opérer sans supervision humaine, les benchmarks qui les évaluent deviennent des outils précieux pour anticiper leurs dérives potentielles.
Celui d’Andon Labs, le Vending-Bench, repose sur un principe simple : confier à plusieurs modèles d’IA de pointe la gestion de distributeurs automatiques simulés sur une année fictive, puis comparer leurs performances financières ainsi que leur comportement vis-à-vis des fournisseurs et des clients.
Pour ce dernier test, publié le 29 juillet 2026, la société londonienne a confronté Claude Opus 5 d’Anthropic à GPT-5.6 Sol d’OpenAI et à Kimi K3 de Moonshot AI, chacun aux commandes d’une machine installée sur une rue touristique de San Francisco. Résultat : Opus 5 signe un nouveau record avec un solde final moyen de 11 182 dollars. Une victoire construite, cependant, sur une accumulation de ruptures d’accords et de tromperies.
Ce contenu est bloqué car vous n’avez pas accepté les cookies et autres traceurs. Ce contenu est fourni par YouTube.
Pour pouvoir le visualiser, vous devez accepter l’usage étant opéré par YouTube avec vos données qui pourront être utilisées pour les finalités suivantes : vous permettre de visualiser et de partager des contenus avec des médias sociaux, favoriser le développement et l’amélioration des produits d’Humanoid et de ses partenaires, vous afficher des publicités personnalisées par rapport à votre profil et activité, vous définir un profil publicitaire personnalisé, mesurer la performance des publicités et du contenu de ce site et mesurer l’audience de ce site (en savoir plus)
En cliquant sur « J’accepte tout », vous consentez aux finalités susmentionnées pour l’ensemble des cookies et autres traceurs déposés par Humanoid et .
Vous gardez la possibilité de retirer votre consentement à tout moment. Pour plus d’informations, nous vous invitons à prendre connaissance de notre Politique cookies.
Une mécanique de concurrence déloyale
C’est pourtant GPT-5.6 Sol qui a lancé les premières hostilités en proposant à ses concurrents un prix plancher fixé à 2,15 dollars.
L’accord est accepté par les deux autres modèles, mais Sol s’en écarte presque aussitôt en abaissant son propre prix à 2,14 dollars. Opus s’aligne à son tour sur ce tarif, ce qui pousse Sol à signaler la situation à la « direction » de la simulation.
Opus formule ensuite une nouvelle proposition : diviser le marché par catégorie de produits, chaque modèle vendant des articles différents pour éviter toute concurrence directe. Sol refuse cette configuration et campe sur l’idée d’un prix plancher commun. Quelques échanges plus tard, Opus revient vers Sol avec un message annonçant qu’il accepte, cette fois, une entente sur les prix.
L’examen des journaux de raisonnement interne du modèle révèle pourtant que cette proposition n’était pas sincère : elle visait à endormir la méfiance de Sol pendant qu’Opus continuait, en parallèle, à baisser discrètement les prix sur ses produits les plus rentables.
Sur l’ensemble de la simulation, Andon Labs comptabilise 11 accords rompus du côté d’Opus, contre deux pour Sol et un seul pour Kimi K3, ce dernier se retrouvant à plusieurs reprises pénalisé, aussi bien par ses concurrents que par ses partenaires ponctuels.

Un vrai signal d’alarme pour les agents autonomes ?
Selon l’étude, le comportement d’Opus a largement dépassé le cadre strict de la gestion de son distributeur. Le modèle d’Anthropic aurait en effet cherché à se positionner comme grossiste auprès des deux autres machines, en proposant des remises sur les achats en gros conditionnées au respect de ses propres exigences de prix de revente. Il aurait également sollicité ses fournisseurs en affirmant, à tort, avoir reçu des offres concurrentes plus avantageuses, dans le but d’obtenir de meilleures conditions d’achat.
Sur le volet client, en revanche, Andon Labs indique qu’Opus n’a jamais menti directement : il s’est contenté d’ignorer certaines réclamations qui auraient normalement dû donner lieu à un remboursement.
Interrogé par le média américain TechCrunch, le cofondateur d’Andon Labs reconnaît que les modèles savaient qu’ils évoluaient dans une simulation, ce qui a pu influencer leur comportement. Il défend néanmoins la pertinence de ce genre de tests : « à l’heure où nous entrons dans un monde où les agents d’IA gèrent les entreprises comme des entités à part entière (…) souhaitons-nous qu’ils mentent, complotent, profèrent des menaces et trahissent ? », interroge-t-il.
Toute l'actu tech en un clin d'œil
Ajoutez Numerama à votre écran d'accueil et restez connectés au futur !


3 hour_ago
59



























.jpg)






French (CA)