GPT-5.6 Sol dépasse légèrement Claude Mythos 5 dans les tests de cybersécurité, les modèles open source réduisent l'écart
Deux évaluations de cybersécurité publiées par l'Institut britannique de sécurité en intelligence artificielle (AISI) montrent que GPT-5.6 Sol surpasse légèrement Claude Mythos 5. Ce résultat mérite attention, mais doit être interprété avec prudence. L'AISI n'a pas publié de classement complet des capacités offensives et défensives en cybersécurité, mais a testé les modèles sur un ensemble restreint de tâches techniques spécifiques, ainsi que sur des scénarios simulés d'attaques réseau à long terme en entreprise. Dans ces conditions, GPT-5.6 Sol a obtenu la note moyenne la plus élevée, tandis que Mythos

GPT-5.6 Sol dépasse légèrement Claude Mythos 5 dans les tests de cybersécurité, les modèles open source réduisent l'écart
Introduction
Dans deux évaluations de cybersécurité publiées par l'Institut britannique de sécurité de l'intelligence artificielle (AISI), GPT-5.6 Sol se classe légèrement au-dessus de Claude Mythos 5. Ce résultat mérite attention, mais doit être interprété avec prudence.
L'AISI n'a pas publié de classement général couvrant toutes les capacités de cybersécurité offensive et défensive. Il a testé les performances des modèles sur plusieurs tâches techniques spécifiques ainsi que dans des simulations d'attaques réseau à long terme en entreprise. Dans ces contextes, GPT-5.6 Sol a obtenu le score moyen le plus élevé, tandis que Mythos 5 s'en approche de très près.
Une découverte plus importante concerne les modèles à poids ouverts. L'AISI a constaté que GLM-5.2 et DeepSeek V4-Pro ont désormais des performances comparables aux modèles fermés de pointe publiés il y a seulement quatre à sept mois. Lors des tests internes de l'AISI en 2025, cet écart était de six à dix mois.
Cette réduction de l'écart temporel est significative car les modèles à poids ouverts peuvent être téléchargés, modifiés, déployés en privé et exécutés sans surveillance du fournisseur. Cette flexibilité, qui favorise la recherche, protège la vie privée et réduit les coûts, pourrait également rendre plus difficile le contrôle des capacités cybernétiques avancées après leur publication.
Qu'a évalué l'AISI
L'AISI a utilisé deux systèmes d'évaluation complémentaires.
Tâches réseau restreintes
Le premier système d'évaluation mesure des compétences spécifiques en cybersécurité à travers 70 tâches sélectionnées parmi un ensemble plus vaste de 96 tâches.
Ces tâches couvrent quatre domaines principaux :
- Recherche et exploitation de vulnérabilités
- Rétro-ingénierie
- Exploitation réseau
- Cryptographie
Elles sont classées en quatre niveaux de difficulté selon l'expérience humaine estimée nécessaire :
| Niveau de difficulté | Expérience humaine approximative | Nombre de tâches |
|---|---|---|
| Non-expert technique | Contexte technique mais expérience limitée en cybersécurité | 18 |
| Apprenti | Environ 1-3 ans | 25 |
| Praticien | Environ 3-10 ans | 19 |
| Expert | Plus de 10 ans | 8 |
Chaque modèle dispose de cinq tentatives par tâche, avec une limite de 2,5 millions de tokens par tentative. L'AISI calcule ensuite le taux de succès moyen.
Cyberrange
Le second système mesure si un modèle peut maintenir de manière autonome une attaque en plusieurs étapes dans un réseau simulé.
Le scénario principal discuté dans le rapport s'intitule Le Dernier Survivant. Il comprend :
- 32 étapes d'attaque consécutives
- Quatre sous-réseaux
- Environ 20 hôtes
- Plusieurs jalons nommés
- Une charge de travail estimée à 20 heures par des experts humains
Les trajectoires de chaque modèle principal représentent la moyenne de dix exécutions, avec une limite d'un million de tokens par exécution.
Ces environnements ne reproduisent pas toutes les difficultés d'une attaque contre une organisation réelle bien défendue. L'AISI précise que ces cyberranges n'incluent actuellement ni défenseurs humains actifs, ni outils défensifs, et ne pénalisent pas le déclenchement d'alarmes.
Que signifient réellement les résultats de GPT-5.6 Sol et Mythos 5
Dans la suite de tâches restreintes, GPT-5.6 Sol enregistre le taux de succès moyen le plus élevé sur le graphique publié par l'AISI. Claude Mythos 5 suit de près, avec des plages d'incertitude qui se chevauchent.

Les tâches à long terme présentent une situation similaire.

On peut en tirer les conclusions suivantes :
- GPT-5.6 Sol obtient en moyenne les meilleures performances dans cette tâche spécifique de cyberrange.
- Mythos 5 s'en approche et a également réalisé la totalité des 32 étapes lors de sa meilleure tentative.
- La différence peut refléter les capacités du modèle, la fiabilité de l'agent, l'utilisation d'outils, les capacités de planification à long terme, ou une combinaison de ces facteurs.
- La force probante d'un seul cyberrange est plus faible que celle de données provenant de nombreuses tâches diversifiées.
- Ces résultats n'établissent pas un classement général en matière de sécurité offensive.
Le rapport de l'AISI se concentre principalement sur l'écart de capacités entre les modèles open source et closed source, plutôt que de déterminer un gagnant global entre Sol et Mythos.
Les modèles open source n'ont désormais que 4 à 7 mois de retard
L'AISI a choisi GLM-5.2 et DeepSeek V4-Pro car ils étaient les principaux candidats de modèles open source au moment des tests.
La comparaison centrale du rapport repose sur les performances similaires des modèles et l'intervalle entre leurs dates de publication.
| Modèle open source | Tâche évaluée | Modèle closed source comparable | Écart de publication estimé |
|---|---|---|---|
| GLM-5.2 | Tâches réseau restreintes | Claude Opus 4.6 et GPT-5.3-Codex | Environ 4 mois |
| GLM-5.2 | Cyberrange "Le Dernier Survivant" | Claude Opus 4.5 | Moins de 7 mois |
| DeepSeek V4-Pro | Tâches réseau restreintes | Claude Opus 4.5 | Environ 5 mois |
| DeepSeek V4-Pro | Tâches de cyberrange | Inférieur à Sonnet 4.5 dans un domaine spécifique | Non considéré comme une correspondance directe de pointe |
GLM-5.2 obtient des performances comparables à Opus 4.6 à tous les quatre niveaux de difficulté des tâches restreintes. Dans le cyberrange "Le Dernier Survivant", il atteint le même nombre moyen final d'étapes qu'Opus 4.5.
DeepSeek V4-Pro correspond à Opus 4.5 sur les tâches restreintes, mais montre des performances plus faibles sur les tâches de cyberrange à long terme.
Les tests internes de l'AISI en 2025 montraient que les modèles open source leaders avaient six à dix mois de retard sur les modèles closed source de pointe. La nouvelle estimation de quatre à sept mois suggère que la fenêtre de préparation pour les défenseurs pourrait se réduire.
Pourquoi cet écart n'est pas une prédiction fixe
Le chiffre de quatre à sept mois décrit uniquement les modèles testés par l'AISI et les tâches d'évaluation. Il ne prédit pas que chaque futur modèle open source maintiendra ce retard fixe.
De nombreux facteurs peuvent faire évoluer l'écart dans un sens ou dans l'autre :
- Les développeurs closed source pourraient réaliser soudainement un bond en avant de leurs capacités.
- Les modèles open source pourraient reproduire les améliorations récentes de pointe.
- De meilleurs frameworks d'agents pourraient libérer davantage de performances des modèles existants.
- Le réglage fin et les prompts spécifiques aux modèles pourraient modifier les capacités mesurées.
- De nouveaux benchmarks pourraient révéler des faiblesses non détectées par les tests actuels.
- Les coûts de déploiement et le matériel disponible pourraient limiter les risques d'abus réels.
- Les mesures de sécurité et les contrôles d'accès pourraient modifier les capacités disponibles des modèles hébergés.
L'AISI indique également que son dispositif pourrait légèrement sous-estimer les capacités maximales des modèles à poids ouverts, car elle n'a pas procédé à une extraction ou une optimisation approfondie spécifique aux modèles.
Ce rapport s'applique uniquement au domaine de la cybersécurité et ne doit pas être utilisé pour déduire des écarts équivalents dans les domaines scientifiques, de programmation, de raisonnement général ou autres.
Les modèles open source sont considérablement moins coûteux pour des niveaux de capacités similaires
L'écart de capacités est faible, mais l'écart de prix est important.
L'AISI a comparé les prix des tokens publiés par les fournisseurs pour des modèles aux performances proches.
Exécution
Coût pour 100 millions de tokens sur un cyber-range
| Modèle | Coût approximatif |
|---|---|
| Claude Opus 4.5 | 85 $ |
| Claude Opus 4.6 | 85 $ |
| GLM-5.2 | 46 $ |
| DeepSeek V4-Pro | 1,19 $ |
Coût pour résoudre une tâche spécifique unique avec une fiabilité de 100 %
| Comparaison | Coût du modèle fermé | Coût du modèle à poids ouverts |
|---|---|---|
| Opus 4.6 vs GLM-5.2 | 15,17 $ | 6,12 $ |
| Opus 4.5 vs DeepSeek V4-Pro | 12,50 $ | 0,28 $ |
Dans ces exemples, le prix publié de DeepSeek V4-Pro est un à deux ordres de grandeur inférieur à celui des modèles fermés comparables.
Cette comparaison comporte des limites. L'AISI n'a pas fait fonctionner les modèles à poids ouverts testés via son propre fournisseur, les coûts d'infrastructure réels peuvent donc différer. L'auto-hébergement ajoute également des coûts de matériel, d'ingénierie, d'électricité, de réseau et de maintenance, qui ne sont pas reflétés dans les prix des API.
Cela dit, des coûts d'inférence plus faibles rendent les expérimentations répétées, le réglage fin et le déploiement privé plus réalisables.
Pourquoi les poids ouverts changent la donne en matière de sécurité
Les modèles à poids ouverts présentent des avantages pratiques :
- Déploiement privé
- Pas besoin de renvoyer les données au fournisseur d'origine
- Personnalisation pour des tâches spécifiques
- Non soumis à l'arrêt du service par le fournisseur
- Recherche reproductible
- Inspection et modification des poids du modèle
- Collaboration entre organisations
Ces mêmes caractéristiques limitent également les mesures de sécurité pouvant être mises en œuvre après la publication.
Les fournisseurs de modèles fermés peuvent :
- Surveiller les schémas d'utilisation anormaux
- Appliquer des classifieurs
- Suspendre des comptes
- Limiter les taux d'accès
- Mettre à jour les mesures de sécurité
- Restreindre des outils spécifiques
- Retirer ou remplacer un modèle
Une fois les poids du modèle rendus publics, les copies peuvent être redistribuées et exécutées en privé. Les refus peuvent être modifiés, la surveillance du déploiement peut être supprimée, et le développeur d'origine ne peut pas récupérer de manière fiable chaque copie.
L'AISI a constaté que les mesures de sécurité n'ont pas entravé de manière substantielle la plupart de ses tests sur les deux modèles ouverts. DeepSeek V4-Pro refusait occasionnellement des tâches de rétro-ingénierie, mais quelques tentatives suffisaient généralement à contourner ces refus.
Cela ne signifie pas que tous les modèles à poids ouverts seront utilisés de manière malveillante, mais que lorsque les modèles atteignent des capacités associées à des risques, la décision de publication devient difficile à inverser.
Les modèles fermés nécessitent également des mesures de sécurité renforcées
L'accès fermé n'est pas une garantie de sécurité.
Anthropic a publié Claude Fable 5 et Claude
Mythos 5 le 9 juin 2026. Fable 5 utilise des classifieurs plus forts pour un accès régulier, tandis que Mythos 5 expose davantage les capacités de cybersécurité du modèle sous-jacent à un groupe limité de défenseurs de confiance.
Le 12 juin, les contrôles à l'exportation américains ont exigé qu'Anthropic suspende l'accès. Anthropic a indiqué que la directive avait été émise après la soumission d'un rapport par des chercheurs d'Amazon décrivant une méthode pour contourner les protections de Fable 5 dans un scénario de cybersécurité limité.
Anthropic a ensuite entraîné un classifieur mis à jour, développé un cadre d'évaluation de la gravité des jailbreaks avec des partenaires gouvernementaux et industriels, et a rétabli Fable 5 à l'échelle mondiale le 1er juillet après la levée des restrictions.
Cet incident révèle plusieurs points :
- Les classifieurs peuvent produire des faux négatifs et des faux positifs.
- La gravité des méthodes de jailbreak varie considérablement.
- Les contournements ne révèlent pas nécessairement les capacités les plus dangereuses du modèle.
- Les fournisseurs fermés peuvent mettre à jour les protections et suspendre l'accès.
- Ces interventions peuvent également entraver les travaux de sécurité légitimes.
- L'industrie et les gouvernements manquent encore de normes unifiées pour évaluer les jailbreaks réseau.
Le déploiement fermé offre plus d'options d'intervention, mais ces options nécessitent toujours une surveillance, des tests, des politiques et des contrôles techniques efficaces.
La fenêtre de préparation défensive se rétrécit
L'AISI décrit l'écart entre l'ouvert et le fermé comme un temps de préparation.
Si les systèmes les plus puissants sont contrôlés pendant plusieurs mois avant une publication équivalente à poids ouverts, les défenseurs peuvent utiliser ce temps pour :
- Découvrir et corriger des vulnérabilités
- Améliorer l'inventaire des actifs
- Supprimer les logiciels non supportés
- Renforcer les contrôles d'identité
- Déployer une authentification résistante au phishing
- Améliorer la segmentation réseau
- Étendre la journalisation et la détection
- Tester les plans de réponse aux incidents
- Appliquer une revue de code et une analyse des menaces assistées par IA
Passer de six à dix mois à quatre à sept mois signifie que les organisations disposent de moins de temps pour accomplir ces tâches avant que des capacités similaires ne deviennent moins chères et plus répandues.
Le Centre national de cybersécurité britannique prévient que l'IA amplifiera l'écart entre les pratiques de sécurité fortes et faibles. Ses directives soulignent que les outils d'IA ne peuvent pas compenser des bases fragiles.
Les organisations avec une gestion des correctifs médiocre, des services exposés, des mots de passe réutilisés, des sauvegardes incomplètes et une surveillance limitée resteront vulnérables, quel que soit le modèle d'IA utilisé par les attaquants.
L'IA accélère également les travaux de sécurité défensive
Les mêmes capacités utilisées pour les évaluations offensives peuvent aider les défenseurs à auditer le code, générer des tests, enquêter sur des défaillances et étendre la recherche de vulnérabilités.
Un cas récent vient du développeur de réseau de jeu Glenn Fiedler, qui a utilisé Claude Code avec Claude Fable 5 pour auditer quatre bibliothèques open source matures :
netcodereliableserializeyojimbo
Cet audit a ajouté des cibles libFuzzer, une intégration continue basée sur des sanitizers, des tests de résistance avec des millions d'itérations, des tests de format de ligne d'or et une revue ligne par ligne.
Le registre public des vulnérabilités montre 43 correctifs :
| Bibliothèque | Correctifs totaux | Correctifs accessibles par le réseau |
|---|---|---|
| netcode | 7 | 2 |
| reliable | 7 | 6 |
| serialize | 11 | 7 |
| yojimbo | 18 | 12 |
| Total | 43 | 27 |
Le
Un problème grave était un débordement de tas dans yojimbo existant depuis 2019, déclenchable à distance. Des fragments de bloc habilement conçus pouvaient être copiés dans le tampon de réassemblage avant la validation de la taille.
Chaque problème listé est accompagné d'un lien vers le correctif et la version, et chaque correctif inclut un test de régression. Le développeur a déclaré avoir dépensé plus de 2 500 $ sur Claude Code pendant le processus de correction de deux semaines.
Les utilisateurs des bibliothèques concernées sont invités à passer à la dernière version spécifiée dans le registre public des vulnérabilités.
Ce cas ne prouve pas que les agents d'IA peuvent sécuriser de manière indépendante n'importe quel logiciel. Il montre qu'un mainteneur compétent peut utiliser l'IA pour étendre le fuzzing, la couverture des sanitizers, la revue et la génération de tests sur une base de code existante.
L'asymétrie de l'accélération offensive/défensive
L'IA peut aider les deux camps, mais les modes de déploiement diffèrent.
Un attaquant n'a besoin que d'une vulnérabilité exploitable, d'une cible accessible et d'un chemin réussi. Les modèles à poids ouverts peuvent être copiés et réutilisés à plusieurs reprises après leur publication.
Un défenseur doit protéger de nombreux systèmes, maintenir un inventaire des actifs, prioriser les correctifs, tester les changements, gérer les temps d'arrêt et coordonner entre les équipes. Les améliorations défensives doivent être mises en œuvre organisation par organisation.
Cela crée une asymétrie :
- Les capacités offensives peuvent se propager rapidement.
- Les capacités défensives doivent être mises en œuvre localement.
- La publication d'un modèle peut être un événement unique.
- Les mises à jour de sécurité doivent être déployées plusieurs fois.
- Les attaquants peuvent choisir la cible la plus faible.
- Les défenseurs doivent couvrir tous les chemins critiques.
La réponse appropriée n'est pas d'éviter l'IA défensive, mais de la combiner avec des pratiques d'ingénierie solides, une expertise humaine et des contrôles de sécurité éprouvés.
Comment les organisations doivent réagir
Les conclusions de l'AISI et du NCSC soutiennent un ensemble d'actions pratiques.
1. Renforcer d'abord la base
Prioriser :
- Inventaire des actifs
- Logiciels supportés
- Correctifs rapides
- Authentification multi-facteurs
- Accès au moindre privilège
- Segmentation réseau
- Sauvegardes testées
- Journalisation centralisée
- Exercices de réponse aux incidents
Les défenses améliorées par l'IA sont les plus efficaces lorsque ces bases existent déjà.
2. Étendre les tests de sécurité continus
Pour les projets logiciels, introduire :
- Fuzzing
- AddressSanitizer
- UndefinedBehaviorSanitizer
- MemorySanitizer là où c'est supporté
- Analyse statique
- Analyse des dépendances
- Tests de régression pour chaque bogue confirmé
- Revues de sécurité des chemins d'entrée non fiables
L'audit de Mas Bandwidth était utile car il combinait une revue par IA avec des preuves mécaniques, plutôt que de se fier à des explications générées.
3. Considérer les découvertes de l'IA comme des pistes, pas des preuves
Les rapports de vulnérabilité générés par l'IA peuvent être corrects, incomplets ou trompeurs.
Exiger :
Reproduction
Analyse des causes racines
Examen manuel
Correction minimale
Tests de régression
Documentation de publication
Divulgation coordonnée, le cas échéant
4. Limitation des privilèges de l'agent
Par défaut, un agent de codage défensif ne doit pas disposer d'un accès illimité.
Limitations à appliquer :
- Informations d'identification de production
- Accès réseau
- Commandes shell destructrices
- Périmètre d'écriture du dépôt
- Accès aux clés
- Droits de déploiement
- Communications externes
Utiliser des environnements isolés, et soumettre les actions critiques à une validation humaine.
5. Mesure du coût et de l'efficacité
Suivre les indicateurs suivants :
- Vulnérabilités confirmées
- Faux positifs
- Temps nécessaire à la reproduction
- Temps nécessaire à la correction
- Nouvelle couverture de test
- Coûts en tokens et infrastructure
- Temps d'examen manuel
- Reculs de sécurité post-déploiement
Si le modèle produit des résultats peu fiables ou nécessite une révision importante, le modèle le moins cher n'est pas nécessairement le plus rentable.
Comment interpréter les benchmarks de cybersécurité pour l'IA
Les benchmarks de cybersécurité sont utiles, mais il faut en connaître les limites.
Un score élevé n'équivaut pas à une compromission réelle
Les environnements simulés simplifient les conditions. Un réseau réel peut comporter des défenseurs actifs, des protections de points finaux, des mécanismes d'alerte, des limites de débit, des systèmes de leurre et des informations incomplètes.
Capacités du modèle et capacités de l'agent sont liées
Les résultats des tâches de longue durée ne dépendent pas uniquement des connaissances du modèle. La conception des outils, la mémoire, la gestion du contexte, les stratégies de nouvelle tentative, la structure des invites et la fiabilité d'exécution influencent toutes les performances.
Résultats moyens et meilleures tentatives répondent à des questions différentes
La meilleure tentative montre ce que le système peut parfois accomplir. Le résultat moyen montre la fiabilité de la progression du système sur plusieurs exécutions.
Pour le risque opérationnel, les deux sont importants.
Les comparaisons basées sur la date de publication sont approximatives
Un modèle dont les performances sont similaires à celles d'un modèle plus ancien n'est pas identique à celui-ci. Ces systèmes peuvent avoir des forces, des faiblesses, des mesures de protection, des coûts et des contraintes de déploiement différents.
Les capacités en cybersécurité ont un double usage
Les mêmes compétences peuvent être utilisées pour les tests d'intrusion, la revue de code sécurisé, la réponse aux incidents, la découverte de vulnérabilités ou une intrusion malveillante.
Les résultats des évaluations doivent éclairer à la fois la gestion des risques et les investissements dans une sécurité défensive.
Questions fréquentes
GPT-5.6 Sol est-il meilleur que Claude Mythos 5 dans les tests de l'AISI ?
GPT-5.6 Sol a obtenu des résultats moyens légèrement supérieurs sur les tâches de cybersécurité étroites de l'AISI et sur l'environnement simulé de longue durée mentionné. Mythos 5 a des scores proches, avec un chevauchement des plages d'incertitude sur l'ensemble des tâches étroites, et les deux modèles ont exécuté la totalité des 32 étapes de l'environnement simulé dans leur meilleure tentative.
Cela signifie-t-il que GPT-5.6 Sol est le meilleur modèle de cybersécurité ?
Pas nécessairement. L'AISI teste des ensembles de tâches spécifiques et des environnements simulés, et non tous les scénarios réels de défense ou d'attaque. Les résultats soutiennent une comparaison étroite sur un benchmark, et non un classement général.
Quel est l'écart entre les modèles à poids ouverts et les modèles propriétaires de pointe ?
L'AISI estime que les principaux modèles à poids ouverts testés accusent un retard de quatre à sept mois. Cette donnée est basée sur la correspondance entre les performances mesurées et les dates de publication des modèles propriétaires comparables.
Quel est le modèle à poids ouverts le plus performant ?
Au moment de la publication du rapport, GLM-5.2 était le modèle à poids ouverts le plus performant testé par l'AISI. Il égalait Opus 4.6 sur les tâches étroites et atteignait le même score moyen qu'Opus 4.5 sur l'environnement simulé de cybersécurité mentionné.
Pourquoi les modèles à poids ouverts suscitent-ils des inquiétudes en matière de cybersécurité ?
Leurs poids peuvent être téléchargés, modifiés, déployés en privé et redistribués. Cela présente des avantages pour la recherche et la vie privée, mais limite la capacité du développeur initial à surveiller les abus, à mettre à jour les mesures de sécurité des déploiements, à suspendre des utilisateurs ou à récupérer toutes les copies.
Dans quelle mesure les modèles à poids ouverts sont-ils moins chers dans l'évaluation de l'AISI ?
Oui. Selon les prix officiels publiés, GLM-5.2 et surtout DeepSeek V4-Pro sont beaucoup moins chers que les modèles propriétaires comparables. Les coûts réels d'auto-hébergement et de déploiement par des tiers peuvent varier.
Un modèle d'IA peut-il aider à la fois les défenseurs et les attaquants ?
Oui. L'IA peut assister la revue de code, la génération de tests de fuzzing, l'analyse de vulnérabilités, l'investigation de journaux et les corrections. Après un travail de sécurité assisté par Claude Code, l'audit de Mas Bandwidth a enregistré 43 corrections dans quatre bibliothèques réseau.
Que devraient prioriser les organisations ?
Avant de se fier aux outils d'IA, renforcer les contrôles de sécurité de base. La visibilité des actifs, la gestion des correctifs, la protection des identités, les sauvegardes, la segmentation réseau, la surveillance et la réponse aux incidents testée restent essentielles.
Outils associés
- AISI Inspect Cyber : Cadre d'évaluation pour créer et exécuter des tâches de cybersécurité pour agents.
- Inspect AI : Cadre open source de l'AISI pour évaluer les grands modèles de langage.
- GLM-5.2 : Dépôt officiel des poids ouverts du modèle de Z.ai.
- DeepSeek API : Documentation officielle et informations d'accès actuelles pour les modèles DeepSeek.
- Claude Code : Environnement de codage agentique d'Anthropic pour le travail sur dépôt, les tests et les revues de sécurité.
- NCSC Cyber Essentials : Référentiel de base britannique pour protéger les organisations contre les cybermenaces courantes.
Liens connexes
- Rapport de l'AISI sur l'écart des capacités cyber des modèles à poids ouverts : Analyse officielle de juillet 2026, méthodologie, graphiques, comparaisons de coûts, limites et conclusions.
- Présentation d'Inspect Cyber : Explication par l'AISI de son cadre ouvert pour l'évaluation de la cybersécurité des agents.
- Rapport de l'AISI sur les tendances de l'IA de pointe : Données probantes plus larges sur les progrès des capacités des modèles de pointe, y compris la cybersécurité.
- Guide du NCSC sur les risques cyber liés à l'IA de pointe : Guide sur les bases de sécurité et le déploiement prudent des défenses améliorées par l'IA.
- Rapport de redéploiement d'Anthropic pour Fable 5 : Explication d'Anthropic sur la suspension de juin 2026, les mises à jour des classifieurs et la restauration de l'accès.
- Journal des bugs de sécurité de Mas Bandwidth : Liste vérifiable de 43 corrections avec messages de commit, sévérité, accessibilité réseau et informations de publication.
- Avis de mise à jour de Mas Bandwidth : Avis du mainteneur invitant les utilisateurs à mettre à jour les bibliothèques réseau concernées.
Résumé
Les derniers résultats de l'AISI montrent que, sur les scores moyens des deux évaluations de cybersécurité spécifiées, GPT-5.6 Sol devance légèrement Claude Mythos 5. Cette avance est minime et ne doit pas être considérée comme une preuve de supériorité générale.
La principale conclusion du rapport est plus large : le retard de GLM-5.2 et DeepSeek V4-Pro par rapport aux modèles propriétaires de pointe comparables est désormais réduit à 4 à 7 mois, contre 6 à 10 mois dans les tests internes de l'AISI en 2025.
Son prix affiché est également bien inférieur à celui de ses concurrents.
Ce délai de latence réduit signifie que la fenêtre de réaction dont disposent les défenseurs avant que les capacités avancées ne deviennent plus faciles à télécharger, à modifier et à exécuter localement est encore plus courte. Parallèlement, la performance de Claude Code, qui a découvert 43 vulnérabilités dans quatre bibliothèques réseau, montre qu’un modèle puissant peut également accélérer le travail défensif.
La véritable stratégie ne consiste pas à se fier uniquement à la protection des modèles ou aux outils de sécurité en IA, mais à renforcer les bases de sécurité et à utiliser l’IA dans un processus de défense contrôlé, piloté par les tests et supervisé par des humains.