Indice de confiance IA

Le code généré par l'IA comporte 15 vulnérabilités par base de code,
en moyenne

Après avoir testé 16 modèles d'IA de premier plan et 1 760 bases de code, nous avons constaté que le risque est prévisible selon le modèle et le framework, fournissant ainsi aux responsables de la sécurité les données nécessaires pour combler les lacunes.

Télécharger le rapport visuel
Explorer les données
modèles d'IA testés
16
Frameworks évalués
11
Bases de code générées
1 760
CWE uniques identifiées
86
En un coup d'œil

Qu'est-ce que le SCW AI Trust Index ?

Le SCW AI Trust Index est un référentiel évolutif qui mesure la fréquence à laquelle les principaux modèles d'IA génèrent du code présentant des vulnérabilités de sécurité. Il est mis à jour au rythme des sorties de nouveaux modèles, plutôt que d'être publié une seule fois pour devenir obsolète.

Télécharger le rapport visuel
Ceci est un titre dynamique avec des options de balise et de style

Les vulnérabilités suivent des modèles prévisibles

Les vulnérabilités suivent des modèles prévisibles. Sur 1 760 bases de code, les mêmes types de faiblesses reviennent systématiquement : les échecs de journalisation, les failles d'injection et les contrôles d'accès défaillants arrivent en tête à chaque fois. Le risque généré par l'IA est reproductible, pas aléatoire.

Ceci est un titre dynamique avec des options de balise et de style

Chaque modèle possède une empreinte de sécurité unique

Chacun des 16 modèles laisse sa propre empreinte reproductible en termes de catégories OWASP, permettant aux équipes d'anticiper — et non seulement de réagir — aux risques potentiels introduits par un modèle donné.

Ceci est un titre dynamique avec des options de balise et de style

Aucun modèle ne domine partout

Le leadership en matière de sécurité varie selon le framework : GPT-5.1 domine pour l'API Java Enterprise, tandis que Claude Opus 4.8 excelle avec Python Django. Le choix du modèle dépend de l'environnement de développement de votre équipe.

Ceci est un titre dynamique avec des options de balise et de style

Le coût ne garantit pas la sécurité

Parmi les 16 modèles testés, le plus coûteux (Claude Fable 5, 174,94 $ par exécution) se classe 2e au classement général, tandis que le moins cher (Gemini 2.5 Flash, 0,58 $ par exécution) obtient un score inférieur à la moyenne. Le prix n'est en aucun cas un indicateur de sécurité.

Vulnérabilités

La faille la plus courante est loin d'être exotique et reproduit des erreurs humaines omniprésentes

86 CWE uniques ont été identifiés dans l'ensemble des données. Trois d'entre eux représentent une part disproportionnée de toutes les conclusions confirmées.

Télécharger le rapport visuel
ID CWENomVrais positifsRisque moyen
CWE-532Insertion d'informations sensibles dans un fichier journal8 54380,06
CWE-79Neutralisation incorrecte des entrées lors de la génération de pages web (« Cross-site Scripting »)2 94990,57
CWE-798Utilisation d'identifiants codés en dur1 34868,5
Les 16 modèles

Indice de confiance global

Score normalisé, 0–100. Un score plus élevé indique moins de vulnérabilités par rapport au reste du secteur ; un score de 100 signifie le moins de vulnérabilités dans cet ensemble de données, et non une absence totale de vulnérabilités.

Télécharger le rapport visuel

Les scores des 6 modèles originaux diffèrent de l'étude RMIT publiée car le groupe de normalisation est passé de 6 à 16 modèles. Les scores sont toujours relatifs à l'ensemble de la cohorte.

Claude Sonnet 5
80,4
Claude Fable 5
76,4
GPT 5.3 Codex
75,3
Claude Opus 4.8
74,5
GPT 5.1
71,6
Gemini 3.1 Pro
66,6
GPT 5.5
66,5
Gemini 2.5 Pro
65,6
Claude Sonnet 4.5
65,2
Gemini 3.5 Flash
59,1
Devstral 2
53,1
Claude Haiku 4.5
50,7
Claude Sonnet 4.6
45,5
Gemini 2.5 Flash
39,4
Qwen3 Coder
32,7
GPT 5 Mini
21,6
Frameworks

Le leader varie selon le framework

Le classement général d'un modèle ne garantit pas qu'il s'agisse du choix le plus sûr pour une pile technologique spécifique.

Télécharger le rapport visuel
FrameworkModèle leader
Java Enterprise APIGPT-5.1
Java SpringClaude Sonnet 4.5
Python DjangoClaude Opus 4.8
C# (.NET)GPT-5.5
CClaude Fable 5
Recherche

Notre méthodologie

Seize modèles d'IA ont chacun généré la même application complexe de gestion des dépenses — authentification, téléchargement de fichiers, paiements, accès à la base de données — sur 11 frameworks, 10 fois indépendamment par combinaison. Chaque base de code a été analysée avec les mêmes outils d'analyse statique open source (Semgrep, Bearer, Bandit) et chaque résultat a été vérifié pour éliminer les faux positifs grâce au même processus agentique.

Télécharger le rapport visuel
Résultats de vulnérabilités vérifiés et distincts
1 554
Vulnérabilités confirmées (vrais positifs)
27 000+
Outils SAST indépendants par base de code
3
Exécutions par paire modèle/framework
10
Méthodologie

Développé en partenariat avec RMIT

L'étude et la méthodologie originales ont été développées en partenariat avec l'Université RMIT et couvraient les six premiers modèles testés. Secure Code Warrior a étendu indépendamment la recherche à 16 modèles en utilisant cette même méthodologie.

Lire la méthodologie complète

Questions fréquentes

What is the SCW AI Trust Index?

A living benchmark that measures how often leading AI models generate code with security vulnerabilities. Its methodology was originally developed with RMIT University and has since been independently extended by Secure Code Warrior to 16 models. It's updated as new models are released rather than published as a one-time study.

Combien de vulnérabilités le code généré par l'IA contient-il en moyenne ?

En moyenne, 15 vulnérabilités confirmées par base de code sur les 1 760 bases de code testées, dont 4 ou plus sont généralement classées comme critiques ou de gravité élevée.

Which AI model produces the most secure code?

No single model wins in every context. Claude Sonnet 5 scored highest overall at 80.4 out of 100, but the leading model changes by framework.

Does a model's API cost predict how secure its code is?

No. Across all 16 models tested, the most expensive model (Claude Fable 5, $174.94 per run) ranks 2nd overall, while the cheapest (Gemini 2.5 Flash, $0.58 per run) scores below average.

What is the most common security flaw in AI-generated code?

CWE-532 — writing sensitive information like passwords or tokens into application log files — appeared 8,543 times, more than any other flaw in the dataset.

How was the research conducted?

Sixteen AI models each generated the same application across 11 frameworks, 10 times each, scanned with the same tools and verification process every time.

Vous avez encore des questions ?

Informations d'assistance pour capter les clients qui pourraient être réticents.

Contacter

Obtenez les données dont votre équipe a besoin pour gouverner le code généré par IA en toute confiance

Téléchargez le résumé visuel pour une vue d'ensemble rapide et partageable des résultats, ou explorez l'ensemble de données interactif complet — par modèle, par framework, par type de vulnérabilité.

Télécharger l'EBOOK
Explorer les données