Índice de confianza en IA

El código generado por IA contiene 15 vulnerabilidades por base de código,
en promedio

Tras analizar 16 modelos de IA líderes y 1760 bases de código, determinamos que el riesgo es predecible según el modelo y el marco de trabajo, lo que proporciona a los líderes de seguridad los datos necesarios para cerrar la brecha.

Descargar informe visual
Explorar los datos
Modelos de IA evaluados
16
Frameworks evaluados
11
Bases de código generadas
1.760
CWE únicos encontrados
86
De un vistazo

¿Qué es el SCW AI Trust Index?

El SCW AI Trust Index es un punto de referencia dinámico que mide la frecuencia con la que los principales modelos de IA generan código con vulnerabilidades de seguridad. Se actualiza a medida que se lanzan nuevos modelos, no se publica una sola vez para quedar obsoleto.

Descargar informe visual
Este es un encabezado dinámico con opciones de etiqueta y estilo

Las vulnerabilidades siguen patrones predecibles

Las vulnerabilidades siguen patrones predecibles. En 1760 bases de código, los mismos tipos de debilidades se repiten: los fallos de registro, los errores de inyección y el control de acceso deficiente encabezan la lista siempre. El riesgo generado por IA es repetible, no aleatorio.

Este es un encabezado dinámico con opciones de etiqueta y estilo

Cada modelo tiene una huella de seguridad distintiva

Cada uno de los 16 modelos deja su propia combinación repetible de categorías OWASP, por lo que los equipos pueden anticiparse —no solo reaccionar— a dónde es probable que un modelo determinado introduzca riesgos.

Este es un encabezado dinámico con opciones de etiqueta y estilo

Ningún modelo es el mejor en todo

El liderazgo en seguridad varía según el framework: GPT-5.1 lidera en Java Enterprise API y Claude Opus 4.8 en Python Django. El modelo adecuado depende de dónde esté trabajando el equipo.

Este es un encabezado dinámico con opciones de etiqueta y estilo

El coste no garantiza la seguridad

De los 16 modelos analizados, el más caro (Claude Fable 5, 174,94 $ por ejecución) ocupa el segundo lugar en la clasificación general, mientras que el más barato (Gemini 2.5 Flash, 0,58 $ por ejecución) obtiene una puntuación inferior a la media. El precio no es un indicador de seguridad en ningún caso.

Vulnerabilidades

El fallo más común dista mucho de ser exótico y refleja un error humano generalizado

Se identificaron 86 CWE únicos en todo el conjunto de datos. Tres de ellos representan una parte desproporcionada de todos los hallazgos confirmados.

Descargar informe visual
ID de CWENombreVerdaderos positivosRiesgo promedio
CWE-532Inserción de información confidencial en archivos de registro8.54380,06
CWE-79Neutralización inadecuada de entradas durante la generación de páginas web ('Cross-site Scripting')2.94990,57
CWE-798Uso de credenciales codificadas de forma rígida1.34868,5
Los 16 modelos

Índice de confianza general

Puntuación normalizada, 0–100. Una cifra más alta significa menos vulnerabilidades en relación con el resto del sector; una puntuación de 100 indica la menor cantidad en este conjunto de datos, no que esté libre de vulnerabilidades.

Descargar informe visual

Las puntuaciones de los 6 modelos originales difieren del estudio publicado por RMIT porque el grupo de normalización se amplió de 6 a 16 modelos. Las puntuaciones son siempre relativas al conjunto completo.

Claude Sonnet 5
80.4
Claude Fable 5
76.4
GPT 5.3 Codex
75.3
Claude Opus 4.8
74.5
GPT 5.1
71.6
Gemini 3.1 Pro
66.6
GPT 5.5
66,5
Gemini 2.5 Pro
65,6
Claude Sonnet 4.5
65,2
Gemini 3.5 Flash
59,1
Devstral 2
53,1
Claude Haiku 4.5
50,7
Claude Sonnet 4.6
45,5
Gemini 2.5 Flash
39,4
Qwen3 Coder
32,7
GPT 5 Mini
21,6
Frameworks

El líder cambia según el framework

La clasificación general de un modelo no garantiza que sea la opción más segura para un stack específico.

Descargar informe visual
FrameworkModelo líder
Java Enterprise APIGPT-5.1
Java SpringClaude Sonnet 4.5
Python DjangoClaude Opus 4.8
C# (.NET)GPT-5.5
CClaude Fable 5
Investigación

Cómo lo hicimos

Dieciséis modelos de IA generaron la misma aplicación compleja de gestión de gastos (autenticación, carga de archivos, pagos, acceso a bases de datos) en 11 marcos de trabajo, 10 veces de forma independiente por cada combinación. Cada base de código se analizó con las mismas herramientas de análisis estático de código abierto (Semgrep, Bearer, Bandit) y cada hallazgo se verificó para descartar falsos positivos utilizando el mismo proceso basado en agentes.

Descargar informe visual
Hallazgos de vulnerabilidades verificados y distintos
1.554
Vulnerabilidades confirmadas (positivos reales)
27.000+
Herramientas SAST independientes por base de código
3
Ejecuciones por par de modelo/marco de trabajo
10
Metodología

Desarrollado en colaboración con RMIT

El estudio y la metodología originales se desarrollaron en colaboración con la Universidad RMIT y abarcaron los seis primeros modelos evaluados. Secure Code Warrior amplió la investigación de forma independiente a 16 modelos utilizando esa misma metodología.

Leer la metodología completa

Gobernanza del software de IA y control a nivel de compromiso

What is the SCW AI Trust Index?

A living benchmark that measures how often leading AI models generate code with security vulnerabilities. Its methodology was originally developed with RMIT University and has since been independently extended by Secure Code Warrior to 16 models. It's updated as new models are released rather than published as a one-time study.

¿Cuántas vulnerabilidades tiene, en promedio, el código generado por IA?

Un promedio de 15 vulnerabilidades confirmadas por base de código en las 1.760 bases de código analizadas, y 4 o más suelen clasificarse como de severidad crítica o alta.

Which AI model produces the most secure code?

No single model wins in every context. Claude Sonnet 5 scored highest overall at 80.4 out of 100, but the leading model changes by framework.

Does a model's API cost predict how secure its code is?

No. Across all 16 models tested, the most expensive model (Claude Fable 5, $174.94 per run) ranks 2nd overall, while the cheapest (Gemini 2.5 Flash, $0.58 per run) scores below average.

What is the most common security flaw in AI-generated code?

CWE-532 — writing sensitive information like passwords or tokens into application log files — appeared 8,543 times, more than any other flaw in the dataset.

How was the research conducted?

Sixteen AI models each generated the same application across 11 frameworks, 10 times each, scanned with the same tools and verification process every time.

¿Aún tienes preguntas?

Detalles de soporte para captar clientes que podrían estar indecisos.

Contactar

Sé el primero en gobernar el desarrollo asistido por IA en commit

Descubra cómo Trust Agent: AI ofrece visibilidad, correlación y control de políticas en todo el desarrollo asistido por IA.

Descargar el EBOOK
Explorar los datos