AI 信任指数

AI 生成的代码平均每个代码库包含 15 个漏洞,
平均而言

通过对 16 个主流 AI 模型和 1,760 个代码库的测试,我们发现风险可根据模型和框架进行预测,从而为安全负责人提供弥补差距所需的数据。

下载可视化报告
探索数据
已测试的 AI 模型
16
已评估的框架
11
已生成的代码库
1,760
发现的唯一 CWE
86
概览

什么是 SCW AI 信任指数?

SCW AI 信任指数是一个动态基准,用于衡量主流 AI 模型生成包含安全漏洞代码的频率。它会随着新模型的发布而实时更新,而非一次性发布后便不再维护。

下载可视化报告
这是一个带有标签和样式选项的动态标题

漏洞遵循可预测的模式

漏洞遵循可预测的模式。在 1,760 个代码库中,相同的弱点类型反复出现——日志记录失败、注入缺陷和访问控制损坏始终位居前列。人工智能产生的风险是可重复的,而非随机的。

这是一个带有标签和样式选项的动态标题

每个模型都有独特的安全指纹

16 种模型中的每一种都会留下其特有的 OWASP 类别组合,因此团队可以预见——而不仅仅是应对——特定模型可能带来的风险。

这是一个带有标签和样式选项的动态标题

没有单一模型能胜任所有场景

安全表现因框架而异——GPT-5.1 在 Java Enterprise API 中领先,而 Claude Opus 4.8 在 Python Django 中表现更佳。选择合适的模型取决于团队的开发环境。

这是一个带有标签和样式选项的动态标题

成本无法预示安全性

在所有 16 个测试模型中,价格最昂贵的模型(Claude Fable 5,每次运行 174.94 美元)总体排名第二,而最便宜的模型(Gemini 2.5 Flash,每次运行 0.58 美元)得分低于平均水平。价格并不能预示安全性。

漏洞

最常见的缺陷并不罕见,往往源于普遍的人为失误

数据集中共识别出 86 个独特的 CWE。其中三个漏洞占据了所有已确认发现的大部分比例。

下载可视化报告
CWE ID名称真正例平均风险
CWE-532将敏感信息插入日志文件8,54380.06
CWE-79网页生成过程中的输入中和不当(跨站脚本攻击)2,94990.57
CWE-798使用硬编码凭据1,34868.5
全部 16 个模型

总体信任指数

归一化评分,范围 0–100。分数越高,代表相对于同类模型而言漏洞越少——100 分仅表示在该数据集中漏洞最少,并不代表完全没有漏洞。

下载可视化报告

原始 6 款模型的评分与已发表的 RMIT 研究结果有所不同,这是因为归一化样本池已从 6 款扩展至 16 款。评分始终是相对于整个群体而言的。

Claude Sonnet 5
80.4
Claude Fable 5
76.4
GPT 5.3 Codex
75.3
Claude Opus 4.8
74.5
GPT 5.1
71.6
Gemini 3.1 Pro
66.6
GPT 5.5
66.5
Gemini 2.5 Pro
65.6
Claude Sonnet 4.5
65.2
Gemini 3.5 Flash
59.1
Devstral 2
53.1
Claude Haiku 4.5
50.7
Claude Sonnet 4.6
45.5
Gemini 2.5 Flash
39.4
Qwen3 Coder
32.7
GPT 5 Mini
21.6
框架

领先者因框架而异

模型的综合排名并不能保证它是特定技术栈中最安全的选择。

下载可视化报告
框架领先模型
Java Enterprise APIGPT-5.1
Java SpringClaude Sonnet 4.5
Python DjangoClaude Opus 4.8
C# (.NET)GPT-5.5
CClaude Fable 5
研究

研究方法

十六个 AI 模型各自生成了同一个复杂的费用管理应用程序(涵盖身份验证、文件上传、支付、数据库访问等功能),涉及 11 个框架,每个组合独立生成 10 次。所有代码库均使用相同的开源静态分析工具(Semgrep、Bearer、Bandit)进行扫描,并使用相同的智能代理流程对每一项发现进行误报验证。

下载可视化报告
已验证的独特漏洞发现
1,554
已确认的漏洞(真阳性)
27,000+
每个代码库的独立 SAST 工具
3
每个模型/框架对的运行次数
10
方法论

与皇家墨尔本理工大学合作开发

最初的研究与方法论是与皇家墨尔本理工大学(RMIT University)合作开发的,涵盖了首批测试的六个模型。Secure Code Warrior 使用相同的方法论,独立将研究范围扩展至 16 个模型。

阅读完整方法论

AI 软件治理与董事会级管控

What is the SCW AI Trust Index?

A living benchmark that measures how often leading AI models generate code with security vulnerabilities. Its methodology was originally developed with RMIT University and has since been independently extended by Secure Code Warrior to 16 models. It's updated as new models are released rather than published as a one-time study.

AI 生成的代码平均存在多少个漏洞?

在测试的 1,760 个代码库中,平均每个代码库有 15 个已确认漏洞,其中通常有 4 个或更多被评为严重(Critical)或高(High)级别。

Which AI model produces the most secure code?

No single model wins in every context. Claude Sonnet 5 scored highest overall at 80.4 out of 100, but the leading model changes by framework.

Does a model's API cost predict how secure its code is?

No. Across all 16 models tested, the most expensive model (Claude Fable 5, $174.94 per run) ranks 2nd overall, while the cheapest (Gemini 2.5 Flash, $0.58 per run) scores below average.

What is the most common security flaw in AI-generated code?

CWE-532 — writing sensitive information like passwords or tokens into application log files — appeared 8,543 times, more than any other flaw in the dataset.

How was the research conducted?

Sixteen AI models each generated the same application across 11 frameworks, 10 times each, scanned with the same tools and verification process every time.

还有问题吗?

支持详细信息以吸引可能处于困境的客户。

联系我们

率先实现 AI 辅助开发全流程治理

了解 Trust Agent:AI 如何在 AI 辅助开发中提供可见性、关联性和策略控制。

下载电子书
探索数据