AIトラストインデックス

AIが生成したコードには、コードベースあたり15件の脆弱性が含まれています。
平均して

16種類の主要AIモデルと1,760のコードベースを対象としたテストにより、リスクはモデルやフレームワークごとに予測可能であることが判明しました。これにより、セキュリティリーダーはギャップを埋めるための的確な判断が可能になります。

ビジュアルレポートをダウンロード
データを確認する
テスト済みAIモデル
16
評価済みフレームワーク
11
生成されたコードベース
1,760
検出された固有のCWE
86
概要

SCW AI Trust Indexとは?

SCW AI Trust Indexは、主要なAIモデルがどの程度の頻度でセキュリティ脆弱性のあるコードを生成するかを測定する、常に更新されるベンチマークです。一度公開して終わりではなく、新しいモデルがリリースされるたびに更新されます。

ビジュアルレポートをダウンロード
タグとスタイルオプションを備えた動的な見出しです

脆弱性には予測可能なパターンがあります

脆弱性には予測可能なパターンがあります。1,760のコードベース全体で、ログ記録の失敗、インジェクションの欠陥、アクセス制御の不備といった同じ種類の弱点が繰り返し発生しています。AIが生成するリスクはランダムではなく、再現性があるのです。

タグとスタイルオプションを備えた動的な見出しです

すべてのモデルには独自のセキュリティフィンガープリントがあります

16種類の各モデルは、それぞれ固有の再現性あるOWASPカテゴリの組み合わせを残すため、チームは特定のモデルがどこでリスクをもたらす可能性が高いかを、事後対応ではなく予測できるようになります。

タグとスタイルオプションを備えた動的な見出しです

すべての分野で勝るモデルは存在しない

セキュリティの優位性はフレームワークによって異なります。Java Enterprise APIではGPT-5.1が、Python DjangoではClaude Opus 4.8がリードしています。最適なモデルは、チームが何を構築しているかによって決まります。

タグとスタイルオプションを備えた動的な見出しです

コストはセキュリティを予測しない

テストした全16モデルのうち、最も高価なモデル(Claude Fable 5、1実行あたり174.94ドル)は総合2位にランクインしましたが、最も安価なモデル(Gemini 2.5 Flash、1実行あたり0.58ドル)は平均を下回りました。価格はセキュリティの良し悪しを予測する指標にはなりません。

脆弱性

最も一般的な欠陥は決して珍しいものではなく、人間が犯しやすい典型的なミスを模倣しています。

データセット全体で86種類のCWEが特定されました。そのうち3種類が、確認された全調査結果の不釣り合いな割合を占めています。

ビジュアルレポートをダウンロード
CWE ID名称真陽性平均リスク
CWE-532ログファイルへの機密情報の挿入8,54380.06
CWE-79Webページ生成時の入力の不適切な無害化(クロスサイトスクリプティング)2,94990.57
CWE-798ハードコードされた認証情報の使用1,34868.5
全16モデル

総合信頼性インデックス

正規化スコア(0~100)。数値が高いほど、他のモデルと比較して脆弱性が少ないことを示します。100というスコアは、本データセット内で最も脆弱性が少ないことを意味し、脆弱性がゼロであることを示すものではありません。

ビジュアルレポートをダウンロード

当初の6モデルのスコアが公開されたRMITの研究結果と異なるのは、正規化の対象が6モデルから16モデルに拡大されたためです。スコアは常に全コホートとの相対値となります。

Claude Sonnet 5
80.4
Claude Fable 5
76.4
GPT 5.3 Codex
75.3
Claude Opus 4.8
74.5
GPT 5.1
71.6
Gemini 3.1 Pro
66.6
GPT 5.5
66.5
Gemini 2.5 Pro
65.6
Claude Sonnet 4.5
65.2
Gemini 3.5 Flash
59.1
Devstral 2
53.1
Claude Haiku 4.5
50.7
Claude Sonnet 4.6
45.5
Gemini 2.5 Flash
39.4
Qwen3 Coder
32.7
GPT 5 Mini
21.6
フレームワーク

フレームワークによってリーダーは変わります

モデルの総合ランクが高いからといって、特定のスタックにとって最も安全な選択肢であるとは限りません。

ビジュアルレポートをダウンロード
フレームワーク主要モデル
Java Enterprise APIGPT-5.1
Java SpringClaude Sonnet 4.5
Python DjangoClaude Opus 4.8
C# (.NET)GPT-5.5
CClaude Fable 5
リサーチ

調査手法

16種類のAIモデルが、認証、ファイルアップロード、決済、データベースアクセスといった機能を備えた複雑な経費管理アプリケーションを、11種類のフレームワークを用いてそれぞれ10回ずつ生成しました。すべてのコードベースを同一のオープンソース静的解析ツール(Semgrep、Bearer、Bandit)でスキャンし、すべての検出結果に対して同一のエージェントプロセスを用いて誤検知の検証を行いました。

ビジュアルレポートをダウンロード
検証済みの脆弱性検出数
1,554
確認された脆弱性(真陽性)
27,000+
コードベースごとの独立したSASTツール
3
モデル/フレームワークのペアごとの実行回数
10
調査手法

RMIT大学との共同開発

当初の調査および手法はRMIT大学との提携により開発され、テストされた最初の6つのモデルを対象としていました。Secure Code Warriorは、その手法を用いて独自に調査対象を16モデルまで拡大しました。

調査手法の全文を読む

AI ソフトウェアガバナンスとコミットレベルの制御

What is the SCW AI Trust Index?

A living benchmark that measures how often leading AI models generate code with security vulnerabilities. Its methodology was originally developed with RMIT University and has since been independently extended by Secure Code Warrior to 16 models. It's updated as new models are released rather than published as a one-time study.

AIが生成したコードには、平均していくつの脆弱性がありますか?

テストした 1,760 のコードベース全体で、コードベースあたり平均 15 件の確認済みの脆弱性があり、通常はそのうち 4 件以上が重大(Critical)または高(High)と評価されます。

Which AI model produces the most secure code?

No single model wins in every context. Claude Sonnet 5 scored highest overall at 80.4 out of 100, but the leading model changes by framework.

Does a model's API cost predict how secure its code is?

No. Across all 16 models tested, the most expensive model (Claude Fable 5, $174.94 per run) ranks 2nd overall, while the cheapest (Gemini 2.5 Flash, $0.58 per run) scores below average.

What is the most common security flaw in AI-generated code?

CWE-532 — writing sensitive information like passwords or tokens into application log files — appeared 8,543 times, more than any other flaw in the dataset.

How was the research conducted?

Sixteen AI models each generated the same application across 11 frameworks, 10 times each, scanned with the same tools and verification process every time.

まだ質問がありますか?

迷っているかもしれない顧客を獲得するためのサポート詳細

連絡

コミットで AI 支援開発を最初に管理しましょう

Trust Agent: AI が AI 支援開発全体でどのように可視化、相関関係、ポリシー制御を実現するかをご覧ください。

電子書籍をダウンロードする
データを探索する