AI 신뢰 지수

AI가 생성한 코드에는 코드베이스당 15개의 취약점이 포함되어 있으며,
평균적으로

16개의 주요 AI 모델과 1,760개의 코드베이스를 대상으로 테스트한 결과, 모델 및 프레임워크별로 위험을 예측할 수 있음을 확인했습니다. 이를 통해 보안 책임자는 격차를 해소하는 데 필요한 데이터를 확보할 수 있습니다.

시각적 보고서 다운로드
데이터 살펴보기
테스트된 AI 모델
16
평가된 프레임워크
11
생성된 코드베이스
1,760
발견된 고유 CWE
86
한눈에 보기

SCW AI Trust Index란 무엇인가요?

SCW AI Trust Index는 주요 AI 모델이 보안 취약점이 포함된 코드를 생성하는 빈도를 측정하는 실시간 벤치마크입니다. 한 번 게시하고 방치하는 것이 아니라, 새로운 모델이 출시될 때마다 업데이트됩니다.

시각적 보고서 다운로드
태그 및 스타일 옵션이 포함된 동적 제목입니다

취약점은 예측 가능한 패턴을 따릅니다

취약점은 예측 가능한 패턴을 따릅니다. 1,760개의 코드베이스 전반에서 로깅 실패, 인젝션 결함, 잘못된 접근 제어와 같은 동일한 유형의 약점이 매번 반복적으로 나타납니다. AI가 생성하는 위험은 무작위가 아니라 반복적입니다.

태그 및 스타일 옵션이 포함된 동적 제목입니다

모든 모델에는 고유한 보안 지문이 있습니다

16개의 각 모델은 고유하고 반복적인 OWASP 카테고리 조합을 생성하므로, 팀은 특정 모델이 어디에서 위험을 초래할지 단순히 대응하는 것을 넘어 미리 예측할 수 있습니다.

태그 및 스타일 옵션이 포함된 동적 제목입니다

모든 분야에서 뛰어난 단일 모델은 없습니다

보안 리더십은 프레임워크에 따라 달라집니다. Java Enterprise API에서는 GPT-5.1이, Python Django에서는 Claude Opus 4.8이 앞서고 있습니다. 팀이 무엇을 개발하느냐에 따라 적합한 모델이 달라집니다.

태그 및 스타일 옵션이 포함된 동적 제목입니다

가격이 보안을 보장하지 않습니다

테스트한 16개 모델 중 가장 비싼 모델(Claude Fable 5, 실행당 $174.94)은 전체 2위를 차지한 반면, 가장 저렴한 모델(Gemini 2.5 Flash, 실행당 $0.58)은 평균 이하의 점수를 기록했습니다. 가격은 보안 수준을 보장하지 않습니다.

취약점

가장 흔한 결함은 결코 특이한 것이 아니며, 흔히 발생하는 인간의 실수를 그대로 반영합니다.

데이터셋 전반에서 86개의 고유한 CWE가 식별되었습니다. 그중 3개가 전체 확인된 결과의 상당 부분을 차지합니다.

시각적 보고서 다운로드
CWE ID이름진양성평균 위험도
CWE-532로그 파일 내 민감 정보 삽입8,54380.06
CWE-79웹 페이지 생성 시 입력값의 부적절한 중화 ('크로스 사이트 스크립팅')2,94990.57
CWE-798하드코딩된 자격 증명 사용1,34868.5
모델 16개 전체

종합 신뢰 지수

정규화 점수(0~100). 점수가 높을수록 다른 모델 대비 취약점이 적음을 의미하며, 100점은 데이터셋 내에서 가장 취약점이 적다는 뜻이지 취약점이 전혀 없다는 의미는 아닙니다.

시각적 보고서 다운로드

기존 6개 모델의 점수가 발표된 RMIT 연구와 다른 이유는 정규화 대상이 6개에서 16개 모델로 확대되었기 때문입니다. 점수는 항상 전체 그룹을 기준으로 상대적으로 산출됩니다.

Claude Sonnet 5
80.4
Claude Fable 5
76.4
GPT 5.3 Codex
75.3
Claude Opus 4.8
74.5
GPT 5.1
71.6
Gemini 3.1 Pro
66.6
GPT 5.5
66.5
Gemini 2.5 Pro
65.6
Claude Sonnet 4.5
65.2
Gemini 3.5 Flash
59.1
Devstral 2
53.1
Claude Haiku 4.5
50.7
Claude Sonnet 4.6
45.5
Gemini 2.5 Flash
39.4
Qwen3 Coder
32.7
GPT 5 Mini
21.6
프레임워크

프레임워크별 선두 모델

모델의 종합 순위가 특정 스택에 가장 안전한 선택임을 보장하지는 않습니다.

비주얼 리포트 다운로드
프레임워크선도 모델
Java Enterprise APIGPT-5.1
Java SpringClaude Sonnet 4.5
Python DjangoClaude Opus 4.8
C# (.NET)GPT-5.5
CClaude Fable 5
연구

연구 방법

16개의 AI 모델이 각각 동일한 복잡도의 경비 관리 애플리케이션(인증, 파일 업로드, 결제, 데이터베이스 액세스 기능 포함)을 11개의 프레임워크에서 조합당 10회씩 생성했습니다. 모든 코드베이스는 동일한 오픈소스 정적 분석 도구(Semgrep, Bearer, Bandit)로 스캔되었으며, 모든 발견 사항은 동일한 에이전트 프로세스를 통해 오탐 여부를 검증했습니다.

시각적 보고서 다운로드
검증된 고유 취약점 발견 건수
1,554
확인된 취약점 (진양성)
27,000+
코드베이스당 독립형 SAST 도구
3
모델/프레임워크 쌍당 실행 횟수
10
방법론

RMIT와 공동 개발

본 연구와 방법론은 RMIT 대학교와의 파트너십을 통해 개발되었으며, 초기 테스트된 6개 모델을 대상으로 했습니다. Secure Code Warrior는 동일한 방법론을 사용하여 연구 범위를 16개 모델로 독자적으로 확장했습니다.

전체 방법론 읽기

AI 소프트웨어 거버넌스 및 커밋 수준 제어

What is the SCW AI Trust Index?

A living benchmark that measures how often leading AI models generate code with security vulnerabilities. Its methodology was originally developed with RMIT University and has since been independently extended by Secure Code Warrior to 16 models. It's updated as new models are released rather than published as a one-time study.

AI가 생성한 코드에는 평균적으로 몇 개의 취약점이 있나요?

테스트한 1,760개 코드베이스 전반에서 코드베이스당 평균 15개의 확인된 취약점이 발견되었으며, 일반적으로 그중 4개 이상이 심각도가 높음(High) 또는 심각(Critical) 수준으로 분류됩니다.

Which AI model produces the most secure code?

No single model wins in every context. Claude Sonnet 5 scored highest overall at 80.4 out of 100, but the leading model changes by framework.

Does a model's API cost predict how secure its code is?

No. Across all 16 models tested, the most expensive model (Claude Fable 5, $174.94 per run) ranks 2nd overall, while the cheapest (Gemini 2.5 Flash, $0.58 per run) scores below average.

What is the most common security flaw in AI-generated code?

CWE-532 — writing sensitive information like passwords or tokens into application log files — appeared 8,543 times, more than any other flaw in the dataset.

How was the research conducted?

Sixteen AI models each generated the same application across 11 frameworks, 10 times each, scanned with the same tools and verification process every time.

아직도 궁금한 점이 있으신가요?

난감할 수 있는 고객을 사로잡기 위한 지원 세부 정보.

연락처

커밋 단계부터 AI 지원 개발을 관리하세요

Trust Agent: AI가 AI 지원 개발 전반에서 가시성, 상관관계 및 정책 제어를 어떻게 제공하는지 알아보십시오.

EBOOK 다운로드
데이터 살펴보기