Remediation Benchmarks

The industry's first continuously updated benchmark for AI-powered security remediation across source code, binaries, containers, cloud infrastructure, Kubernetes, AI models, and software supply chains.

Weekly Benchmark Dashboard

Repositories Scanned

+2345
12,847

Artifacts Indexed

+47392
345,892

Vulnerabilities Detected

+12847
89,234

Remediations Generated

+8234
45,829

Pull Requests Submitted

+1823
12,847

Accepted Pull Requests

+1534
11,247

Avg Security Improvement

+0.9%
8.4%

Avg Time to Remediation

-0.4m
2.3m

Benchmark Categories

+5.2%

Source Code Remediation

Score89.4
2,847 benchmark cases
Updated 2 days ago
+3.1%

Binary Remediation

Score76.8
1,634 benchmark cases
Updated 3 days ago
+6.8%

Docker & OCI Images

Score82.3
4,521 benchmark cases
Updated 1 day ago
+4.5%

Kubernetes & Helm

Score85.7
3,012 benchmark cases
Updated 2 days ago
+2.3%

Cloud Infrastructure

Score79.2
2,156 benchmark cases
Updated 4 days ago
+7.9%

AI Models

Score84.6
1,289 benchmark cases
Updated 1 day ago
+9.4%

AI-Generated Code

Score72.1
1,856 benchmark cases
Updated 12 hours ago
+4.1%

Software Supply Chain

Score81.5
2,445 benchmark cases
Updated 3 days ago

Language Benchmarks

Rust

Avg Security Score92.1
Remediation Rate95.2%
Build Success98.5%
Common Vulns:

Unsafe Code, Panic Unwrap, Dependency Issues

Java

Avg Security Score88.3
Remediation Rate91.2%
Build Success94.1%
Common Vulns:

Injection, XXE, Deserialization

Go

Avg Security Score86.7
Remediation Rate89.5%
Build Success96.3%
Common Vulns:

Buffer Overflow, Race Conditions, Path Traversal

C#

Avg Security Score85.1
Remediation Rate88.2%
Build Success93.4%
Common Vulns:

Deserialization, SQL Injection, Format String

Python

Avg Security Score84.2
Remediation Rate87.3%
Build Success91.2%
Common Vulns:

Injection, Type Confusion, Unsafe Pickle

TypeScript

Avg Security Score83.8
Remediation Rate86.7%
Build Success90.2%
Common Vulns:

Type Bypass, Unsafe Any, Dependency Issues

JavaScript

Avg Security Score81.5
Remediation Rate84.1%
Build Success88.7%
Common Vulns:

XSS, CSRF, Prototype Pollution, Dependency Issues

C++

Avg Security Score79.2
Remediation Rate81.3%
Build Success86.1%
Common Vulns:

Buffer Overflow, Use After Free, Integer Overflow

Artifact Benchmarks

GitHub Repositories

45,823 analyzed

+3.2%
Avg Score82.4
Remediation %86.3%
12,547 critical findings

Docker Images

78,234 analyzed

+5.1%
Avg Score80.1
Remediation %83.7%
18,923 critical findings

AI Models

3,456 analyzed

+8.9%
Avg Score74.2
Remediation %79.1%
892 critical findings

Helm Charts

12,847 analyzed

+4.3%
Avg Score85.3
Remediation %88.2%
2,134 critical findings

Terraform

6,234 analyzed

+2.1%
Avg Score83.1
Remediation %85.9%
1,456 critical findings

Binaries

8,923 analyzed

+1.8%
Avg Score76.8
Remediation %78.3%
2,847 critical findings

Benchmark Methodology

Key Principle: Every benchmark measures verified remediation, not simply vulnerability detection. A fix only counts if it resolves the issue, compiles, passes all tests, and passes human review.

Acceptance Criteria for Verified Fix

Resolves the original vulnerability
Code compiles without errors
All existing tests pass
No new test failures introduced
Passes security scanning post-remediation
Approved by human security engineer

Research Library

🔐
Research

State of Open Source Security 2024

Security Research Team

Dec 15, 202412 min
📊
Benchmark

Enterprise Actions Benchmark Report

OpsMx Research

Dec 10, 202418 min
🐳
Container

Top Docker Security Report 2024

Container Security Team

Dec 5, 202415 min
🤖
AI

AI Model Security Landscape

AI Safety Research

Nov 28, 202416 min
📦
Container

Container Security Trends Q4 2024

Platform Security

Nov 20, 202411 min
Success

Remediation Success Report 2024

Engineering Analytics

Nov 15, 202414 min

Run Your Own Benchmarks

OpsMx Remediation Benchmarks is the transparent, continuously updated industry standard for measuring AI-powered security remediation quality.