Sansa Bench
Coding leaderboard for Sansa Bench, with charts, model comparison, and methodology. This dimension scores code generation across languages by running solutions against test cases.
Top models for Coding
- 1.
Claude-Opus-5 Reasoning High0.670
- 2.
Gemini-3.1-Pro-Preview Reasoning Low0.669
- 3.
Grok-4.1-Fast Reasoning Low0.658
- 4.
Gemini-3.1-Pro-Preview Reasoning High0.658
- 5.
Claude-Opus-4.8 Reasoning High0.593
Methodology: Coding
What it measures
Tests code generation tasks across multiple programming languages. Queries require writing code in Python, JavaScript, Bash, SQL, or other languages to solve programming problems, implement algorithms, or create functional programs. Code is evaluated through execution against test cases.
Scoring & Criteria
Returns score 1.0 if code executes successfully (returncode=0) and passes all tests. Returns 0.0 for syntax errors, runtime errors, test failures, missing dependencies, or timeouts. All submissions are executed and tested.
Evaluation Type: Code Generation
Grades code by executing it against test cases. Extracts Python code from markdown blocks and runs it in an isolated environment (local subprocess or Docker container).