Coding

Sansa Bench

Coding leaderboard for Sansa Bench, with charts, model comparison, and methodology. This dimension scores code generation across languages by running solutions against test cases.

Inspiration & Acknowledgments91 models testedUpdated Aug 8, 2026

Top models for Coding

  1. 1.Claude-Opus-5 Reasoning High0.670
  2. 2.Gemini-3.1-Pro-Preview Reasoning Low0.669
  3. 3.Grok-4.1-Fast Reasoning Low0.658
  4. 4.Gemini-3.1-Pro-Preview Reasoning High0.658
  5. 5.Claude-Opus-4.8 Reasoning High0.593

Methodology: Coding

What it measures

Tests code generation tasks across multiple programming languages. Queries require writing code in Python, JavaScript, Bash, SQL, or other languages to solve programming problems, implement algorithms, or create functional programs. Code is evaluated through execution against test cases.

Scoring & Criteria

Returns score 1.0 if code executes successfully (returncode=0) and passes all tests. Returns 0.0 for syntax errors, runtime errors, test failures, missing dependencies, or timeouts. All submissions are executed and tested.

Evaluation Type: Code Generation

Grades code by executing it against test cases. Extracts Python code from markdown blocks and runs it in an isolated environment (local subprocess or Docker container).

Example Question

Question:
Write a Python function `find_common_elements` that takes two lists of integers and returns a new list containing the unique elements common to both lists, sorted in ascending order. You should write self-contained code starting with:
```
def find_common_elements(list1, list2):
```
Answer:
import unittest
class TestCases(unittest.TestCase):
def test_basic(self):
self.assertEqual(find_common_elements([1, 2, 3, 4], [3, 4, 5, 6]), [3, 4])
def test_duplicates(self):
self.assertEqual(find_common_elements([1, 1, 2, 3], [1, 2, 2, 4]), [1, 2])
def test_empty(self):
self.assertEqual(find_common_elements([], [1, 2, 3]), [])
def test_no_common(self):
self.assertEqual(find_common_elements([1, 2], [3, 4]), [])