Benchmark

EvalLab

What is EvalLab?

Provides a frozen 120-task Python coding benchmark with paired comparisons and uncertainty analysis focused on ranking stability.

Released
2026-08-22
Evaluates
Language & Knowledge, Software & AI Compute, cs.AI
Openness
unknown
Importer
Claire Radar
Review status
ai-name-audit-deferred
Reported scores
0

Source provenance

EvalLab code

No reported scores are on record for this benchmark yet.

Which sources cite EvalLab?

Related Language & Knowledge, Software & AI Compute, cs.AI benchmarks