Benchmark directory
Every benchmark in the catalog, each with its own page covering what it tests, who published it, and which scores are on record. The interactive dashboard is here.
1173 benchmarks
- A-Bench
- A-OKVQA
- AA-AnalystAgent
- AA-Briefcase
- AA-Briefcase
- AA-Index
- AA-LCR
- AA-LCR
- AA-Omniscience Accuracy
- AA-Omniscience Index
- AA-Omniscience Non-Hallucination Rate
- AbsPyramid
- ACEBench
- ActionAtlas
- ActivityNet
- Ada-LEval
- AdvancedIF
- AECBench
- ael_gate_benchmark_cases_template
- AetherCode
- AFQMC
- Agent Startup Bench
- AgentBoard
- AgentHarm
- AgentHazard
- AgentRewardBench
- Agents' Last Exam
- AGIEval
- AGIEval
- AgMMU
- AI2 Reasoning Challenge (ARC)
- AI2D
- AIDABench
- Aider
- Aider-Polyglot
- Aider-Polyglot Edit
- AIME
- AIME 2024
- AIME 2025
- AIME 2025
- AIME 2026
- AIR-Bench
- AIR-Bench
- AIRBench-2024
- AIRTBench
- AITZ_EM
- ALE-Bench
- AlignBench
- AlignBench
- AlpacaEval 2.0
- AMBROSIA
- AMC_2022_23
- AMO Bench
- AMSbench
- Android Control High_EM
- Android Control Low_EM
- AndroidBench
- AndroidWorld
- AndroidWorld_SR
- Aneumo
- Apex
- APEX-Agents
- APEX-Agents-AA
- APEX-SWE
- API-Bank
- APPS
- AQUA-RAT
- Arc
- ARC-AGI
- ARC-AGI v2
- ARC-AGI-3
- ARC-C
- ARC-c
- ARC-E
- ARC-e
- ArcAGI2
- Arena Hard
- Arena-Hard v2
- Arena-Hard-Auto
- ArgusInspection
- ARKitScenes
- Artifacts Bench
- ArtifactsBench
- Artificial Analysis
- ArXivMath
- ASDiv
- AssetOpsBench
- atlas
- AttaQ
- AudioJailbreak
- AudioTrust
- AutoAdvExBench
- AutoLogi
- AutomationBench
- AutomationBench-AA
- AutomationBench-AA
- AV-Odyssey-Bench
- AX-b
- AX-g
- AXBENCH
- BABILong
- BabyVision
- BankerToolBench
- BBH
- BBH
- BC-VL
- Beam 128K
- Belebele
- BenchCAD
- BenchCAD (with Python tool)
- BenchMAX
- Beyond AIME
- BFCL
- BFCL v2
- BFCL-v3
- BFCL-V4
- BFCL_v3_MultiTurn
- Big Bench Audio
- Big Finance Bench
- BIG-Bench
- BIG-Bench Extra Hard
- BIG-Bench Hard
- BigCodeBench
- BigCodeBench
- BigCodeBench-Full
- BigCodeBench-Hard
- BigOBench
- BioLP-Bench
- BioMysteryBench
- Bird-SQL (dev)
- BixBench
- BLINK
- BLINK
- Blueprint-Bench 2
- BoolQ
- BoolQ
- BRIGHT
- BrowseComp
- BrowseComp Long Context 128k
- BrowseComp Long Context 256k
- BrowseComp-VL
- BrowseComp-zh
- BUST
- ByteMorph
- C-Eval
- C-Eval
- C-FAITH
- C3
- CaLM
- Capture-the-Flag Challenges (Internal)
- CausalVQA
- CBNSL
- CC-Bench-V2 Backend
- CC-Bench-V2 Frontend
- CC-Bench-V2 Repo Exploration
- CC-OCR
- CEB
- CFEval
- CFinBench
- CFLUE
- CG-Bench
- CharadesSTA
- CHARM
- ChartMuseum
- ChartQA
- ChartQAPro
- CharXiv-D
- CharXiv-R
- CHASE-Code
- ChemBench
- CheXpert CXR
- CHID
- ChronoMagic-Bench
- CI Memories Coverage
- CI Memories Violation Rate
- CL-bench
- CL-bench (Life)
- Claw-Eval
- ClawEval-MM
- CleanPatrick
- clembench
- CLEVER
- ClimateViz
- CloningScenarios
- CLUEWSC
- CMB
- CMMLU
- CMMLU
- CMNLI
- CMT-Benchmark
- CNMO 2024
- CodeCriticBench
- CodeElo
- CodeForces
- Codegolf v2.2
- CodeMMLU
- Cohere Agentic Question Answering
- Cohere Data Analysis
- Cohere Memory Usage Quality
- COLLIE
- Collie
- ColorBench
- CombiBench
- Common Voice 15
- CommonSenseQA
- CommonSenseQA
- CompBench
- ComplexFuncBench
- Connectors
- ContextualJudgeBench
- ContPhy
- ConvBench
- COPA
- CORAL
- CorpusQA
- CorpusQA 1M
- CountBench
- CountQA
- CoVoST2
- CoVoST2 en-zh
- CoWorkBench
- CPRet
- CRAG
- CRAG
- Creation-MMBench
- Creative Writing v3
- CreativeWork
- CREW-WILDFIRE
- CriticBench
- CritPt
- CritPT
- CrossVid
- CrossWordBench
- Crows-Pairs
- CRPE
- CRPErelation
- CRUX-O
- CRUXEval-Input-CoT
- CruxEval-O
- CRUXEval-Output-CoT
- CS-Bench
- CS-Eval
- CSimpleQA
- CSL
- CSTS
- CTIBench
- CursorBench v3.2
- CVDP
- CVQA
- CVTG-2K
- CyBench
- CyberGym
- CyberSecEval
- CyberSecEval 4
- Cybersecurity CTFs
- DABstep
- DailyOmni
- DebugBench
- DECK-Bench
- Deepfake-Eval-2024
- DeepPlanning
- DeepResearchBench
- DeepSearchQA
- DeepSWE
- DeepSWE 1.0
- DeepSWE 1.1
- DermMCQA
- Design2Code
- DICE-BENCH
- DME
- DocVQA
- DocVQAtest
- Doubao Multi-Turn Bench
- DOVE
- DRACO
- DRAGON
- DROP
- DROP
- DS-1000
- DS-Arena-Code
- DS-FIM-Eval
- DSBench-FullStack
- DSBench-Hard
- DUDE
- DyCodeEval
- DynaMath
- DynaMath
- E-EVAL
- ECLeKTic
- EditInspector
- EgoNormia
- EgoSchema
- EHRNoteQA
- ELBench
- EmbodiedAgentInterface
- EmbodiedBench
- EmbSpatialBench
- EMMA
- EMMA
- EnterpriseOps-Gym-AA
- EPRSTMT
- EQ-Bench
- ER-Reason
- ERQA
- EvalPlus
- EWMBench
- ExploitBench
- ExploitGym
- FACTS Grounding
- FActScore
- FalseReject
- FEABench
- FedMABench
- FigQA
- Fin-Eva
- Finance Agent
- Finance Agent v1.1
- Finance Agent v2
- FinQA
- FinSearchComp T2&T3
- FinSearchComp-T3
- Flame-VLM-Code
- Flames
- FlenQA
- FLEURS
- Flores
- FLUB
- Forensics-bench
- FortisAVQA
- FRAMES
- FREB-TQA
- French MMLU
- Frontier Science
- Frontier-Bench v0.1
- FrontierCode
- FrontierCode 1.1
- FrontierCS
- FrontierMath
- FrontierMath Tier 4 (v2)
- FrontierScience Olympiad
- FrontierScience Research
- FrontierSWE
- FrontierSWE (Impl.)
- FullStackBench en
- FullStackBench zh
- FunctionalMATH
- GAIA
- GAIA2
- GameWorld
- GAOKAO-Bench
- GAOKAO-MM
- GAUGE
- GDP.pdf
- GDPval
- GDPval-AA
- GDPval-AA v2 (Elo)
- GDPval-AA v2 (normalized score)
- GDPval-MM
- GDPval-Rubrics
- GenAI-Bench
- GeneBench
- GeneBench-Pro
- General-Bench
- GiantSteps Tempo
- GitGoodBench
- Global PIQA
- Global-MMLU
- Global-MMLU-Lite
- GMAIMMBench
- Gorilla
- Gorilla Benchmark API Bench
- GovReport
- GPQA
- GPQA
- GPQA Biology
- GPQA Chemistry
- GPQA Diamond
- GPQA Physics
- GPT-ImgEval
- GrailQA
- GraphWalks
- Graphwalks BFS 1M
- Graphwalks BFS <128k
- Graphwalks BFS >128k
- Graphwalks parents <128k
- Graphwalks parents >128k
- GroundingSuite
- GroundUI-1K
- GSM-8K (CoT)
- GSM1k
- GSM8k
- GSM8K
- GSM8K Chat
- GSM8K-V
- GTA
- Gym4ReaL
- Hallusion Bench
- HallusionBench
- HaluEval
- HARDMath2
- Harvey LAB (Vals)
- Harvey LAB-AA
- Harvey LAB-AA
- HealthBench
- HealthBench Consensus
- HealthBench Hard
- HealthBench Professional
- HellaSwag
- HellaSwag
- HelloBench
- HERB
- HiddenMath
- HiPhO
- HLE-Verified
- HMMT 2025
- HMMT Feb 26
- HMMT25
- HoloBench
- HorizonMath
- HotpotQA
- HR-Bench (4k)
- HtFLlib
- HumanEval
- HumanEval
- HumanEval Plus
- HumanEval+
- HumanEval-Average
- HumanEval-ER
- HumanEval-Mul
- HumanEval-X
- HumanEvalFIM-Average
- Humanity's Last Exam
- Humanity's Last Exam (no tools, text-only)
- Humanity's Last Exam (with tools, text-only)
- Humanity’s Last Exam
- Hypersim
- HypoBench
- HypoEval
- IaC-Eval
- IF
- IFBench
- IFBench
- IFEval
- IFEval
- IFIR
- Image2FloorPlan
- ImageMining
- IMDL-BenCo
- IMO 2025
- IMO-AnswerBench
- IMOProof-Adv
- Include
- independence-bench
- IndicMMLU-Pro
- InfiBench
- InfiniteBench/En.MC
- InfiniteBench/En.QA
- InfoBench
- InfographicsQA
- InfoVQA
- InfoVQAtest
- Instruct HumanEval
- InstruSum
- InterGPS
- Internal API instruction following (hard)
- Internal Research Debugging Evaluation
- InternData-A1
- InternData-M1
- InternData-N1
- IntPhys2
- IPhO 2025
- IQBench
- IS-Bench
- ITBench
- ITBench-AA
- J1-Bench
- JailTrickBench
- JL1-CD
- Job Bench
- JOB-Complex
- JudgeBench
- K-Sort-Arena
- Kernel Bench L3
- KernelBench Hard
- KernelGen 1P
- Kimi Claw 24/7 Bench
- Kimi Code Bench v2
- KINA
- KITAB-Bench
- KMMLU-Redux
- KnowLogic
- KOFFVQA
- KOR-Bench
- L-Eval
- LABBench2
- LAMBADA
- LaMP-QA
- LangNavBench
- LaRA
- LBPP (v2)
- LCSTS
- Legal Agent Benchmark
- LENS
- LifeSciBench
- LINGOLY
- LingoQA
- LiveBench
- LiveBench
- LiveBench 20241125
- LiveCodeBench
- LiveCodeBench
- LiveCodeBench
- LiveCodeBench Pro
- LiveCodeBench v5
- LiveCodeBench v5 24.12-25.2
- LiveCodeBench v6
- LiveCodeBench(01-09)
- LiveLongBench
- LiveMathBench
- LiveMathematicianBench
- LiveSports-3K
- LiveSQLBench
- LLaVA-Bench
- LLM-BabyBench
- LLM-SRBench
- LLM-Uncertainty-Bench
- LLMThinkBench
- lm-evaluation-harness
- LMAct
- LMArena Text Leaderboard
- LOCA-Bench (256k)
- LOKI
- LongBench
- LongBench v2
- LongCodeBench
- LongFact
- LongFact Concepts
- LongFact Objects
- LongText-Bench
- LongVALE
- LongVideoBench
- LongVideoBench
- LoopNav
- LSAT
- LTMbenchmark
- LV-Eval
- LVBench
- M3T
- Management Consulting Tasks (Internal)
- MaritimeBench
- MASK
- MASK
- Massive-STEPS
- MastermindEval
- MATH
- MATH
- MATH (CoT)
- MATH-500
- MathArena Apex
- MathBench
- MathQA
- MathVerse
- MathVerse
- MathVerse-Mini
- MathVision
- MathVision
- MathVista
- MathVista
- MathVista-Mini
- MAVERIX
- MAVOS-DD
- MAXIFE
- MBPP
- MBPP
- MBPP ++ base version
- MBPP EvalPlus
- MBPP EvalPlus (base)
- MBPP pass@1
- MBPP Plus
- MBPP+
- MCiteBench
- MCP Atlas
- MCP-Mark
- MCP-Universe
- MeasureBench
- MedAgents-Bench
- MEDAL
- MedArabiQ
- MedBench
- MedBookVQA
- MedBrowseComp
- MedCalc-Bench
- MedChemBench (Internal)
- MedHallTune
- MedHallu
- MedJourney
- MedSafetyBench
- MedXpertQA
- MedXpertQA
- MedXpertQA-MM
- MEGA MLQA
- MEGA TyDi QA
- MEGA UDPOS
- MEGA XCOPA
- MEGA XStoryCloze
- Meld
- MER-UniBench
- Meta Internal Coding Bench
- MEWC
- MGSM
- MIABench
- MIB
- MicroVQA
- MIEB
- MiLiC-Eval
- MIMIC CXR
- MiMo Coding Bench
- Mind2Web
- Minerva
- miniCTX
- MiniLongBench
- MIRACL-VISION
- MIRAGE
- MJ-Bench
- MKQA
- MLCR-AA
- MLE-Bench
- MLE-Bench Lite
- MLRC-Bench
- MLS-Bench Lite
- MLVU
- MLVU
- MLVU-M
- MM IF-Eval
- MM-AlignBench
- MM-BrowserComp
- MM-ClawBench
- MM-IQ
- MM-Mind2Web
- MM-MT-Bench
- MM-RLHF
- MM-Vet
- MMAD
- MMAR
- MMAU
- MMAU Music
- MMAU Sound
- MMAU Speech
- MMBC
- MMBench
- MMBench
- MMBench-V1.1
- MMBench-Video
- MMBench-Video
- MMDU
- MME
- MME
- MME-CoT
- MME-RealWorld
- MME-RealWorld
- MMIE
- MMIR
- MMIU
- MMKE-Bench
- MMLongBench
- MMLongBench-128K
- MMLongBench-Doc
- MMLongBench-Doc
- MMLU
- MMLU
- MMLU (CoT)
- MMLU Chat
- MMLU French
- MMLU-Base
- MMLU-Pro
- MMLU-Pro
- MMLU-ProX
- MMLU-Redux
- MMLU-redux-2.0
- MMLU-STEM
- MMMLU
- MMMU
- MMMU
- MMMU (val)
- MMMU (validation)
- MMMU-Pro
- MMMU-Pro
- MMMU-Pro (with tools)
- MMMUval
- MMS-VPR
- MMSearch
- MMSearch
- MMSearch-Plus
- MMSI-Bench
- MMSIBench
- MMStar
- MMStar
- MMT-Bench
- MMT-Bench
- MMTB
- MMVet
- MMVetGPT4Turbo
- MMVU
- MobileMiniWob++_SR
- MobileWorld
- MolPuzzle
- Mono2Stereo
- MORSE-500
- MotionBench
- MotionBench
- MotionMillion
- MR-Ben-Meta-Reasoning-Benchmark
- MR-GSM8K
- MRAG-Bench
- MRCR
- MRCR 128K (2-needle)
- MRCR 128K (4-needle)
- MRCR 128K (8-needle)
- MRCR 1M
- MRCR 1M (pointwise)
- MRCR 64K (2-needle)
- MRCR 64K (4-needle)
- MRCR 64K (8-needle)
- MRCR v2
- MRCR v2 (8-needle)
- MRCR v2 (8-needle, 512K-1M)
- MS_MARCO
- MSQA
- MT-AIME 2025
- MT-Bench
- MT-Bench-101
- MTCMB
- MTEB
- MTVQA
- MTVQA
- MuirBench
- Multi-Challenge
- Multi-IF
- Multi-SWE-Bench
- MultiLF
- Multilingual MGSM (CoT)
- Multilingual MMLU
- MultiLoKo
- MultiPL-E
- Multipl-E HumanEval
- Multipl-E MBPP
- MusicCaps
- MuSR
- MVBench
- MVBench
- MVL-SIB
- MVPBench
- NanoGPT
- Natural Questions
- Natural2Code
- NaturalCodeBench
- NaturalProofs
- NewsBench
- Nexus
- NIH/Multi-needle
- NL2Repo
- NMOS
- nolima
- NoLiMa 128K
- NoLiMa 32K
- NoLiMa 64K
- NOVA-63
- NPPC
- NQ
- NQ
- Nuscene
- NutritionQA
- Objectron
- OCNLI
- OCRBench
- OCRBench
- OCRBench-V2 (en)
- OCRBench-V2 (zh)
- OCRBench_V2
- OctoCodingBench
- ODinW
- OfficeQA Pro
- OJBench
- OJBench (C++)
- OlymMATH
- OlympiadBench
- OlympiadBench
- OlympicArena
- Omni-MATH
- OmniAlign-V
- OmniBench
- OmniBench
- OmniBench Music
- OmniDocBench
- OmniDocBench
- OmniDocBench 1.5
- OmniGAIA
- OmniGIRL
- OmniMath
- OmniMMI
- OmniScience
- OmniScience (non-hallucination rate)
- OneMillion Bench
- Open-rewrite
- OpenAI MMLU
- OpenAI-MRCR: 2 needle 128k
- OpenAI-MRCR: 2 needle 1M
- OpenAI-MRCR: 2 needle 256k
- OpenBookQA
- OpenbookQA
- OpenFinData
- OpenRCA
- OpenTuringBench
- OpenUnlearning
- OPT-BENCH
- OptimBench
- OR-Bench
- Orak
- OSS-Bench
- OSWorld
- OSWorld 2.0
- OSWorld Extended
- OSWorld Screenshot-only
- OSWorld-G
- OSWorld-Verified
- OVBench
- OVOBench
- P-MMEval
- PaperBench
- PaperBench
- PashtoOCR
- PathMCQA
- PCA-Bench
- PerceptionBench
- PerceptionTest
- PersonaLens
- PertEval-scFM
- PhiBench
- PHYBench
- PhyGenBench
- PhysicsFinals
- PhysReason
- PICABench
- PinchBench
- PIQA
- PIQA
- PlanBench
- PLawBench
- PMC-VQA
- PointGrounding
- PokerBench
- PolyMATH
- PolyMath-en
- POPE
- POPE
- PopQA
- PosterSum
- PostTrainBench
- PostTrainBench Lite
- PRBench-Finance
- PRBench-Legal
- PresentBench
- PRMBench_Preview
- ProBench
- ProcessBench
- ProfBench
- Program Bench
- ProJudge
- ProofNet
- ProtocolQA
- Q-Bench
- QASC
- Qasper
- QMSum
- QVHighlights
- QwenClawBench
- QwenQoderBench
- QwenReactBench
- QwenSVG
- QwenSWEBench
- QwenWebBench
- QwenWorldBench
- RACE(High)
- RACE(Middle)
- RDB2G-Bench
- RE-Bench
- REAL
- RealKIE-FCC
- RealToxicityPrompts
- RealWorldQA
- RealworldQA
- ReCoRD
- RecreationBench
- RedCode
- RefCOCO-avg
- RefCOCOg
- RefSpatialBench
- RepLiQA
- Repo Env
- RepoBench
- RepoQA
- ResearchClawBench
- Reveal
- RewardBench
- RExBench
- RFUAV
- RigorousBench
- RISEBench
- RM-Bench
- RoboSpatialHome
- Robust IF
- RoleLLM
- RSI Index
- RSMMVP
- RTE
- RULER
- RULER 1000K
- RULER 128k
- RULER 2048K
- RULER 512K
- RULER 64k
- RUListening
- RXRX3-CORE
- S-Eval
- S1-Bench
- SAEBench
- SafetyBench
- SALAD-Bench
- SAT Math
- SCAM
- SciCode
- SciCode
- ScienceQA
- ScienceQA
- ScienceQA Visual
- SciFIBench
- ScreenSpot
- ScreenSpot Pro
- Seal-0
- Search and Function-Calling
- SEC-bench
- SEC-bench Pro
- SecBench
- SecCodeBench
- SEED-Bench
- SEED-Bench-2
- SEED-Bench-2-Plus
- SeedClawBench
- SFE
- SG-Bench
- SGI-Bench
- Shell
- ShoppingMMLU
- SIFO
- SIFO-Multiturn
- SimpleQA
- SimpleQA Verified
- SimpleVQA
- SIQA
- Siren AgentDojo Attack Success Rate
- Siren AgentDojo Utility
- SkillsBench
- SlakeVQA
- SmartBench
- SMMILE
- Social IQa
- Spatial457
- Spider
- Spider
- Spider2-V
- SportQA
- SpreadsheetBench
- SpreadsheetBench 2
- SpreadSheetBench-v1
- SQuALITY
- StableToolBench
- STARK_10k
- STEM
- StrategyQA
- StructFlowBench
- StructTokenBench
- StudentEval
- StyleRec
- SummScreenFD
- SUNRGBD
- SuperChem
- SuperGLUE
- SuperGPQA
- SuperGPQA
- SURDS
- SVAMP
- SVG-Bench
- SWE Atlas - Codebase QnA
- SWE Atlas - Test Writing
- SWE-Atlas
- SWE-bench Multilingual
- SWE-Bench Multimodal
- SWE-Bench Pro
- SWE-Bench Verified
- SWE-bench Verified (Agentic Coding)
- SWE-bench Verified (Agentless)
- SWE-bench Verified (Multiple Attempts)
- SWE-bench-Live
- SWE-Factory
- SWE-fficiency
- SWE-Lancer
- SWE-Lancer (IC-Diamond subset)
- SWE-Marathon
- SWE-MM
- SWE-Perf
- SWE-Review
- SwiLTra-Bench
- SWT-Bench
- T-Eval
- t2-bench
- TabFact
- TableEval
- TaskBench
- Tau-bench
- TAU-bench Airline
- TAU-bench Retail
- Tau2 Airline
- Tau2 Retail
- Tau2 Telecom
- Tau3 Airline
- Tau3 Banking
- Tau3 Retail
- Tau3 Telecom
- TAU3-Bench
- TempCompass
- Terminal-Bench
- Terminal-Bench 2.0
- Terminal-Bench 2.1
- Terminal-Bench 3.0
- Terminal-Bench Hard
- Terminal-Bench Hard
- Terminal-Bench v2.1
- Terminus
- testing
- Text2World
- TextVQA
- TGLG
- Thai_local_benchmark
- TheoremQA
- TheoremQA
- Threat-Signature_Eval
- THUNDER
- TimeTravel
- tiny_qa_benchmark_pp
- TIR-Bench
- TLDR9+ (test)
- TOMATO
- Toolathlon
- ToolHop
- ToolRet
- Trae Code Gen
- Trae Error Fix
- TransBench
- Translation en→Set1 COMET22
- Translation en→Set1 spBleu
- Translation Set1→en COMET22
- Translation Set1→en spBleu
- TransLaw
- TreeBench
- TriviaQA
- TriviaQA
- TruthfulQA
- TruthfulQA
- TVBench
- TydiQA
- TyDiQA
- U-NIAH
- ubuntu_osworld
- UHGEval
- UniBench
- Uniform Bar Exam
- UrbanVideo-Bench
- USAMO 2026
- USAMO25
- UTBoost
- V*
- V-STaR
- VATEX
- VBench
- VCR_en_easy
- Vending-Bench 2
- VIBE
- VIBE
- VIBE Android
- VIBE Backend
- VIBE iOS
- VIBE Simulation
- VIBE Web
- Vibe-Eval
- VIBE-Pro
- VIBE-V2
- Video-MME
- Video-MME
- Video-MME (long, no subtitles)
- VideoGUI
- VideoHolmes
- VideoMathQA
- VideoMME w sub.
- VideoMME w/o sub.
- VideoMMMU
- VideoReasonBench
- VideoSimpleQA
- ViLBench
- Virology Capabilities Test
- VISCO
- VisFactor
- Vision2Web
- ViStoryBench
- VisualPuzzles
- VisualSimpleQA
- VisualWebBench
- VisuLogic
- VITA-Bench
- VKnowU
- VLADBench
- VLM2-Bench
- VLMsAreBiased
- VLMsAreBlind
- VocalSound
- VoiceBench Avg
- VQA-Rad
- VQAv2
- VQAv2 (test)
- VQAv2 (val)
- VRBench
- We-Math
- Web Bench
- WebArena-Verified
- WebDev Arena
- WebUI-Bench
- WebVoyager
- WhodunitBench
- WiC
- WideSearch
- WikiContradict
- WikiSQL
- Wild Bench
- WildBench
- WildClawBench
- WildClawBench
- Winogrande
- WinoGrande
- WMDP
- WMT23
- WMT24++
- Workspace Bench
- WorldBench
- WorldGenBench
- WorldScore
- WorldVQA
- WritingBench
- WritingBench
- WSC
- xCodeEval
- xDailyBench
- XLSum English
- XSTest
- XSum
- xVerify
- YC-Bench
- Yue_Benchmark
- ZClawBench
- ZebraLogic
- ZEROBench
- ZeroBench
- ZEROBench-Sub
- τ²-Bench Telecom
- τ³-Banking