Benchmark

VITA-Bench

VITA-Bench evaluates AI agents on real-world virtual task automation, measuring their ability to complete complex multi-step tasks in simulated…

Modality
text
Categories
reasoning, agents
Openness
unknown
Source
llm_stats
Reported scores
10

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Qwen3.5-122B-A10BQwen0.3362026-02-24evidence
Qwen3.5-27BQwen0.4192026-02-24evidence
Qwen3.5-35B-A3BQwen0.3192026-02-24evidence
Qwen3.5-397B-A17BQwen0.4972026-02-16evidence
Qwen3.5-4BQwen0.222026-03-02evidence
Qwen3.5-9BQwen0.2982026-03-02evidence
Qwen3.6 PlusQwen0.4432026-04-02evidence
Qwen3.6-35B-A3BQwen0.3562026-04-16evidence
Qwen3.7 MaxQwen0.4792026-05-19evidence
Qwen3.7-PlusQwen0.4562026-05-31evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.