Benchmark

OSWorld-Verified

OSWorld-Verified is a verified subset of OSWorld, a scalable real computer environment for multimodal agents supporting task setup, execution-based…

Modality
multimodal
Categories
multimodal, general, agents, vision
Openness
unknown
Source
llm_stats
Reported scores
24

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude Fable 5Anthropic0.852026-06-09evidence
Claude Mythos PreviewAnthropic0.7962026-04-07evidence
Claude Opus 4.7Anthropic0.782026-04-16evidence
Claude Opus 4.8Anthropic0.8342026-05-28evidence
Claude Sonnet 5Anthropic0.8122026-06-30evidence
Gemini 3.5 FlashGoogle0.7842026-05-19evidence
Gemini 3.5 Flash-LiteGoogle0.742026-07-21evidence
Gemini 3.6 FlashGoogle0.832026-07-21evidence
GPT-5.3 CodexOpenAI0.6472026-02-05evidence
GPT-5.4OpenAI0.752026-03-05evidence
GPT-5.4 miniOpenAI0.7212026-03-17evidence
GPT-5.4 nanoOpenAI0.392026-03-17evidence
GPT-5.5OpenAI0.7872026-04-23evidence
Kimi K2.6Moonshot AI0.7312026-04-20evidence
MiniMax M3MiniMax0.70062026-06-01evidence
Muse Glimmer-30BMeta0.6592026-08-10evidence
Muse Spark 1.1Meta0.8082026-07-09evidence
Qwen3.5-122B-A10BQwen0.582026-02-24evidence
Qwen3.5-27BQwen0.5622026-02-24evidence
Qwen3.5-35B-A3BQwen0.5452026-02-24evidence
Qwen3.6 PlusQwen0.6252026-04-02evidence
Qwen3.7-PlusQwen0.7332026-05-31evidence
Qwen3.8 MaxQwen0.8612026-08-02evidence
Qwen3.8-27BQwen0.8432026-08-14evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.