Benchmark

CharXiv-R

CharXiv-R is the reasoning component of the CharXiv benchmark, focusing on complex reasoning questions that require synthesizing information across visual…

Modality
multimodal
Categories
multimodal, reasoning, vision
Openness
unknown
Source
llm_stats
Reported scores
51

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude Mythos PreviewAnthropic0.9322026-04-07evidence
Claude Opus 4.6Anthropic0.7742026-02-05evidence
Claude Opus 4.7Anthropic0.912026-04-16evidence
Claude Opus 4.8Anthropic0.8992026-05-28evidence
Claude Sonnet 5Anthropic0.8832026-06-30evidence
Command A+Cohere0.5272026-05-20evidence
Gemini 3 FlashGoogle0.8032025-12-17evidence
Gemini 3 ProGoogle0.8142025-11-18evidence
Gemini 3.1 Flash-LiteGoogle0.7322026-03-03evidence
Gemini 3.5 FlashGoogle0.8422026-05-19evidence
Gemini 3.5 Flash-LiteGoogle0.7652026-07-21evidence
Gemini 3.6 FlashGoogle0.8942026-07-21evidence
Gemini 3.7 FlashGoogle0.8872026-08-13evidence
GPT-4.1OpenAI0.5672025-04-14evidence
GPT-4.1 miniOpenAI0.5682025-04-14evidence
GPT-4.1 nanoOpenAI0.4052025-04-14evidence
GPT-4.5OpenAI0.5542025-02-27evidence
GPT-4oOpenAI0.5882024-08-06evidence
GPT-5OpenAI0.8112025-08-07evidence
GPT-5.2OpenAI0.8212025-12-11evidence
GPT-5.5 InstantOpenAI0.8162026-05-05evidence
Inkling-SmallThinking Machines Lab0.7742026-07-30evidence
Kimi K2.5Moonshot AI0.7752026-01-27evidence
Kimi K2.6Moonshot AI0.8672026-04-20evidence
Kimi K3Moonshot AI0.9132026-07-16evidence
MiMo-V2.5Xiaomi0.812026-04-22evidence
Muse Glimmer-30BMeta0.7882026-08-10evidence
Muse SparkMeta0.8642026-04-08evidence
Muse Spark 1.1Meta0.8842026-07-09evidence
o3OpenAI0.7862025-04-16evidence
o4-miniOpenAI0.722025-04-16evidence
Qwen3 VL 235B A22B InstructQwen0.6212025-09-22evidence
Qwen3 VL 235B A22B ThinkingQwen0.6612025-09-22evidence
Qwen3 VL 30B A3B InstructQwen0.4892025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.5662025-09-22evidence
Qwen3 VL 32B InstructQwen0.6282025-09-22evidence
Qwen3 VL 32B ThinkingQwen0.6522025-09-22evidence
Qwen3 VL 4B InstructQwen0.3972025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.5032025-09-22evidence
Qwen3 VL 8B InstructQwen0.4642025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.532025-09-22evidence
Qwen3.5-122B-A10BQwen0.7722026-02-24evidence
Qwen3.5-27BQwen0.7952026-02-24evidence
Qwen3.5-35B-A3BQwen0.7752026-02-24evidence
Qwen3.6 PlusQwen0.8152026-04-02evidence
Qwen3.6-27BQwen0.7842026-04-21evidence
Qwen3.6-35B-A3BQwen0.782026-04-16evidence
Qwen3.7-PlusQwen0.8592026-05-31evidence
Qwen3.8-27BQwen0.9022026-08-14evidence
Seed 2.1 ProByteDance0.8642026-06-24evidence
Seed 2.1 TurboByteDance0.8362026-06-24evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.