Benchmark

OmegaUse-OfficeVal

What is OmegaUse-OfficeVal?

Evaluates LLM agents on long-horizon office-suite tasks from 100 practitioner-derived scenarios, scoring deliverable quality through code-based verifiers and…

Released
2026-07-29
Evaluates
General AI, Language & Knowledge, cs.AI
Openness
unknown
Importer
Claire Radar
Review status
unreviewed
Reported scores
0

Source provenance

OmegaUse-OfficeVal paper and code

No reported scores are on record for this benchmark yet.

Which sources cite OmegaUse-OfficeVal?

Related General AI, Language & Knowledge, cs.AI benchmarks