Benchmark

WeaveBench

What is WeaveBench?

WeaveBench evaluates computer-use agents on 114 long-horizon tasks across 8 real-world work domains. Each task interleaves GUI interaction with command-line…

Released
2026-06-08
Evaluates
General AI, Language & Knowledge, cs.AI
Openness
unknown
Importer
Claire Radar
Review status
source-reviewed
Reported scores
0

Source provenance

WeaveBench paper, code and dataset

No reported scores are on record for this benchmark yet.

Which sources cite WeaveBench?

Related General AI, Language & Knowledge, cs.AI benchmarks