WorldMemArena WorldMemArena is a large scale multimodal memory benchmark designed to evaluate how well AI systems retain, update, and recall information across extended multi session interactions grounded in real world scenarios. Dataset Summary Split Samples Sessions Turns Images Memory Points QA Pairs : : : : : : Agent / GUI 203 4,074 16,252 5,755 13,907 10,382 Agent / Embodied 220 3,075 12,087 6,437 12,186 11,788 Lifelong / Project 18 540 14,580 1,601 6,980 990 Lifelong / Personal 20 600 16,320 1,803 7,121 1,100 Total 461 8,489 59,239 15,595 40,194 24,258 Scale highlights: ~2.8M total words of dialogue across all samples Lifelong samples average 30 sessions and ~57K words each, comparable to a short novel Agent samples average 15~20 sessions with ~29 screenshots each 11 question types spanning factual recall, dynamic updates, visual reasoning, and cross modal integration Dataset Structure Each subcategory folder contains: {sample id}.json — the full sample including sessions, memory points, and QA checkpoints images/{sample id}/ — all associated images for that sample (relative paths) small ids.json small ids.json is a JSON array of 150 sample IDs that form a balanced subset of…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy