missionbench-a7f2b6be·1 events·first seen Aliases: MissionBench
Researchers introduce MissionBench, a benchmark comprising 120 missions across five simulated 3D aerial environments and four task families, designed to evaluate multimodal LLMs as zero-shot embodied agents. Across 22 open- and closed-source MLLMs, the best model achieves under 35% success versus 84.4% human performance, revealing a large capability gap in long-horizon embodied tasks. The study finds scaling yields gains but that mission-level competence requires coordinating spatial perception, multi-step planning, and adaptive reasoning beyond what current models reliably provide.