GSA volc GSA Embodied Perception Training Dataset Large scale Grounding Spatial Affordance (GSA) training data for embodied perception Teacher models. Data Summary Metric Count Total Images ~580K Total Annotations 3,267,527 SFT Samples 1,000,000 GRPO Samples 250,526 Dimensions 6 (G grounding / S spatial / A identity attr / A obj state / A action precondition / A action interface) Dimension Distribution (SFT) Category Target Actual G (Grounding) 40% 400,000 S (Spatial) 40% 400,000 A (Affordance) 20% 200,000 Directory Structure ''' GSA volc/ ├── images/ Images organized by source │ ├── visual genome/ 108K images │ ├── grasp anything/ 398K images │ ├── benchmark/ 47K images │ ├── bridgev2/ 25K images │ └── ... ├── annotations/ │ ├── flywheel verified/ Verified by GSA data flywheel (6 dims) │ ├── converted/ Converted from public datasets (1.6M) │ ├── sft train.jsonl ms swift SFT format (1M) │ └── grpo train.jsonl ms swift GRPO format (250K) ├── flywheel batches/ Batch configs for additional generation └── metadata/ ├── manifest.json └── image entries.jsonl ''' Training Format (SFT ms swift compatible) '''json { "messages": [ {"role": "system", "content": "You are an embodied perception…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy