Temporal VIP描述 概述 本数据集用于视频重要人物检测任务,经过严格清理,移除了处理失败的视频。数据集包含结构化的视觉特征(npz文件)和大模型生成的语义描述(json文件),适用于多模态建模、时空分析和重要人物识别等研究方向。 数据集统计 训练集: 5549 个视频 验证集: 1850 个视频 测试集: 1850 个视频 总计: 9249 个视频 数据组成与格式 1. 视觉特征数据(npz文件) 每个视频对应一个 .npz 文件,字段如下: 字段名 形状示例 类型 说明 frames (120, 192, 336, 3) uint8 采样后的视频帧序列,RGB格式 bboxes (120, 20, 4) float32 每帧每人的边界框[x1, y1, x2, y2],已缩放到目标分辨率 person ids (120, 20) int32 每帧每人的唯一ID frame mask (120,) bool 帧有效性掩码,True为有效帧 person mask (120, 20) bool 人物存在掩码,True为该帧该索引有人物 target index () int 重要人物的索引位置(如无则为 1) original ids (20,) int32 索引到原始人物ID的映射 video id () string 视频唯一标识符 scene category () string 场景类别 字段说明: frames :用于视觉特征提取、时序建模。 bboxes 、 person ids 、 person mask :用于定位和跟踪每一帧中的所有人物。 target index :指示本视频中"重要人物"的索引,便于监督学习。 frame mask 、 person mask :用于筛选有效帧和有效人物,保证数据质量。 original ids :便于将索引还原为原始ID,支持跨帧/跨视频分析。 video id 、 scene category :视频的唯一标识和场景类别。 场景类别映射(01 11) (11个场景英文首单词,顺序与01 11目录一致) all scene names = ['Indoor', 'Outdoor', 'Educational', 'Daily', 'Social', 'Sports', 'Art', 'Medical', 'Formal', 'Emergency', 'Unknown'] 01 :Indoor Daily(室内日常) 02 :Outdoor Public(户外公共) 03 :Educational Teaching(教育教学) 04 :Daily Office(日常办公) 05 :Social Gathering(社交聚会) 06 :Sports(体育运动) 07 :Art and Perform…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy