Temporal-VIP描述
概述
本数据集用于视频重要人物检测任务,经过严格清理,移除了处理失败的视频。数据集包含结构化的视觉特征(npz文件)和大模型生成的语义描述(json文件),适用于多模态建模、时空分析和重要人物识别等研究方向。
数据集统计
- 训练集: 5549 个视频
- 验证集: 1850 个视频
- 测试集: 1850 个视频
- 总计: 9249 个视频
数据组成与格式
1. 视觉特征数据(npz文件)
每个视频对应一个.npz文件,字段如下:
| 字段名 | 形状示例 | 类型 | 说明 |
|---|---|---|---|
| frames | (120, 192, 336, 3) | uint8 | 采样后的视频帧序列,RGB格式 |
| bboxes | (120, 20, 4) | float32 | 每帧每人的边界框[x1, y1, x2, y2],已缩放到目标分辨率 |
| person_ids | (120, 20) | int32 | 每帧每人的唯一ID |
| frame_mask | (120,) | bool | 帧有效性掩码,True为有效帧 |
| person_mask | (120, 20) | bool | 人物存在掩码,True为该帧该索引有人物 |
| target_index | () | int | 重要人物的索引位置(如无则为-1) |
| original_ids | (20,) | int32 | 索引到原始人物ID的映射 |
| video_id | () | string | 视频唯一标识符 |
| scene_category | () | string | 场景类别 |
字段说明:
frames:用于视觉特征提取、时序建模。bboxes、person_ids、person_mask:用于定位和跟踪每一帧中的所有人物。target_index:指示本视频中"重要人物"的索引,便于监督学习。frame_mask、person_mask:用于筛选有效帧和有效人物,保证数据质量。original_ids:便于将索引还原为原始ID,支持跨帧/跨视频分析。video_id、scene_category:视频的唯一标识和场景类别。
场景类别映射(01-11)
(11个场景英文首单词,顺序与01-11目录一致) all_scene_names = ['Indoor', 'Outdoor', 'Educational', 'Daily', 'Social', 'Sports', 'Art', 'Medical', 'Formal', 'Emergency', 'Unknown']
01:Indoor Daily(室内日常)02:Outdoor Public(户外公共)03:Educational Teaching(教育教学)04:Daily Office(日常办公)05:Social Gathering(社交聚会)06:Sports(体育运动)07:Art and Performance(艺术与表演)08:Medical and Nursing(医疗护理)09:Formal Meeting(正式会议)10:Emergency or Special Event(紧急或特殊事件)11:Unknown or Unclassifiable(未知或不可分类)
2. 语义描述数据(json文件)
每个视频对应一个.json文件,字段如下:
| 字段名 | 类型 | 说明 |
|---|---|---|
| context_description | string | 视频整体场景描述,简要介绍场景、氛围和主要活动 |
| person_descriptions | list | 人物列表,每个元素为一个字典,包含person_id和feature字段 |
| vip_description | dict | 重要人物描述,包含person_id和explanation |
| video_name | string | 视频文件名(与npz文件名一致) |
person_descriptions结构:
person_id:字符串,人物ID(与npz中的original_ids对应)feature:字典,包含以下子字段:location:人物在画面中的位置描述action:人物当前的动作或行为expression:人物表情或情绪interaction:与其他人物的互动关系
vip_description结构:
person_id:字符串,重要人物IDexplanation:字符串,说明为何该人物被认为是重要人物
数据索引与掩码机制
- 人物索引一致性:所有帧中同一索引位置对应同一个人物ID,便于时序建模。
- 掩码使用:
frame_mask:筛选有效帧,避免无效帧干扰训练。person_mask:筛选有效人物,支持稀疏场景下的鲁棒建模。
数据预处理与清理流程
- 帧采样与补齐:每个视频均匀采样120帧,不足则补齐。
- 边界框与ID处理:统一分配人物索引,缩放边界框,保证跨帧一致性。
- 重要人物标注:通过人工或自动方式标注重要人物索引。
- 语义描述生成:利用大模型自动生成每个视频的结构化语义描述。
- 异常数据剔除:移除target_index为-1或其他异常样本,保证数据质量。
目录结构
preprocessed_fixed/train|val|test/:视觉特征npz文件llm_marked_videos_description/train|val|test/:语义描述json文件
使用建议
- 训练/评估时,建议严格根据
frame_mask和person_mask筛选有效数据。 - 多模态任务可联合使用npz和json文件,进行视觉-语义对齐、事件检测、重要人物识别等研究。
- 若需还原原始人物ID,可通过
original_ids字段实现。
版本与更新
- 本描述文档对应数据集最新划分(train: 5549,val: 1850,test: 1850,总计: 9249)。
- 最后更新:2026年3月
如需进一步了解字段含义或数据使用范例,请参考项目代码或联系数据集维护者。