DiDeMo时间定位数据集下载 | 视频自然语言时刻检索基准数据集 | 含训练/验证/测试集
内容覆盖范围
DiDeMo(Distinct Describable Moments)是由Flickr采集的视频时间定位基准数据集,专为自然语言驱动的视频时刻检索任务设计。数据集将视频统一剪辑为30秒以内片段,并按5秒间隔划分标注单元以降低人工标注复杂度。整体规模覆盖10,464个视频,细分为训练集8,395个、验证集1,065个、测试集1,004个,总计包含26,892个经人工验证的精确时刻标注。
该数据集的核心价值在于描述文本的高细粒度与多维度覆盖:每条描述均经过多轮验证,确保单一时刻对应唯一语义。描述内容涵盖摄像机运动(如推轨、变焦)、时间转换指标(如"第一次""随后")及具体活动行为,适用于需要理解时序关系与视觉语义对齐的模型训练。
可用途径与适用场景
学术研究:作为视频自然语言定位(Video-Language Grounding)的标准评测基准,广泛用于CVPR、ICCV、ECCV等顶会的时刻检索、时序动作定位、视频问答等方向研究。
模型训练:支持跨模态预训练模型(如MCN、2D-TAN、Moment-DETR等)在时序边界回归与语义对齐任务上的训练与调优。
工程落地:为短视频内容检索、智能视频剪辑、自动化字幕对齐、监控事件定位等AI应用提供高质量标注数据支撑。
教学演示:适用于计算机视觉、多媒体分析相关课程的案例教学与实验复现。
DiDeMo 时间定位数据集.zip
(45.13 KB, 需要: RMB 5 元)


雷达卡


京公网安备 11010802022788号







