楼主: ewfwedwd
80 0

[经管数据集] Flickr30K Entities 数据集 [推广有奖]

  • 0关注
  • 1粉丝

已卖:486份资源

学科带头人

76%

还不是VIP/贵宾

-

威望
0 级
论坛币
1433 个
通用积分
458.0207
学术水平
6 点
热心指数
6 点
信用等级
6 点
经验
18903 点
帖子
1231
精华
0
在线时间
380 小时
注册时间
2022-11-18
最后登录
2026-9-28

楼主
ewfwedwd 发表于 2026-7-10 13:31:52 |AI写论文

+2 论坛币
k人 参与回答

经管之家送您一份

应届毕业生专属福利!

求职就业群
赵安豆老师微信:zhaoandou666

经管之家联合CDA

送您一个全额奖学金名额~ !

感谢您参与论坛问题回答

经管之家送您两个论坛币!

+2 论坛币

Flickr30K Entities 数据集下载 | 图像文本实体定位基准 视觉 grounding 核心数据集



Flickr30K Entities 是 Flickr30K 数据集的权威扩展版本,专为图像中文本实体提及的精确定位(Visual Grounding / Phrase Localization)而构建。该数据集在原有 158K 条图像描述句子的基础上,新增了 244K 条共指链(coreference chain)和 276K 个手动标注边界框(bounding box),实现了自然语言描述与图像区域级别的细粒度对齐,是视觉语言预训练、多模态大模型、图像文本 grounding 等方向的核心基准数据集。



数据集内容覆盖范围


Flickr30K Entities 基于 Flickr30K 的 31,783 张真实场景图像,提供多层次结构化标注:

图像描述:158K 条人工撰写的图像描述句子,覆盖日常生活、人物、动物、场景等多样化主题

共指链标注:244K 条 coreference chain,将同一图像内不同句子中对同一实体的指代关联起来,解决跨句实体一致性问题

边界框标注:276K 个精确的手动标注 bounding box,将文本中的名词短语与图像中的对应区域一一映射

实体类别:涵盖人、动物、物体、场景部件等多种实体类型,支持细粒度的短语定位任务



核心应用场景与可用途径


Flickr30K Entities 广泛应用于以下前沿研究与工程方向:

视觉语言理解与定位

Phrase Grounding(短语定位):给定图像描述中的名词短语,在图像中定位对应的边界框区域

Referring Expression Comprehension(指代表达理解):根据自然语言描述找到图像中的目标对象

Visual Question Answering(视觉问答):结合实体定位提升 VQA 模型的空间推理能力



多模态大模型与预训练


视觉语言预训练(VLP):作为 CLIP、ALBEF、BLIP、LLaVA 等模型的 grounding 能力评测基准

多模态对齐学习:训练图像-文本跨模态对齐模块,提升大模型的细粒度理解能力

指令微调(Instruction Tuning):用于构建视觉 grounding 指令数据集,增强多模态 LLM 的定位能力



计算机视觉与 NLP 交叉研究


图像字幕生成(Image Captioning):评估生成描述中实体与图像区域的对应准确性

实体级图像检索:支持基于文本实体的细粒度图像搜索与匹配

共指消解(Coreference Resolution):跨模态共指链的构建与推理研究


a4aa251e-b2f8-46d2-854d-d040842a1ed9.png






Flickr30K Entities 数据集.zip (42.67 KB, 需要: RMB 5 元)

二维码

扫码加我 拉你入群

请注明:姓名-公司-职位

以便审核进群资格,未注明则拒绝

关键词:entities ties 数据集 Reference bounding

您需要登录后才可以回帖 登录 | 我要注册

本版微信群
扫码
拉您进交流群
GMT+8, 2026-9-29 00:53