网创工坊Ref-AVS
Ref-AVS:多模态音视场景的精准目标分割革命
Ref-AVS 是一项全新提出的任务,旨在通过自然语言中包含的多模态线索(如音频、视觉等)对视频中的目标进行精准分割。这种任务模仿了人类在现实世界中基于多模态信息识别和定位物体的能力,并通过创建首个Ref-AVS基准数据集进行实验验证,标志着音视场景理解的新进展。
SEARCH INTELLIGENCE
从资讯、AI应用到创新实践,让每一次搜索都能抵达更完整的数智脉络。
Ref-AVS 是一项全新提出的任务,旨在通过自然语言中包含的多模态线索(如音频、视觉等)对视频中的目标进行精准分割。这种任务模仿了人类在现实世界中基于多模态信息识别和定位物体的能力,并通过创建首个Ref-AVS基准数据集进行实验验证,标志着音视场景理解的新进展。