竞赛挑战
汇聚全球顶级多模态算法竞赛,提供真实场景数据,赢取丰厚奖金与学术荣誉。

2026 SLoMO-AD:电影音频描述生成竞赛
本赛事要求参赛者根据电影及对白间隙的目标时间段生成简洁、选择性强且前后连贯的音频描述,服务盲人及低视力观众,重点考察长时上下文理解、角色识别与电影叙事能力。比赛使用 CMD-AD 与 SF20K,设置开放组和每词元激活参数少于 100 亿的轻量组;最终以 ADQA 与 CIDEr 加权得分排名,并通过时长检查保证描述适配对白空隙。

Perception Test 2026挑战赛:KilometerVision
本任务面向最长10分钟、约1公里的步行游览视频,要求模型结合视频内容、文本问题及文本或图像选项,回答距离估计、指南针朝向、地图路径理解和地标识别等空间推理问题。比赛设置标准视频问答、图像答案选项和题干含图像三种配置,基于Walking_Tours数据集开展验证与测试,以Top-1准确率评估;模型规模不限,优胜者纳入总额2万欧元奖金评选。

Perception Test 2026挑战赛:KilometerAudio
本任务面向1至3小时的长视频,要求模型联合处理画面、音轨和文本问题,完成声音识别、语音理解以及音频事件与视觉内容关联等多跳推理,并从五个候选答案中选择正确项,重点考察模型在超长时序场景中的跨模态信息定位与综合理解能力。比赛基于Walking_Tours数据集,包含225段公开视频;验证与测试阶段均以Top-1准确率评估,模型规模不限,优胜者参与总额2万欧元奖金评选。

Perception Test 2026挑战赛:Grounded VideoQA
本任务要求模型根据视频与文本问题,在整段视频中持续跟踪能够回答问题的目标对象,并输出其时序定位结果。比赛采用Perception Test中带有Grounded VideoQA标注的高分辨率视频,数据包含RGB画面与音频,视频最长35秒、30帧每秒、最高1080p;训练、验证和测试集分别含586、1545和932段视频。验证与测试均以HOTA指标评估,模型规模不限,优胜者参与总额2万欧元奖金评选。