Xmart青年论坛由上海交通大学跨媒体语言智能实验室(SJTU X-LANCE lab)创办,中国计算机学会语音对话专委会主办,语音之家协办,旨在邀请国内外优秀的青年学者分享其最新科研工作和成果,促进多元且深入的交流与合作。Xmart学生论坛作为其中一个系列,致力于邀请国内外知名高校有成体系工作的研究生,主要通过线上分享的方式,系统地介绍其科研成果和心得,为青年学生打造一个学术探讨,思维碰撞和多学科交叉融合的平台。

Xmart•学生论坛丨肖俊斌、李磊磊:面向第一视角的问题研究与展望

形式:线上

时间:12月19日(周四) 14:30 ~ 16:30


报告嘉宾

肖俊斌,新加坡国立大学 (NUS) 博士后研究员,2023年于 NUS 计算机系取得博士学位,师从新加坡科学院院士蔡达成(Chua Tat Seng)教授。博士及博后期间,围绕多模态视频问答任务,重点研究视频结构化表征与跨模态交互、视频因果建模与鲁棒学习、大模型可信决策与具身交互。在TPAMI\CVPR\ICCV\ECCV\AAAI\ACL\EMNLP 等人工智能国际顶级会议及期刊上正式发表论文 26 篇。其工作受到 Google DeepMind, Microsoft, Meta AI 等众多领域内世界顶级机构研究人员 Follow,目前谷歌学术引用 1260 余次。长期担任人工智能主流国际会议及期刊程序委员会成员或审稿人,并在ACM MM’19上成功举办首届大规模视频视觉关系理解挑战赛。获 CVPR’22最佳论文候选(排名第 3),NUS 院长杰出研究成就奖。

李磊磊,西安交通大学人工智能学院一年级博士生。主要研究方向为第一视角下的驾驶场景交通事故视频理解。重点关注生成式事故视频溯因学习、事故风险概率预测等问题。研究成果在CVPR、IEEE Intelligent Transportation Systems Magazine (ITSM)等人工智能权威会议和重要期刊上发表论文多篇,构建了领域最大规模(万余起)的驾驶场景交通事故多模态理解数据集MM-AU,曾获自主无人系统大会(ICAUS2023)最佳论文奖等。


报告摘要

报告一:面向第一视角的具身问答辅助技术:研究与展望

多模态大模型在最近两年得到了迅猛发展,视觉问答任务作为训练和评估多模态大模型能力的核心任务,其性能得到了跨越式的提升。然而,目前的视觉问答不仅图片/视频为第三视角聚焦于感兴趣的目标区域拍摄而成,其问题更是局限于评估模型对视觉内容的客观理解能力,不能反映用户在对应第一视角情景下的主观所需,因而缺乏实用性。鉴于此,面向第一视角的具身问答辅助技术得到越来越多的关注。本报告中,我将梳理面向第一视角具身问答的应用场景,特点及挑战,并分享团队在相关方向上的一些探索性工作。


报告二:第一视角下的交通事故视频溯因理解

当前的驾驶安全已经步入自动驾驶车辆安全为主的时代。由于复杂多变的交通环境,自动驾驶汽车难免存在交互意图理解不充分造成的事故隐患。为促进可信自动驾驶感知,交通事故的溯因式理解旨在通过给定事故视频条件下,利用多模态推理能力实现事故致因检索以及生成式溯因生成,解析事故发生过程中的因果联系,满足自动驾驶可信感知乃至决策的需要。针对领域内缺乏高质量多模态事故理解数据及溯因学习方法问题,本报告将汇报第一视角下的交通事故视频溯因理解,包含数据构建、生成式模型设计和潜在问题的讨论。


参加方式


①

直播将通过语音之家微信视频号进行直播

手机端、PC端可同步观看

👇👇👇

②

腾讯会议参加

会议号:388-271-795

上海交通大学跨媒体语言智能实验室(SJTU Cross Media Language Intelligence Lab, X-LANCE)成立于2012年,前身是“智能语音实验室”(SpeechLab),经过多年发展,成为了涵盖视听文语言信息处理核心各研究领域的“跨模态语言智能实验室”。目前,跨媒体语言智能实验室的教师组有一位教授、四位副教授和一位科研助理,拥有二十余名博士研究生,近四十名硕士研究生,还包括ACM班、AI班、IEEE班、电院CS等专业、巴黎卓越工程师学院、密西根学院等的三十余名本科生。

实验室获得了包括国家重点研发计划、自然科学基金委优秀青年科学基金在内的诸多国家和企业项目支持。实验室与思必驰科技股份有限公司深度合作,成立了“上海交通大学思必驰智能人机交互联合实验室”。实验室可调动丰富的数据资源以及多达数百块H800、A800、A10等GPU卡的丰富计算资源,是国际上极少数可以进行产业级大尺度数据分析和研究的人工智能实验室之一。

X-LANCE实验室致力于做能够改变世界的国际水平的技术研究,实验室的学术信条:要用技术改变世界,首先必须是一个优秀的工程师;而一个杰出的工程师一定是一位科学家。