
01 EXPLOITING MODALITY-INVARIANT FEATURE FOR ROBUST MULTIMODAL EMOTION RECOGNITION WITH MISSING MODALITIES
作者:左昊麟1,刘瑞1*,赵金明2,高光来1,李海洲3
单位:1内蒙古大学,2启元实验室,3香港中文大学(深圳校区)
代码网址:
https://github.com/ZhuoYulang/IF-MMIN
论文链接:
https://ieeexplore.ieee.org/abstract/document/10095836
论文解读:论文分享 | 利用模态不变特征在模态缺失条件下实现更鲁棒的多模态情感识别
02 ICCRN: INPLACE CEPSTRAL CONVOLUTIONAL RECURRENT NEURAL NETWORK FOR MONAURAL SPEECH ENHANCEMENT
摘要:根据语音产生的机理,声道将缓慢变化的语义信息调制到声带发出的宽带载波上,这在频谱上分别表现为包络和谐波结构,它们在倒谱域中可以被更稀疏地表示。基于这一机制,我们提出了一种在时频倒谱空间中进行联合降噪的倒谱频率增强模块(CFB)。该方法不使用倒谱作为输入特征,而是隐式的实现频域特征和倒谱空间的相互变换,并在时频域和倒谱空间进行联合增强。最终我们将该CFB模块整合到了我们之前的原地卷积循环网络(ICRN)中,成功的将该模型的适用场景从多通道拓展到了单通道场景。实验结果表明,提出的ICCRN模型显著优于基线系统,并且在谐波结构增强方面具有独特优势。
论文链接:
https://ieeexplore.ieee.org/abstract/document/10096918
03 SPEECH ENHANCEMENT WITH INTELLIGENT NEURAL HOMOMORPHIC SYNTHESIS
作者:何树林1,饶为2,刘晋江1,陈鋆2 , 琚雨恺2 , 张学良1 , 王燕南2 , 商世东2
单位:1内蒙古大学,2腾讯天籁实验室
论文链接:
https://ieeexplore.ieee.org/abstract/document/10096178
04 CLASS-GUIDED TRIPLE HEAD PREDICTION NETWORK FOR LONG-TAIL OBJECT DETECTION
作者:刘旭阳,郑媛
单位:内蒙古大学
论文链接:
https://ieeexplore.ieee.org/document/10095289
05 TRANSFORMER-BASED DEEP HASHING METHOD FOR MULTI-SCALE FEATURE FUSION
作者:贺超,魏宏喜
单位:内蒙古大学
源代码可用:
https://github.com/shuaichaochao/TDH
论文链接:
https://ieeexplore.ieee.org/abstract/document/10094794
06 YOLOX-B: A BETTER YOLOX MODEL FOR REAL-TIME DRIVER BEHAVIOR DETECTION
摘要:在煤炭运输场景中,针对驾驶员行为检测任务提出的目标检测模型普遍存在定位不准确和小目标难以检测的问题,本文提出了一种新的模型YOLOX-B,该模型引入了一种序列化属性空间金字塔池化结构(S-ASPP),通过序列化属性卷积获得不同大小的感受野信息,解决了最大池化中的信息丢失问题。最大限度地提高了卷积的效率。同时,通过引入基于转置卷积的轻量级特征重组模块,自适应预测上采样核权值,使模型能够更好地完成加权像素恢复,提高小目标的检测精度。在公开可用的PASCAL VOC 2012数据集和自建驾驶员行为数据集上的实验结果表明,YOLOX-B与YOLOX-S保持相同的推理速度,平均平均精度(map)分别提高4.4%和0.8%。
论文链接:
https://ieeexplore.ieee.org/abstract/document/10096629
07 MTFD: MULTI-TEACHER FUSION DISTILLATION FOR COMPRESSED VIDEO ACTION RECOGNITION
作者:郭金鑫,张佳强,李少杰,张晓静,马明
单位:内蒙古大学
论文链接:
https://ieeexplore.ieee.org/abstract/document/10097123
