最新开源丨VITA-1.5:实时视觉与语音交互,1.5秒互动延迟
来源丨 HsuDan丶 PaperWeekly 近日,VITA-MLLM 团队宣布推出VITA-1.5,是一个开源的集成了视觉、语言和语音的多模态大语言模型,旨在实现类似 GPT-4o 水平的实时视觉和语音交互。 论文链接:
15 0 0
来源丨 HsuDan丶 PaperWeekly 近日,VITA-MLLM 团队宣布推出VITA-1.5,是一个开源的集成了视觉、语言和语音的多模态大语言模型,旨在实现类似 GPT-4o 水平的实时视觉和语音交互。 论文链接: