声浪
近日,中国矿业大学与快手科技联合研发的AudioGen-Omni模型,以面向音频-语音-歌曲三合一生成的统一多模态扩散Transformer架构,实现了高保真音频、语音与歌曲的生成,并达成与输入视频的深度时序同步。 论文链接:https:/…
来源丨AIGC开放社区 今天凌晨1点30,OpenAI开源了大模型GPT-oss,一共有1200亿和200亿两种参数,支持Apache 2.0商业化。 开源地址: https://github.com/openai/GPT-oss http…
论文题目:Multi-Input Multi-Output Target-Speaker Voice Activity Detection For Unified, Flexible, and Robust Audio-Visual Spe…
来源丨AIGC开放社区 今天,阿里开源了最新文生图模型 Qwen-Image 。 Qwen-Image是一个200亿参数的MMDiT模型,可生成写实、动漫、赛博朋克、科幻、极简、复古、超现实、水墨等几十种类型的图片,支持图片的风格迁移、增删…
来源丨小米技术 音频理解是构建全场景智能生态的关键领域,在智能座舱、家居交互等场景均有广泛应用。今天小米发布和全量开源了 MiDashengLM-7B 模型。MiDashengLM-7B 基于 Xiaomi Dasheng 作为音频编码器和…
【职位描述】 1.参与研发前沿的机器人大模型 (vision language action model). 包括但不限于机器人动作表征,多模态表征,vla大模型架构设计和训练等 2.跟进并调研国内外前沿的vla大模型技术,协助团队完成相关…
【公司介绍】 自变量机器人是国内唯一实现端到端统一具身智能大模型商业化的具身智能创业公司,技术水平和融资规模均达到国内TOP水平,一年内完成七轮亿元级融资,其中包含美团独家投资A轮,君联资本、光速光合、北京机器人产业基金、云启资本、广发信德…
