OpenAI最强代码模型GPT-5.2-Codex上线
周五凌晨,OpenAI 发布 GPT-5.2-Codex,这是迄今为止最先进的智能体编码模型,专为复杂的实际软件工程而设计。 GPT-5.2-Codex 是 GPT-5.2 的升级版本,提高了指令遵循能力、对长远语境的理解能力,它针对 Co…
16 0 0
周五凌晨,OpenAI 发布 GPT-5.2-Codex,这是迄今为止最先进的智能体编码模型,专为复杂的实际软件工程而设计。 GPT-5.2-Codex 是 GPT-5.2 的升级版本,提高了指令遵循能力、对长远语境的理解能力,它针对 Co…
从简单的指令执行到具备“心智”的情感共鸣,AI 语音交互正在经历怎样的蜕变?在人工智能飞速发展的今天,我们渴望的不再仅仅是一个“有问必答”的助手,而是一个能听懂弦外之音、能接住突发话茬的“知心伙伴”。 最近,ICASSP 2026 发起类人…
继 SAM(Segment Anything Model)、SAM 3D后,Meta 又有了新动作。 深夜,Meta 放出音频分割模型SAM Audio,其通过多模态提示(无论是文本、视觉,还是标注时间片段),让人们能够轻松地从复杂的音频混…
标题:Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking 地址:https://arxiv.org/pdf/2511.…
只需3秒录音,就能让你的声音无缝切换语种、方言与情绪——中、粤、日、英、开心、愤怒......9 种通用语言、18种方言,通通搞定! 一段嘈杂环境下的会议录音,AI 也能毫秒级输出文字,绕口令、RAP、背景音乐干扰,照样精准识别! 通义百聆…
A Survey on Speech Large Language Models for Understanding 论文作者:彭景¹²*,王雨诚³*,李波含¹²,郭奕玮¹²,王翰坤¹²,方衍贵⁵,奚彧¹²,李浩宇¹²,李旭⁴,张克⁶,王帅…