声浪
人人都能炼专属Agent,上海交大开源端侧Agent全栈工具链,真实场景性能超GPT-5!
手机AI助手能自动帮你订外卖、酒店和网购,正逐渐成为新趋势。这种能处理日常任务的智能助手,已从科幻走向现实。但实现真正“解放双手”仍面临挑战:如何高效训练并在手机端部署AI模型,此前似乎只有少数大公司能解决。从获取高质量数据、模型训练适配,…
10 0 0
CosyVoice TTS 3.0版本,让声音也能有情绪
CosyVoice 系列一直是 TTS 领域备受瞩目的标杆之作。从 CosyVoice 1 到如今的 CosyVoice 3,它不仅逐步实现了当前 TTS 技术的主流功能,更在技术架构上实现了全面覆盖与深度优化。近日,CosyVoice 3…
16 0 0
听得清,识得准,语音识别模型Qwen3-ASR-Flash来了!
今天,我们正式推出通义千问系列最新的语音识别模型 Qwen3-ASR-Flash,它基于Qwen3基座模型,经海量多模态数据以及千万⼩时规模的ASR(自动语音识别)数据训练构建而成。 Qwen3-ASR-Flash实现了⾼精度⾼鲁棒性的语⾳…
12 0 0
大模型破译甲骨文创下新SOTA!复旦团队推出新框架
来源丨量子位 让大模型破译从未见过的甲骨文,准确率拿下新SOTA! 自复旦大学的研究人员提出了一种基于部首和象形分析的可解释甲骨文破译框架—— 不仅在公开基准数据集HUST-OBC和EV-OBC上,达到最先进的Top-10识别准确率以及优异…
12 0 0
WenetSpeech-Yue: 首个具有多维度标注的大规模粤语语音语料库开源!
语音理解与生成的飞速发展离不开大规模高质量语音数据集的推动。其中,语音识别(ASR)和语音合成(TTS)被公认为最首要的任务。但对于拥有约 8490 万母语使用者的粤语而言,受限于标注资源匮乏,研究进展缓慢,ASR 与 TTS 的表现始终不…
19 1 0
利用 ARM NEON 指令集加速:端侧 FFT 的高效实现
今天介绍下工程方法的内容,在移动设备和嵌入式系统中,高效的数字信号处理(DSP)算法至关重要。快速傅里叶变换(FFT)作为核心算法之一,其性能直接影响到音频处理、图像分析、通信等多个应用领域。本文将介绍一个在端侧计算十分高效基于NEON的F…
12 0 0
