活动介绍
为促进推动语音、对话与听觉信息处理技术的创新与发展,同花顺与中国计算机学会语音对话与听觉专委会(CCF-TCSDAP)特别策划“走进企业”系列报告会活动,旨在加强学术界与工业界的深度融合,拓宽研究成果在实际应用中的广度与深度。活动将邀请多位来自国内知名高校及科研机构的专家学者走进企业,围绕语音对话与听觉技术的前沿学术成果与落地事件、大模型的自然语言理解与情感计算,以及多模态交互技术的创新应用等核心议题通过深入探讨这些技术难点,打通从理论算法到产业落地的“最后一公里”,共同探索智能语音技术在提升人机交互体验中的新路径与新范式。
本次活动将安排半天时间,包含学术报告、技术座谈及互动研讨等环节。拟邀请4位 CCF-TCSDAP 专家学者进行主题分享,介绍领域前沿进展;公司也将安排技术报告,展示自身在语音技术领域成果。双方将围绕金融垂直领域的语音识别、情感计算及噪音环境处理等关键问题进行深度交流,共同探讨解决方案,促进产学研高效对接。
活动时间:2026年5月23日 下午11:00-16:00
会议地点:同花顺总部一期11楼,雅典娜报告厅
地址:浙江省杭州市余杭区同顺街18号
活动日程

报告主题介绍
胡新辉 —— 同花顺语音技术在金融垂直场景中的应用与实践
报告摘要:同花顺是一家以人工智能技术为核心驱动力、深耕金融服务领域的科技公司。依托丰富的金融应用场景、大规模数据资源和强大的计算能力,公司正持续推动 AI 在智能交互、复杂推理、辅助决策与内容创造等方面的能力提升。其核心技术方向涵盖语音处理、自然语言处理、计算机视觉、数字生成及AI 医疗等多个领域。其中,语音技术团队近年来逐步构建起较为完整的智能语音交互技术体系,覆盖复杂场景语音识别、多场景语音合成、语音转换、多模态交互等关键能力,并已在多个实际业务场景中实现落地应用。团队不仅支撑了公司内外部多类业务,包括语音转写、智能客服、内容生成、智能机器人硬件等,也积极探索前沿技术方向,较早布局多模态交互、AI 数字内容生成等领域。
本报告将重点介绍同花顺语音技术在主要应用场景中的落地实践,分享团队近期在语音识别、语音合成与克隆、多模态交互等方向的技术进展,并展示相关技术在金融服务的开户,信息咨询、电子书阅读、会议转写、自动电话接听服务等场景中的应用成果。
谢磊 —— 语音理解、生成与对话大模型进展
报告摘要:本次报告将介绍西北工业大学ASLP实验室近期在语音深度理解、生成与对话大模型方面的相关进展,特别针对多说话人语音识别与转写、长音频理解、全双工对话模型、指令跟随高表现力语音生成的技术与评估方面进行深入探讨。同时交流当前语音交互领域的挑战性问题。
李明 —— 鉴别与生成相融合的目标说话人语音抽取
报告摘要:本报告将系统介绍实验室在目标说话人语音抽取方向上的研究进展:首先,回顾基于鉴别式框架的系列工作,支持语音、唇动、人脸等多种注册方式;其次,分享生成式方法的探索成果,以LauraTSE为代表;最后,重点展示鉴别与生成相融合的最新研究结果,呈现该方法在性能与鲁棒性上的优势。
刘李 —— 音频推理与拟人情感化语音生成技术进展
报告摘要:本次报告,将系统展示团队在音频认知推理与拟人情感化语音生成领域的前沿突破。我们提出了Audio‑DeepThinker,通过渐进式推理感知强化学习,首次实现大型音频语言模型结构化思维链的自主涌现,在多项深层推理基准上荣登榜首。在此基础上,我们构建了PhyAVBench,这是全球首个面向物理常识的音视频生成评测平台,并独创对比物理响应评分机制,推动生成模型从“视听同步”迈向“物理可解释”的新高度。在情感化生成方向,我们研发了EmoSteer‑TTS,首次实现无需训练、激活级细粒度情感操控的语音合成,为可控人机交互开辟全新范式。进一步地,团队推出了AudioGenie,一个统一的多智能体协作框架,打通文本、图像、视频到语音、音效、音乐、歌曲等多类型音频的生成闭环。上述工作共同构筑了从音频逻辑推理到情感智能生成的完整技术体系,为下一代具身智能、多模态交互与物理世界模拟奠定了关键理论与应用基础。
凌震华 —— 声学环境鲁棒可控的个性化语音合成
报告摘要:语音合成将文本等输入信息转换为自然流畅的语音,是智能语音技术的核心组成。零样本语音合成是当前语音合成面向个性化发展的主要范式。在真实应用场景中,零样本语音合成仍然面临声学环境鲁棒性与声学环境可控性不足的挑战。本报告将介绍我们近期在声学环境鲁棒可控的个性化语音合成方面的研究进展,包括基于离散声学表征增强的声学环境鲁棒零样本语音合成、基于渐进式表征解耦的稳态声学环境可控零样本语音合成、基于解耦音频填充的瞬态声学环境可控零样本语音合成等。
嘉宾介绍
胡新辉 浙江核新同花顺网络信息股份有限公司首席科学家,浙江省海外高层次人才特聘专家。获哈尔滨工业大学本科及硕士学位,日本东京大学工学博士学位。长期从事语音技术领域的研究与开发工作,曾先后在日本东芝研究开发中心、日本电气通信基础技术研究所(ATR)及日本国立研究开发法人信息通信研究机构(NICT)担任主任研究员,负责大型人工智能项目的基础研究与系统开发,主持日本文部科学省竞争性科研资金项目(信息处理技术方向)。在国际会议及期刊上发表论文80余篇,获国家发明专利10余项。所带领的技术团队在国内外技术大赛中屡获佳绩,在ASRU 2019中英混杂语音识别挑战赛的端到端语音识别赛道中获得季军,在ICASSP 2022多通道多方会议转录挑战赛(M2MeT)中获得第一名。现负责公司人工智能前沿技术研究与智能交互产品的研发,主要研究方向包括语音处理、机器翻译、多模态大模型交互等。
凌震华 CCF语音对话与听觉专委会秘书长,中国科学技术大学教授,博士生导师,信息科学技术学院副院长,语音及语言信息处理国家工程研究中心副主任,入选国家重大人才工程。主要从事语音信号处理、自然语言处理等方向的研究。主持多项国家自然科学基金、国家重点研发计划等科研项目,已发表论文200 余篇,累计被引1万余次,获国家科技进步奖一等奖、IEEE信号处理学会最佳青年作者论文奖等奖项,多次在国际语音语言技术评测中获得第一名。现任IEEE TASLP期刊编委、IEEE信号处理学会语音与语言处理技术委员会委员、中国计算机学会语音对话与听觉专委会秘书长。
谢磊 西北工业大学计算机学院教授、博士生导师,音频语音与语言处理实验室(ASLP@NPU)负责人。主要研究方向包括语音处理、对话式人工智能,以及面向语音与语言技术的先进神经网络模型与大模型技术,在语音增强、自动语音识别、语音合成与语音对话等领域开展了系统性研究。他长期致力于建设面向学术界的开源工具与数据资源,指导了被广泛使用的 WeNet 语音识别工具包和 WenetSpeech 开源语音数据系列等项目。他曾获得多项荣誉,包括教育部新世纪优秀人才支持计划、陕西省青年科技新星、全球前2%顶尖科学家(斯坦福大学 & Elsevier)以及华为云 AI 名师等。已发表论文 400 余篇,Google Scholar 引用超过 18000 次,H-index 为 63。曾获多项国际会议最佳论文奖及国际评测冠军,诸多研究成果已实现产业落地。现任 ISCA SIG-CSLP 副主席,并担任 IEEE/ACM TASLP 与 IEEE SPL 的高级领域编委(SAE)。
李明 香港中文大学(深圳)人工智能学院教授。他的研究兴趣涵盖智能语音处理和多模态行为信号分析与理解。曾获得第十五批江苏省六大高峰B类高层级人才,主持了十余项国家及省市级纵向科研项目。在TASLP、TAFFC、TMM、TSP、TNSRE、TCSS、JASA、CSL、PR等学术期刊以及ACM MM、CVPR、ICASSP、Interspeech、CHI等学术会议发表学术论文200余篇,谷歌学术引用万余次。曾任美国卡内基梅隆大学客座教授和美国杜克大学客座研究员,IEEE语音及语言技术委员会委员,APSIPA 语音及语言处理专委会委员,TASLP, CSL等多个国际知名学术期刊副主编,ASRU、Odyssey等重要学术会议技术程序委员会主席,带领团队十余次获得国际评测冠军,两次获得国际会议最佳论文奖,与十余家知名企业开展了产学研合作,多项技术在实际产品中得到应用。2016年获IBM Faculty Award,2018年获ISCA最佳期刊论文奖,2020年获教育部高校科研优秀青年成果奖。
刘李 香港科技大学(广州)的副研究员、博导。她在法国格勒诺布尔阿尔卑斯大学GIPSA-lab获得博士学位。曾担任加拿大Ryerson University的博士后研究员。她的主要研究方向是语音处理、音视频理解与生成以及可信人工智能等。她目前以第一作者或通讯作者身份在这些领域已发表学术论文70多篇,其中包括此领域顶级期刊和会议TPAMI, TASLP, NeurIPS等。她现担任国际IEEE机器学习信号处理委员会MLSP Member Nominations & Election分会主席。她曾担任2022年语音信号处理顶会ICASSP的Local Chair (China site)。她获得了广东省青年拔尖人才以及深圳市海外高层次人才-孔雀人才称号。作为项目负责人,她主持国自然面上项目、国自然重点项目课题、国自然青年项目、广东省面上项目、广东省区域联合基金-青年基金项目、2024 CCF-腾讯犀牛鸟项目、2023/2025腾讯AI Lab犀牛鸟专项计划、2025年度CCF-快手大模型探索者基金2022阿里巴巴创新研究计划项目、2022以及2024腾讯公益创投计划等。她曾在2017年荣获法国Sephora Berribi数学与计算机领域女性科学家奖、IEEE Multimedia Signal Processing Rising Star Runner-up Award以及2024年CCF-腾讯犀牛鸟项目卓越奖。她团队文章获得2024年第16届国际社会机器人学会议ICSR最佳学生论文提名奖、CVPR 2025 CV4Animals Workshop杰出论文以及2022/2023深圳市科协人工智能优秀论文奖。她团队在2026国际语音顶会Interspeech音频推理挑战赛中获得单模型赛道冠军和Agent赛道季军(18个国家和地区的156支队伍)。
CCF语音对话与听觉专委会介绍
(CCF Technical Committee on Speech Dialogue and Auditory Processing 缩写CCF TCSDAP)
语音、对话与听觉是人类沟通和获取信息最自然便捷的手段,语音、对话与听觉信息处理的研究内容既包括人类听觉以及言语产生机理等基础科学问题,也涵盖听觉感知分析、语音识别与合成、口语对话与理解、音乐工程等重要技术领域。专委会旨在团结和组织我国语音、对话与听觉相关领域的专业人士,开展学术交流活动,强化各研究方向的融合,促进学术界与工业界的合作,提升我国语音、对话与听觉领域的科研、教学、应用水平以及国际影响力。
浙江核新同花顺网络信息股份有限公司介绍
浙江核新同花顺网络信息股份有限公司成立于1994年,是我国领先的互联网金融信息服务提供商,是业内首家在创业板上市的企业。公司始终坚持以技术创新为核心驱动力,致力于推动金融投资的普及化、智能化与便捷化。同花顺已发展成为国内金融科技领域具有重要影响力的重点企业。
公司高度重视技术研发,保持研发投入占营业收入比例超过20%。依托国家级博士后科研工作站、省级高新技术企业研发中心、省级人工智能研究院、省级工程技术研究中心等科研和工程创新平台。公司与国内外高校及科研机构建立了深度合作机制,研发团队规模超过3400人,其中包括博士、硕士近千人,累计申请发明专利逾百项,取得软件著作权500余项。在智能投顾、量化交易、金融大数据分析等领域持续突破,多项核心技术达到国际先进水平。
为促进人工智能与金融信息服务的融合创新,同花顺现面向国内外高校及科研机构征集合作,重点围绕金融智能体、多模态大模型和可信金融智能服务等方向,开展前瞻性、应用型技术研究,共同推动前沿技术在金融信息服务领域快速落地,形成可商业化的产品与服务。合作团队将获得真实业务场景和海量行业数据支撑,并有机会借助同花顺平台扩大学术影响力,拓展产学研合作网络,为优秀毕业生提供实践与就业通道。
有意向的高校或科研团队,请提交合作意向书(含研究方向、团队介绍及预期成果),发送至:马天翼(matianyi@myhexin.com)。我们将组织专家进行评审,与入选团队逐一沟通合作细节。期待与您携手,共同推动智能金融技术的前沿突破与产业落地。
CCF语音对话与听觉专委会走进企业活动
CCF语音对话与听觉专委会为了进一步促进语音、对话与听觉信息处理技术的创新与发展,加强学术界与工业界的深度融合,拓宽研究成果在实际应用中的广度和深度,特别策划并推出“走进企业”系列报告会活动。活动目的:1. 深入了解当前语音、对话与听觉信息处理领域的前沿技术和研究动态;2. 与领域专家学者面对面交流,探讨企业发展中遇到的技术难题和解决方案;3. 增进企业品牌知名度和行业影响力,吸引优秀人才加入;4. 拓展业务合作渠道,寻找潜在的商业合作伙伴。
具体活动内容与申请要求参见附件一“CCF语音对话与听觉专委会走进企业系列报告会活动细则”。申请方请填写附件二“CCF语音对话与听觉专委会走进企业系列报告会活动申请表”,邮件发送至:专委会秘书长凌震华(zhling@ustc.edu.cn),抄送给秘书组成员朱璇(xuan.zhu@samsung.com),卜辉(buhui@aishelldata.com),秦霄羽(xyqin@tsinghua.edu.cn)。
附件一:CCF-TCSDAP走进企业系列报告会活动细则.docx
附件二:CCF-TCSDAP走进企业系列报告会活动申请表.docx
初审|吴锡欣
复审|朱 璇
终审|凌震华
