• [互动交流] 语音翻译-短语音翻译-语音转文字-语音识别-语音播报翻译API接口介绍
    前言随着全球化交流的不断深入,语音翻译已经成为跨语言沟通的重要工具。无论是跨境电商、国际会议、在线教育,还是海外旅游、智能客服等场景,都需要将一种语言快速转换为另一种语言,从而消除语言障碍,提高沟通效率。语音翻译API是一种基于人工智能技术的开放接口,能够自动完成"语音识别 → 文本翻译 → 语音播报"的整个处理流程。语音翻译API有哪些应用场景?随着AI技术的发展,语音翻译已经广泛应用于多个行业,例如:跨境电商客服实时沟通海外旅游语音交流国际会议语音翻译在线教育多语言授课智能语音助手AI客服机器人企业跨国办公沟通跨语言直播互动视频字幕翻译多语言学习平台对于需要面向海外用户的产品来说,语音翻译接口能够有效提升用户体验,降低沟通成本。请求说明名称类型必须说明fromString是源语言toString是目标语言formatString是音频格式:pcm、wavvoiceString是音频文件二进制数据,需使用base64编码,编码后的大小不能超过4MB戳这里返回样例{ "code": 200, // 返回码,详见返回码说明 "msg": "成功", // 返回码对应描述 "taskNo": "65605503936940344488", // 本次请求号 "charge": false, // 计费标志 "data": { "result": { "source": "你好。",//语音识别得到的原文 "target": "hello",//翻译后的目标语言文本 "target_tts": "aaa"//译文 TTS,使用base64编码(注:若翻译后的目标语言文本字节数超过400,则不返回target_tts内容) } } } 语音翻译接口有哪些优势?相比传统需要分别调用语音识别、机器翻译和语音合成多个接口的方案,语音翻译API具有以下优势:一站式处理一次调用即可完成语音识别、文本翻译及语音播报,无需重复开发。支持40多种语言覆盖中文、英文、日文、韩文、法文、德文、西班牙语等多种语言之间的互译,满足国际化业务需求。支持60秒短语音接口可处理60秒以内的语音内容,适用于大多数日常业务场景。接入简单采用标准HTTP API,开发语言不限,可快速集成至Web、APP、小程序及企业后台系统。
  • [问题求助] TTS播报文字内容过长?
    【问题来源】     内部测试环境功能测试 【问题简要】     TTS播报内容:您的储蓄卡余额为378.64元。了解当前使用明细,可以登录我行APP、手机银行、微信银行进行明细查询。您可以登录我行官网,参与当前优惠活动与存储活动,抽最高100元话费福利!请问还有什么可以帮您的? 【问题类别】     IVR(gsl)     【AICC解决方案版本】     AICC 版本:AICC 23.200     SCE 版本: ICDV300R008C25SPC009 【期望解决时间】     尽快 【日志或错误截图】          
  • [问题求助] Web接口直接访问Cell,请求参数为变量无法替换
    【问题来源】     内部测试环境功能测试 【问题简要】  问题1:   参照Web接口直接访问Cell,请求参数设置为变量,实际未替换变量成功     请求参数:{"sessionId": "$sessionId", "queryText":"$queryText"},从日志端看到sessionId=1711420619-167,queryText=挂失。     同时也尝试了使用请求参数{"sessionId": "${sessionId}", "queryText":"${queryText}"}任然未替换其中变量。 问题2:如果web接口返回的内容是json数组格式如何解析?  如:{"strA":"a",  "answerContents":[{"text":"测试","type":1}], "actions":[]}【问题类别】     IVR(gsl)     【AICC解决方案版本】     AICC 版本:AICC 23.200     SCE 版本: ICDV300R008C25SPC009 【期望解决时间】     尽快 【日志或错误截图】
  • [问题求助] IVR语音识别结果解析
    【问题来源】     内部测试环境功能测试 【问题简要】     ASR识别结果为:{<id 余额查询余额查询><asrid ef9ff17e749f45df><meaning 余额查询余额查询>}0.990     怎么获取到ASR识别结果中的业务名称“余额查询”,使用哪个CELL能处理这类动态结果? 【问题类别】     IVR(gsl)     【AICC解决方案版本】     AICC 版本:AICC 23.200     SCE 版本: ICDV300R008C25SPC009 【期望解决时间】     尽快 【日志或错误截图】
  • [问题求助] ASR识别结果判断
    【问题来源】     内部测试环境功能测试 【问题简要】          问题1:ASR识别后的文字通过工具打开为乱码;     问题2:如何判断ASR的识别文字做后续的处理。 ASR识别到文字后,通过对比判断业务类型,对比失败,从底层日志能看到ASR识别的文字,通过文本工具打开ASR识别的结果为乱码,尝试使用了“字符集编码转换”CELL进行编码转换GBK转UTF8,还是不行,请问有什么办法能对比识别的意图,如客户说“余额查询”,IVR判断结果为“余额查询”时进入到余额查询的节点。 【问题类别】     IVR(gsl)     【AICC解决方案版本】     AICC 版本:AICC 23.200     SCE 版本: ICDV300R008C25SPC009 【期望解决时间】     在线等     【日志或错误截图】日志文件和sce源文件见附件。
  • [问题求助] TTS语速问题
    【问题来源】     公司内部测试环境     【问题简要】     通过TTS报工号的放音语速为x-slow,通过ivr脚本放音的语速为medium,通过CTI页面修改TTS报工号放音语速不生效,请问怎么修改TTS报工号的放音语速 【问题类别】     TTS     【AICC解决方案版本】     AICC 版本:AICC 23.200     SCE 版本: ICDV300R008C25SPC009  【期望解决时间】     在线等      【问题现象描述】      环境:内部测试环境           【日志或错误截图】           TTS报工号截图CTI侧配置  UAP侧配置通过脚本测试TTS的语速是正常的
  • [问题求助] IVR对接ASR失败
    【问题来源】     上海井星科技   【问题简要】     使用demo文件ASR.GSL测试,连接ASR报错:VP load GSL Grammar fail 【问题类别】     IVR(gsl)     【AICC解决方案版本】     AICC 版本:AICC 23.200     SCE 版本: ICDV300R008C25SPC009 【期望解决时间】     在线等     【问题现象描述】      环境:内部测试环境          【日志或错误截图】        
  • [其他] 浅聊语音识别技术常用的方法
    语音识别技术,也被称为自动语音识别(Automatic Speech Recognition,ASR),其目标是将人类的语音中的词汇内容转换为计算机可读的输入,例如按键、二进制编码或者字符序列。与说话人识别及说话人确认不同,后者尝试识别或确认发出语音的说话人而非其中所包含的词汇内容。2019年8月17日,北京互联网法院发布《互联网技术司法应用白皮书》语音识别技术常用的方法有如下四种: 1. 基于语言学和 声学的方法,2. 随机模型法,3. 利用人工神经网络的方法,4. 概率语法分析。其中最主流的方法是随机模型法。 基于语言学和声学的方法 基于语言学和声学的方法是最早应用于语音识别的方法,但是这种方法涉及的知识太过于困难,导致现在并没有得到大规模普及。  随机模型法 随机模型法目前应用较为成熟,该方法主要采用提取特征、训练模板、对模板进行分类及对模板进行判断的步骤来对语音进行识别。该方法涉及到的技术一般有3种:动态时间规整(DTW),隐马尔科夫模型(HMM)理论和矢量量化(VQ )技术。其中,HMM 算法相较于其他两者的优点是简便优质, 在语音识别性能方面更为优异。也正因为如此,如今大部分语音识别系统都在使用HMM算法。 神经网络的方法 (ANN)神经网络方法是在语音识别发展的后期才有的一种新的识别方法。它其实是一种模拟人类神经活动的方法,同时具有人的一些特性,如自动适应和自主学习。其较强的归类能力和映射能力在语音识别技术中具有很高的利用价值。业界将 ANN 与传统的方法进行结合,各取所长,使得语音识别的效率得到了显著的提升。 概率语法分析法 概率语法分析法是一种能够识别大长度语段的技术,主要是为了完成“区别语言的特征”,对于不同层次的知识利用相应层次的知识来解决。这种方法最大的不足就是,建立一个有效、适宜的适用知识系统存在着一定的困难。
  • [其他] 浅浅了解语音识别技术框架 
    声学特征提取 模拟的语音信号进行采样得到波形数据之后,首先要输入到特征提取模块,提取出合适的声学特征参数供后续声学模型训练使用。好的声学特征应当考虑以下三个方面 的因素。第一,应当具有比较优秀的区分特性.以使声学模型不同的建模单元可以方便准确的建模。其次,特征提取也可以认为是语音信息的压缩编码过程,既需要将信道、说话人的因素消除保留与内容相关的信息,又需要在不损失过多有用信息的情况下使用尽量低的参数维度,便于高效准确的进行模型的训练。最后,需要考虑鲁棒性,即对环境噪声的抗干扰能力。 声学模型 如今主流语音识别系统都采用隐马尔科夫模型(HMM)作为声学模型,这是因为HMM具有很多优良特性。HMM模型的状态跳转模型很适合人类语音的短时平稳特性,可以对不断产生的观测值(语音信号)进行方便的统计建模;与HNN相伴生的动态规划算法可以有效地实现对可变长度的时间序列进行分段和分类的功能;HMM的应用范围广泛。只要选择不同的生成概率密度,离散分布或者连续分布,都可以使用HNM进行建模。HMM以及与之相关的技术在语音识别系统中处于最核心的地位。自从HMM的理论被提出以来(Baum and Easo,1967),它在语音信号处理及相关领域的应用范围变得越来越广泛,在语音识别领域起到核心角色的作用,它还广泛活跃精音的参数合成、语言理解、 机器翻译等其他领域。  以汉语为例: 汉语按音素的发音特征分类分为辅音、单元音、复元音、复鼻尾音四种,按音节结构分类为声母和韵母。并且由音素构成声母或韵母。有时,将含有声调的韵母称为调母。由单个调母或由声母与调母拼音成为音节。汉语的一个音节就是汉语一个字的音,即音节字。由音节字构成词,最后再由词构成句子。 汉语声母共有22个,其中包括零声母,韵母共有38个。按音素分类,汉语辅音共有22个,单元音13个,复元音13个,复鼻尾音16个。 目前常用的声学模型基元为声韵母、音节或词,根据实现目的不同来选取不同的基元。汉语加上语气词共有412个音节,包括轻音字,共有1282个有调音节字,所以当在小词汇表孤立词语音识别时常选用词作为基元,在大词汇表语音识别时常采用音节或声韵母建模,而在连续语音识别时,由于协同发音的影响,常采用声韵母建模。 基于统计的语音识别模型常用的就是HMM模型λ(N,M,π,A,B),涉及到HMM模型的相关理论包括模型的结构选取、模型的初始化、模型参数的重估以及相应的识别算法等。 语言模型与语言处理 语言模型包括由识别语音命令构成的语法网络或由统计方法构成的语言模型,语言处理可以进行语法、语义分析。 语言模型对中、大词汇量的语音识别系统特别重要。当分类发生错误时可以根据语言学模型、语法结构、语义学进行判断纠正,特别是一些同音字则必须通过上下文结构才能确定词义。语言学理论包括语义结构、语法规则、语言的数学描述模型等有关方面。目前比较成功的语言模型通常是采用统计语法的语言模型与基于规则语法结构命令语言模型。语法结构可以限定不同词之间的相互连接关系,减少了识别系统的搜索空间,这有利于提高系统的识别。