-
标记内容:单卡单卡文档反馈:原意思是“单机单卡”吧 页面链接:https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_1154.html
-
9月12日,2023金域医学“域见杯”医检人工智能开发者大赛圆满落下帷幕。经过近三个月的角逐后,“Z lab”团队在728支参赛队伍中脱颖而出,摘得赛题一“智能临床咨询模型”的桂冠;“道”团队在513支参赛队伍中突出重围,在赛题二“智能染色体核型分析结果解读模型”中拔得头筹!2023“域见杯”医检人工智能开发者大赛由金域医学携手华为云举办,是面向全球医学检验人工智能的交流赛事。开发者利用人工智能算法辅助医生找到最优的治疗方案,共同探索生物医药技术与新一代信息技术融合创新的应用场景,重构医检产业价值。不论是对智慧医检领域,还是对金域医学和华为公司来说,“域见杯”不仅是一场比赛,更是一次重大探索。在颁奖典礼上,金域医学集团董事长兼首席执行官梁耀铭表示,“域见杯”不仅激发了开发者对医检人工智能赛道的浓厚兴趣,也正在让凝聚医检生态伙伴成为现实,实现培养交叉复合型人才、构建智慧医检新范式的大赛设置初衷。华为云EI服务产品部部长尤鹏表示,“域见杯”是华为公司和金域医学在AI领域合作的一个关键里程碑。在未来,华为公司将持续构建AI技术能力,结合金域医学丰富的行业知识和实践,切实提升医检行业的智能化水平。那么,对于这些有想法、敢于颠覆的开发者们来说,“域见杯”又是怎样的存在呢?video第一印象:“域见杯”的独特之处对于许多参赛的开发者们来说,能够接触“医检领域”是深深吸引自己来参赛的原因之一。“我感觉我们选择的‘智能染色体核型分析结果解读模型’赛题,对造福人类还是比较有实际意义的。” 吴嘉谞来自赛题二的亚军团队——智能网优,他认为这种医检领域的比赛实用性很强,不仅与自己的身体密切相关,更是与未来的医检发展密不可分。赛题二冠军团队“道”的刘京乔在接受采访时表示,参赛除了可以获得荣誉,有机会接触、学习医检相关的知识也是吸引自己的地方。另外四支进入决赛的团队都表达了同样的感受,开发者们勇于跳出自己熟悉的领域,在一个新的领域里继续学习、不断成长。除此之外,来自赛题一季军团队“我尊重挺身而出的人”的赵国梁认为,这次大赛是结合AI技术的文本生成类比赛,可以借此锻炼自己的工程能力和算法设计。在AIGC和大模型的浪潮下,参加“域见杯”不仅能够亲身体验科技前沿技术,也是一个可以拓宽知识视野、挑战自己技术能力的机会,更是可以为未来职业发展积累宝贵经验。“MedicalLM”团队的屈渝立就被这股浪潮所吸引,因此投身其中。他认为比赛提供了宝贵的实践机会,帮助自己更好地了解和学习这些技术。其实,屈渝立已经连续两届都进入了“域见杯”总决赛。当被问到为什么会连续两年来参加时,他是这么回答的:“‘域见杯’的一个特点就是,参赛所运用的技术是当前AI领域的最新的技术,而且每一届的题目都具有很高的实际应用价值。”屈渝立还表示,每届“域见杯”的参赛体验都非常好,不论是比赛流程、评分环节还是颁奖环节,都非常专业。突破瓶颈,“域见”更好的自己遇到瓶颈、突破瓶颈是成长的必经之路。在本次比赛中,各个参赛队伍遇到的瓶颈各不相同,例如数据量小、缺乏相关经验、回答范式与常见问答范式不同等。但是这难不倒爱思考、勇于突破自我的开发者们。“Z lab”团队首先根据实验对比,选择了一种实验效果最好的backbone,经过对论文的不断深挖研究,选择了最合适的方式通过预训练,一举夺得冠军。 “智能网优”团队则是与大部分其他团队反其道而行,在尝试多种模型后,选择了泛化性更好的small模型。“asdf”和“CVTEDMer”团队选择同时参加了两道赛题的比赛。参赛选手们需要针对不同的赛题进行更有针对性地分析,也需要耗费更多的精力去研究、尝试和学习。但他们不仅突破了在赛题中遇到的瓶颈,更突破了自我能力的瓶颈,在两道赛题中均取得优异成绩。大胆的创新和尝试,以及根据现状冷静、认真地分析,一次次地尝试、一次次地调整、一次次地不断突破自我,最终他们成就了更好的自己。[1] 触类旁通,助力智慧医检创新发展参赛选手的突破不仅局限在熟悉的技术里提升自我,更体现在打破行业间的壁垒,推动医检领域行业创新。吴嘉谞来自通信行业,在学习金域医学的AI应用落地过程中,发现有许多地方都与自己所属的行业有一致性,包括解决方案、落地手段和遇到的困难等等,他表示深受启发,已经迫不及待想将这些经验和方法复用在实际工作中。“Z lab”团队表示,这次参赛最大的感受就是跨界医检可以促进知识的交叉与创新。不同领域的专业人员互相启发,将自己的经验与思路应用到医检行业中,为产生更多创新性的设计方案与技术路径增加可能性。尽管大多数参赛选手的专业背景或职业领域与医检行业本无交集,但他们把自身积累的知识和经验引入智慧医检领域,并以独特的视角重新审视医检行业,从而带来了创新和活力。不仅如此,他们还把在比赛中获得的经验和见解带回了自己的领域。这种知识的交流和跨界合作,不仅促进了医检行业的不断创新,也丰富了其他行业的思维和方法,为整个科技领域带来了更广泛的影响。这正是多元化和跨界合作的力量。本届“域见杯”已圆满落下帷幕,但是智慧医检的发展还需要不断推动和创新。期待在未来,参赛选手们的经验与方法可以在智慧医检领域落地应用,协助医生和患者解决实际问题,提供更好的医学检测服务,真正做到普惠AI。
-
9月12日,2023金域医学“域见杯”医检人工智能开发者大赛圆满落下帷幕。经过近三个月的角逐后,“Z lab”团队在728支参赛队伍中脱颖而出,摘得赛题一“智能临床咨询模型”的桂冠;“道”团队在513支参赛队伍中突出重围,在赛题二“智能染色体核型分析结果解读模型”中拔得头筹!2023“域见杯”医检人工智能开发者大赛由金域医学携手华为云举办,是面向全球医学检验人工智能的交流赛事。开发者利用人工智能算法辅助医生找到最优的治疗方案,共同探索生物医药技术与新一代信息技术融合创新的应用场景,重构医检产业价值。不论是对智慧医检领域,还是对金域医学和华为公司来说,“域见杯”不仅是一场比赛,更是一次重大探索。在颁奖典礼上,金域医学集团董事长兼首席执行官梁耀铭表示,“域见杯”不仅激发了开发者对医检人工智能赛道的浓厚兴趣,也正在让凝聚医检生态伙伴成为现实,实现培养交叉复合型人才、构建智慧医检新范式的大赛设置初衷。华为云EI服务产品部部长尤鹏表示,“域见杯”是华为公司和金域医学在AI领域合作的一个关键里程碑。在未来,华为公司将持续构建AI技术能力,结合金域医学丰富的行业知识和实践,切实提升医检行业的智能化水平。那么,对于这些有想法、敢于颠覆的开发者们来说,“域见杯”又是怎样的存在呢?video第一印象:“域见杯”的独特之处对于许多参赛的开发者们来说,能够接触“医检领域”是深深吸引自己来参赛的原因之一。“我感觉我们选择的‘智能染色体核型分析结果解读模型’赛题,对造福人类还是比较有实际意义的。” 吴嘉谞来自赛题二的亚军团队——智能网优,他认为这种医检领域的比赛实用性很强,不仅与自己的身体密切相关,更是与未来的医检发展密不可分。赛题二冠军团队“道”的刘京乔在接受采访时表示,参赛除了可以获得荣誉,有机会接触、学习医检相关的知识也是吸引自己的地方。另外四支进入决赛的团队都表达了同样的感受,开发者们勇于跳出自己熟悉的领域,在一个新的领域里继续学习、不断成长。除此之外,来自赛题一季军团队“我尊重挺身而出的人”的赵国梁认为,这次大赛是结合AI技术的文本生成类比赛,可以借此锻炼自己的工程能力和算法设计。在AIGC和大模型的浪潮下,参加“域见杯”不仅能够亲身体验科技前沿技术,也是一个可以拓宽知识视野、挑战自己技术能力的机会,更是可以为未来职业发展积累宝贵经验。“MedicalLM”团队的屈渝立就被这股浪潮所吸引,因此投身其中。他认为比赛提供了宝贵的实践机会,帮助自己更好地了解和学习这些技术。其实,屈渝立已经连续两届都进入了“域见杯”总决赛。当被问到为什么会连续两年来参加时,他是这么回答的:“‘域见杯’的一个特点就是,参赛所运用的技术是当前AI领域的最新的技术,而且每一届的题目都具有很高的实际应用价值。”屈渝立还表示,每届“域见杯”的参赛体验都非常好,不论是比赛流程、评分环节还是颁奖环节,都非常专业。突破瓶颈,“域见”更好的自己遇到瓶颈、突破瓶颈是成长的必经之路。在本次比赛中,各个参赛队伍遇到的瓶颈各不相同,例如数据量小、缺乏相关经验、回答范式与常见问答范式不同等。但是这难不倒爱思考、勇于突破自我的开发者们。“Z lab”团队首先根据实验对比,选择了一种实验效果最好的backbone,经过对论文的不断深挖研究,选择了最合适的方式通过预训练,一举夺得冠军。 “智能网优”团队则是与大部分其他团队反其道而行,在尝试多种模型后,选择了泛化性更好的small模型。“asdf”和“CVTEDMer”团队选择同时参加了两道赛题的比赛。参赛选手们需要针对不同的赛题进行更有针对性地分析,也需要耗费更多的精力去研究、尝试和学习。但他们不仅突破了在赛题中遇到的瓶颈,更突破了自我能力的瓶颈,在两道赛题中均取得优异成绩。大胆的创新和尝试,以及根据现状冷静、认真地分析,一次次地尝试、一次次地调整、一次次地不断突破自我,最终他们成就了更好的自己。[1] 触类旁通,助力智慧医检创新发展参赛选手的突破不仅局限在熟悉的技术里提升自我,更体现在打破行业间的壁垒,推动医检领域行业创新。吴嘉谞来自通信行业,在学习金域医学的AI应用落地过程中,发现有许多地方都与自己所属的行业有一致性,包括解决方案、落地手段和遇到的困难等等,他表示深受启发,已经迫不及待想将这些经验和方法复用在实际工作中。“Z lab”团队表示,这次参赛最大的感受就是跨界医检可以促进知识的交叉与创新。不同领域的专业人员互相启发,将自己的经验与思路应用到医检行业中,为产生更多创新性的设计方案与技术路径增加可能性。尽管大多数参赛选手的专业背景或职业领域与医检行业本无交集,但他们把自身积累的知识和经验引入智慧医检领域,并以独特的视角重新审视医检行业,从而带来了创新和活力。不仅如此,他们还把在比赛中获得的经验和见解带回了自己的领域。这种知识的交流和跨界合作,不仅促进了医检行业的不断创新,也丰富了其他行业的思维和方法,为整个科技领域带来了更广泛的影响。这正是多元化和跨界合作的力量。本届“域见杯”已圆满落下帷幕,但是智慧医检的发展还需要不断推动和创新。期待在未来,参赛选手们的经验与方法可以在智慧医检领域落地应用,协助医生和患者解决实际问题,提供更好的医学检测服务,真正做到普惠AI。
-
能达到当前主流的32K吗
-
历时近3个月,海内外超1200支队伍参赛——9月12日,由广州市科学技术局、广州市工业和信息化局指导,广州金域医学检验集团和广东省人工智能产业协会主办,广州人工智能公共算力中心协办,华为云计算技术有限公司提供技术支持的2023“域见杯”医检人工智能开发者大赛圆满落幕。“Z Lab”战队、“道”战队分别夺得两道赛题的桂冠,各斩获10万元奖金。▲总决赛现场在颁奖典礼上,由金域医学承建的临床检验与病理诊断人工智能开放创新平台正式上线。这也是中国医检行业首个人工智能开放创新平台,可满足开发者从数据管理到应用部署的一站式AI研发需求,具备全栈式、全流程、全场景的特点。平台的上线,将为国内智慧医检生态建设提速加码。▲广州市科技局党组成员、副局长孙翔致辞广州市科技局副局长孙翔表示,“域见杯”医检人工智能开发者大赛吸引了众多优秀的团队和个人,进一步激发了医学和信息技术交叉人才的潜力,也为后续人工智能应用研发及其转化落地提供了标杆性的示范作用。临床检验与病理诊断人工智能开放创新平台的上线,可以让优质的开放创新资源辐射全产业链,从而更好地构建生物技术和新一代信息技术融合的医检人工智能生态。▲金域医学集团董事长兼首席执行官梁耀铭致辞“连续两年举办‘域见杯’,我们欣喜地发现越来越多的开发者对医检人工智能赛道产生了浓厚的兴趣,正在逐步实现凝聚医检生态伙伴,培养交叉复合型人才,构建智慧医检新范式的大赛设置初衷。”金域医学集团董事长兼首席执行官梁耀铭表示,金域医学也将借助医检人工智能开放创新平台的上线,构建共创、共享、共赢的智慧医检创新生态,助力广东抢占国内乃至全球智慧医检发展制高点,让更多百姓享受高效、可及、精准的诊疗服务。▲华为云EI服务产品部部长尤鹏致辞华为云EI服务产品部部长尤鹏表示,本次大赛,是华为公司和金域医学在AI领域合作的一个关键里程碑,也是双方携手面向未来的一次重大探索。作为国内AI领域的深度参与者和贡献者,华为推出了自己的盘古大模型,重塑千行百业。面向未来,华为公司将继续做好服务,持续构建AI技术能力,结合金域医学丰富的行业知识和实践,将技术转化为实实在在的服务能力,切实提升医检行业的智能化水平,提升诊疗效率,为广大老百姓提供更好的医学检测服务,真正实现普惠AI。聚焦医检AIGC应用吸引超千支队伍参赛当前,人工智能发展迎来“新风口”。随着AIGC技术热浪不断席卷,国内人工智能大模型发展“百花齐放”,正从通用大模型逐步渗透进千行百业的各个环节。2023“域见杯”医检人工智能开发者大赛的举办,正是为了汇聚更多人才,更好地探索开发医检AIGC技术落地应用。大赛围绕医学自然语言处理主题,设置“智能临床咨询模型”“智能染色体核型分析结果解读模型”双赛题。赛题设置紧跟技术热点、训练数据源自真实医疗场景等特点降低了开发者们打榜的门槛,吸引了高校、个人、科研机构和企业等众多选手参赛。本届大赛参赛规模远超去年首届,累计超1200支队伍参赛。其中,有不少队伍具备一定医疗领域人工智能开发参赛的经验,同时向两道赛题发起挑战。▲华为云人工智能领域首席科学家田奇进行赛事回顾及技术总结“本届比赛涌现了不少亮点。”华为云人工智能领域首席科学家田奇指出,选手们采用多种技术前沿(SOTA)的深度神经网络模型进行打榜;算法开发上,选手在开源算法基础上加入自己对赛题的理解,改进了算法。“由于赛题涉及医疗专业场景,有较多难懂的医疗数据,部分选手提出新的方法,有效提升模型在长难案例上的整体表现,让我们看到开发者在生物技术和新一代信息技术交叉领域,可以释放更多潜能。”▲“Z Lab”战队斩获“智能临床咨询模型”赛题一等奖▲ “道”战队斩获“智能染色体核型分析结果解读模型”赛题一等奖决赛当天,两个赛题各前6名的队伍齐聚广州作最后的角逐,“Z Lab”战队、“道”战队分别夺得桂冠,各斩获10万元奖金。医检人工智能发展面临数据、算法、算力三大挑战随着人工智能大模型渗透进千行百业,对开发者而言,产业实践已成为衡量模型价值的重要标准。大赛为想要在医疗人工智能领域有所发展的开发者们提供了舞台,吸引了上千名开发者竞相角逐,但这远远不够。医检人工智能的发展,面临数据、算法、算力三大挑战。人工智能开发需要大量高质量数据,而国内大部分医疗数据存储于各级医疗机构,业务系统相对独立,数据较难实现共享,存在明显的“数据孤岛”现象,可供训练的真实场景数据集有限。即便得到了大量的医疗数据,如何对离散的海量医学专业数据进行处理、统计和分析,通过模型进行有效的整合,是另一个挑战。特别是,医疗行业的严谨性对模型的精确度要求更高,从而对算法和算力提出了更高的要求。最后,开发出来的医学人工智能成果存在规模化落地的困境,数据与算法模型的产、供、销缺乏产业链资源支撑,都成为制约医检人工智能进一步发展与落地的重要因素。医检人工智能行业急需一个专有的平台,满足个人及企业开发者对训练、开发、应用和分享的需求。▲临床检验与病理诊断人工智能开放创新平台正式上线为解决以上痛点,作为医检人工智能领域的先行者,金域医学利用所拥有超10PB 数据量的全球领先的东方人种大样本、大数据库,积极开展数字化转型工作,取得了成效。2020年,广东省科技厅发布第三批“广东省新一代人工智能开放创新平台”名单,金域医学正式承建“临床检验与病理诊断广东省新一代人工智能开放创新平台”。医检人工智能开发者有了自己的专属平台9月12日,由金域医学承建的临床检验与病理诊断人工智能开放创新平台正式上线,医检人工智能开发者将有自己的专属平台。通过算力、算法、数据、模型共享,平台可向创业公司、医疗科研机构、个人开发者、行业专家等用户提供服务,满足了开发者从数据训练到人工智能应用部署的全流程开发需求,包含数据处理、开发训练、模型管理、在线部署等。开发者可以在平台上使用公开数据集进行模型训练;也可获得普惠价格的算力,支撑数据处理、各类模型的开发。此外,平台一站式模型训练服务,为用户提供主流算法框架和开发框架、丰富的算力资源及合规可用的训练数据,最大限度地降低研发成本,吸纳产业创新资源集聚。目前,该平台已上线多项经过医检医学专家处理过的疾病诊断数据集,实现样本资源、高质量医检数据与病例标注数据的安全共享,降低开发门槛。通过稳定可靠、可持续创新的云服务构建,平台可以保护用户数据安全,同时提供联邦学习能力,满足多方开发者在数据不出域的情况下完成通用模型的训练。
-
前言大家好,我是“流明”团队的队长,非常荣幸参加域见杯赛题二“智能临床咨询模型”,获得了B榜第四名,这里做一个简单的分享,一起交流学习。分享数据分析主要讲了一些预模型的重要性,脱敏数据对模型本身不太友好,如果想要达到理想的效果需要重新预训练,其次就是简单提到了数据的长度分布和一些数据的特点。模型选择根据线上的分数最终选择T5作为单模型,简单讲了模型的基本结构。训练策略上用到了数据增强,余弦退火,标签平滑,对比训练,对抗训练, ema这些技巧都是可以提升分数的一个技巧,至少在我们团队做的t5-base实验是有用的最终t5-base单模型在初赛上第三,复赛第4这个一个分数,整个方案相对来说比较简单,不足写的也是比较多的。感想首先就是感谢广州市科学技术局、金域医学以及华为云提供的这次竞赛机会,其次就是认识了一些小伙伴,最后对于我个人来说最近比较疲于奔命,很多事情做不到尽善尽美,越来越希望在有限的时间里做一些简单尽所能及的事情。
-
问题现象已购买专属资源池,但创建Notebook时该资源池不可选择,无法创建Notebook。提示当前专属资源池未初始化开发环境,请到专属资源池页面初始化开发环境。原因分析新购买的专属资源池,需要初始化环境才能用于创建Notebook。解决方法请到专属资源池页面初始化开发环境。进入“专属资源池”页面,单击“操作”列的“更多 > 设置作业类型”。在“设置作业类型”页面,勾选“开发环境”,单击“确定”。此时“开发环境”的状态为“环境初始化中”,等到状态为“已启用”,即可使用新购买的专属资源池。图1 设置“作业类型”为“开发环境”图2 开发环境初始化
-
除DNN之外,经常用于计算机视觉的CNN也可以用来构建语音声学模型。当然,CNN也经常与其他模型结合使用。CNN用于声学模型方面主要包括TDNN、CNN-DNN框架、DFCNN、CNN-LSTM-DNN(CLDNN)框架、CNN-DNN-LSTM(CDL)框架、逐层语境扩展和注意CNN框架(LACE)等。这些基于CNN的混合模型框架都在声学模型上取得了很多成果,比如其中两个,一个是时延神经网络(TDNN),是最早基于CNN的语音识别方法,TDNN会沿频率轴和时间轴同时进行卷积,因此能够利用可变长度的语境信息。TDNN用于语音识别分为两种情况:第一种情况是只有TDNN,很难用于大词汇量连续性语音识别(LVCSR),原因在于可变长度的表述与可变长度的语境信息是两回事,在LVCSR中需要处理可变长度表述问题,而TDNN只能处理可变长度语境信息;第二种情况TDNN-HMM混合模型,由于HMM能够处理可变长度表述问题,因此该模型能够有效地处理LVCSR问题。一个是全序列卷积神经网络(DFCNN),是由国内语音识别领域领头羊KDXF于2016年提出的一种语音识别框架。DFCNN先对时域的语音信号进行傅里叶变换得到语音的语谱图,DFCNN直接将一句语音转化成一张图像作为输入,输出单元则直接与最终的识别结果(如音节或汉字)相对应。在DFCNN的结构中把时间和频率作为图像的两个维度,通过较多的卷积层和池化层的组合,实现对整句语音的建模。DFCNN的原理是把语谱图看作带有特定模式的图像,而有经验的语音学专家能够从中看出里面说的内容。感觉就是很神奇,语音识别竟然可以用转换的图像来作为输入....最后用于声学建模的神经网络就是RNN,其中更多是LSTM。音频信号具有明显的协同发音现象,因此必须考虑长时相关性。由于RNN具有更强的长时建模能力,使得RNN也逐渐替代DNN和CNN,成为语音识别主流的建模方案。例如,常见的基于seq2seq的编码-解码框架就是一种基于RNN的模型。长期的研究和实践证明:基于深度学练的声学模型要比传统的基于浅层模型的声学模型更适合语音处理任务。语音识别的应用环境常常比较复杂,选择能够应对各种情况的模型建模是工业界及学术界常用的建模方式。但单一模型都有局限性,HMM能够处理可变长度表述问题,CNN能够处理可变声道,RNN/CNN能够处理可变长度语境信息。在声学模型建模中,由于混合模型能够结合各个模型的优势,因此它是目前乃至今后一段时间内声学建模的主流方式。
-
被人工智能专业录取,对于马上要入学的本科生来说,各位大佬有什么学习的建议?如果将来想要从事人工智能方向的工作,需要提前做哪些准备?
-
声波是一种信号,可以将其称为音频信号。原始的音频信号通常由于人类发声器官或语音采集设备所带来的静音片段、混叠、噪声、高次谐波失真等因素,会在一定程度上对语音信号质量产生影响。所以,在正式使用声学模型进行语音识别之前,必须对音频信号进行预处理和特征提取。最初始的预处理工作就是静音切除,也叫作语音激活检测(Voice Activity Detection,VAD)或语音边界检测。其目的是从音频信号流中识别和消除长时间的静音片段,在截取出来的有效片段上进行后续处理会在很大程度上降低静音片段带来的干扰。除此之外,还有许多其他的音频预处理技术。其次就是特征提取工作,音频信号中通常包含非常丰富的特征参数,不同的特征向量表征着不同的声学意义,从音频信号中选择有效的音频表征的过程就是语音特征提取。常用的语音特征包括线性预测倒谱系数(LPCC)和梅尔频率倒谱系数(MFCC),其中LPCC特征是根据声管模型建立的特征参数,是对声道响应的特征表征;而MFCC特征是基于人的听觉特征提取出来的特征参数,是对人耳听觉的特征表征。所以,在对音频信号进行特征提取时通常使用MFCC特征。MFCC主要由预加重、分帧、加窗、快速傅里叶变换(FFT)、梅尔滤波器组、离散余弦变换几部分组成,其中FFT与梅尔滤波器组是MFCC最重要的部分。在实际的语音研究工作中,也不需要我们再重新构造一个MFCC特征提取方法,Python提供了pyaudio和librosa等语音处理工作库,可以直接调用MFCC算法的相关模块快速实现音频预处理工作。过去在语音识别上所取得的成果证明MFCC是一种行之有效的特征提取方法。但随着深度学练的发展,受限玻尔兹曼机(RBM)、卷积神经网络(CNN)、CNN-LSTM-DNN(CLDNN)等深度神经网络模型作为一个直接学练滤波器代替梅尔滤波器组,被用于自动学练的语音特征提取中,并取得了良好的效果。
-
因为语音识别相较于一般的自然语言处理任务特殊之处就在于声学模型,所以语言识别的关键也就是信-号预处理技术和声学模型部分。在深度学习兴起应用到语言识别领域之前,声学模型已经有了非常成熟的模型体系,以及被成功应用到实际系统中的案例,例如,经典的高斯混合模型(GMM)和隐马尔可夫模型(HMM)等。神经网络和深度学习兴起以后,循环神经网络、LSTM、编码-解码框架、注意力机制等基于深度学习的声学模型将此前各项基于传统声学模型的识别案例错误率降低了一个层次,所以基于深度学习的语音识别技术也正在逐渐成为语音识别领域的核心。语音识别发展到如今,无论是基于传统声学模型的语音识别系统还是基于深度学习的语音识别系统,语音识别的各个模块都是分开优化的。但是语音识别本质上是一个序列识别问题,如果模型中的所有组件都能够联合优化,那么很可能会获取更好的识别准确度,因而端到端的自动语音识别是未来语音识别最重要的发展方向之一所以,语音识别顺序,首先是声波信-号处理与特征提取等预处理技术;然后是GMM和HMM等传统的声学模型,其中重点是语音识别的技术原理;之后是基于深度学习的声学模型,最后是端到端的自动语音识别。
-
语音识别的输入和输出都是什么? 声音从本质上来说是一种波,也就是声波,这种波可以作为一种信号来进行处理,所以输入实际上就是一段随时间播放的信号序列,而输出则是一段文本序列。将语音片段输入转化为文本输出的过程就是语音识别。一个完整的语音识别系统通常包括信息处理与特征提取、声学模型语言模型和解码搜索四个模块。信号处理与特征提取可以视作音频数据的预处理部分,一般来说,一段高保真、无噪声的语言是非常难得的,在实际研究中用到的语音片段或多或少都有噪声,所以在正式进入声学模型之前,需要通过消除噪声和信道增强等预处理技术,将信号从时域转化到频域,然后为之后的声学模型提取有效的特征向量。接下来声学模型会将预处理部分得到的特征向量转化为声学模型得分,与此同时,语言模型,即在自然语言处理中的类似NGGram和RNN等模型,会得到一个语言模型得分。最后在解码搜索阶段会针对声学模型得分和语言模型得分进行综合将得分最高的词序列作为最后的识别结构。这便是语音识别的一般原理。
-
在自然语言处理中,注意力模型通常是应用在经典的编码G解码(EncoderGDecoder)框架下的,seq2seq模型正是一种典型的编码G解码框架。编码G解码作为一种通用框架,在具体的自然语言处理任务上还不够精细化。换句话说,单纯的编码G解码框架并不能有效地聚焦到输入目标上,这使得像seq2seq的模型在独自使用时并不能发挥其最大功效。例如,编码器将输入编码成上下文向量C,在解码时每一个输出Y都会不加区分地使用这个C进行解码。而注意力模型要做的事就是根据序列的每个时间步将编码器编码为不同的C, 在解码时,结合每个不同的C进行解码输出,这样得到的结果会更加准确。在应用了注意力模型之后,每个输入会被独立编码,解码时就会有各自对应的C进行解码,而不是简单的一刀切。一段汉译英的机器翻译注意力模型图解示意图。
-
所谓seq2seq模型,翻译过来就是序列对序列的模型。seq2seq本质上就是一种多对多(N VS M)RNN模型,即输入序列和输出序列不等长的RNN模型。也正是因为seq2seq的这个特性,使得其有着广泛的应用场景,例如,神经机器翻译、文本摘要、语音识别、文本生成、机器创作等。seq2seq模型虽然强大,但如果仅仅是单一使用,那么效果会打一些折扣。注意力模型就是基于编码G解码框架下的一种模拟人类注意力直觉的一种模型。人脑的注意力机制本质上是一种注意力资源分配的模型。例如,在阅读一篇论文时,在某个特定时刻我们的注意力肯定只会在某一行的文字描述,而在看到一张图片时,我们的注意力肯定会聚焦于某一局部。随着目光移动,我们的注意力肯定又聚焦到另外一行文字,另外一个图像局部上。所以,对于一篇论文、一张图片,在任意一时刻我们的注意力分布是不一样的。这便是著名的注意力机制模型的由来。在计算机视觉目标检测领域,目标检测中的FastRCNN利用RoI(兴趣区域)来更好地执行检测任务,其中RoI便是注意力模型在计算机视觉中的应用。注意力模型的使用更多的是在自然语言处理领域,在机器翻译等序列模型应用上有着更为广泛的应用。
-
普通神经网络和卷积神经网络都有梯度爆炸和梯度消失,那么RNN也有吗?有。而且梯度爆炸和梯度消失的问题对RNN的伤害更大。当RNN网络加深时,因为梯度消失的问题使得前层的网络权重得不到更新,RNN就会在一定程度上丢失记忆性。为此,在传统的RNN结构基础上,研究人员给出一些著名的改进方案,因为这些改进方案都脱离不了经典的RNN结构,所以一般来说我们也称这些改进方案为RNN变种网络。比较著名的就是循环门控单元(GRU)和长短期记忆网络(LSTM)。GRU和LSTM的结构基本一致,但有部分不同的地方。要明确的是,LSTM的本质是一种RNN网络;LSTM在传统的RNN结构上做了相对复杂的改进,这些改进使得LSTM相对于经典RNN能够更好地解决梯度爆炸和梯度消失问题,让循环袢经网络具备更强、更好的记忆性能,这也是LSTM的价值所在。
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第三期2026/08/21 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;念擎-华为云AI开发者运营案例开发专家
本期直播内容:AI六层能力首次详细解读 + 新一代华为云开发者空间亮相 + 校园案例直播带练
回顾中
热门标签