-
首次在大规模图像数据集(ImageNet)实现了深层卷积神经网络结构,引发深度学习热潮的AlexNet 论文(https://papers.nips.cc/paper/4824-imagenet-classification-with-deep-convolutional-neural-networks.pdf)在 2012 年引入了分组卷积。实现分组卷积的主要原因是让网络训练可在 2 个内存有限(每个 GPU 有 1.5 GB 内存)的 GPU 上进行。下面的 AlexNet 表明在大多数层中都有两个分开的卷积路径。这是在两个 GPU 上执行模型并行化(当然如果可以使用更多 GPU,还能执行多 GPU 并行化)。分组卷积的优点高效训练由于卷积可分为多个路径,因此每个路径可以由不同的GPU进行处理。此过程允许以并行的方式对多个GPU进行模型训练。这种基于多GPU的模型并行化允许网络在每个步骤处理更多图像。一般认为模型并行化比数据并行化效果更好,后者将数据集分成多个批次(Batch),然后分开训练每一批次。但是当批次大小过小时,本质上执行的是随机梯度下降,而非批梯度下降,这会造成收敛速度缓慢切收敛结果更差。在训练非常深的神经网络时,分组卷积会非常重要,正如下图ResNeXt中那样,图片来自论文(https://arxiv.org/abs/1611.05431)模型性能更优这有一点让人惊讶,分组卷积在某些情况下能提供比标准2D卷积更好的模型。这在文章(https://blog.yani.io/filter-group-tutorial/)有很好地解释,这里仅做简要的分析。原因主要和稀疏滤波器(稀疏矩阵)有关。下图是相邻层滤波器的相关性,为稀疏关系。图为在 CIFAR10 上训练的一个 Network-in-Network 模型中相邻层的过滤器的相关性矩阵。高度相关的过滤器对更明亮,而相关性更低的过滤器则更暗。图片来自:https://blog.yani.io/filter-group-tutorial
-
扩张卷积由这两篇引入:https://arxiv.org/abs/1412.7062;https://arxiv.org/abs/1511.07122这是一个标准的离散卷积:扩张卷积如下:
-
在使用转置卷积时观察到一个棘手的现象(尤其是深色部分常出现)就是"棋盘格子状伪影",被命名为棋盘效应(Checkboard artifacts)。下图直观地展示了棋盘效应(来源:https://distill.pub/2016/deconv-checkerboard/)本文仅做简要介绍,详细部分请参考论文:Deconvolution and Checkerboard Artifacts(https://distill.pub/2016/deconv-checkerboard)棋盘效应是由于转置卷积的“不均匀重叠”(Uneven overlap)的结果。使图像中某个部位的颜色比其他部位更深。尤其是当卷积核(Kernel)的大小不能被步长(Stride)整除时,反卷积就会不均匀重叠。虽然原则上网络可以通过训练调整权重来避免这种情况,但在实践中神经网络很难完全避免这种不均匀重叠。下面通过一个详细的例子,更为直观展示棋盘效应。下图的顶部部分是输入层,底部部分为转置卷积输出结果。结果转置卷积操作,小尺寸的输入映射到较大尺寸的输出(体现在长和宽维度)。在(a)中,步长为1,卷积核为2*2。如红色部分所展示,输入第一个像素映射到输出上第一个和第二个像素。而正如绿色部分,输入的第二个像素映射到输出上的第二个和第三个像素。则输出上的第二个像素从输入上的第一个和第二个像素接收信息。总而言之,输出中间部分的像素从输入中接收的信息存在重叠区域。在示例(b)中的卷积核大小增加到3时,输出所接收到的大多数信息的中心部分将收缩。但这并不是最大的问题,因为重叠仍然是均匀的。如果将步幅改为2,在卷积核大小为2的示例中,输出上的所有像素从输入中接收相同数量的信息。由下图(a)可见,此时描以转置卷积的重叠。若将卷积核大小改为4(下图(b)),则均匀重叠区域将收缩,与此同时因为重叠是均匀的,故仍然为有效输出。但如果将卷积核大小改为3,步长为2(下图(c)),以及将卷积核大小改为5,步长为2(下图(d)),问题就出现了,对于这两种情况输出上的每个像素接收的信息量与相邻像素不同。在输出上找不到连续且均匀重叠区域。在二维情况下棋盘效应更为严重,下图直观地展示了在二维空间内的棋盘效应。
-
对于很多生成模型(如GAN中的生成器、自动编码器(Autoencoder)、语义分割等模型)。我们通常希望进行与正常卷积相反的装换,即我们希望执行上采样,比如自动编码器或者语义分割。(对于语义分割,首先用编码器提取特征图,然后用解码器回复原始图像大小,这样来分类原始图像的每个像素。)实现上采样的传统方法是应用插值方案或人工创建规则。而神经网络等现代架构则倾向于让网络自己自动学习合适的变换,无需人类干预。为了做到这一点,我们可以使用转置卷积。转置卷积在文献中也被称为去卷积(Deconvolution)或微步幅卷积(Fractionally strided convolution)。但是,需要指出去卷积这个名称并不是很合适,因为转置卷积并非信号/图像处理领域定义的那种真正的去卷积。从技术上讲,信号处理中的去卷积是卷积运算的逆运算。但这里却不是这种运算。后面我们会介绍为什么将这种运算称为转置卷积更自然且更合适。我们可以使用常见卷积实现转置卷积。这里我们用一个简单的例子来说明,输入层为2*2,先进行填充值Padding为2*2单位步长的零填充,再使用步长Stride为1的3*3卷积核进行卷积操作则实现了上采样,上采样输出的大小为4*4。值得一提的是,可以通过各种填充和步长,我们可以将同样的2*2输入映射到不同的图像尺寸。下图,转置卷积被应用在同一张2*2的输入上(输入之间插入了一个零,并且周围加了2*2的单位步长的零填充)上应用3*3的卷积核,得到的结果(即上采样结果)大小为5*5通过观察上述例子中的转置卷积能够帮助我们构建起一些直观的认识。但为了进一步应用转置卷积,我们还需要了解计算机的矩阵乘法是如何实现的。从实现过程的角度我们可以理解为何转置卷积才是最合适的名称
-
在上一个插图中,可以看出,这实际上是在完成3D卷积。但通常意义上,仍然称之为深度学习的2D卷积。因为将滤波器深度和输入层深度相同,3D滤波器仅在2个维度上移动(例如图像的高度和宽度),得到的结果为单通道。通过将2D卷积的推广,在3D卷积定义为滤波器的深度小于输入层的深度(即卷积核的个数小于输入层通道数),故3D滤波器需要在三个维度上滑动(输入层的长、宽、高)。在滤波器滑动的每个位置执行一次卷积操作,得到一个数值。当滤波器滑过整个3D空间,输出的结构也是3D的2D卷积和3D卷积的主要区别为滤波器滑动的空间维度。3D卷积的优势在于描述3D空间中的对象关系。3D关系在某一些应用中十分重要,如3D对象的分割以及医学图像的重构等。
-
2D卷积(2D Convolution)3D卷积(3D Convolution)1*1卷积(1*1 Convolution)反卷积(转置卷积)(Transposed Convolution)扩张卷积(Dilated Convolution / Atrous Convolution)空间可分卷积(Spatially Separable Convolution)深度可分卷积(Depthwise Separable Convolution)平展卷积(Flattened Convolution)分组卷积(Grouped Convolution)混洗分组卷积(Shuffled Grouped Convolution)逐点分组卷积(Pointwise Grouped Convolution)
-
工程TensorFlow 2.X,会是它走下神坛的开始?都1202年了,机器学习还要用TensorFlow吗?2020/12/25 19:24原文链接产业登上NIST竞赛榜单,获得BCTC增强级活体认证:小视再攀高峰!国内的计算机视觉创业公司中,有一家因为先进的活体检测技术正在迅速引起人们的关注。2020/12/25 19:22原文链接NPU时代,边缘智能走向何方?加入这场技术工作坊,一起解读边缘智能引擎趋势!OPEN AI LAB 专场—NPU时代的边缘智能引擎趋势2020/12/25 15:00原文链接IT不重要这篇写于十七年前的文章《IT Doesn't Matter》研究了信息技术在商业中的发展规律,结果发现,它遵循着与铁路、电力等早期技术极为相似的传播和演化规律。通过一系列示例,作者展示了IT创新如何迅速成为共享业务基础设施的一部分,从而抵消了它们提供竞争优势的能力。2020/12/25 14:57原文链接深度对话杨植麟博士:NLP科研和创业的方法论对话循环智能联合创始人2020/12/25 10:20原文链接理论速度、准确率与泛化性能媲美SOTA CNN:Facebook提出高效图像TransformerFacebook提出数据高效图像Transformer (DeiT),高效处理图像分类任务。2020/12/25 19:21原文链接入门只有170字节,最小的64位Hello World程序这样写成如何编写出最小的 64 位 Hello World 程序?2020/12/25 19:20原文链接其他用iPhone给林徽因拍照是啥样?这款“穿越相机”把老照片变现代风开发“水淹食堂”的ACM班校友罗璇又出新作2020-12-25 14:49:36原文链接会议摘要怎么写?这篇论文手把手教你科研新手福音2020-12-25 13:10:09原文链接知道了05后的隐藏技能之后,我酸了…05后要上“天”了2020-12-25 12:31:50原文链接
-
1.人脑与计算机面部感知对比:深度卷积神经网络在计算等特定任务上(比如身份识别)要比人类熟练得多,但在学习对称性、均匀性和一致性等语义概念时却比人类困难得多。2.预训练的CNN模型:所有用于人脸图像的样式转换方法在应用样式转换之前都需要在样式图像和内容图像之间进行某种类型的匹配。否则会造成伪影和面部结构的变形。3.变分自编码器VAE:关于人脸图像,VAE模型在学习变化的隐藏因素方面非常有效。性能不如最大化数据可能性本身的生成模型。与其他生成模型相比,VAEs生成的样本更模糊,质量更低。提高VAEs生成样本的质量是一个开放的问题,正在积极研究。找到让他们学习潜在表征的方法仍然是具有挑战性的研究问题。4.生成性对抗网络:GANs没有显式建模和求解数据集密度函数,而是专注于从该分布生成样本。GANs对这个问题的解决方案是首先从简单的已知潜在分布(如随机噪声)中采样,然后学习将这个样本转换成训练分布的样本。用GANs的主要缺点是试图同时训练两个网络。这可能具有挑战性,因为它会导致对超参数的选择非常敏感的不稳定和困难的过程。一个非常活跃的研究领域是寻找更好的损失函数,使GANs的训练更加稳定。遗传神经网络的另一个主要问题是模式崩溃现象,这是在遗传神经网络生成的样本中普遍观察到的缺乏多样性。许多研究人员一直致力于通过提高GAN组织样本的多样性来解决这个问题。5.自回归模型:PixelRNNs和PixelRNNs是强大的生成模型,提供了一个显式和易处理的数据似然计算框架。由于这种显式似然计算,他们能够生成高质量的样本。这些型号的主要缺点是速度慢。因此,寻找提高这组生成模型速度的方法是一个活跃的研究领域。关于人脸图像,像素神经网络和像素神经网络在生成像素级细节方面工作良好,并且能够提高生成的人脸的视觉质量。然而,与前面提到的生成模型组不同,它们不能从人脸图像中提取高级语义概念。因此,当涉及到对人脸图像执行语义操作时,它们在混合框架中工作得最好,在混合框架中,一些其他的生成模型负责提取语义概念,而自回归模型通过向生成的图像添加真实的细节来提高图像的质量。6.基于流的模型:基于流的生成模型总结了所有以前成功的模型的优点。类似于自回归模型,它们定义了一个易于处理的对数似然估计。与VAEs类似,它们的功能形式是灵活的。此外,他们的采样过程快速准确,类似于GANs。此外,它们能够以精确和有效的方式实现可解释的潜在空间表示。然而,与其他三组生成模式相比,它们迄今为止在研究人员中受到的关注较少,这意味着有相当大的改进空间。7.混合深层生成模型:生成模型中的另一个强大趋势是将两个以前回顾过的模型组合在一个框架中的模型组,因为它们试图利用各自的优点,同时避免它们的缺点。混合深度生成模型是一组很有前途的用于人脸图像合成和语义操作的深度生成模型。他们利用不同模型中的优点,同时通过将具有相反强度的模型结合到框架中来弥补它们的缺点。因此,他们能够生成具有显著的真实感和视觉质量的语义编辑的人脸图像。
-
第1章中介绍了梯度下降算法训练回归模型,神经网络模型也一样需要使用梯度下降算法来更新参数。然而一个神经网络通常会有上百万的参数,那么如何高效地计算这百万级别的参数是需要重点考虑的问题。神经网络中使用反向传播(Backward Propagation)算法,使得计算梯度更加有效率。在介绍反向传播之前,先来介绍一下链式法则。假设有两个函数y=g(x)和z=h(y),那么z对x的求导过程如下:假设有三个函数x=g(s)、y=h(s)和z=k(x,y),z对s的求导过程如下:神经网络的梯度计算,就是依赖链式法则一层层反向传播的。如图3.4所示的前向神经网络,输入层有n个属性x1,x2,…,xn,中间隐藏层有p个神经元,第j个神经元为hj,j∈(0,p-1)。输出层为q维。对隐藏层的每一个神经元hj,先经过一个线性变换,公式如下:式中,wj0——偏置值;wj1,wj2,…,wjn——作用在属性x1,x2,…,xn上的权重。[插图]输入给神经元后,经过激活函数的作用得到[插图]。第二层同理有神经元输入:输出。以上为前向神经网络的前向传播(ForwardPropagation)过程。对单个数据样本(x,y),假设损失函数为均方差,则对第k个输出项的损失为:通过链式法则,损失函数对权重vkj的梯度为:式中,第一项第三项而对于第二项,假设激活函数为sigmoid函数,则梯度有一个很好的性质,即:三项相乘可以得到:由于真实标签yk由数据给定,而输出值[插图]与hj均由前向传播算法计算得到,则可以轻易地计算得到每个中间层权重vkj,并且该计算过程可以并行进行。类似地,可以得到损失值在隐藏单元hj上的累积梯度为同理,可以通过链式法则,得到损失函数对第一层权重wji的梯度为(假设隐藏层激活函数为ReLU函数):在上一步计算得到后,也可以高效并行地计算出。在上述过程中,假设了损失函数是均方差,激活函数为sigmoid和ReLU,其实这样的计算法则对任意可微的损失函数和激活函数都是有效的。从计算过程来看,在前向传播得到隐藏层与输出层数值后,先从损失函数算起,接着从顶层逐渐计算梯度,将梯度逐层往输入层传播。这与前向传播的顺序是相反的,也是该算法为什么被称为反向传播的原因。反向传播(见图3.5)得到所有参数的梯度之后,可以利用梯度下降算法对参数进行更新迭代,从而达到训练神经网络的目的。神经网络训练过程如算法3.1所示。输入:数据集,步长为α,小批量训练样本的大小为b,迭代次数为T输出:训练完成的神经网络(1) 初始化网络参数w0(2) for t∈{1,2,…,T}(3) 从m个样本中均匀随机无放回选取b个样本mb(4) 前向传播逐层计算隐藏层的参数值,得到样本输出(5) 根据损失函数计算误差,得到输出层梯度(6) 反向逐层计算隐藏层梯度(7) 计算连接参数梯度并更新参数 本文转载自华为云社区 作者:HWCloudAI
-
本章介绍了深度神经网络的几个相关概念,并给出了用MindSpore实现简单神经网络的样例。深度学习(Deep Learning)与传统机器学习最大的不同在于其利用神经网络对数据进行高级抽象。而最基础的神经网络结构为前向神经网络(Feed forwardNeural Network,FNN),又称多层感知机(Multi-Layer Perceptron,MLP)。在介绍多层感知机之前,先来认识一下神经网络的基础单元——感知机。如图3.1所示,x1,x2,…,xn为输入,w1,w2,…,wn为与之对应的权重,w0为偏置。感知机对这些输入进行加权求和,再加上偏置值w0,最后通过激活函数f(·)得到神经元的输出。在分类问题中提到的逻辑函数为一种常用的激活函数(Activation Function),目的是将一个在较大范围变化的值挤压到(0,1)的输出值范围内,或者输出0/1对应的概率值。此外,双余弦函数以及修正线性单元(Rectified Linear Unit,ReLU)函数ReLU(x)=max(x,0)也经常作为神经元的激活函数。这些激活函数的目的都是为神经元带来非线性运算。相比线性函数而言,非线性函数的表达能力更强,图3.2展示了这三种激活函数的形状。尽管非线性激活函数的单个神经元带来了非线性特征,但它只拥有一层神经元,学习能力非常有限,仍然只能处理线性可分的问题。为了解决更复杂的非线性可分问题,多层感知机(MLP)被提出。图3.3为一个简单的三层前向神经网络模型,包括输入层、隐藏层和输出层。数据x作为输入提供给输入层,经过线性映射和非线性激活函数,得到隐藏层。隐藏层再经过一层运算得到输出层。其中输入层的节点数由数据本身的属性数量决定,输出层的节点数可以是类别个数、抽象特征个数等。隐藏层的层数人为指定,并且层数可以是一层或多层,每个隐藏层上都可设置一类非线性激活函数。经过线性组合与非线性变换,这个由多层神经元组成的函数模型,具有更强大的学习能力。 本文转载自华为云社区 作者:HWCloudAI
-
产业分析美的、便利蜂、贝壳等企业案例后,杨国安对数字化转型有这三个洞察数字化的威力不是加法,而是乘法2020/12/21 17:15原文链接怎样才算人工智能教育?这家机器人公司「以赛带学」输出AI教育教学成果“所谓人工智能教育是,用创客的思维,STEAM的理念培养面向未来AI智能时代的未来制造者。”2020/12/21 16:59原文链接人工智能让遥感数据释放巨大潜能:人口普查中的「人工」或将被取代该研究证实了卷积神经网络(CNN)针对卫星图像数据深入分析的潜能。2020/12/21 15:53原文链接AI种草莓,比最强人类多两倍:首次农业人机大战结束了云南昆明开启的「多多农研科技大赛」在12月16日落下了帷幕。2020/12/21 15:44原文链接教育公司如何借助AI技术,更快提升课程顾问的水平跨越从“知道”到“做到”的鸿沟2020/12/21 15:36原文链接入门速度数百倍之差,有人断言KNN面临淘汰,更快更强的ANN将取而代之这也许是真的。2020/12/21 15:49原文链接清华大学发布首个自动图机器学习工具包AutoGL,开源易用可扩展,支持自定义模型清华大学发布全球首个开源自动图学习工具包 AutoGL。2020/12/21 15:37原文链接其他 谷歌传奇Jeff Dean获2021年IEEE冯诺依曼奖,8页本科论文被大学图书馆保存至今以表彰对大规模分布式计算机系统和人工智能系统科学与工程的贡献”。2020-12-21 14:06:10原文链接彭博社:微软正为其数据中心自研芯片彭博社评论称,此举可能对英特尔数据中心芯片业务构成威胁。2020-12-21 10:14:55原文链接快讯美国民权组织开始阻止在美国机场扩大人脸识别使用由美国公民自由联盟领导的民权组织联盟对拟议扩大陆路和海港海关和边境保护局(CBP)的面部识别提出了反对意见。国家移民法律中心,为未来而战和电子前沿基金会也与其他十二个国家一起参加了议案。CBP 于 11 月提交的拟议规则将扩大生物识别出口系统,并授权从进入该国的任何非公民收集面部图像。但是,在评论期最后一天星期一的文件中,该联盟认为这些措施太极端了。(The Verge)2020-12-22 08:45原文链接付费平台 Bolt 获 7500 万美元 A 轮融资付费平台 Bolt 近日宣布,该公司最近完成了 7500 万美元的融资。一年之后,Bolt 处理了超过 10 亿美元的零售交易,其购物者网络的规模增长了 10 倍,每月增加了 25 万购物者。据了解,总部位于旧金山的 Bolt 由 Eric Feldman 和 Ryan Breslow 于 2014 年创立,提供了旨在简化网络交易的多种工具。(Venture Beat)2020-12-22 08:45原文链接Elon Musk:特斯拉将于 2021 年推出全自驾车订阅服务特斯拉价值 10,000 美元的全自驾车附件是很多人不一定能负担得起的奢侈品,即使是那些有足够钱买一台特斯拉的人也是如此。特斯拉首席执行官 Elon Musk 表示,明年可能会有更简单的购买功能的方法。一位说要租赁特斯拉的人在推特上告诉 Musk,他在租赁特斯拉汽车时存在的购买全自动驾驶的问题。Musk 表示,全自动驾驶订阅将于 2021 年初开始提供。(ZDNet)2020-12-22 08:31原文链接Google Cloud 扩展了其全球云区域Google Cloud 表示,随着其在全球范围内的扩张,它将在智利,德国和沙特阿拉伯启动新的云区域。对于超大规模云提供商而言,随着国家/地区推出要求客户数据保留在国家/地区中的数据主权法律,添加区域变得至关重要。Google Cloud 一直在 2020 年构建其混合,行业和垂直游戏。随着 Google Cloud 的扩展,出现了三个新的云区域。2020 年,Google Cloud 在雅加达,印度尼西亚,拉斯维加斯,盐湖城和首尔启动了新区域。多哈,卡塔尔,马德里,米兰和巴黎也都在附近。(ZDNet)2020-12-22 08:31原文链接英国国家医疗服务体系与有争议的人工智能公司 Palantir 签署价值 2300 万英镑合同在没有经过仔细审查的情况下,英国国家医疗服务体系(NHS)已经与 Palantir 签署了一项价值 2300 万英镑的为期两年的合同。尽管这家备受争议的 AI 公司与英国的卫生服务合作原本应该是临时的紧急措施,以帮助应对 COVID-19 大流行。据悉,这项已于 12 月 18 日发布的协议正在为 NHS 提供数据平台,以帮助纷发 COVID-19 疫苗。(The Register)2020-12-22 08:24原文链接梅赛德斯即将推出 AI 驱动的 MBUX 信息娱乐系统明年新款梅赛德斯 EQS 轿车问世时,该款轿车将配备 MBUX 信息娱乐系统的新改进版,即 MBUX Hyperscreen,作为可选升级。该公司表示,超宽屏幕覆盖了即将推出的 EV 的整个前仪表板,并添加了 AI 以使使用该系统更加直观。据了解,这家汽车制造商将在即将于 1 月 11 日美国东部时间上午 11 点举行的 CES 新闻发布会上详细介绍信息娱乐系统。(Engadget)2020-12-22 08:23原文链接人工智能解决了量子化学中的 Schrödinger 方程柏林自由大学的一组科学家开发了一种人工智能方法,用于计算量子化学中 Schrödinger 方程的基态。据了解,量子化学的目标是仅根据原子在空间中的排列来预测分子的化学和物理性质,而无需进行资源密集和耗时的实验室实验。原则上,这可以通过求解 Schrödinger 方程来实现,但实际上这是极其困难的。点击下方链接了解更多信息。(PHYS ORG)2020-12-22 08:16原文链接人工智能机器人利用受损腿部继续行走人工智能通常依赖于所谓的神经网络,即受人脑启发的算法。但是与我们不同的是,一旦经过训练和部署,人工智能大脑通常就不会学习新事物。他们一直怀着与生俱来的想法。在一项新研究中,研究人员使用「Hebbian 规则」(一种允许人工智能大脑继续学习的数学公式)创建了神经网络。这些网络不是静态的,而是根据经验变化的,而不是突触的权重(该值指示活动如何从一个神经元传播到另一个神经元)。之后,团队部分移开了两个机器人的左前腿,迫使它们试图弥补伤害。研究人员在本月的神经信息处理系统会议上报告说,两个机器人起初都在挣扎,但 Hebbian 机器人却能行走近七倍。(Science)2020-12-22 08:16原文链接人工智能通过眼球运动来衡量癌症患者的心理健康科学家已经开发出深度学习算法的组合,这些算法使用眼动追踪来评估手术后癌症患者的心理健康。理想情况下,这将有助于发现人们无法进行初步的心理评估时可能患有焦虑症或抑郁症的患者。据了解,该系统结合了卷积神经网络和长短期记忆算法,以研究戴着跟踪眼镜的患者在考虑图稿时的眼球运动。人工智能使用这些眼镜的注视和瞳孔位置数据来确定某人对他们将在以后填写的既定希望,焦虑和心理健康调查表上提出疑虑的可能性。(Engadget)2020-12-22 08:12原文链接
-
近年来掀起的深度学习革命已经深刻地改变了诸多应用领域,并将在越来越多的领域取得成功。其中最广为人知的领域包括自动语音识别、图像识别、自然语言理解及很多其他交叉领域(如医疗、生物、金融等)。下面将依次简单介绍这些深度学习的典型现实应用。1.3.1 自动语音识别自动语音识别(Automatic Speech Recognition,ASR)是一项将语音转换成文本的技术。从早期的基于模板的方法到严格的统计模型,再到如今的深度模型,语音识别技术已经经历了几代的更迭。在深度学习模型之前,自动语音识别的主流模型是隐马尔可夫模型(Hidden Markov Models,HMM)。在使用这些模型之前,所有的自动语音识别系统都需要经历四个步骤:特征提取、声学模型、语言模型和解码搜索。在进入声学模型之前,需要消除噪声和增强信号,并将信号从时域转换到频域。声学模型主要用来进行特征的转换与表示,再通过一个语言模型,在解码搜索中对模型的结果进行排序并选取得分最高的文本序列。早期应用于声学建模的深度模型是普通的深度神经网络(Deep Neural Networks,DNN),但DNN需要固定大小的输入,因而需要一种能够处理不同长度语音信号的方法。另外,考虑到语音信号是一种非平稳时序信号,如何有效地对长时时序动态相关性进行建模也颇为重要。而这些恰好是循环神经网络的强项。因此,目前主流的自动语音识别深度学习模型是循环神经网络的变种——长短期记忆网络(Long ShortTerm Memory,LSTM)。以循环神经网络为基础的语音识别系统极大地减少了识别错误率,被广泛应用于目前商业上主流的语音识别设备(如亚马逊的Alexa)上。1.3.2 图像识别图像识别是深度学习最成功的应用之一。深度学习在计算机视觉领域的突破发生在2012年,Hinton教授的研究小组利用卷积神经网络架构(AlexNet)大幅降低了ImageNet ILSVRC挑战中图像分类任务的错误率并取得了冠军。之后不断有新的基于卷积神经网络的架构被提出,包括GoogleNet、VGGNet、ResNet、DenseNets和Inception。这些模型在不断加深网络深度的同时,也能不断提升图像分类的准确率。同时,深度学习也被应用于其他计算机视觉任务中,包括目标检测、图像分割、图像标注、行为分析、人脸识别,以及基于生成对抗网络(Generative Adversarial Networks,GAN)的图形风格迁移、视频生成等。在这些应用的背后,起到关键作用的深度学习模型当属深度卷积神经网络。卷积神经网络中最重要的操作是卷积和池化。受益于参数共享和稀疏连接,卷积神经网络非常适合处理图像数据。通过堆叠很多层,卷积神经网络可以不断地从低层特征中提取更高层的特征,最终更好地进行下游任务的处理。目前各种新的网络架构仍在不断被提出,我们期望深度学习在图像识别领域不断取得新的成果。1.3.3 自然语言处理神经网络从2000年开始就逐渐被应用到语言模型中,在成分解析、情感分析、信息抽取、机器翻译、文本分类等自然语言理解的任务上均取得了好的结果。其中,一项重要成果就是词向量的学习。词向量可以看作是一种运用深度神经网络将词转换成隐含空间中的一个向量化的位置表示的方法。将词向量作为循环神经网络的输入,能有效利用合成式的向量语法对句子和短语进行解析。合成式的向量语法可以被认为是由循环神经网络实施的上下文无关的概率语法。另一方面,以长短期记忆网络为代表的循环神经网络在机器翻译和语言模型等方面的表现也较为突出。近年来,除了循环神经网络之外,新的一些深度神经网络结构(如Transformer)也不断被提出,它们通过学习文本序列中的长期依赖和分层结构,在自然语言处理的任务上取得了显著的效果。此外,基于预训练的无监督模型,如建立在Transformer基础上的BERT(Bidirectional Encoder Representations from Transformers)模型,采用迁移学习和微调的方法,进一步刷新了深度学习方法在自然语言处理任务上的技术前沿。到目前为止,面向自然语言处理任务的深度学习架构仍在不断进化,与强化学习、无监督学习等的结合应该会带来效果更优的模型。1.3.4 其他领域深度学习在其他领域(如生物学、医疗和金融等)也有很多应用。在生物学研究中,深度学习算法可以发现人类无法捕捉到的特征。研究人员利用这些算法对细胞图像进行分类,建立基因组连接,加速药物发明周期。在医疗领域,深度卷积神经网络被应用于癌细胞分类、病变检测、器官分割和图像增强等医疗图像分析任务中,并取得了不错的成果。在金融领域,深度学习被应用于金融欺诈检测和反洗钱等任务,也可以通过模拟交易员的行为,完成选股、择时、风控等较为复杂的任务。此外,深度学习在异常检测和信用评分等领域也有应用。 本文转载自华为云社区 作者:HWCloudAI
-
深度学习是使用多层结构从原始数据中自动学习并提取高层次特征的一类机器学习算法。通常,从原始数据中提取高层次、抽象的特征是非常困难的。深度学习将原始的数据表示成一个嵌套的特征层级,这样一来,每层特征均可以由更简单的特征来定义和计算。尤为重要的是,深度学习可以自动地学习如何最优地将不同的特征置于哪一层。也就是说,相比于传统机器学习算法需要提供人工定义的特征,深度学习可以自己学习如何提取特征。因此,相比于传统的机器学习算法,深度学习并不依赖复杂且耗时的手动特征工程。深度学习中的“深度”体现在将数据转换为所需要数据的层数之深。给定模型进行数据输入,可以将描述模型如何得到输出的流程图中的最长路径的长度记为模型的深度。另一方面,在深度概率模型中,也把描述概念之间如何相互关联的图的深度而非计算图的深度记为一种模型的深度。值得注意的是,后者用来计算表示的计算图可能比概念图要深得多。鉴于这两种观点的共存,一般在一个模型有多深才算作“深度”模型上并没有达成共识。不过一般深度学习指的是比传统的机器学习需要更多的计算步骤或者概念学习的模型。绝大多数的深度学习模型是以人工神经网络(Artificial Neural Network,ANN)为基础构建的。人工神经网络是受人脑的启发而发明的计算系统。一个人工神经网络是由一个相互连接的被叫作神经元的单元组成的集合。神经元以层的形式被组织起来,不同的层对输入做不同的变换来获得不同层次的抽象和特征提取。不同的神经元之间的连接被赋予不同的权重,代表了一个神经元对另一个神经元的影响。感知机(Perceptron)是最早可以从样本数据中学习权重的模型。感知机的学习算法属于线性模型的参数学习方法。虽然线性模型仍然是一种被广泛使用的机器学习算法,却存在很多缺陷,最著名的缺陷是感知机无法学习异或(XOR)函数。目前,最为典型的深度学习模型框架是前向神经网络(Feedforward NeuralNetwork),也被叫作多层感知机(Multi Layer Perceptron,MLP)。前向神经网络之所以被称作“前向”是因为通过该网络的信息流是前向传递的,从输入数据开始,经过中间层的计算,得到最终输出。整个结构没有反馈连接,信息单向传播。前向神经网络构成了很多实用的深度学习模型的基础。例如,用于计算机视觉任务的卷积神经网络(Convolution Neural Network,CNN)就是一种特殊的前向神经网络。当前向神经网络被拓展到允许反馈连接时,被叫作循环神经网络(Recurrent Neural Network,RNN)。卷积神经网络和循环神经网络在现实应用中取得了非常大的成功。下面介绍的深度学习的现实应用很多都是以它们作为基础的。 本文转载自华为云社区 作者:HWCloudAI
-
11月22日,哈尔滨工业大学(深圳)和华为技术有限公司合作的创新实验课程——《华为云ModelArts AI模型开发实战》圆满结课。该课程由华为技术有限公司高级工程师、现任华为云EI图像算法专家——杜奇主讲,哈工大(深圳)实验与创新实践教育中心提供场地和软硬件等支持,共计16学时。课程主要面向有一定计算机基础的本科生,选课通知一经发布,便引起同学们的极大热情,课程容量80人,在两天内即被选完,课程内容如表1所示。《华为云ModelArts AI模型开发实战》的课程内容结合了华为云的技术积累和哈工大(深圳)的专业培养目标,基于华为云ModelArts一站式AI开发平台,向同学们讲解了图像分类、物体检测、人脸识别、OCR和视频分析五大热门AI领域的重要知识点。同学们可以利用ModelArts平台易上手的自动学习、预置算法、Notebook和充足的算力资源,零AI基础、零编程经验也可以进行AI模型的开发。通过本课程的学习,同学们无论是从理论上还是从动手实践上,都学到了AI领域的很多基础知识和经典算法,掌握了一定的模型调优能力。课堂上,同学们积极和老师互动,对杜老师讲授的内容表现出浓厚的兴趣,现场教学效果很好。为深化“引企入教”改革,推进创新教育理念,培养学生创新精神和实践能力,哈工大(深圳)开设企业创新实验课程,并将继续吸引优秀企业走进校园,促进企业需求融入人才培养环节。附:课程PPT、现场授课视频、源代码和实践案例文档获取链接表1 课程内容安排序号教学内容教学要求学时教学方式1人工智能的发展史与现状通过讲解人工智能各流派的发展历史,使学生了解人工智能各流派能解决和不能解决的问题,从历史的角度来看待人工智能技术的发展1讲课2神经网络发展史梳理神经网络的发展历史,使学生了解损失函数、梯度下降、学习率等基础概念是怎么发展而来的1讲课3ModelArts介绍与实验前准备讲师现场讲解演示ModelArts,使学生了解ModelArts能做什么,并进行实验前的必要准备1实验4零代码开发美食分类模型讲师现场演示,再搭配丰富的图文教程,教导学生掌握使用自动学习开发图像分类模型的方法1实验5图像分类介绍梳理图像分类领域的发展脉络,介绍经典数据集和经典算法,使学生掌握图像分类领域的基础知识1讲课6物体检测介绍梳理物体检测领域的发展脉络,介绍经典数据集和经典算法,使学生掌握物体检测领域的基础知识1讲课7使用FasterRCNN预置算法基于海量数据训练人车检测模型讲师现场演示,再搭配丰富的图文教程,教导学生掌握使用预置算法开发物体检测模型的方法2实验8人脸识别介绍讲解人脸相关的不同研究领域,介绍经典数据集和经典算法,使学生掌握人脸识别领域的基础知识1讲课9人脸检测工具对比学生自己动手测试不同人脸检测工具的检测效果,通过对比实验,使学生清楚知道在什么场景下适合用什么人脸检测工具1实验10人脸年龄和表情识别学生自行运行人脸年龄和表情识别算法,分析网络结构,使学生掌握人脸年龄和表情识别的原理1实验11FaceNet算法完成人脸识别讲师讲解FaceNet的网络结构,学生按照图文教程搭建FaceNet模型,并进行模型的训练和预测,从而掌握FaceNet算法实现人脸识别的方法1实验12OCR介绍介绍OCR领域的经典数据集和经典算法,使学生掌握OCR领域的基础知识1讲课13CTPN算法完成文字位置检测通过CTPN文字检测的实验,使学生掌握文字检测和常规物体检测的区别于联系1实验14视频分析介绍讲师讲解视频分析不同领域的应用、经典数据集和经典算法,使学生了解AI在视频方向上有哪些应用1讲课15使用C3D和I3D模型实现视频动作识别讲师讲解C3D模型和I3D模型结构,学生参考实验文档,动手训练C3D模型,并且掌握C3D模型和I3D模型的预测方法1实验宣传海报课堂现场课后留影
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第五期2026/09/04 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;蒋春阳-华为云AI开发者案例开发专家
本期直播内容: AI工具体验营 · 第5-8课连讲。Agent-Team 多智能体协作完成毕业设计实践
回顾中 -
华为云开发者AI素养ClassRoom·第六期2026/09/08 周二 19:00-20:00
樊渊-2026华为软件挑战赛冠军
高手来了:看软挑高手解析二维排样问题—从工业难题到算法突破
回顾中
热门标签