• [其他] 分享无监督学习的未来(2)
    以新方法训练堆叠浅层的自编码器    我们的目标是在自下而上和自上而下对某个特征的预测之间取得一致。这很容易通过缩小所有隐藏激活向量来实现。这被称为所谓的“塌缩问题”(collapse problem)。不过,我们可以通过使用更好的协议定义来避免这个问题:两个变量在每个训练样例中的值是否一致,以及它们在不同训练样例中是否遵循同样的变化。我们先讨论一种完全不同的无监督学习方法,之后我再回到这种方法。之前,我和我的学生想出了一个方法,用一个更好的定义来解释两者的一致性。与其说它们应该相等,不如说它们应该是相似的,即它们在不同的训练案例上有什么样的变化趋势。所以在一个特定的训练案例中,我们希望神经网络的一部分中的自下而上的预测与自上而下的预测相一致。不要尝试解释输入的每一个细节,只需关注于提取在空间或时间上一致的属性。和自动编码器不同,这里允许我们忽略噪声。提取空间一致性属性Becker 和我在1992年引入了一种提取空间一致属性的方法:最大化两个输入非重叠图像块的表征的互信息。如果a 和b是标量,则通过最小化 来最大化互信息。如果a和b是向量,则通过最小化 来最大化互信息。相关论文:Maximizing the Mutual Infomation between two Gaussian distributed variables(Becker 和Hinton,1992)接下来看一个提取空间一致性属性的简单样例:    首先用随机点填充一张图片使它没有明显的结构。然后再取另一张图片,这张图片是第一张图片经过水平移动后的版本。所以图像对中唯一的结构就是它们之间的相对平移。很久以前我们用的是非常小的电脑。所以我们只从左边的图像中取了一个一维的条带,从右边的图像中取了一个一维的条带。我们在左图上散落了一些随机点。然后我们看了右图,这是左图的翻译版。你可以看到,如果你看两个相邻的图像块,那么它们的视差是一样的。左右条带之间的偏移相同。所以,如果你训练一个神经网络,看看左手边的patch块来提取一个属性, 训练一个神经网络的副本来观察右手边的patch块,吸引一个属性。可以看出仅有的一致性属性分离了,这就是我们想要提取的,它也确实起到了作用。转自,青暮,https://www.leiphone.com/news/202009/xd0M2fn80c856Fcc.html
  • [其他] 实用AutoML系统所面临的关键技术难题和挑战
    自动化机器学习作为一项能够帮助AI快速落地的关键技术,已经得到了国内外学术界和工业界的广泛关注。经过近几年的研究发展,AutoML在基本技术方法和任务上,已经取得显著的进展和成果。一、关键技术难题和挑战(1)开发一个高效全流程数据分析模型难度大大部分实际应用的模型往往是端到端的机器学习流水线。典型的数据分析流程涉及到多个阶段,包括数据预处理、特征工程、算法选择、模型评估及超参数优化等,而且每个分析阶段又包含了多种方法。数据分析人员需要了解每个阶段中每个方法的适用场景、运行原理以及超参数调优技巧,并通过不断尝试各种算法模型,反复迭代和试错,最终针对实际业务数据特征设计性能优异的机器学习流水线。因此,开发一个高效的全流程的数据分析模型具有技术难度大、严重依赖专家经验、周期较长等困难。目前主流的贝叶斯优化方法将机器学习流水线自动化设计问题抽象成模型选择和超参数调优的联合高维优化问题。然而,大部分贝叶斯优化方法在高维场景下性能较差。另外,基于遗传算法的自动化算法又面临着效率较低、耗时过长的问题。(2)概念漂移场景下的AutoML建模问题现有的AutoML技术方法大都用来解决静态数据集的自动化建模问题,但是在一些现实场景下,数据是持续产生的,数据特征是动态发生变化的。这种数据特征的动态改变也称为概念漂移。例如,在许多实际应用场景中,比如在线广告、推荐系统、情绪分析、欺诈检测等,数据按天、周、月甚至年依次到来,并且随着时间推移,数据分布会发生变化。由于存在概念漂移,一个时间段下训练所得到的模型,有可能难以适应下一个时间段的数据,从而导致预测准确性下降。终身学习(Lifelong Learning ) 的目的就是能够捕获数据概念漂移,使机器学习模型能够随着数据集的变化而动态更新。(3)特征工程中的问题和挑战特征提取的主要目标是通过从输入数据中提取突出的特征来提高机器学习模型的准确性,同时还可能从输入中消除噪声和冗余。 必须考虑特征的可扩展性,因为用于机器学习的数据集大小的增长使得提取特征变得困难且不可行。十年前,要对数千个特征运行特征选择算法是一个挑战,而现在的挑战是要对数百万个输入维执行此操作。这就提出了一个巨大的挑战:我们如何使特征提取具有可扩展性?特征工程通常需要相关领域的专业知识,并且涉及反复试验和错误,模型测试和评估。将原始数据转换为功能部件通常需要大量人员参与有关该问题的领域知识,因为它主要是由直觉驱动的。二、如何解决这些问题和挑战?(1)超参数重要性分析工具大多数 AutoML 工具常常只能机械地给出最优的参数配置,却无法洞察超参数与模型性能之间的关系。针对该问题,超参数重要性分析工具应运而生,它对 AutoML 工具运行过程中产生的算法性能数据进行离线分析,获得关于不同算法的超参数是如何影响模型性能的见解,这有助于算法开发人员深入理解算法的工作原理。 键超参数选择类似于特征选择,它可通过量化超参数重要性,以精简搜索空间的方式来加速搜索过程,提升 AutoML 效率,帮助专家洞察搜索空间。(2)提高计算效率和得到良好结果为了达到高计算效率和得到具有良好结果的目标,目前主要使用经验技术来提升 AutoML 的性能和效率。根据所使用的技术不同,可大致分为三类:基于集成学习的优化技术、基于元学习的优化技术和基于迁移学习的优化技术。 基于集成学习的优化技术将多个基础学习器合成一个强学习器,以达到提高学习器泛化能力的目的,在 AutoML 工具中使用集成学习技术可以提升工具所得结果的泛化性能。基于元学习的优化技术从历史经验中提取元知识(如数据集和模型的元特征、配置的性能等等),并基于元知识训练元学习器再应用于新问题中。元学习技术是 AutoML 性能优化中最常见的优化技术,常应用于在配置生成、动态配置自适应和配置评估等阶段进行性能提升,例如 Auto-Sklearn。基于迁移学习的优化技术使用来自原域的知识尝试改进目标域,它与基于元学习的优化技术的区别在于是否利用提取的知识训练模型,如果训练模型则是元学习,若直接使用知识则是迁移学习。(3)根据实际应用场景搭建算法框架文献1面向全流程数据分析中的自动化机器学习流水线设计场景,首先分析全流程数据分析特点,定义一种由五阶段构成的机器学习流水线,可以同时处理离散型和连续型特征面向终身学习场景,针对普遍存在的概念漂移和数据不平衡问题,研究提出了一种基于加权集成学习的算法框架Auto-LEE。作者:Python码一码转载自:简书
  • [其他] 分享无监督学习的历史——BERT
    BERTBERT是一种深度自编码器,经过训练可以补充句子中遗漏的单词。BERT实际上与信息检索非常相关,因为它可以提取非常好的单词表征。这对于理解文档非常有用。BERT有很多个层,并且在每一层中,都有每个输入单词的嵌入向量。第一个隐藏层中有单词的向量表征,第二个隐藏层中有相同单词的更好的向量表征。随着深入网络,给定单词的表征将变得越来越好。实际上,L + 1层中的某个单词的表征,是通过比较L层中该单词的嵌入与其它单词的嵌入生成的。这种比较是通过称为Transformer的注意力机制实现的。这种嵌入是很好的单词表征,可用于各种自然语言任务。如果用标准的一维卷积神经网络来表示单词字符串,我们将通过这些向量来表示句子中的单词。通过组合信息,激活单词的权重矩阵,我们可以获得下一层向量来表征单词。因此,和之前的方法类似,只需查看前一级中所有附近单词的表征,即可将这些表征组合成下一层中更好的单词表征,但这里使用了注意力机制。BERT的机制实际上看起来像信息检索。每个单词都通过学习的权重矩阵生成查询向量、键向量和值向量。然后,对于L层的每个单词,我们将获取其查询向量,并将其与所有其它单词的键向量进行比较。如果查询向量和键向量之间可以很好地匹配时,也就是说,当查询向量和键向量的标量积很大时,附近位置的值向量影响下一层的单词表征。例如,假设我的名字是June。我将生成一个查询向量,该查询向量可以很好地匹配月份,也可以很好地匹配女性名字。我们将在句子的其余部分中选择相关的词,并使用这些相关的词来修改June的表征。如果句子中还有其他几个女性的名字,则June的表征将变得更接近女性人名的表征,如果句子中出现了月份相关的单词,June的表征将变得更接近“六月”的表征。也就是说,它们将根据上下文进行优化,所以这很像信息检索,不过所有查询、值和键都是学习得到的。因此,我们可以使用这种神经网络进行语言建模。首先使用Transformers预训练单词片段嵌入。如果采用句子或更长的文本片段,则需要成千上万个片段,将它们输入Transformers的多个层,以学习所有的键、值和查询。因此,单词表征会在输出之前得到完善,可以很好地利用上下文信息。然后,我们在另一个神经网络中使用这些单词片段的表征,神经网络可以从先前的单词片段中预测下一个单词片段,因此这是一个自动回归模型。但是,它考虑的不是那些单词片段,而是BERT生成的单词片段的表征。它的效果比规则模型更好。通过给它一个初始的单词序列,然后让它预测下一个片段的概率分布。这样一来,我们就可以生成长长的单词串,直到获得完整的故事为止,效果令人惊讶。BERT需要用数十亿个文字数据来训练,然后我们使用其产生的嵌入,训练具有1,750亿个参数的语言模型,耗时超过一千petaflop天。一旦完成训练,我们就可以生成新闻文章,如上图所示。这是GPT-3的例子,有趣的是,大多数人无法确定这篇新闻文章是由BERT撰写的,它通过了图灵测试。现在,我们回到有关如何进行监督学习的基础思想。变分自编码器BERT比堆叠自编码器的效果更好,这是因为端到端学习可以确保前面层中的隐藏单元学习提取后面层所需的特征,这是反向传播所擅长的事情。转自,青暮,https://www.leiphone.com/news/202009/xd0M2fn80c856Fcc.html
  • [其他] 分享深度学习算法——IMPALA:大规模强化学习算法
    IMPALA:大规模强化学习算法论文名称:Scalable Distributed Deep-RL with Importance Weighted Actor-Learner Architectures作者:Lasse Espeholt / Hubert Soyer / Remi Munos / Karen Simonyan / Volodymir Mnih / Tom Ward / Yotam Doron / Vlad Firoiu / Tim Harley / Iain Dunning / Shane Legg / Koray Kavukcuoglu发表时间:2018/6/28论文链接:https://arxiv.org/abs/1802.01561推荐原因这是并行RL算法领域引用最为高的一篇文章。文章和以往做的工作不同,不仅仅有工程上实验效果的大幅提升,还做了理论的分析解决了on-policy与off-policy的训练差异问题,整体工作是相当solid的。作者同时启动了多个Actor和一个Learner,每个Actor都是包含整个policy参数的,负责和环境交互产生数据,Learner是负责训练参数还有同步参数给Actor的。这就有个问题了,参数同步会有无法避免的延迟,那这个就违背了On-policy算法的更新原则,作者提出了一种很好的方式解决这个问题,对有延迟的数据进行修正使得on-policy的训练方式可以继续进行。转自,AI科技评论,https://www.leiphone.com/news/202008/SUjAO0ZQwOFFm2Lq.html
  • [行业动态] 【4月6日 AI 快讯】如何基于元学习方法进行有效的模型训练?四篇论文详细剖析元模型的学习原理和过程
    理论 如何基于元学习方法进行有效的模型训练?四篇论文详细剖析元模型的学习原理和过程本文以四篇最新论文为例,详细剖析了元模型的学习原理和过程。2021/04/05 20:46原文链接修图动口不动手,有人把StyleGAN和CLIP组了个CP,能听懂修图指令那种「求帮忙把背景 P 成五彩斑斓的黑,可以吗?」2021/04/05 20:43原文链接其他硅谷亚裔一直在经历职场PUA:勤奋聪明赚钱多,但永远升不上管理岗多份报告显示,亚裔美国人是最不可能被提升到管理职位的2021-04-05 13:08:58原文链接 
  • [其他] 联邦学习
        联邦机器学习(Federated machine learning/Federated Learning),又名联邦学习,联合学习,联盟学习。联邦机器学习是一个机器学习框架,能有效帮助多个机构在满足用户隐私保护、数据安全和政府法规的要求下,进行数据使用和机器学习建模。联邦学习作为分布式的机器学习范式,可以有效解决数据孤岛问题,让参与方在不共享数据的基础上联合建模,能从技术上打破数据孤岛,实现AI协作。谷歌在2016年提出了针对手机终端的联邦学习,微众银行AI团队则从金融行业实践出发,关注跨机构跨组织的大数据合作场景,首次提出“联邦迁移学习”的解决方案,将迁移学习和联邦学习结合起来。据杨强教授在“联邦学习研讨会”上介绍,联邦迁移学习让联邦学习更加通用化,可以在不同数据结构、不同机构间发挥作用,没有领域和算法限制,同时具有模型质量无损、保护隐私、确保数据安全的优势。    联邦学习定义了机器学习框架,在此框架下通过设计虚拟模型解决不同数据拥有方在不交换数据的情况下进行协作的问题。虚拟模型是各方将数据聚合在一起的最优模型,各自区域依据模型为本地目标服务。联邦学习要求此建模结果应当无限接近传统模式,即将多个数据拥有方的数据汇聚到一处进行建模的结果。在联邦机制下,各参与者的身份和地位相同,可建立共享数据策略。由于数据不发生转移,因此不会泄露用户隐私或影响数据规范。为了保护数据隐私、满足合法合规的要求。联邦学习有三大构成要素:数据源、联邦学习系统、用户。三者间关系如图所示,在联邦学习系统下,各个数据源方进行数据预处理,共同建立及其学习模型,并将输出结果反馈给用户。联邦学习的分类根据参与各方数据源分布的情况不同,联邦学习可以被分为三类:横向联邦学习、纵向联邦学习、联邦迁移学习。横向联邦学习在两个数据集的用户特征重叠较多而用户重叠较少的情况下,我们把数据集按照横向(即用户维度)切分,并取出双方用户特征相同而用户不完全相同的那部分数据进行训练。这种方法叫做横向联邦学习。比如业务相同但是分布在不同地区的两家企业,它们的用户群体分别来自各自所在的地区,相互的交集很小。但是,它们的业务很相似,因此,记录的用户特征是相同的。此时,就可以使用横向联邦学习来构建联合模型。横向联邦学习中多方联合训练的方式与分布式机器学习(Distributed Machine Learning)有部分相似的地方。分布式机器学习涵盖了多个方面,包括把机器学习中的训练数据分布式存储、计算任务分布式运行、模型结果分布式发布等,参数服务器是分布式机器学习中一个典型的例子。参数服务器作为加速机器学习模型训练过程的一种工具,它将数据存储在分布式的工作节点上,通过一个中心式的调度节点调配数据分布和分配计算资源,以便更高效的获得最终的训练模型。而对于联邦学习而言,首先在于横向联邦学习中的工作节点代表的是模型训练的数据拥有方,其对本地的数据具有完全的自治权限,可以自主决定何时加入联邦学习进行建模,相对地在参数服务器中,中心节点始终占据着主导地位,因此联邦学习面对的是一个更复杂的学习环境;其次,联邦学习则强调模型训练过程中对数据拥有方的数据隐私保护,是一种应对数据隐私保护的有效措施,能够更好地应对未来愈加严格的数据隐私和数据安全监管环境。纵向联邦学习在两个数据集的用户重叠较多而用户特征重叠较少的情况下,我们把数据集按照纵向(即特征维度)切分,并取出双方用户相同而用户特征不完全相同的那部分数据进行训练。这种方法叫做纵向联邦学习。比如有两个不同机构,一家是某地的银行,另一家是同一个地方的电商。它们的用户群体很有可能包含该地的大部分居民,因此用户的交集较大。但是,由于银行记录的都是用户的收支行为与信用评级,而电商则保有用户的浏览与购买历史,因此它们的用户特征交集较小。纵向联邦学习就是将这些不同特征在加密的状态下加以聚合,以增强模型能力的联邦学习。目前机器学习模型如逻辑回归、决策树等均是建立在纵向联邦学习系统框架之下的。联邦迁移学习在两个数据集的用户与用户特征重叠都较少的情况下,我们不对数据进行切分,而可以利用迁移学习来克服数据或标签不足的情况。这种方法叫做联邦迁移学习。比如有两个不同机构,一家是位于中国的银行,另一家是位于美国的电商。由于受到地域限制,这两家机构的用户群体交集很小。同时,由于机构类型的不同,二者的数据特征也只有小部分重合。在这种情况下,要想进行有效的联邦学习,就必须引入迁移学习,来解决单边数据规模小和标签样本少的问题,从而提升模型的效果。
  • [技术干货] 赋能行业AI落地,华为云知识计算解决方案让行业知识与AI高效结合
    近日,第一届DataFunSummit知识图谱在线峰会正式举行,40多位知名学者和技术专家出席本次峰会,共议“知识图谱的核心技术与前沿应用”。会上,华为云3位专家介绍了华为云知识计算解决方案的具体行业实践。“新一代人工智能技术要解决如何与各行各业深度融合的问题,要做到真正的落地,就需要把知识驱动和数据驱动结合起来,实现AI与行业知识的高效结合,同时利用知识、数据、算法和算力四个要素。这是AI未来发展的必然方向。华为云知识计算解决方案是业界首个全生命周期知识计算解决方案,是解决行业知识与AI结合的一条全新而且有效的路径。”华为算法专家段博士在《基于知识图谱的企业知识计算与应用》主题演讲中指出,华为云600多个AI项目的实践经验表明,AI进入企业核心业务系统后,平均能够带来18%的盈利能力提升。AI在行业落地的关键要素之一即知识与数据的双重驱动。基于华为云知识计算解决方案打造的企业级知识计算平台,可以一站式完成行业知识的获取、建模与管理,推动AI进入企业核心业务系统,使得机器的控制更加精准,辅助人高效分析和决策,辅助知识实现高效传承,释放行业专家的精力华为技术专家吴博士在《知识表征在测井综合解释中的应用》介绍了华为云知识计算解决方案在油气领域的具体实践。吴博士表示,储层预测是一个跨学科领域,这导致油气勘探开发流程复杂且漫长。在整个过程中,测井是发现油气田的重要一环,但测井专家人数稀缺、传统测井资料解释耗时耗力,常规的找油找气方法面临着严峻的挑战。当前油气勘探要实现“降本增效,增储上产”的目标,需要借助人工智能新技术实现智能勘探。华为云的知识计算解决方案不仅构建勘探开发领域的知识图谱,而且利用深度学习与图嵌入融合算法,训练油气层识别模型。此外,为解决跨区块、跨油田测井曲线不一致的问题,华为云知识计算解决方案还开发了知识迁移技术。借助华为云认知计算平台,大港油田对900口油井实施了油气水层的智能识别,平均解释时间缩短了70%,识别准确率达到测井解释专家水平。通过知识图谱的建设与应用,从业门槛显著降低,专家知识得到有效传承在知识图谱与智能部作分论坛中,华为诺亚方舟实验室研究员廖博士发表了《乐府:预训练语言模型在诗词对联生成中的应用》主题演讲。廖博士指出,中文传统诗歌对联的生成有着严格的要求,具体体现在格律、平仄、押韵等方面。华为云基于GPT训练的“乐府作诗机”不仅达成了上述作诗要求,同时词句组合多样性高、意境氛围感强,甚至能够达到专业诗人的水平,让人“难辨真假”。此外,华为团队用PMLM技术,在只有少量数据的情况下,完成了比近体诗生成难度更大的宋词生成任务。知识图谱成是人工智能迈向认知智能的强大技术助力。知识计算则是将各种形态的知识,通过包含知识图谱在内的一系列AI技术进行综合运用,实现对知识的抽取、表达、并协同大量数据进行计算,进而产生更为精准的模型,再次赋能给机器和人的一种全新方法。通过应用知识计算解决方案,企业将可以打造自己的知识计算平台,整合分散在不同介质、多种形态的企业数据,形成带有建议性的知识,有效用于预测分析和辅助决策,提高企业的经营效率。华为云知识计算解决方案已在油气、汽车、电力、金融等多个领域进行了成功实践,助力企业更好地完成数字化升级、智能化转型。华为云也将继续携手行业客户、伙伴一同构建行业知识计算解决方案,共建全场景智慧、践行普惠AI理念,创造行业新价值!
  • [其他] 多模态学习
    模态(Modality),虽然不是我们的日常用语,但却十分容易理解。我们每一天都会接触到各种不同来源和形式的信息。正如我们有视觉、听觉、嗅觉和触觉等,那么我们接触的信息就有视频、图像、文字、语音、味道、软硬度等,这每一种信息的形式就可以称作一种模态。模态的范围要比我们的感知能力更宽泛。除了视觉、听觉获得的模态信息,我们也可以利用传感器获得诸如雷达、红外线等不同感应数据的模态信息。此外,模态的类型定义也可以非常宽泛,比如我们可以把两种不同的语言当做是两种模态,把不同结构下采集的数据,也可以当做两种模态。比如,仅仅一个视频内容数据,就是一个高维度、多模态的数据信息,其中包含了标题、简介、评论、字幕等文本信息,也有视频帧的图像、声音,以及连贯动作视频片段的视觉、声音信息。多模态学习,从上世纪70年代就已经起步,几经发展,现在正进入到机器学习特别是深度学习的阶段。通常称为多模态机器学习(Multi-Modal Machine Learning ,MMML),试图通过机器学习的方法实现对多源模态信息进行分析和理解。当前主要热门的研究方向自然是对图像、视频、音频、语义之间的多模态学习。当前,多模态学习主要研究方向有多模态表示学习、模态间映射,多模态对齐、融合、协同学习等。多模态表示学习,研究如何将多个模态数据所蕴含的语义信息数值化为实值向量,通俗理解就是对多个模态的数据进行相关性编码,让不同模态建立起映射关系。按多模态表示共享的方式,主要分为公共表示学习和特异性表示学习,后者由于是分别学习不同模态的特征,可以应用于诸如零次学习、模态间映射、跨模态检索等任务中。模态间映射,研究如何将某一特定模态数据中的信息映射至另一模态。例如,给定一幅图像,通过机器学习得到这副图像的描述,或者给定一段文字,生成一幅匹配的图像。类似于我们学习中遇到的“看图说话”和“以题作画”的问题。模态间映射早已可以应用于语音合成、图像视频描述以及跨模态检索等应用中。此外,多模态对齐,主要研究如何识别不同模态之间的部件、元素的对应关系,以促进学习到的多模态表示更加精确,例如将电影画面、口型、语音、字幕的自动对齐;多模态融合,主要致力于不同模态间的模型与特征的整合,以获得更全面的特征,提高模型鲁棒性,并且保证模型在某些模态缺失时仍能有效工作;而多模态协同学习,主要考虑如何从信息丰富模态上学习的知识迁移到信息匮乏的模态,使各个模态的学习互相辅助。典型的方法包括多模态的零样本学习、领域自适应等。近两年,随着机器学习的模型的飞速进展,多模态学习中出现的映射质量问题、对齐的匹配度量以及融合噪声干扰等问题,都在实现很好的优化解决,为多模态的落地应用做好了准备。
  • [其他] 分享深度学习算法——无监督的室内深度估计的块匹配和平面正则化
    P2Net:无监督的室内深度估计的块匹配和平面正则化论文名称:P2Net: Patch-match and Plane-regularization for Unsupervised Indoor Depth Estimation作者:Yu Zehao /Jin Lei /Gao Shenghua发表时间:2020/7/15论文链接:https://arxiv.org/abs/2007.07696开源地址:https://github.com/svip-lab/Indoor-SfMLearner推荐原因这篇论文提出了一个新的无监督室内场景下的深度估计网络P2Net,其创新点在于提出了两种新式无监督损失函数,论文发表在ECCV2020上。传统的无监督损失函数是以像素点为单位的图像重构损失,以及边缘敏感的梯度平滑损失。作者发现只在每个像素点处计算图像重构损失得到的特征表示并不够鲁棒,由此提出采用基于图像块表示的重构损失。具体地,采用已有的特征描述子算法DSO提取特征关键点,以关键点为中心构建局部窗口,计算整个窗口内的重构损失更具有鲁棒性。另外,考虑到无监督训练时的崩塌来源于室内场景下的无纹理区域,作者认为无纹理区域可以看做是一个平面,通过对图像提取超像素点从而构造平面区域,在同一平面上的像素点的深度信息应当具有一致性,由此提出平面一致性损失。作者提出的P2Net在NYU Depth V2和ScanNet两个公开数据集上取得了SOTA的效果。转自,AI科技评论,https://www.leiphone.com/news/202008/SUjAO0ZQwOFFm2Lq.html
  • [行业动态] CVPR 2021华为诺亚方舟实验室发表30篇论文 |CVPR 2021
    一年一度的计算机视觉顶会IEEE计算机视觉及模式识别大会CVPR录用结果最近公布。据悉,今年CVPR投稿量与论文接收量相对往年继续上升,有效投搞量达7015篇,接收论文1663篇,接收率23.7%,与往年相比略有上升。华为诺亚方舟实验室此次有30篇论文被接收,包括两篇Oral,其中主要由正式或者实习员工完成的工作有24篇,主要由高校合作方完成的工作有6篇。研究方向涵盖模型压缩和能耗高效、神经网络搜索、语义理解、底层视觉、自动驾驶、无损数据压缩、可解释AI等多个方面。诺亚方舟实验室的这些文章,体现出工业界需求与学术前沿的紧密结合,围绕业务中的迫切需求,结合最新学术进展提出创新性解决方案,也让学术研究能够有具体落地。如这些文章中包含了去年AdderNet算法的继续演进AdderSR,以及最近广为流传的IPT网络等。下面挑选一些本次CVPR接收的代表性论文进行介绍。CVPR 2021代表性工作介绍AdderSR: Towards Energy Efficient Image Super-Resolution本论文研究使用加法网络解决图像超分的问题,降低超分网络的能耗。由于任务的属性不同,直接将加法网络应用到超分任务上损失严重,本文对该问题进行了深入分析。首先,加法算子难以学到恒等映射;除此之外,加法算子难以学到有效的高通滤波器,但是这两个特性对于图像处理任务非常重要。在此基础上,本文继而提出自连接加法单元和可学习的幂激活函数来调整特征分布、增强细节,有效解决该问题。实验表明,本文提出的加法超分网络可以有效减少2.5x能耗,并达到与原模型非常接近的效果。ReNAS: Relativistic Evaluation of Neural Architecture Search (Oral)一个有效的神经网络结构性能评估方案是神经网络结构搜索(NAS)成功的关键。现有NAS算法通常在训练时间有限的小型数据集上训练和评估神经结构。但这样一种粗糙的评估方式很难对神经网络结构进行准确评估。本文提出一种新的神经网络结构评价方案,旨在确定哪个神经网络结构的性能更好,而不是精确地预测性能绝对值。因此,我们提出了一个结构相对性能预测NAS (ReNAS)。我们将神经结构编码为特征张量,并利用预测器进一步细化表示。本方法可用于离散搜索,无需额外评估。在NASBench101数据集上抽样424个(搜索空间的0.1%)神经架构及其标签已经足够学习一个准确的架构性能预测器。在NAS-Bench-101和NAS-Bench-201数据集上,我们搜索的神经结构的准确性高于最新的方法,显示了本方法的优先性。Transformation Invariant Few-Shot Object Detection不同于以往基于元学习的小样本物体检测框架,本文从样本扩增的角度解决这一问题。本文提出了一种简单而有效的变换不变原则,它可以灵活地应用于各种元学习模型,以提高新类物体的检测性能。该方法通过对变换后图像的预测结果引入一致性正则,增强小样本物体检测模型的泛化能力。重要的是,这一方法可以处理未标记数据,从而解决半监督小样本物体检测问题。实验表明,本文提出的方法在标准小样本物体检测和半监督小样本物体检测上均有效。Joint-DetNAS: Upgrade Your Detector with NAS,Pruning and Dynamic DistillationJoint-DetNAS是一个融合了NAS、剪枝以及蒸馏的目标检测模型优化算法,由两个主要部分组成:a) 构建弹性教师模型池:通过一次渐进式收缩训练获得大量高质量模型,用于支撑教师模型搜索b)学生-教师网络联合优化:通过交迭搜索,动态寻找最优蒸馏组合。学生网络采用Network Morphism策略, 有效融合模型结构演化和剪枝技术。算法直接输出学生模型作为结果,无需额外训练。Joint-DetNAS搜索高效且优化效果显著:如对于R101-FPN模型,在FPS及FLOPS优化 50%的情况下,仍能有2.5%的AP提升。TransNAS-Bench-101: Improving Transferrability and Generalizability of Cross-Task Neural Architecture Search神经网络架构搜索(NAS)的最新突破将该领域的研究范围扩展到了更广泛的视觉任务和更多样化的搜索空间。现有的NAS方法大多是在单个任务上进行搜索,而跨任务搜索的算法正在涌现。为了降低计算成本和实验复杂性对跨任务算法研究的阻碍,本论文提出了TransNAS-Bench-101基准测试数据集。该数据集涵盖了图像分类、语义分割、自编码器等七个不同的视觉任务,并探索了两类不同的搜索空间:Cell-based搜索空间和Macro-based搜索空间。通过7,352个backbone在七个任务上的训练,我们提供了51,464个模型的详细训练数据。我们希望借助TransNAS-Bench-101来鼓励跨任务的NAS算法的出现,从而将跨任务搜索的效率和通用性提高到新的水平。Pre-Trained Image Processing Transformer随着现代硬件计算能力的快速增强,在大规模数据集上预训练的Transformer模型(例如BERT,GPT-3)表现出了巨大的潜力和超越传统模型的效果。我们提出了一种可用于底层视觉任务(例如,去噪,超分辨率和去雨)的预训练Transformer模型(IPT)。为了最大程度地挖掘Transformer的能力,我们利用具有大量自然图像的ImageNet数据集生成大量降质图像对,并在这些图像上使用多头和多尾机制对IPT模型进行预训练。另外,我们还引入了对比学习以来提升模型的泛化性能。我们提出的IPT模型可以在迅速微调后有效地用于不同的底层视觉任务中,并在多项任务上取得了SOTA的结果。Efficient Multi-Stage Video Denoising with Recurrent Spatio-Temporal Fusion论文提出了极简的视频去噪网络EMVD,旨在通过结合传统图像处理和深度学习构造高能效的像素级视频处理框架。基于时序融合、空间去噪和时空精细化等多阶段设计,结合可逆可学习变换,既递归地利用视频中自然固有的时空相关性渐进改善视频质量,又大大降低模型的复杂度。通过业界公开数据集和真实数据集评测,计算量仅5.38GFLOPS的EMVD精度和视觉效果超过300多倍计算量的SOTA网络模型,在硬件资源有限的终端设备上处理1080P视频可达50FPS,业界首次在终端设备上实现实时的高分辨率视频AI降噪算法。深度学习领域的图像降噪方法往往需要噪声图像和相应的干净图像配对来训练,然而在真实场景中构造训练配对是十分困难的。我们提出Neighbor2Neighbor:通过近邻采样,从含噪图像采样出两张“相似但不相同”的子图以构成配对数据来训练降噪网络,其中两张子图每个位置对应的像素在原噪声图像中都是近邻像素;同时,在损失函数中引入正则项来修正两张近邻子图“相似但不相同”导致的过度平滑问题。本方法仅需噪声图像数据集即可训练任意降噪网络,在RGB域合成数据和RAW域真实含噪图像数据集上均表现出优秀的降噪效果,性能接近基于“噪声-干净”图像配对进行训练的模型。相比于现有的自监督图像降噪方法,本方法既不需要构造配对数据的采集过程,也不需要改造网络结构,同时无需额外的噪声模型信息,在暗光人脸拍照、夜间户外拍照、医学图像降噪等场景具有较高的应用潜力。Focus on Local: Detecting Lane Marker from Bottom Up via Key Point当前车道线检测的主流方向分为基于分割和基于检测的方法两大类。前者生成像素级的语义类别并通过聚类生成不同实例的曲线,后者由每个锚点预测整根曲线,这两种方法都直接建模全局信息,存在聚类容易产生误差以及远端预测不准的问题。受到人体位姿估计方法的启发,我们首次将车道线检测转化为局部关键点估计及其关联问题,用距离信息建模局部关联关系。车道线局部建模相对于全局建模更加简单,复杂度更低,泛化性能更好。我们采用两个轻量化的模型,在车道线检测公开数据集CULane和TuSimple上取得了新的SOTA结果,另外在跨数据集的泛化性能上也展现出了相当大的优越性。综上,我们的方法证明了位姿估计方法在车道线检测中的应用潜力,为解决这一问题开辟了新的方向。AF2-S3Net: Attentive Feature Fusion with Adaptive Feature Selection for Sparse Semantic Segmentation Network激光雷达点云的语义分割可视为自动驾驶的基石功能之一,精确的分割结果可以辅助物体检测、定位等核心感知任务。针对LiDAR语义分割问题,AF2S3Net以3D稀疏神经网络为框架,通过多分支、多层级主动特征融合实现了全局空间语义与局部细节的动态叠加,在单个网络中实现了单点网络与3D卷积网络的有机统一。同时为了降低特征融合后产生的梯度噪声,各分支原始特征被投票后送入特征选择模块,该模块通过压缩赋权过滤了部分噪声特征列向量,从而进一步提升了网络稳定性和泛化能力。在SemanticKITTI和nuScenes两大重量级LiDAR数据集语义分割竞赛排行榜上,AF2S3Net斩获双料冠军。QPP: Real-Time Quantization Parameter Prediction for Deep Neural Networks深度神经网络的权重和特征的量化可以降低能耗,提升计算效率,有助于促进其在手机等设备上的应用。量化感知训练的方法通常可以达到较好的效果,但是需要完整的数据集,但是这一点很多情况下难以满足。非训练量化的方法通常需要一个比较耗时的量化参数计算过程,否则量化精度损失比较严重。本文提出一种量化参数预测的算法,称为QPP。通过部分训练数据或者无标签数据的学习,QPP预测器在给定网络输入的情况下可以准确预测激活值的量化参数。预测器在避免复杂计算的同时有效保持了原始模型的精度。因此,本文的方法结合了动态量化和静态量化的优点。本文将QPP算法用在两个标准的动态量化算法上,并在分类、分割、超分等视觉任务上进行了广泛的验证。iVPF: Numerical Invertible Volume Preserving Flows for Lossless Compression在存储领域,高效无损压缩由于可以有效降低存储介质成本,故被广泛研究。AI算法通过学习数据分布规律并根据数据规律进行压缩,具有压缩率高等有点,具备良好的研究和应用前景。可逆流模型(Flow model)能准确拟合概率分布,理论压缩比高,但由于浮点误差问题,不能直接用于无损压缩任务。本方案第一次提出基于保体积流模型(volume preserving flow)的无损压缩方法吗,具有压缩率高,压缩吞吐率大的优点。首先,设计保体积流算子的数值计算方法,消除数据和待压缩隐变量的误差,保证无损压缩正确性;其次,设计基于保体积流模型的压缩和解压算法,它能达到最优的理论压缩率上界,压缩比高,压缩吞吐率高。本方法在图像数据集取得了最优的压缩率性能。CausalVAE: Disentangled Representation Learning via Neural Structural Causal Models解耦表征学习旨在寻找低维的、由多个可解释因子组成的观测数据的隐表征。常用的变分自动编码器(VAE)的框架假设因子是独立的。然而,在实际场景中,具有语义的因素并不是必然独立的。相反,可能有一个潜在的描述这些因素相互依赖的因果结构。因此,我们提出了一个新的基于VAE的框架,名为因果VAE,其中包括带有因果结构的神经层,以此找到数据中的因果相关概念。在华为解耦数据集和真实数据集CelebA的实验表明,因果VAE学习的是语义上可解释的隐表征。我们可以控制某些语义因子,他们之间的信息可以通过表征之间的因果关系正确传递,生成反事实图片。
  • [其他] 分享机器学习趋势论文
    论文 1:Hyperbolic Graph Convolutional Neural Networks双曲图卷积神经网络论文地址:https://papers.nips.cc/paper/8733-hyperbolic-graph-convolutional-neural-networks.pdf开源地址:https://github.com/HazyResearch/hgcn论文 2:Hyperbolic Graph Neural Networks双曲图神经网络论文地址:https://papers.nips.cc/paper/9033-hyperbolic-graph-neural-networks.pdf开源:https://github.com/facebookresearch/hgnn论文 1 和论文 2 两者的思想是相似的,都希望把双曲空间的好处和图神经网络的表达能力结合起来,只不过具体的模型设计有所区别。前一篇论文主要研究了节点分类和连接预测任务,相比于欧氏空间中的方法大大降低了错误率,在Gromov双曲性分数较低(图和树结构的相似度)的数据集上表现尤其好。后一篇论文关注的重点是图分类任务。转自,杨晓凡,https://www.leiphone.com/news/201912/GsRSElsUReef0z7o.html
  • [热门活动] 【超图软件:场景+应用,带你“硬核”解析云原生GIS】——看直播赢海量码豆和3999元超图开发者训练营入场券
    面对千亿、亿量级的数据,如何保证系统稳定运行,如何快速落地、如何加快处理速度、如何节省成本?最近大火的云原生遇上GIS会产生怎样的火花呢?别着急! 全球第三大、亚洲最大的地理信息系统(GIS)软件厂商超图软件来了!▼ 直播预告:时间:4月1日(周四)19:00 -20:00主题:《超图-场景+应用,带你“硬核”解析云原生GIS》直播码豆链接(点我赢海量码豆)▼ 看直播,参与论坛活动,赢海量码豆&GIS课程券&3999元SuperMap GIS开发者训练营入场券!!!(顶级专家线下小班授课)(小云不会告诉你说这是小云见过最“硬核”的直播礼物,距离踏入超图工作成为大神只差这一步!)(往期训练营精彩课程回顾,戳我)▼ ROUND1:提问GET码豆+3999元超图开发者训练营入场券在本帖回复#超图云原生GIS#+你最想提问专家的问题,便可获得200码豆(一个id仅为一个提问可获得码豆,但可提多个问题参与优秀问题评选,限前500名)。(例:#超图云原生GIS# 云原生GIS能做什么,SuperMap云原生GIS价值何在?)并且超图专家将挑选出6个问题论坛和社群回答,4名优秀问题赠送3000码豆,2名最佳问题赠送价值3999元超图软件开发者训练营入场券!!!                                               ( *小云碎碎念:大家一定要好好提问,抓住这次机会哦~) (扫我加入社群)本次活动所有奖励领取,必须加入社群并收看直播,否则无效!!!ROUND2:完成云原生GIS实操Demo送码豆***本实验旨在让用户了解超图云原生GIS技术,学会如何快速构建应用,实验完成度决定你所获码豆的数量。一、青铜,500码豆:提供一张安装iManager for Kubernetes的界面截图(进度条100%)二、白银,1000码豆:提供一张iManager for Kuberetes的管理界面截图(配置许可后)三、铂金,5000码豆:提供一张GIS云套件管理界面截图1、实验文档请参见附件文件,如果有问题需要咨询,请在本次活动专属群内获得帮助。2、为了方便码豆奖励计算,每一个奖励任务的完成均需截图发帖,格式为#青铜(白银、铂金)任务,已完成#+截图,(例:小云完成了铂金任务,则需要将青铜、白银、铂金奖励任务完成的截图按照格式要求回帖3次,否则只可得到对应回帖码豆礼品奖励。)3、所有截图必须包括【1、上述各任务的完成、2、华为云账号、3、本地时间】,严禁偷图、盗图。                                                                                                                                                                           (截图示例) (扫我加入社群)本次活动所有奖励领取,必须加入社群并收看直播,否则无效!ROUND3:看直播,签到得500码豆,赢3999元超图开发者训练营入场券+200元917GIS学院课程券1、直播期间(4月1日,周四19:00-20:00)。将任意时间段的收看截图回帖至本帖,即可获得加码500码豆。(限前1000名)直播链接(点我GET码豆和直播礼物)(观看直播请截图回帖,这样才可以把码豆发到你的账户哦~) 2、整场直播60分钟,共进行4轮抽奖,奖品如下超图917大学GIS学院网址:http://edu.supermap.com/#/Index  (扫我加入社群)本次活动所有奖励领取,必须加入社群并收看直播,否则无效!4月1日(周四)19:00-20:00一定要来看直播!和小云一起探索如何部署云原生GIS,解析云原生GIS技术和应用解决方案吧!说不定获得超图917大学GIS学院开发者训练营入场券,变大神的就是你!温馨提示: 1)请务必使用个人账号参与活动(IAM、企业账号等账号参与无效);2)本次活动所有奖励将于活动结束后5个工作日内发放,所有奖励领取,必须加入社群并且观看直播,否则无效。3)所有获得华为奖品的用户,请于获奖后3个工作日内完成实名认证,否则视为放弃奖励;4)本次活动一个实名认证账号只能对应一个获奖人,如同一账号填写多个不同获奖人,不予发放奖励;5)活动参与需遵守《华为社区常规活动规则》.6)本活动最终解释权归华为云所有。本期活动已结束,现将获奖用户公布如下:一、最佳问题——超图gis开发者训练营入场券1、16层+busyfan+寒六先生 #目前的主要应用场景有哪些?客户对使用云原生GIS有哪些前置条件?2、33层+hw28810968+路遥知马力,云原生GIS能做什么,是否需要专业的知识,是否需要一定的软硬件支持,运行环境是什么?二、优秀问题——3000 码豆1、3层 +hw626725 想赚钱的洋洋子 #超图云原生GIS#+很想了解超图云原生GIS的价值都有哪些?2、17 层+hw84740751 花溪  云原生GIS中SuperMap做国土资源一张图是否还是和以前一样?还是单单把一些功能云化了?3、43层 +ZhangXingYu0401 ZXY  #超图云原生GIS#SuperMap云原生GIS技术体系四个层面:GIS数据云原生存储与分布式计算、GIS微服务架构与服务治理、基于容器的多节点部署与弹性伸缩、一体化智能运维与管理,分别各有什么优势?4、77层+ ice18855953528 望闻问切ice  #超图云原生GIS#+差异化优势在哪里呢?主要是针对什么场景解决了哪些痛点问题?三、完成云原生GIS部署——码豆大礼包序号楼层华为云id论坛名码豆114a565855829超级蛋蛋6500256zhenyuxu十年树木6500369hw57984361笨笨20206500466hwstaff_wwx883698skywalkerwty500593wWX883698skywalkerwty!6500687fjqsun小小20186500750hw11326648Drawn-rays6500四、码豆奖励汇总表华为云ID码豆华为云ID码豆a5658558297200kaiwen231500hw113266487200chenxi2111500zhenyuxu7200maoning2019500hw579843617200hw23597877500fjqsun6700hw65491762500wWX8836986700cai_hy500hw847407513700sunshine_huawei500ZhangXingYu04013700bigdata1500hw6267253200hw98541549500ice188559535283200hw02116591500hw05669415700hw27878554200zhangyibaluobo700linghz666200hw36946664700hw56444785200busyfan700zhangpaodan200hw78999453700BY_FireFlyFlower200hw35128823700lyzml1991200hw63492350700lml-smlie200zy6501700A1ice_Coo200zy1586700hw78949957200hw86105405700hw26536804200py6840700hw46433192200hw55101971700zhengxx6688200hw84074913700hw28810968200hw36175659700coolanimals200hw52825744700hw46425134200liuxifeng700franco52576200hw17383096700Ethins200hw09974076700khg305387543200hwstaff_wwx883698700csdn_zeke200yizhangl700oznar119200xj120141121700hw75771608200listen2you700hw73261881200bruce20700hw94545161200hw45873041700east119200hw12320743700hw05593987200canfen500beyondalan200qiushu2020500huohaohao200hw31711871500linxiaohao200hw35544043500suchao444200hw51364135500Gaojifeng123200hw63991709500hw46969185200qimiao2111500meet00200hw79926743500hw71255899200qimiao2112500hw87971254200qimiao2113500changgaogong200heiyouyoubaluobo500DouDou_200mi_mic500huang_guoqing200hw73501220500sunxiaobei200momingqimiao2111500hw25373680200hw37344076200sz5989200hw57269863200hjh15003396976200注:1、所有中奖用户在申诉时间结束前必须完成实名认证并确定华为云账号是否正确,否则码豆无法发放,视为放弃领奖。2、本次活动申诉时间:2021年4月9日12:00前
  • [认证交流] 【我与华为云认证】微认证之路
    初识:第一次接触华为认证是在大三的暑假,当时报名参加了华为云云计算夏令营,第一次认识到HCIA、HCIP和HCIE,通过一个暑假的学习,很遗憾没有去考HCIA。认知:时隔一年后,快毕业的时候接触到了华为云,通过Java全栈课程、求职暑假训练营、7天训练营以及其他活动,慢慢的接触华为云课程,完成了人生的第一个微认证:公众号后台消息回复,当时激动的心情,感觉自己突然有用了,接着又慢慢接触到其他微认证,鲲鹏、软开等等。相伴:今年由于工作的原因还没有继续完成微认证,列表里已经购买了十几个微认证,将在接下去的时间完成它们,目的是学习更多的知识,也将在5月12日之前完成第一个HCIA认证!送自己及学习路上的同伴,加油,向着美好的未来以及憧憬着的希望去奔跑,他们就在你眼前!
  • [其他] 分享机器学习趋势论文—— 多关系Poincaré图嵌入
    论文:Multi-relational Poincaré Graph Embeddings多关系庞加莱图嵌入论文地址:https://papers.nips.cc/paper/8696-multi-relational-poincare-graph-embeddings.pdf    论文在它们的多关系庞加莱模型(MuRP)的知识图嵌入中用上了双曲几何。直觉上,正确的三元组客体应该落在主体附近的某个超球面中,相关的这些决策边界是由学习到的参数描绘的。作者用来优化模型的是黎曼几何SGD(大量数学警告)。在两个标准的评测数据集 WN18RR 和 FB15k-237 上,MuRP 的效果比对比模型更好,因为它“更具备双曲几何”而且也更适用于树结构(如果能像上面的论文一样计算一下Gromov双曲性分数就更好了)。更有趣的是,MuRP只需要40维,得到的准确率就和欧氏空间模型用100维甚至200维向量的结果差不多!明显可以看到,双曲空间的模型可以节省空间维度和存储容量,同时还不需要有任何精度的牺牲。    还有一个双曲知识图嵌入比赛,获奖方法名为 RotationH,论文见 https://grlearning.github.io/papers/101.pdf  ,其实和上面的双曲图卷积神经网络论文的作者是同一个人。这个模型使用了双曲空间的旋转(思路上和RotatE https://arxiv.org/abs/1902.10197 模型相似,不过RotatE是复数空间的模型),也使用了可学习的曲率。RotationH 在WN18RR上刷新了最好成绩,而且在低维的设定下也有很好的表现,比如,32维的RotationH就能得到和500维RotatE差不多的表现。    转自,杨晓凡,https://www.leiphone.com/news/201912/GsRSElsUReef0z7o.html
  • [其他] 分享机器学习趋势论文——知识图嵌入的群表示理论
    论文:Group Representation Theory for Knowledge Graph Embedding链接:https://grlearning.github.io/papers/15.pdf    论文从群论的角度来研究KG嵌入。结果表明,在复空间中可以对阿贝尔群进行建模,且证明了RotatE(在复空间中进行旋转)可以表示任何有限阿贝尔群。有没有被“群论”、“阿贝尔群”这些数学名词吓到?不过没关系,这篇文章里有对相关的群论知识做简要介绍。不过这个工作在如何将这个工作拓展到1-N或N-N的关系上,还有很大的gap。作者提出一个假设,即或许我们可以用四元数域H来代替复数空间C。    转自,杨晓凡,https://www.leiphone.com/news/201912/GsRSElsUReef0z7o.html
总条数:5195 到第
上滑加载中