-
中山大学人机物智能融合实验室发布了基于常识的无偏视觉问答数据集 (Knowledge-Routed Visual Question Reasoning,KRVQA)。由于自然语言与标注者中自然存在的偏差,现有的算法能够通过拟合数据集内的这些偏差达到很好的效果,而不需要理解对应的文字和图像信息。相关论文发表在国际知名顶级期刊 TNNLS 上。在自然语言处理和计算机视觉领域,已经有工作开始探索基于常识的阅读理解和视觉问答问题。这类问题要求算法需要额外的常识才能给出答案。但现有的常识视觉问答数据集大多是人工标注的,并没有基于合适的知识或情感表达进行构建。这不仅导致常识的分布相当稀疏,容易产生解释的二义性,同时还容易引入标注者偏差,使得相关算法仍在关注于增加神经网络的表达能力以拟合问题和答案之间的表面联系。 针对此问题,研究者提出了新的基于知识路由的视觉推理数据集 (Knowledge-Routed Visual Question Reasoning,KRVQA),该数据集基于现有的多个公开知识 / 常识图谱中与现有图像场景图 (scene graph) 相关的部分,通过预先定义的规则搜索图谱中的推理路径,并生成大规模无偏差的问答和推理标注。如图 1 所示,该数据集避免现有数据驱动的深度模型通过过拟合得到高准确率,推动视觉问答模型正确感知图像中的视觉对象,理解问题并整合对象之间的关系和相应常识回答问题。文章链接:https://arxiv.org/abs/2012.07192数据集链接:http://www.sysu-hcp.net/resources/图 1:KRVQA 测试基准的样例示意。 具体而言,基于通过生成推理路径,从图像场景图或知识库中选择一个或两个三元组进行多步推理,并通过约束使用的三元组,将知识从其他偏差中分离出来,并平衡答案的分布,避免答案歧义。两个主要的约束为: 1. 一个问题必须与知识库中的多个三元组相关,但仅有一个三元组与图像相关。2. 所有的问题都基于不同的知识库三元组,但训练集和测试集拥有相同的候选答案集合。约束 1 能强制视觉问答模型正确地感知图像,而不能仅仅根据给定的问题猜测知识。约束 2 则能避免现有方法通过训练集中的样本来拟合知识库,强制模型通过外部知识来处理未见过的问题,促进模型在泛化性上的研究。 研究者对各种知识库编码方法和最新视觉问答模型进行了大量实验,结果表明,在给定知识库的情况下,是否给定问题相关的三元组的两张情况间仍然会存在较大的差距。这说明提出的 KRVQA 数据集能很好体现现有深度模型在知识推理问题上的不足。 KRVQA 数据集 该数据集基于从自然图像场景图和外部知识库中提取的一个或两个三元组,组成推理结构,并以该结构为基础通过模板构建问题答案对。 给定一个图像,研究者首先合并其场景图和外部知识库以形成和图像相关的知识图。该数据集利用现有的公开标注数据构建数据集,包括使用 Visual Genome 数据集中图像场景图标注以获得图像中的所有对象 / 关系三元组, 使用 WebChild、ConceptNet、DBpedia 等一般常识知识库获取图像信息以外的常识三元组。场景图和知识库中的三元组都包含一个主语、一个关系和一个宾语共三个项。如果图像场景图中的物体和知识库某个三元组中一项的名称相同,这两项就将合并。在合并所有名称相同的项之后,可以得到一个与图像相关的知识图。研究者利用其中包含的三元组来生成复杂的问题——答案对。 然后从图中提取一条路径并根据路径提出一阶或二阶问题。推理路径的提取由一组层级化的基本查询的构建。一个基本查询将告知模型在已知主语 A,宾语 B 和关系 R 中的其中两个时,需要去哪个信息源取出第三个信息。例如,表示需要模型从知识库中找到包括主语 A 和宾语 B 的三元组,并将三元组的关系 R 取出作为输出。有如下 6 个基本查询: :给定主语 A 和宾语 B,从图像中获得它们的关系 R。 :给定主语 A 和关系 R,从图像中获得宾语 B。 :给定宾语 B 和关系 R,从图像中获得主语 A。 :给定主语 A 和宾语 B,从知识库中获得它们的关系 R。 :给定主语 A 和关系 R,从知识库中获得宾语 B。 :给定宾语 B 和关系 R,从知识库中获得主语 A。 通过将每个基本查询的输出作为下个基本查询的输入,便可以组成问题的层次化推理结构,并作为标注信息。例如,“What is the object that is on the desk used for?”的需要从图像中查询得知是什么在桌子上,并在给定前一步查询得到的物体 A 和关系 “UsedFor” 的情况下,从知识库中得到桌子上的物体的用处。 最终,根据提取的三元组和模板,例如 “(man, holds, umbrella)” 和模板 “what is <A> <R>? <B>” 生成问题答案对“what is the man holding?Umbrella”。 表 2 不同问题类型及对应模板实例 数据集的统计特性 数据集总共包括 32910 个图像,193449 个知识三元组和 157201 个问题答案对。其中包括 68448 个一步推理问题和 88753 个二步推理问题,以及 87193 个外部知识相关问题和 70008 个外部知识无关问题。 知识库无关的问题中,候选答案的数量为 2378。候选答案出现的频次在数据集中表现出了长尾分布。这使得模型必须准确解析图像,找出物体和它们的关系以正确处理图像中显著性不高的物体。知识库相关的问题中,候选答案的数量为 6536,研究者通过限制每个答案的最大出现次数,使得知识库相关的问题的答案分布均匀,避免模型拟合知识库。验证和测试集中 97% 的答案存在于训练集中,使得之前基于分类的视觉问答方法也能应用在该数据集上。 图 2 知识相关问题的答案分布 图 3 知识无关问题的答案分布 实验 研究者通过评估多个最新视觉问答模型的性能以及包括知识图嵌入和问题编码器预训练等各种知识嵌入方法,以检验提出的 KRVQA 数据集的性质。其中视觉问答模型包括: Q-type。对于每个问题,使用其问题类型中最频繁的训练答案作为输出答案。LSTM。使用双向 LSTM 对问题进行编码。并仅用问题编码预测最终答案。推理路径预测。使用双向 LSTM 对问题进行编码,并以全监督方式训练和预测推理路径和问题类型,以此从场景图和知识库中检索正确答案。Bottom-up attention。该方法取得了 2017 年视觉问答挑战赛的第一名方法。具有视觉问答模型的经典架构。MCAN。模块化共同注意网络(MCAN)为目前在 VQAv2 数据集上不使用额外数据得到最高的性能的方法,同时具有与在各种视觉语言任务上预训练的最新模型相似的网络架构结构。表 2 不同视觉问答方法在 KRVQA 上的准确率 如表 2 所示,基线方法 「Q-type」和「LSTM」仅根据问题预测答案,准确率大幅低于其他方。所有的方法在两步问题上的表现都与一步问题有较大差距,在知识相关问题上的准确率也更低。这些结果表明,KRVQA 数据集中的问题需要结合图像上下文和知识进行推理回答,多跳推理对现有方法仍具有挑战性。 知识编码与预训练 通过在整个知识库上训练,RotatE 可以对知识库中所有的实体和关系进行编码,使得针对三元组有。研究者使用 RotatE 对知识库三元组编码,并与 VQAv2 数据集上的效果最好之一的 MCAN 基线模型融合,如图 4 所示。 图 4 嵌入知识库编码的 MCAN 模型 最近的研究表明,通过对大量文本的训练,语言模型可以在一定程度上对知识进行编码。受此启发,研究者同样在知识文本上预训练问题编码器,对知识进行隐式编码。具体地说,MCAN 的自注意问题编码器将知识三元组的对应文本作为输入,然后如图 5 所示预测被掩盖的文本字符或相应的知识三元组。 图 5 用以隐式编码知识库的预训练任务示意 在表三上所示的 KRVQA 结果显示,在给定标定的三元组或查询实体时,模型能大幅提高在知识相关问题上的结果。而在给定除查询实体外的标定三元组 “+knowledge inference” 时,由于一副图像可能对应多个知识三元组,模型在推理图像答案时仅仅取得了少量提高。两个预训练任务则仅仅相对基线方法有稍微的提高。这显示了 KRVQA 中知识库的重要性,同时说明当前模型在正确感知图像内容以及编码知识库上的不足。 表 3 不同知识库编码方法与 MCAN 基线方法的准确率
-
OpenAI 图像版 GPT-3、120 亿参数的 DALL-E 刷屏社区,这个大型模型可以将以自然语言形式表达的大量概念转换为合适的图像,效果十分惊艳。如输入「牛油果形状的椅子」,就可以获得绿油油、形态各异的牛油果椅子图像。如果 GPT-3 一样,大家都在期待 OpenAI 放出 DALL-E 的官方论文与实现代码。 经过近两个月的等待,DALL-E 的论文和代码终于新鲜出炉!不过此项目正在更新,截止发稿时 DALL-E 只开放了使用图像重建部分 d-VAE 训练的 CNN 编码器和解码器部分,而 Transformer 代码部分还没有公开。除此以外数据集也不能使用。而论文也是公布了 d-VAE 的论文。项目地址:https://github.com/openai/DALL-E论文地址:https://arxiv.org/abs/2102.12092只能期待后续 OpenAI 公开更多的技术细节。 DALL-E 部分代码已开源这是为 DALL·E 所使用的 d-VAE 的官方 PyTorch 包。在运行 DALL-E/notebooks/usage.ipynb 程序之前,需要先安装软件包,代码如下:pip install git+https://github.com/openai/DALL-E.git解码器、编码器代码 d-VAE 论文 年初在论文还没有公开的情况下,就有人开始复现,他们复现的依据来自某博主制作的油管视频,在视频中,对 DALL·E 的原理结构进行了猜测。那么,现在论文已公开,是否颠覆了他的预想。传统上,文本到图像的生成主要集中在在固定的训练数据集上找到更好的建模假设。这些假设可能涉及复杂的体系架构、辅助损失或辅助信息,例如在训练期间提供的对象部件标签或分割掩码。该研究提出了一种基于 transformer 的简单方法,将文本和图像 token 作为单个数据流进行自回归建模。在足够的数据和扩展的情况下,当以 zero-shot 方式评估时, 该研究提出的方法与以前的领域特定模型具有相当的竞争力。
-
作者:Sergei Ivanov等机器之心编译GBDT 和 GNN 方法各有各的优势,现在,来自法国、俄罗斯两家机构的研究者将二者的优势结合起来,探索使用 GBDT 模型处理图结构数据。论文地址:https://openreview.net/pdf?id=ebS5NUfoMKL图神经网络(GNN)已经在学习图结构方面取得了巨大成功,应用于分子设计、计算机视觉、组合优化、推荐系统等多个方面。该领域的进展依靠于规范的 GNN 架构的存在,该架构将原始输入数据有效地编码为表达型表征,从而在新的数据集和任务上获得高质量的结果。最近的一些研究主要集中于具有稀疏数据的 GNN 上,这些数据代表同质节点嵌入(例如 one-hot 编码的图统计)或者词袋表征。但是在许多情况下,具有详细信息和丰富语义的表格数据更为自然,现实世界的人工智能也更丰富。例如在社交网络中,每个人都有社会人口统计学特征(例如年龄、性别、毕业日期),这些特征在数据类型、规模和缺失值上有很大差异。带有表格数据图形的 GNN 的研究是缺少的,梯度提升决策树(GBDT)在具有此类异构数据的应用程序中占主导地位。 GBDT 非常适用于表格数据,因为它们具有以下特性: 能够有效地学习表格数据中常见的具有超平面边界的决策空间;非常适合处理基数高、值缺失且比例不同的变量;它们为决策树或通过事后分析阶段的集合提供定性解释;在实际应用中,对于大量数据,它们收敛速度更快。相反,GNN 的关键特征使它们同时考虑节点的邻域信息和节点特征来进行预测,这与 GBDT 不同,GBDT 需要额外的预处理分析才能为算法提供图摘要(例如通过无监督图嵌入)。此外,理论上已经证明,通过消息传递的 GNN 可以在其图输入上计算任何可由图灵机器计算的函数,即 GNN 是唯一在图上具有通用性的学习架构(近似化和可计算性)。此外,与基于树的方法相比,基于梯度的神经网络学习具有多种优势: GNN 中含有的关系归纳偏差减轻了手动设计捕获网络拓扑特征的需求;训练神经网络的端到端属性允许在依赖于应用程序的解决方案中将 GNN 进行多阶段或多组件集成;采用图网络的预训练表征丰富了迁移学习中的许多重要任务,例如无监督领域自适应、自监督学习和主动学习机制。显然,GBDT 和 GNN 方法都有着明显的优势,可以将二者的优势结合起来吗?此前所有尝试将梯度提升和神经网络结合起来的方法在计算上都很繁琐,没有考虑图结构化数据,并且缺乏 GNN 架构中包含的关系偏向。 本研究是第一个探索使用 GBDT 模型处理图结构数据的研究。在这篇论文中,研究者提出了一种针对含表格数据的图的新型学习架构 BGNN,该架构将 GBDT 对表格节点特征的学习与 GNN 相结合,从而利用图的拓扑优化预测。这使 BGNN 可以继承梯度提升方法(异构学习和可解释性)和图网络(表征学习和端到端训练)的优势。 总体而言,该研究的贡献有: 设计了一种新的通用体系架构,将 GBDT 和 GNN 组合为一个 pipeline;通过迭代添加适合 GNN 梯度更新的新树,该研究克服了 GBDT 的端到端训练的挑战,使得错误信号可从网络拓扑反向传播到 GBDT;研究者针对节点预测任务中的强基准对方法进行了广泛的评估,实验结果表明,在各种现实表格数据中,异构节点回归和节点分类任务的性能显著提高;由于训练过程中的损失收敛速度更快,该方法比其他 GNN SOTA 模型更有效。此外,学习到的表征在潜在空间中展现出可辨别的结构,这进一步证明了该方法的表达能力。方法介绍GBDT 和 GNN 的优化遵循不同的方法:GNN 的参数通过梯度下降进行优化,而 GBDT 则是迭代构建的,并且决策树在构建之后仍然保持固定(决策树基于特征空间的硬拆分,因此不可微分)。 一种简单的方法是仅在节点特征上训练 GBDT 模型,然后将得到的 GBDT 预测与原始输入一起用作 GNN 的新节点特征。在这种情况下,将通过图神经网络进一步完善 GBDT 对图不敏感的预测。这种方法(被称为 Res-GNN)已经可以提高某些任务的 GNN 性能,但 GBDT 模型将完全忽略图的结构,并可能会丢失图的描述性特征,从而向 GNN 提供不准确的输入数据。 相反,该研究提出对 GBDT 和 GNN 进行端到端的训练,称为 BGNN(Boost-GNN)。该研究首先应用 GBDT,然后再应用 GNN。但考虑到最终预测的质量,该研究对它们进行了优化,BGNN 的训练如图 1 所示。已经构建好的决策树由于其离散的结构而无法正确调整,因此该研究通过添加新的树来迭代地更新 GBDT 模型,使其近似于 GNN 损失函数。图 1:BGNN 的训练过程,计算每一个 epoch 的步数。下图算法 1 展示了 BGNN 模型的训练算法,它可用于半监督节点回归与分类这样的任意节点级别的预热问题。更多实验结果读者可以查看原论文。本文来源:https://mp.weixin.qq.com/s/wIUVN9L5nnBgR_JSXY9OfA
-
华为网络AI学习赛2021-硬盘异常检测华为网络AI学习赛2021-硬盘异常检测 过程经过几天的数据处理,训练集的特征维度从 109 -> 53 -> 77 -> 57 -> 219,然而比赛分数一直没有超过样例代码,看到这个情况,很是意外。VegaAutoML中的参数 max_trial_number 从 2 -> 5 -> 200 -> 1,这样调节也不行。训练任务的运行日志输出准确率接近于1(如下所示)。到测试集一提交就是 0.1: model_id ... trial_result 0 stacking_all_20210228_000333 ... {'accuracy': 1.0, 'precision': 1.0, 'f1': 1.0,... 1 stacking_heterogeneous_20210228_000334 ... {'accuracy': 1.0, 'precision': 1.0, 'f1': 1.0,... 2 lightgbm_20210228_000325 ... {'accuracy': 0.9998, 'precision': 1.0, 'f1': 0... 3 lightgbm_20210228_000331 ... {'accuracy': 0.9998, 'precision': 1.0, 'f1': 0... [4 rows x 4 columns]存在 过拟合!!! 学习在比赛资料中,比较有帮助的是前辈的方案帖。在 slaine 的方案帖中,提到了过拟合的问题(此处只展示了小部分内容,建议阅读全文):"尝试一:为了解决过拟合问题,首先想到的是剔除在训练集中表现强劲的特征,也就是我在上面讲到的与硬盘工作时间强相关的特征(9,241,242等等),但是删除这些特征后线上成绩依然没有得到明显提升。" 在 bullet 的方案帖中,用了较长的篇幅去描述过拟合问题(此处只展示了小部分内容,建议阅读全文):"由于训练集中仅有每块样本前30天的记录,而样本变为坏样本后便不再有记录,因此,数据中好样本都集中在2018年12月而坏样本大多在2018年11月之前,如果把时间作为入模变量进行建模,就能在训练集完美区分好坏样本——12月没了记录的就是坏样本,但这显然是过拟合。由于没有2018年11月前的好样本数据,因此这个比赛存在超级难点,即如何判断模型是在识别好坏样本而不是在识别时间的远近。" 反思与探索先阅读前辈的方案,再动手实践,是少走弯路的好方法。在训练模型之前,多做数据分析和数据可视化,了解数据集是否存在某种误导性。比如 不公平对比、正负样本不平衡等 学习资源和参考资料#网络约AI,有你更精彩#网络人工智能黑客松大赛二等奖方案分享一等奖方案分享【2021学习赛---硬盘异常检测】2月23号直播ppt【学习赛2021--硬盘异常检测】样例代码【学习赛2021--KPI异常检测】优秀选手usstroot直播baseline代码及ppt网络AI学习赛2021.硬盘异常检测,赛题解读 其他学习赛推荐华为网络AI学习赛2021-KPI异常检测华为网络AI学习赛2021-日志异常检测 备注感谢老师的教学与课件欢迎各位同学一起来交流比赛心得^_^比赛配备了较为丰富的学习资料,有助于新手平稳入门,推荐参赛
-
华为网络AI学习赛2021-硬盘异常检测 pandas 查看训练数据集的基本信息import os os.chdir("/home/ma-user/work/disk") import pandas as pd from naie.datasets import get_data_reference dr_train = get_data_reference("DatasetService", "learning_training_data", file_type='csv') train_data = dr_train.to_pandas_dataframe()# 查看前6行数据 train_data.head(n=6)# 查看训练数据集的大小 train_data.shape (558636, 109)# 查看训练数据集的行标签 train_data.index.values array([ 0, 1, 2, ..., 558633, 558634, 558635])# 查看训练数据集的列标签 # 转成list的话,可以使用 train_data.columns.values.tolist() train_data.columns.values array(['date_g', 'serial_number', 'model', 'capacity_bytes', 'failure', 'smart_1_normalized', 'smart_1_raw', 'smart_2_normalized', 'smart_2_raw', 'smart_3_normalized', 'smart_3_raw', 'smart_4_normalized', 'smart_4_raw', 'smart_5_normalized', 'smart_5_raw', 'smart_7_normalized', 'smart_7_raw', 'smart_8_normalized', 'smart_8_raw', 'smart_9_normalized', 'smart_9_raw', 'smart_10_normalized', 'smart_10_raw', 'smart_11_normalized', 'smart_11_raw', 'smart_12_normalized', 'smart_12_raw', 'smart_13_normalized', 'smart_13_raw', 'smart_15_normalized', 'smart_15_raw', 'smart_22_normalized', 'smart_22_raw', 'smart_23_normalized', 'smart_23_raw', 'smart_24_normalized', 'smart_24_raw', 'smart_177_normalized', 'smart_177_raw', 'smart_179_normalized', 'smart_179_raw', 'smart_181_normalized', 'smart_181_raw', 'smart_182_normalized', 'smart_182_raw', 'smart_183_normalized', 'smart_183_raw', 'smart_184_normalized', 'smart_184_raw', 'smart_187_normalized', 'smart_187_raw', 'smart_188_normalized', 'smart_188_raw', 'smart_189_normalized', 'smart_189_raw', 'smart_190_normalized', 'smart_190_raw', 'smart_191_normalized', 'smart_191_raw', 'smart_192_normalized', 'smart_192_raw', 'smart_193_normalized', 'smart_193_raw', 'smart_194_normalized', 'smart_194_raw', 'smart_195_normalized', 'smart_195_raw', 'smart_196_normalized', 'smart_196_raw', 'smart_197_normalized', 'smart_197_raw', 'smart_198_normalized', 'smart_198_raw', 'smart_199_normalized', 'smart_199_raw', 'smart_200_normalized', 'smart_200_raw', 'smart_201_normalized', 'smart_201_raw', 'smart_220_normalized', 'smart_220_raw', 'smart_222_normalized', 'smart_222_raw', 'smart_223_normalized', 'smart_223_raw', 'smart_224_normalized', 'smart_224_raw', 'smart_225_normalized', 'smart_225_raw', 'smart_226_normalized', 'smart_226_raw', 'smart_235_normalized', 'smart_235_raw', 'smart_240_normalized', 'smart_240_raw', 'smart_241_normalized', 'smart_241_raw', 'smart_242_normalized', 'smart_242_raw', 'smart_250_normalized', 'smart_250_raw', 'smart_251_normalized', 'smart_251_raw', 'smart_252_normalized', 'smart_252_raw', 'smart_254_normalized', 'smart_254_raw', 'smart_255_normalized', 'smart_255_raw'], dtype=object)# 摘要信息 train_data.info() <class 'pandas.core.frame.DataFrame'> RangeIndex: 558636 entries, 0 to 558635 Columns: 109 entries, date_g to smart_255_raw dtypes: float64(104), int64(2), object(3) memory usage: 464.6+ MB# 描述统计信息(boxplot中提到的数值) train_data.describe() 学习资源和参考资料【2021学习赛---硬盘异常检测】2月23号直播ppt【学习赛2021--硬盘异常检测】样例代码https://blog.csdn.net/qq_40981268/article/details/86566068https://www.itdiandi.net/view/1800https://blog.csdn.net/qq_37975685/article/details/107953941 其他学习赛推荐华为网络AI学习赛2021-KPI异常检测华为网络AI学习赛2021-日志异常检测 备注感谢老师的教学与课件欢迎各位同学一起来交流比赛心得^_^比赛配备了较为丰富的学习资料,有助于新手平稳入门,推荐参赛
-
华为网络AI学习赛2021-硬盘异常检测 Pandas 查看训练数据集中正负样本比例import os os.chdir("/home/ma-user/work/disk") import pandas as pd from naie.datasets import get_data_reference dr_train = get_data_reference("DatasetService", "learning_training_data", file_type='csv') train_data = dr_train.to_pandas_dataframe()# 查看列的信息 train_data['failure'] 0 0 1 0 2 0 3 0 4 0 .. 558631 0 558632 0 558633 0 558634 0 558635 0 Name: failure, Length: 558636, dtype: int64# crosstab # rosstab(index, columns, values=None, rownames=None, colnames=None, aggfunc=None, margins=False, margins_name:str='All', dropna:bool=True, normalize=False) -> 'DataFrame' # Compute a simple cross tabulation of two (or more) factors. By default # computes a frequency table of the factors unless an array of values and an # aggregation function are passed. pd.crosstab(train_data.failure,"count")type(pd.crosstab(train_data.failure,"count")) pandas.core.frame.DataFrame# 饼图 # 显示的小数位数 autopct='%.3f%%' pd.crosstab(train_data.failure,"count").plot(kind="pie",subplots=True,autopct='%.3f%%')# 柱状图 pd.crosstab(train_data.failure,"count").plot(kind="bar")有些学习数据集的正负样本比例是平衡的,在实际中不平衡的会多一些。 学习资源和参考资料【2021学习赛---硬盘异常检测】2月23号直播ppt【学习赛2021--硬盘异常检测】样例代码【学习赛2021--KPI异常检测】优秀选手usstroot直播baseline代码及pptMatplotlib简单画图(四) -- pandas绘图之DataFrame 其他学习赛推荐华为网络AI学习赛2021-KPI异常检测华为网络AI学习赛2021-日志异常检测 备注感谢老师的教学与课件欢迎各位同学一起来交流比赛心得^_^比赛配备了较为丰富的学习资料,有助于新手平稳入门,推荐参赛
-
人工智能顶会 ICLR 2021 放出了今年的论文接收结果。和其他著名人工智能会议一样,今年的 ICLR 论文投稿数量继续增长:共获得 2997 篇有效投稿,860 篇论文最终被接收(2020 年为 687 篇),其中 53 篇将进行口头讲述报告(Oral),114 篇 Spotlight,其余为 Poster 论文。今年大会论文 29% 的接收率相比去年的 26.5% 也有提升,与其他一些顶会大幅降低接收率相比,ICLR 似乎更加友好。但在社交网络上,我们仍然看到了「评分 6、8、6、8,但仍被程序主席毙掉」的惨剧。在此之前,所有论文的初审结果已于去年 11 月 11 日公布。值得注意的是,此次会议收到的论文中有 856 篇是 NeurIPS 2020 Rejection 之后再提交的。论文结果放出以后,人们也整理了本次大会的论文评分和链接列表:https://docs.google.com/spreadsheets/d/1n58O0lgGI5kI0QQY9f4BDDpNB4oFjb5D51yMr9fHAK4/edit#gid=1546418007其中可见,不同于去年超过 30 篇满分论文,今年只有 15 篇论文获得了平均 8 分及以上的分数,也没出现「满分论文」。其中排名最高的是来自麻省理工学院(MIT)Keyulu Xu、马里兰大学 Mozhi Zhang、Jingling Li 等人的论文《How Neural Networks Extrapolate: From Feedforward to Graph Neural Networks 获得了 9、8、9、9 四个评分。论文链接:https://openreview.net/forum?id=UH-cmocLJC该研究的主题是通过梯度下降训练的神经网络如何外推(extrapolate),即在训练分布的支持以外还能学到什么。之前的研究表明用神经网络外推时的混合实验结果如下:虽然多层感知机(MLP)在一些简单任务中无法很好地外推,但是图神经网络(GNN,一种具有 MLP 模块的结构化网络)在一些较为复杂的任务中已经显示出一定的成功。通过理论解释,研究者确定了 MLP 和 GNN 良好推断的条件。首先,该研究对 ReLU MLP 从原点沿任何方向快速收敛到线性函数的观察结果进行量化。这意味着 ReLU MLP 不会外推大多数非线性函数。但是,当训练分布足够多样化时,ReLU MLP 被证明可以用于学习线性目标函数。其次,结合分析 GNN 的成功和局限性,这些结果提出了一种假设:GNN 在将算法任务外推到新数据(例如较大的图或边权重)方面的成功取决于架构或特征中的特定于编码任务的非线性性。该研究为这种假设理论和实验依据。该研究的理论分析建立在超参数网络与神经正切核的连接上。实验表明,该研究的理论适用于不同的训练设置。图 1:ReLU MLP 如何外推。研究者训练 MLP 以学习非线性函数(灰色),并从内部(蓝色)和外部(黑色)两方面绘制其预测结果。MLP 从原点沿多个方向迅速收敛至训练数据范围以外的线性函数。因此,MLP 在大多数非线性任务中无法很好地外推,但 MLP 能够很好地全局外推线性目标函数。图 2:GNN 如何外推。由于 MLP 在学习线性函数时可以很好地进行外推,因此研究者作出如下假设:如果在架构(左)和输入表征(右,借助域知识或表征学习)中编码适当的非线性,GNN 就会在动态规划(DP)中很好地进行外推。编码的非线性可能对于插值(interpolation)是非必需的,因为它们可能是通过 MLP 模块近似化的,但是它们有助于外推。ICLR 全称为 International Conference on Learning Representations(国际学习表征会议)。自 2013 年开始每年举办一次,2021 年将举办第九届会议。该会议与 CVPR、ACL、NeurIPS 等学术会议一样被认为是国际人工智能顶会,同时也是 CCF 评选的一类会议。ICLR 的创始人包括深度学习三巨头之二的 Yoshua Bengio 和 Yann LeCun。数据的应用表征对机器学习的性能有着重要的影响,表征学习对于计算机视觉、语音处理、自然语言处理等多个领域都起着至关重要的作用,ICLR 旨在打造这一领域交流研究的平台。今年的 ICLR 大会原定于奥地利首都维也纳举行,但由于新冠疫情的原因已连续第二届改为线上形式,正式的活动将在 5 月 4-8 日进行。虽然参会的人数还不是最多,但 ICLR 的影响力已不容小觑。在今年的论文结果放出之后,Yann LeCun 在推特上给出了一些 ICLR 大会的数据:ICLR 的谷歌学术 h5 指数已经排到了全榜第 17 名,超过了 NeurIPS、ICCV、ICML,落后于 CVPR(该榜单的前三名是 Nature、新英格兰医学杂志和 Science)。对于一个 2013 年刚起步的学术会议来说,这是相当值得称赞的成绩。LeCun 表示,开放的审稿形式,以及深度学习领域近年来的良好发展趋势是 ICLR 大会成功的原因。参考内容:https://iclr.cc/Conferences/2021/Dateshttps://scholar.google.com/citations?view_op=top_venues&hl=en本文转自:机器之心转载请注明出处
-
作者:Mahitha Singirikonda正如巴菲特所言:「近似的正确好过精确的错误。」在机器学习中,过拟合(overfitting)会使模型的预测性能变差,通常发生在模型过于复杂的情况下,如参数过多等。本文对过拟合及其解决方法进行了归纳阐述。在机器学习中,如果模型过于专注于特定的训练数据而错过了要点,那么该模型就被认为是过拟合。该模型提供的答案和正确答案相距甚远,即准确率降低。这类模型将无关数据中的噪声视为信号,对准确率造成负面影响。即使模型经过很好地训练使损失很小,也无济于事,它在新数据上的性能仍然很差。欠拟合是指模型未捕获数据的逻辑。因此,欠拟合模型具备较低的准确率和较高的损失。如何确定模型是否过拟合?构建模型时,数据会被分为 3 类:训练集、验证集和测试集。训练数据用来训练模型;验证集用于在每一步测试构建的模型;测试集用于最后评估模型。通常数据以 80:10:10 或 70:20:10 的比率分配。在构建模型的过程中,在每个 epoch 中使用验证数据测试当前已构建的模型,得到模型的损失和准确率,以及每个 epoch 的验证损失和验证准确率。模型构建完成后,使用测试数据对模型进行测试并得到准确率。如果准确率和验证准确率存在较大的差异,则说明该模型是过拟合的。如果验证集和测试集的损失都很高,那么就说明该模型是欠拟合的。如何防止过拟合交叉验证交叉验证是防止过拟合的好方法。在交叉验证中,我们生成多个训练测试划分(splits)并调整模型。K-折验证是一种标准的交叉验证方法,即将数据分成 k 个子集,用其中一个子集进行验证,其他子集用于训练算法。交叉验证允许调整超参数,性能是所有值的平均值。该方法计算成本较高,但不会浪费太多数据。交叉验证过程参见下图:用更多数据进行训练用更多相关数据训练模型有助于更好地识别信号,避免将噪声作为信号。数据增强是增加训练数据的一种方式,可以通过翻转(flipping)、平移(translation)、旋转(rotation)、缩放(scaling)、更改亮度(changing brightness)等方法来实现。移除特征移除特征能够降低模型的复杂性,并且在一定程度上避免噪声,使模型更高效。为了降低复杂度,我们可以移除层或减少神经元数量,使网络变小。早停对模型进行迭代训练时,我们可以度量每次迭代的性能。当验证损失开始增加时,我们应该停止训练模型,这样就能阻止过拟合。下图展示了停止训练模型的时机:正则化正则化可用于降低模型的复杂性。这是通过惩罚损失函数完成的,可通过 L1 和 L2 两种方式完成,数学方程式如下:L1 惩罚的目的是优化权重绝对值的总和。它生成一个简单且可解释的模型,且对于异常值是鲁棒的。L2 惩罚权重值的平方和。该模型能够学习复杂的数据模式,但对于异常值不具备鲁棒性。这两种正则化方法都有助于解决过拟合问题,读者可以根据需要选择使用。DropoutDropout 是一种正则化方法,用于随机禁用神经网络单元。它可以在任何隐藏层或输入层上实现,但不能在输出层上实现。该方法可以免除对其他神经元的依赖,进而使网络学习独立的相关性。该方法能够降低网络的密度,如下图所示:总结过拟合是一个需要解决的问题,因为它会让我们无法有效地使用现有数据。有时我们也可以在构建模型之前,预估到会出现过拟合的情况。通过查看数据、收集数据的方式、采样方式,错误的假设,错误表征能够发现过拟合的预兆。为避免这种情况,请在建模之前先检查数据。但有时在预处理过程中无法检测到过拟合,而是在构建模型后才能检测出来。我们可以使用上述方法解决过拟合问题。原文链接:https://mahithas.medium.com/overfitting-identify-and-resolve-df3e3fdd2860本文来源:机器之心
-
作者 Sebastian Ruder去年有哪些机器学习重要进展是你必须关注的?听听 DeepMind 研究科学家怎么说。2020 年因为新冠疫情,很多人不得不在家工作和学习,大量人工智能学术会议也转为线上。不过在去年我们仍然看到了很多 AI 技术领域的进展。DeepMind 研究科学家 Sebastian Ruder 近日帮我们对去年的机器学习社区进行了一番总结。首先你必须了解的是:这些重点的选择基于作者个人熟悉的领域,所选主题偏向于表示学习、迁移学习,面向自然语言处理(NLP)。如果读者有不同的见解,可以留下自己的评论。Sebastian Ruder 列出的 2020 年十大机器学习研究进展是:大模型和高效模型语言模型从 2018 年到 2020 年的发展(图片来自 State of AI Report 2020)。2020 年发生了什么?在过去的一年,我们看到了很多前所未有的巨型语言和语音模型,如 Meena(Adiwardana et al., 2020)、Turing-NLG、BST(Roller et al., 2020)和 GPT-3(Brown et al., 2020)。与此同时,研究人员们也早已意识到训练这样的模型要耗费过量的能源(Strubell et al., 2019),并转而探索体量更小、效果仍然不错的模型:最近的一些进展方向来自于裁剪((Sajjad et al., 2020、Sanh et al., 2020、)、量化(Fan et al., 2020b)、蒸馏(Sanh et al., 2019、Sun et al., 2020)和压缩(Xu et al., 2020)。另有一些研究关注如何让 Transformer 架构本身变得更高效。其中的模型包括 Performer(Choromanski et al., 2020)和 Big Bird(Zaheer et al., 2020),如本文第一张图所示。该图显示了在 Long Range Arena 基准测试中不同模型的性能(y 轴)、速度(x 轴)和内存占用量(圆圈大小)(Tay et al., 2020)。像 experiment-impact-tracker 这样的工具(Henderson et al., 2020)已让我们对于模型的能耗效率更为了解。其研究者还推动了评估效率的竞赛和基准测试,如 EMNLP 2020 上的 SustaiNLP 研讨会,NeurIPS 2020 上的 Efficient QA 竞赛和 HULK(Zhou et al., 2020)。模型体量的扩大可以让我们不断突破深度学习能力的极限。而为了在现实世界部署它们,模型必须高效。这两个方向也是相辅相成的:压缩大号模型可以兼顾效率和性能(Li et al., 2020),而效率更高的方法也可以推动更强、更大的模型(Clark et al., 2020)。鉴于对效率和可用性的考虑,我认为未来研究的重点不仅仅是模型的表现和参数数量,也会有能耗效率。这会有助于人们对于新方法进行更全面的评估,从而缩小机器学习研究与实际应用之间的差距。检索增强使用 REALM 进行无监督预训练,检索器和编码器经过了联合预训练。大规模模型可以利用预训练数据学习出令人惊讶的全局知识,这使得它们可以重建事实(Jiang et al., 2020)并在不接触外界上下文的情况下回答问题(Roberts et al., 2020)。然而,把这些知识隐式地存储在模型参数中效率很低,需要极大的模型来存储足量的信息。与之不同的是,最近的一些方法选择同时训练检索模型和大规模语言模型,在知识密集型 NLP 任务上获得了强大的结果,如开放域问答(Guu et al., 2020、Lewis et al., 2020)和语言建模(Khandelwal et al., 2020)。这些方法的主要优点是将检索直接集成到语言模型的预训练中,从而让语言模型效率更高,专注于学习自然语言理解中更具挑战性的概念。因此在 NeurIPS 2020 EfficientQA 竞赛中的最佳系统依赖于检索(Min et al., 2020)。检索是很多生成任务的标准方法,例如文本摘要和对话此前已大量被摘要生成所替代 (Allahyari et al., 2017)。检索增强生成可以将两个方面的优点结合在一起:检索段的事实正确性、真实性以及所生成文本的相关性和构成。检索增强生成对于处理过去困扰生成神经模型的失败案例尤其有用,尤其是在处理幻觉(hallucination)上(Nie et al., 2019)。它也可以通过直接提供预测依据来帮助使系统更易于解释。少样本学习在过去几年中,由于预训练的进步,给定任务的训练样本数量持续减少(Peters et al., 2018、Howard et al., 2018)。我们现在正处在可以使用数十个示例来完成给定任务的阶段(Bansal et al., 2020)。自然地,人们想到了少样本学习变革语言建模的范式,其中最为突出的例子就是 GPT-3 中上下文学习的方法。它可以根据一些输入 - 输出对和一个提示进行预测。无需进行梯度更新。不过这种方式仍然有其限制:它需要一个巨大的模型——模型需要依赖现有的知识——这个模型能够使用的知识量受到其上下文窗口的限制,同时提示需要手工完成。最近的一些工作试图通过使用小模型,集成微调和自动生成自然语言提示(Schick and Schütze, 2020、Gao et al., 2020、Shin et al., 2020)让少样本学习变得更加有效。这些研究与可控神经文本生成的更广泛领域紧密相关,后者试图广泛地利用预训练模型的生成能力。有关这一方面,可以参阅 Lilian Weng 的一篇博客:https://lilianweng.github.io/lil-log/2021/01/02/controllable-neural-text-generation.html少样本学习可以使一个模型快速承接各种任务。但是为每个任务更新整个模型的权重是很浪费的。我们最好进行局部更新,让更改集中在一小部分参数里。有一些方法让这些微调变得更加有效和实用,包括使用 adapter(Houlsby et al., 2019、Pfeiffer et al., 2020a、Üstün et al., 2020),加入稀疏参数向量(Guo et al., 2020),以及仅修改偏差值(Ben-Zaken et al., 2020)。能够仅基于几个范例就可以让模型学会完成任务的方法,大幅度降低了机器学习、NLP 模型应用的门槛。这让模型可以适应新领域,在数据昂贵的情况下为应用的可能性开辟了道路。对于现实世界的情况,我们可以收集上千个训练样本。模型同样也应该可以在少样本学习和大训练集学习之间无缝切换,不应受到例如文本长度这样的限制。在整个训练集上微调过的模型已经在 SuperGLUE 等很多流行任务中实现了超越人类的性能,但如何增强其少样本学习能力是改进的关键所在。对比学习对比学习是一种为 ML 模型描述相似和不同事物的任务的方法。利用这种方法,可以训练机器学习模型来区分相似和不同的图像。最近,对比学习在计算机视觉和语音的自监督表征学习(van den Oord, 2018; Hénaff et al., 2019)中越来越受欢迎。用于视觉表征学习的新一代自监督强大方法依赖于使用实例判别任务的对比学习:将不同图像视为 negative pairs,相同图像的多个视图视为 positive pairs。最近的方法进一步改善了这种通用框架:SimCLR(Chen et al., 2020)定义了增强型实例的对比损失;Momentum Contrast(He et al., 2020)试图确保大量且一致的样本对集合;SwAV(Caron et al., 2020)利用在线聚类;而 BYOL 仅使用 positive pairs(Grill et al., 2020)。Chen 和 He (2020) 进一步提出了一种与先前方法有关的更简单的表述。最近,Zhao et al. (2020)发现数据增强对于对比学习至关重要。这可能表明为什么在数据增强不那么普遍的 NLP 中使用大型预训练模型进行无监督对比学习并不成功。他们还假设,实例判别比计算机视觉中的有监督预训练更好的原因是:它不会试图让一个类中所有实例的特征相似,而是保留每个实例的信息。在 NLP 中,Gunel et al. (2020)无监督的预训练涉及对成千上万个单词类型进行分类的问题不大。在 NLP 中,Gunel et al. (2020)最近采用对比学习进行有监督的微调。语言建模中常用的 one-hot 标签与模型输出的 logit 之间的交叉熵目标存在一些局限性,例如在不平衡的类中泛化效果较差(Cao et al., 2019)。对比学习是一种可选择的补充范式,可以帮助缓解其中的一些问题。对比学习与 masked 语言建模相结合能够让我们学习更丰富、更鲁棒的表征。它可以帮助解决模型异常值以及罕见的句法和语义现象带来的问题,这对当前的 NLP 模型是一个挑战。要评估的不只是准确率NLP 中的 SOTA 模型已在许多任务上实现了超越人类的表现,但我们能否相信这样的模型可以实现真正的自然语言理解(Yogatama et al., 2019; Bender and Koller, 2020)?其实,当前的模型离这个目标还很远。但矛盾的是,现有的简单性能指标无法体现这些模型的局限性。该领域有两个关键主题:a)精选当前模型难以处理的样例;b)不只是选择准确率等简单指标,而是进行更细粒度的评估。关于前者,常用的方法是在数据集创建过程中使用对抗过滤(Zellers et al., 2018),过滤出由当前模型正确预测的样例。最近的研究提出了更有效的对抗过滤方法(Sakaguchi et al., 2020; Le Bras et al., 2020)和一种迭代数据集创建处理方法(Nie et al., 2020; Bartolo et al., 2020),其中样例经过过滤,模型经过了多轮的重新训练。Dynabench 提供了此类不断变化的基准的子集。针对第二点的方法在本质上也是相似的。该领域通常会创建 minimal pairs(也称为反事实样例或对比集)(Kaushik et al., 2020; Gardner et al., 2020; Warstadt et al., 2020),这些 minimal pairs 以最小的方式干扰了样例,并且经常更改 gold label。Ribeiro et al. (2020) 在 CheckList 框架中形式化了一些基本的直觉,从而可以半自动地创建此类测试用例。此外,基于不同的属性来描述样例可以对模型的优缺点进行更细粒度的分析(Fu et al., 2020)为了构建功能更强大的机器学习模型,我们不仅需要了解模型是否优于先前的系统,还需要了解它会导致哪种错误以及还有哪些问题没被反映出来。通过提供对模型行为的细粒度诊断,我们可以更轻松地识别模型的缺陷并提出解决方案。同样,利用细粒度的评估可以更细致地比较不同方法的优缺点。语言模型的现实应用问题与 2019 年语言模型 (LMs) 分析侧重于此类模型所捕获的语法、语义和世界认知的氛围相比,最近一年的分析揭示了许多实际问题。比如经过预训练的 LM 容易生成「有毒」的语言 (Gehman et al., 2020)」、泄露信息 (Song & Raghunathan, 2020)。还存在微调后易受到攻击的问题,以致攻击者可以操纵模型预测结果 (Kurita et al., 2020; Wallace et al., 2020),以及容易受到模型的影响(Krishna et al., 2020; Carlini et al., 2020)。众所周知,预训练模型可以捕获关于受保护属性(例如性别)的偏见(Bolukbasi et al., 2016; Webster et al., 2020),Sun et al., 2019 的研究给出了一份减轻性别偏见的调查。大公司推出的大型预训练模型往往在实际场景中会有积极的部署,所以我们更应该意识到这些模型存在什么偏见,又会产生什么有害的后果。随着更大模型的开发和推出,从一开始就将这些偏见和公平问题纳入开发过程是很重要的。 Multilinguality2020 年,多语言 NLP 有诸多亮点。旨在加强非洲语种 NLP 研究的 Masakhane 机构在第五届机器翻译会议 (WMT20) 上发表的主题演讲,是去年最令人鼓舞的演讲之一。此外,这一年还出现了其他语言的新通用基准,包括 XTREME (Hu et al., 2020)、XGLUE (Liang et al., 2020)、IndoNLU (Wilie et al., 2020)、IndicGLUE (Kakwani et al., 2020)。现有的数据集也拓展到了其他语言中,比如:SQuAD: XQuAD (Artetxe et al., 2020), MLQA (Lewis et al., 2020), FQuAD (d'Hoffschmidt et al., 2020);Natural Questions: TyDiQA (Clark et al., 2020), MKQA (Longpre et al., 2020);MNLI: OCNLI (Hu et al., 2020), FarsTail (Amirkhani et al., 2020);the CoNLL-09 dataset: X-SRL (Daza and Frank, 2020);the CNN/Daily Mail dataset: MLSUM (Scialom et al., 2020)。通过 Hugging Face 数据集可以访问其中的大部分数据集,以及许多其他语言的数据。涵盖 100 种语言的强大模型也就应运而生了,包括 XML-R (Conneau et al., 2020)、RemBERT (Chung et al., 2020)、InfoXLM (Chi et al., 2020)等,具体可参见 XTREME 排行榜。大量特定语言的 BERT 模型已经针对英语以外的语言进行了训练,例如 AraBERT (Antoun et al., 2020)和 IndoBERT (Wilie et al., 2020),查看 Nozza et al., 2020; Rust et al., 2020 的研究可以了解更多信息。借助高效的多语言框架,比如 AdapterHub (Pfeiffer et al., 2020)、Stanza (Qi et al., 2020)和 Trankit (Nguyen et al., 2020) ,世界上许多语种的建模和应用工作都变得轻松了许多。此外,还有两篇很有启发的研究,《The State and Fate of Linguistic Diversity(Joshi et al., 2020)》和《Decolonising Speech and Language Technology (Bird, 2020)》。第一篇文章强调了使用英语之外语言的紧迫性,第二篇文章指出了不要将语言社区及数据视为商品。拓展到英语之外的 NLP 研究有很多好处,对人类社会能产生实实在在的影响。考虑到不同语言中数据和模型的可用性,英语之外的 NLP 模型将大有作为。同时,开发能够应对最具挑战性设置的模型并确定哪些情况会造成当前模型的基础假设失败,仍然是一项激动人心的工作。图像TransformersTransformer 在 NLP 领域取得了巨大的成功,但它在卷积神经网络 CNN 占据主导地位的计算机视觉领域却没那么成功。2020 年初的 DETR (Carion et al., 2020) 将 CNN 用于计算图像特征,但后来的模型完全是无卷积的。Image GPT (Chen et al., 2020)采用了 GPT-2 的方法,直接从像素进行预训练,其性能优于有监督的 Wide ResNet,后来的模型是将图像重塑为被视为「token」的补丁。Vision Transformer (ViT,Dosovitskiy et al., 2020)在数百万个标记好的图像上进行了训练,每一个图像都包含此类补丁,模型效果优于现有最新的 CNN。Image Processing Transformer(IPT,Chen et al., 2020)在被破坏的 ImageNet 示例上进行对比损失预训练,在 low-level 图像任务上实现了新的 SOTA。Data-efficient image Transformer (DeiT,Touvron et al., 2020) 以蒸馏方法在 ImageNet 上进行了预训练。有趣的是,研究者们发现了 CNN 是更好的教师,这一发现类似于蒸馏归纳偏置(inductive bias)应用于 BERT (Kuncoro et al., 2020)。相比之下在语音领域,Transformer 并未直接应用于音频信号,而通常是将 CNN 等编码器的输出作为输入(Moritz et al., 2020; Gulati et al., 2020; Conneau et al., 2020)。与 CNN 和 RNN 相比,Transformer 的归纳偏置更少。尽管在理论上,它不如 RNN (Weiss et al., 2018; Hahn et al., 2020)强大,但如果基于充足的数据和规模,Transformer 会超越其他竞争对手的表现。未来,我们可能会看到 Transformer 在 CV 领域越来越流行,它们特别适用于有足够计算和数据用于无监督预训练的情况。在小规模配置的情况下,CNN 应该仍是首选方法和基线。自然科学与机器学习去年,DeepMind 的 AlphaFold 在 CASP 蛋白质折叠挑战赛中实现了突破性的表现,除此之外,将机器学习应用于自然科学还有一些显著的进展。MetNet (Sønderby et al., 2020)证明机器学习在降水预测方面优于数值天气预报;Lample 和 Charton(2020)采用神经网络求解微分方程,比商用计算机系统效果更好;Bellemare et al. (2020)使用强化学习为平流层的热气球导航。此外,ML 现已被广泛应用于 COVID-19,例如 Kapoor 等人利用 ML 预测 COVID-19 的传播,并预测与 COVID-19 相关的结构,Anastasopoulos 等人将相关数据翻译成 35 种不同的语言,Lee 等人的研究可以实时回答有关 COVID-19 的问题。有关 COVID-19 相关的 NLP 应用程序的概述,请参阅第一期 COVID-19 NLP 研讨会的会议记录:《Proceedings of the 1st Workshop on NLP for COVID-19 (Part 2) at EMNLP 2020》。自然科学可以说是 ML 最具影响力的应用领域。它的改进涉及到生活的许多方面,可以对世界产生深远的影响。随着蛋白质折叠等核心领域的进展,ML 在自然科学中的应用速度只会加快。期待更多促进世界进步的研究出现。强化学习与最先进的智能体相比,Agent57 和 MuZero 整个训练过程中在雅达利游戏中的表现优于人类基准(Badia et al., 2020)。单个深度强化学习智能体 Agent57(Badia et al., 2020)首次在 57 款 Atari 游戏上超过人类,这也是深度强化学习领域中的一个长期基准。智能体的多功能性来自于神经网络,该网络允许在探索性策略和利用性策略之间切换。强化学习在游戏方面的另一个里程碑是 Schrittwieser 等人开发的 MuZero,它能预测环境各个方面,而环境对精确的规划非常重要。在没有任何游戏动态知识的情况下,MuZero 在雅达利上达到了 SOTA 性能,在围棋、国际象棋和日本象棋上表现也很出色。最后是 Munchausen RL 智能体(Vieillard et al., 2020),其通过一个简单的、理论上成立的修改,提高了 SOTA 水平。强化学习算法有许多实际意义 (Bellemare et al., 2020)。研究人员对这一领域的基本算法进行改进,通过更好的规划、环境建模和行动预测产生很大的实际影响。随着经典基准(如 Atari)的基本解决,研究人员可能会寻找更具挑战性的设置来测试他们的算法,如推广到外分布任务、提高样本效率、多任务学习等。参考内容:https://ruder.io/research-highlights-2020/本文来源:https://www.jiqizhixin.com/articles/2021-01-20-4
-
作者:祝存超、陈牧昊、范长俊、程光权、张岩时序知识的表征和推理是一个具有挑战性的问题。在本文中,来自国防科技大学等的研究者借鉴了自然语言生成(NLG)中的复制机制思路,并通过设计一种全新的基于时序知识图谱嵌入(TKGE)的模型来更有效地建模时序知识图谱。在多个公开时序知识图谱(TKG)基准数据集上,新模型 CyGNet 在未来事实(链接)预测任务上均实现了 SOTA 结果。知识图谱在知识驱动的信息检索、自然语言理解和推荐系统领域有着广泛的应用。一个知识图谱只拥有静态某一时刻的事实,而目前快速增长的数据往往表现出复杂的时间动态,即时序知识图谱(TKG)。具有代表性的时序知识图谱包括全球事件、语言和音调数据库(Global Database of Events, Language, and Tone, GDELT)和综合危机预警系统(Integrated Crisis Early Warning System, ICEWS)。下图 1 展示了 ICEWS 系统的一个外交活动记录子图。然而,现有建模时序知识图谱的方法忽视了时间事实的复杂演变(即许多事实在历史上反复出现)这个自然现象。例如:全球经济危机大约每隔 7 至 10 年就会定期发生一次;外交活动定期发生在两个建立关系的国家之间;东非动物每年 6 月都会进行大规模的迁徙。更具体地说,在整个 24 年的 ICEWS 数据集中(即 1995 年至 2019 年),超过 80% 的事件在过去已经发生过了。这些现象更进一步强调了利用已知事实预测未来事实的重要性。这也是本文的主要出发点。所以,为了能将时间事实的复杂演变现象融入并建模时序知识图谱,来自中国国防科技大学、美国南加州大学、法国计算与先进技术学院等机构的研究者相信更有效地利用历史上发生过的已知事实能够提高时间事实推断的精度。他们决定借鉴在自然语言生成中的复制机制(copy mechanism)思路,探索一种新的框架,通过有效学习时间重复模式以更精准地建模时序知识图谱。论文链接:https://arxiv.org/pdf/2012.08492v1.pdf代码链接:https://github.com/CunchaoZ/CyGNet首先,研究者通过复制机制来探究时序事实的内在现象,并提出在时序知识图谱中学习推理未来事实的时候应参考已知事实。 其次,研究者通过时间感知复制生成(copy-generation)机制创建了一个新的时序知识图谱嵌入模型CyGNet(Temporal Copy-Generation Network) 。该模型能够结合两种推理模式以根据历史词汇表或整个实体词汇表来进行推测,从而更符合上述 TKG 事实的演变模式。 最后,研究者在 ICEWS18、ICEWS14、GDELT、WIKI 和 YAGO 等 5 个公开 TKG 基准数据集上进行了广泛的实验,结果表明 CyGNet 在未来事实(链接)预测任务上优于以往 SOTA TKG 模型。5 个数据集的统计。方法 模型 CyGNet 举例 如下图 2 所示,研究者以预测 2018 年 NBA 冠军球队为例,总体介绍了 CyGNet 模型的预测流程。可以看到,当预测 2018 年哪支球队获得了总冠军时,我们可以从历史得知一共有 18 支 NBA 球队曾经获得过冠军。CyGNet 首先获得每个实体的嵌入向量(见彩色柱),然后使用生成模式(generation mode)得到所有 30 支 NBA 球队获得冠军的概率(见绿色条形,条形越高表示概率越大),同时使用复制模式得到所有曾经得到过冠军的 18 支球队的概率。通过合并两个模块得到的概率,CyGNet最终预测「金州勇士(Golden State Warriors)」能够获得 2018 年 NBA 冠军。模型 CyGNet 结构CyGNet 各部分之间的联系如下图 3 所示,主要由复制模式和生成模式两个模块组成。前者从一个具有重复事实的特定历史词汇表中选择实体,后者从整个实体词汇表选择实体。在训练过程中,研究者按照时间顺序依次训练每个时间片的知识图谱。每训练一个新的时间片的知识图谱,他们都会将该时间片之前的所有历史重复事实加入到历史词汇表,如下图 4 所示(验证和测试的时候,研究者使用整个训练集的历史信息)。复制模式首先得到每个时间片的历史词汇表,该词汇表由多热指示向量表示,其中在历史出现过的实体记为 1,未出现过的实体记为 0.然后通过一层 MLP 获得一个索引向量 v_q:通过将中的未出现过的实体的值设为无限小的值(如 - 10000),然后通过简单的加和,将未出现过的实体概率值降到无限小。通过一层 softmax,即可将未出现过的实体概率无限逼近与 0,得到历史出现过的所有实体的概率值 p(c):生成模式(generation mode)生成模式通过一层 MLP,然后再接一层 softmax,即可得到整个词汇表的概率值:通过参数 alpha 调整复制机制和生成机制的权重,得到最终预测概率,概率最大的即 CyGNet 预测的实体:实验分析链路预测实验结果 研究者在以下五个公开 TKG 基准数据集上进行了实验,如下表 2 和 3 所示。CyGNet 模型在预测未来事实的链路预测任务上的表现超过所有 baseline 模型,这说明了 CyGNet 可以通过结合复制机制和生成机制有效地建模时序知识图谱数据。控制变量实验结果CyGNet-Copy-only 是当 CyGNet 只使用复制模式,CyGNet-Generation-only 只使用生成模式,CyGNet-Generation-new 是 CyGNet 模型改变生成模式的词汇表,即生成模式只从全新的从未发生过的实体中选择。如下表 4 所示,每个模块都对模型产生了重要的作用。 参数 \ alpha 的敏感度分析 以 ICEWS18 为例,研究者分析了调整复制模式和生成模式权重的参数 alpha。实验结果证明 CyGNet 能有效的结合生成模式和复制模式。总结时序知识图谱预测在现实中是一个重要且有挑战性的问题。传统的方法大多侧重于通过对时序信息进行精细复杂的建模来提高预测的准确性。CyGNet 抓住时序实体经常性的重复出现这一现象,借鉴了自然语言生成领域中的「复制-生成」机制,设计了两个模块进行预测。两个模块的模型都很简单,却打败了传统的设计很复杂的模型,这充分说明了利用好时序实体重复出现特性的优势。然而对于这一特性不明显的数据,CyGNet 的表现可能未必同样出色。本文来源:https://www.jiqizhixin.com/articles/2021-01-24-3
-
自发布以来,ImageNet 数据集逐渐成为机器学习社区最流行的图像分类基准,但 ImageNet 自身存在着标签噪声,以及单标签标注属性与多类别样本之间的不匹配。所以在本文中,韩国 Naver AI 实验室提出了一种新颖的重新标注策略以及一个基于额外源数据的强大图像分类器,通过该策略训练的 ResNet 等多种架构都实现了性能提升。ImageNet 是机器学习社区最流行的图像分类基准数据集,包含超过 1400 万张标注图像。该数据集由斯坦福教授李飞飞等人于 2006 年开始创建,后成为评估计算机视觉模型在下游视觉任务中能力的试金石。然而 ImageNet 并不完美,其标签存在大量噪声。近期多项研究表明,该数据集中许多样本包含多个类别,而 ImageNet 本身是一个单标签基准数据集。一些研究者提出将 ImageNet 转换为多标签任务评估基准,但是可能是由于标注成本过高,他们并未修复训练集。在近日发布的一篇论文中,来自韩国 NAVER AI LAB 的研究者认为,在应用了随机剪裁的训练设置下,单标签标注和高效多标签图像之间的不匹配带来了同等问题。在使用单标签标注时,图像随机剪裁可能包含与真值完全不同的对象,为训练带来噪声甚至不准确的监督信号。为此,这些研究者决定使用多标签对 ImageNet 训练集进行重新标注:他们在额外的数据源上训练了一个强大的图像分类器,使用其生成多标签,解决了标注成本问题;在最终池化层之前使用像素级多标签预测,以充分利用额外的位置特定监督信号。原始 ImageNet 标签(左上)与本文 ReLabel 标注器的效果对比。基于重新标注样本的训练可以全面提升模型性能。例如,使用该研究提出的局部多标签后,ResNet-50 在 ImageNet 上的 top-1 分类准确率达到 78.9%,使用 CutMix 正则化后还可以进一步提升至 80.2%。实验表明,使用局部多标签训练的模型在迁移至目标检测和实例分割任务以及多种稳健性基准时,性能优于基线方法。此外,研究者还开源了重新标注的 ImageNet 训练集、预训练权重和源代码。论文地址:https://arxiv.org/pdf/2101.05022.pdfGitHub 地址:https://github.com/naver-ai/relabel_imagenet方法这项研究提出了一种重新标注(re-labelling)策略 ReLabel,以在 ImageNet 训练集上获得像素级真值标签。标签映射((label map))具有两个特征:多类别标签和局部标签。研究者使用机器标注器(machine annotator)获得标签映射,该标注器是在额外源数据上训练的 SOTA 图像分类器。研究者介绍了如何获得标签映射,并提出了一个新颖的训练框架 LabelPooling,以使用这类局部多标签训练图像分类器。重新标注 ImageNet研究者从机器标注器中获得密集真值标签,从这类模型中获得的预测可能接近于人类预测。由于训练机器标注器需要访问专有训练数据并在 GPU 或 TPU 上训练数百天,所以研究者采用开源训练权重作为机器标注器。机器标注器如下图 4 所示:研究者注意到,尽管机器标注器在 ImageNet 上使用单标签监督(softmax 交叉熵损失)进行训练,但它们仍然倾向于对多类别图像进行多标签预测。所以,如果数据集中存在大量的标签噪声,则利用单标签交叉熵损失训练的模型倾向于预测多标签输出。此外,利用分类器获取标签还有一个好处:提取位置特定的标签。研究者移除了分类器的全局平均池化层,并将接下来的线性层转化为 1×1 的卷积层,从而将该分类器转化为一个全卷积网络。然后,模型的输出成为 f(x) ∈ R^W×H×C。研究者将该输出 f(x) 作为标签映射标注 L ∈ R^W×H×C。利用密集多标签训练分类器在获得上述密集多标签 L ∈ R^W×H×C 之后,接下来需要考虑如何利用它们训练分类器。对此,研究者提出了一种新颖的训练方案 LabelPooling,它将局部真值考虑了进来。下图 3 展示了 LabelPooling 和原始 ImageNet 训练之间的区别:在标准 ImageNet 训练设置下,随机剪裁的监督信号来自于每张图像的单标签真值。另一方面,LabelPooling 会加载预计算的标签映射,并在标签映射上执行与随机剪裁坐标相对应的区域池化操作。研究者采用了 RoIAlign 区域池化方法。此外,研究者在池化预测图上执行全局平均池化和 softmax 操作,以获得多标签真值向量。最后,研究者使用了交叉熵损失。ReLabel 的伪代码。实验ImageNet 分类为了验证 ReLabel 的效果,研究者使用不同的网络架构和评估指标(包括近期提出的多标签评估指标)执行 ImageNet 分类任务。他们在包含 128 万训练图像和 5 万验证图像的 ImageNet-1K 基准上评估 ReLabel 策略。对于所有模型,他们均使用标准数据增强技术,如随机剪裁、翻转、色彩抖动。与其他标签操纵方法的对比:研究者对比了 ReLabel 与之前那些直接调整 ImageNet 标签的方法,使用的模型是 ResNet50。结果参见下表 3:在不同网络架构上的结果:研究者使用 ReLabel 训练了多个不同架构(包括 ResNet-18、ResNet101、EfficientNet-{B0,B1,B2,B3}、ReXNet),表明 ReLabel 可用于具备不同训练机制的多种网络。下表 4 展示了实验结果,从中可以看出,ReLabel 持续提升不同网络架构的性能,例如将 EfficientNet-B3 的准确率从 81.7% 提升至 82.5%。SOTA 性能:ReLabel 对实现最优性能的其他训练技巧起到补充作用,例如将 CutMix 正则化与 ReLabel 结合起来。研究者在随机剪裁图像上执行 CutMix,然后根据 CutMix 算法将池化标签进行混合。实验结果参见下表 5:ReLabel + CutMix 在以 ResNet-50 和 ResNet-101 作为主干模型的情况下,均取得了 SOTA ImageNet top-1 准确率。迁移学习研究者还检验了 ReLabel 带来的 ImageNet 性能改进能否迁移至不同的下游任务,展示了在五个细粒度分类任务、目标检测与实例分割任务上的结果。细粒度分类任务:研究者在五个细粒度分类任务(Food-101、Stanford Cars、DTD、FGVC Aircraft 和 Oxford Pets)上评估了使用 ReLabel 预训练的 ResNet-50 的性能。实验结果参见下表 8:目标检测与实例分割:研究者分别使用具备特征金字塔网络的 Faster-RCNN 和 Mask-RCNN 作为目标检测和实例分割任务的 base 模型。Faster-RCNN 和 Mask-RCNN 的主干网络基于 ReLabel 预训练的 ResNet-50 模型进行初始化,然后使用原始训练策略在 COCO 数据集上进行微调。实验结果参见下表 9:多标签分类多标签训练常用随机剪裁作为数据增强方式,在这种情况下,ReLabel 和 LabelPooling 可以提供额外的局部监督信号,帮助改善原始多标签训练集。研究者使用多标签分类数据集 COCO 进行实验,然后使用基于标签映射的 LabelPooling 训练多标签分类器。下表 10 展示了实验结果:使用 ReLabel 和机器生成的标签地图后,ResNet-50 和 ResNet-101 的 mAP 分别增长了 3.7 pp 和 2.4 pp;使用 oracle 标签地图后,二者的 mAP 分别增长了 4.2 pp 和 4.3 pp。
-
这门课聚焦生成建模技术的理论和数学基础,探讨多种生成模型技术。在概率统计理论中,生成模型是指能够随机生成观测数据的模型,尤其是在给定某些隐含参数的条件下。它能够给观测值和标注数据序列指定一个联合概率分布。在机器学习中,生成模型可用来直接对数据建模(例如根据某个变量的概率密度函数进行数据采样),也可以用来建立变量间的条件概率分布。 生成模型是最近较为活跃的研究领域,从事机器学习研究的人有必要了解这一研究主题。去年秋季,华盛顿大学开设了一门主题为「生成模型」的课程 CSE 599,探讨了多种生成模型相关技术。课程地址:https://courses.cs.washington.edu/courses/cse599i/20au/这门课与当前的生成模型研究紧密相关,并提供了阅读该领域近期进展相关论文所需的背景知识。课程聚焦生成建模技术的理论和数学基础,学生在开始本课程前最好了解机器学习领域的基础概念。该课程于 2020 年 9 月 30 日开始,12 月 7 日结课。目前已放出课程讲义和 slide,每节课还提供额外的补充阅读材料。CSE 599 课程表部分截图。课程主题这门课程涉及以下主题:自回归模型NADE 框架RNN/LSTM 和 Transformer变分自编码器(VAE)高斯 VAEConvNet 与 ResNet后验崩溃离散式 VAE生成对抗网络f-GANWasserstein GANGenerative Sinkhorn Modeling生成流自回归流可逆网络神经常微分方程基于能量的模型Stein 方法与评分匹配郎格文动力学与扩散 具备类似主题的课程还有斯坦福大学开设的 CS236(深度生成模型)课程和加州大学伯克利分校的 CS294-158(深度无监督学习)课程。感兴趣的读者可以多了解这两门课。讲师简介课程主讲人 John Thickstun 本科毕业于布朗大学应用数学专业,目前在华盛顿大学计算机科学与工程系攻读博士学位。目前的研究兴趣包括生成模型、采样、时序,及其在音乐领域的应用,多篇论文发表在 EMNLP、ICML、ISMIR、ICLR 等学术会议上。个人主页:http://homes.cs.washington.edu/~thickstn/本文分享:https://www.jiqizhixin.com/articles/2021-01-29
-
全球人工智能领域的顶级学术会议AAAI 2021将于2月2日-9日在线上召开。论文录用结果显示,华为云的7篇AI科研成果被收录。华为云被接收的研究涉及联邦学习、深度学习、机器学习、自然语言处理、迁移学习、知识计算等技术领域,充分展现了华为云在人工智能领域的基础研究实力。技术创新和应用落地是这些论文的亮点,相关技术目前已在油气勘探、药物研发、AI 开发、智能交通等业务场景下规模化落地,加速行业智能升级。 AAAI 每年评审并收录来自全球最顶尖的人工智能领域学术论文,代表全球 AI 技术的趋势和未来。以下是华为云此次入选 7 篇论文介绍:论文一:业界首创自分组个性化联邦学习框架,并已落地华为云 ModelArts论文标题:《非独立同分布下的自分组个性化联邦学习》(Personalized Cross-Silo Federated Learning on Non-IID Data) 论文地址:https://arxiv.org/abs/2007.03797联邦学习机制以其独有的隐私保护机制受到很多拥有高质数据的大客户青睐。但是,各大客户的数据分布非常不一致,对模型的需求也不尽相同,这些在很大程度上制约了传统联邦学习方法的性能和应用范围。华为云自研 FedAMP 联邦学习框架使用独特的自适应分组学习机制(如图一)让拥有相似数据分布的客户进行更多合作,并对每个客户的模型进行个性化定制,从而有效处理普遍存在的数据分布不一致问题,并大幅度提高联邦学习性能。通过与中国科学院上海药物所在 AI 药物联邦学习上的合作,FedAMP 优质的性能获得了蒋华良院士的高度认可,并在中国医药创新与投资大会上吸引了众多医疗制药厂商洽谈合作。 图 1 FedAMP 联邦学习框架论文二: 首次提出利用物理信息深度学习的框架将二阶交通理论模型融合到神经网络中,以高效解决交通态的估值的问题:(Physics-Informed Deep Learning for Traffic State Estimation: A Hybrid Paradigm Informed By Second-Order Traffic Models)交通态的估值需要解决如何使用稀疏的传感器(如传感线圈,浮动车)数据将整条道路的交通态(如速度,流量,密度)完整地估计出来。这对算法的数据效率有着非常高的要求,而传统的纯交通模型和纯机器学习的解决方案的效果均不理想。针对这些问题,本论文提出了基于物理信息深度学习框架,通过对激励函数和连接权重的特殊设计,将复杂的二阶交通模型编码到神经网络中去(图二 - a),让神经网络在高阶交通理论的约束下进行训练。具体方法是,使用传统神经网络进行交通态的估值,然后将估值进一步输入到物理信息神经网络中去,计算出该估值的理论余量来量化偏移交通理论的程度。这个理论余量为估值网络的训练提供了重要的正则化信息,大大提高了估值模型的训练效率和估值精度。如图(图二 - b)所示,本方法可以基于很少的观测数据获得更高的估值准确度。本文是华为员工在哥伦比亚大学深造期间完成的工作。(a) (b) 图 2 编码了二阶交通理论模型的物理信息神经网络与交通态估值结果论文三:使用图卷积网络拟合权值共享神经结构搜索的搜索空间,提升神经结构搜索鲁棒性。(Fitting the Search Space of Weight-sharing NAS with Graph Convolutional Networks)论文地址:https://arxiv.org/pdf/2004.08423.pdf权值共享的神经结构搜索通过训练一个包含所有分支的超网络来复用不同操作上的计算量,以子网络采样的方式评估网络结构,大幅度提高了搜索速度。然而,这种子网络采样的方式并不能保证子网络的评估性能准确反映其真实属性。本文认为产生这一现象的原因是使用共享权值构建子网络的过程中产生了权值失配,使得评估性能中混入了一个随机噪声项。本论文提出使用一个图卷积网络来拟合采样子网络的评估性能,从而将这个随机噪声的影响降至最低。实验结果表明,使用本方案后,子网络的拟合性能与真实性能间的排序相关性得到有效提高,最终搜索得到的网络结构性能也更加优异。此外,本方案通过图卷积网络拟合了整个搜索空间中子网络的评估性能,因此可以很方便地选取符合不同硬件约束的网络结构。 图 3 总体框架示意图论文四:首次提出基于多轮阅读理解的框架解决实体链接问题实体链接是将文本中提到的实体链接到知识库中对应实体的任务,目的是解决实体存在的歧义性问题,但由于名称的变化和实体的模糊性,此任务十分具有挑战性,尤其是短文本的实体链接,由于句子长度短,在链接过程中,每个待消歧的实体能利用的上下文信息非常有限。针对这个任务,本论文提出了一个多项选择阅读理解的框架,为句子中每个待消歧的实体分别生成一个问题,并将知识库中的候选实体转换成候选答案集,通过这样一个设计,实体链接转换为了一个阅读理解的问题(图 1 Local 部分)。在选择正确答案的过程中,待消歧实体的上下文信息与知识库中的候选实体之间获得了充分的交互,同时多个候选实体间的区别也得到了潜在地考虑。为了进一步捕捉句子内待消歧实体间的主题一致性来提高链接的准确率,本文采用了多轮阅读理解的方式以序列去处理多个待消歧的实体(图 1 Global 部分),为句子内多个实体的消歧提供了更丰富的信息。另外,为了解决短文本中常见的不可链接问题(即知识库中没有对应的实体),本文额外设计了一个两阶段的验证机制来判断实体是否可被链接。本论文提出的方法在多个中英文数据集上均取得了目前最优的实体链接效果。 图 4 基于多轮阅读理解的实体链接框架论文五:首次提出基于多尺度地质知识迁移的跨区块油气储集层分类算法,利用迁移学习提升跨区块油气储集层分类效果。(Cross-Oilfield Reservoir Classification via Multi-Scale Sensor Knowledge Transfer)油气储集层分类是油气勘探中的一个关键步骤(如图一所示),自动准确的油气储集层分类方法不仅可以降低油气行业专家的工作负担,也可以帮助油气勘探公司做出最优的开采决策。当前已有的油气储集层分类主要关注在单一区块上的分类效果,但是在新区块上应用效果却不尽如人意。因此,如何迁移地层特征从而实现跨区块也能准确分类是一个富有挑战的任务。本论文首次提出了一种多尺度传感器抽取方法从多元测井记录中抽取地质特征的多尺度表示,然后设计了一种 encoder-decoder 模块来充分利用目标和源区块的特有特征,最后通过一个知识迁移模块来学习特征不变性表示,从而将地质知识从源区块迁移到目标区块。真实油气数据上的实验结果表明本论文精心设计的迁移学习方法,可以提升分类模型在新区块上的分类表现,相较于基线算法可以有 %6.1 的效果提升。 图 5 油气勘探工作流论文六:首次提供基于超几何分布的概率模型,用于解决远程监督命名实体识别中的去噪问题。(Denoising Distantly Supervised Named Entity Recognition via a Hypergeometric Probabilistic Model)远程监督是一种常见的机器学习范式,可以降低对标注数据的依赖。但是远程监督往往会引入噪声,从而影响学习效果。对于基于远程监督的命名实体识别(NER)来说,如何有效去噪就是一个十分重要的问题。以往的去噪方法主要基于实例层次的统计结果,往往忽略了不同数据集不同实体类型之间噪声分布的差异性,从而导致这些方法何难适用于高噪声比例的设定。本论文提出了一种基于超几何分布的学习方法,同时考虑噪声分布和实例层次的置信度。具体而言,我们将每个训练 batch 里面噪声样本的数量建模成一个由噪声比例决定的超几何分布,这样一来每个实例都可以通过上一轮训练获得的置信度来决定是噪声还是正确样本。实验结果表明本论文提出的方法可以有效去除远程监督范式引入的噪声,显著提升 NER 的效果。 该工作由华为云团队与中科院软件所合作完成。论文七:提出基于对抗学习与相似性增强的域泛化训练新框架,在域泛化行人再识别领域创下新纪录 (Dual Distribution Alignment Network for Generalizable Person Re-Identification)域泛化是一种适用于现实应用场景的机器学习范式,对于行人再识别问题,域泛化是指在大规模多源数据上进行模型训练,期望模型在任意未知的场景中都能够直接适用。现实应用中,大规模训练数据往往难以收集,域泛化方法正是一个使得模型能够低成本快速部署的优秀方案。以往的方法对域间的巨大差异缺乏有效的处理手段,同时忽略了域间样本可能的相似性信息。在数据域层面,本论文提出了新的对抗学习方法,通过减少中心域与外围域的差异,实现了域间差异的有效消除;在样本层面,本论文通过增强来自不同域的相似样本之间的相似性,进一步对齐来自不同域的样本特征分布。在这两个方面的共同作用下,本论文的双重分布对齐网络实现了新的性能突破。实验表明,所提方法在公共测试基准数据集上取得了当前最好的结果。该工作由华为云团队与厦门大学合作完成。 图 7 针对域泛化行人再识别问题的双重分布对齐网络示意图为了更好地赋能产业升级,华为云持续深耕 AI 基础研究和落地应用,打造更懂世界的 AI。2020 年以来,华为云 EI 研究团队已在图像分类、弱标注场景下的图像分类、图像检测,多模态数据处理、语音语义等领域取得多项世界第一。未来,华为云将持续把 AI 前沿算法产品化,并开放给各行业的 AI 开发者使用,通过技术创新驱动产业智能升级。
-
一篇关于贝叶斯统计与建模的综述文章,出现在了 Nature 新子刊 Nature Reviews Methods Primers 的第一期上。新年伊始,Nature 旗下再添三本新刊:Nature Aging(《自然 - 老龄化》)、Nature Computational Science(《自然 - 计算科学》)和 Nature Reviews Methods Primers(《自然综述 - 方法导论》)。其中 Nature Reviews Methods Primers 以刊发综述文章的形式为读者提供各种科学方法的概述及其在不同研究问题上的应用,每周出版一次。期刊上的所有文章都将采取约稿形式,涵盖生命科学和物理科学中使用的分析、应用、统计、理论和计算方法。1 月 14 日,Nature Reviews Methods Primers 上线第一期,刊登了一篇关于贝叶斯统计与建模的综述文章,作者来自荷兰乌得勒支大学、加州大学默塞德分校、爱丁堡大学、牛津大学、乔治城大学、莱斯大学、哥伦比亚大学、艾伦 · 图灵研究所等机构。这篇文章描述了贝叶斯分析的各个阶段,从指定先验和数据模型,到推断、模型检验与改进,探讨了先验和后验预测检验的重要性,选择恰当的技术从后验分布、变分推断和变量选择中采样。此外,这篇文章还提供了贝叶斯分析在多个研究领域的成功应用示例,包括社会科学、生态学、遗传学、医学等,并提出了可复现性策略和报告标准,概述了更新版的 WAMBS(何时需要担心误用贝叶斯统计以及如何避免)检查表。最后,这篇文章介绍了贝叶斯分析对人工智能的影响。贝叶斯统计简介贝叶斯统计是基于贝叶斯定理的数据分析和参数估计方法,其独特性在于统计模型中的观测和未观测参数是基于联合概率分布的,即先验分布和数据分布。典型的贝叶斯工作流程包括三个主要步骤(参见下图 1):通过先验分布捕捉统计模型中给定参数的可用知识,这通常是在数据收集之前确定的;利用观测数据中可用参数的信息确定似然函数;利用贝叶斯定理结合先验分布和似然函数,得到后验分布。后验分布用观测数据来平衡先验知识,从而反映更新的知识,可用于执行推断。在对该联合概率分布取平均时,贝叶斯推断是最优的,对这些定量的推断基于观测数据的条件分布。图 1:贝叶斯研究阶段。a. 标准研究流程;b. 利用贝叶斯统计的研究工作流程。(注:图中后验的表示 p(y|θ) 应为 p(θ|y))贝叶斯统计的基础最初出现在 Reverend Thomas Bayes 的文章中,后来由贝叶斯的朋友 Richard Price 在 1763 年发表了这篇文章,主要关于逆概率,即如何仅基于过去的事件确定未来事件发生的概率。1825 年,Pierre Simon Laplace 重新发现了贝叶斯公式,也就是今天我们所说的贝叶斯定理。逆概率与贝叶斯定理在数学领域中长期存在,但直到最近 50 年,这些工具才在应用统计学领域中崛起。贝叶斯定理。(来源:https://zh.wikipedia.org/zh-hans/%E8%B4%9D%E5%8F%B6%E6%96%AF%E5%AE%9A%E7%90%86)贝叶斯工作流程贝叶斯工作流程的前两个步骤如上图 1 所示。首先确定先验分布,先验的选择通常被视为研究者在实现贝叶斯模型时要做的一个更重要的选择,因为它对最终结果影响巨大。要实现合适的先验,需要用到先验预测检验流程。然后是确定似然函数,将似然函数结合先验得到后验分布(或后验)。先验和似然函数对于确定后验分布非常重要。这篇文章提供了多个示例来展示整个流程。第一个示例是关于博士延毕的。研究者询问 333 名博士生完成博士论文所需的时间,进而计算延迟时间,即计划时间与实际时间的差距(时间单位为月)。先验分布首先需要形式化先验分布。先验分布在贝叶斯统计中起到决定性作用。下图 2 展示了该示例中似然函数、先验分布和后验分布的关系:图 2:贝叶斯定理重要组件图示。先验预测检验 由于基于贝叶斯分析的推断受限于先验的「正确性」(correctness),因此我们需要审慎地检验指定模型是否能够生成实际数据。这部分通过先验预测检验过程来完成。先验预测检验有助于避免模型错误指定(参见下图 3),例如对比错误地用精度替代方差时的先验预测分布(图 3a)和基于正确超参数的分布(图 3b)。此外,这里还展示了观测数据和模拟数据的核密度估计,即对概率密度函数的估计结果(图 3c)。图 3:博士延毕示例中的先验预测检验。确定似然函数似然函数在贝叶斯推断和频率学派推断中都有应用。在两种推断范式下,似然函数的作用都是将观测数据的概率表示为未知参数。在一些案例中,指定似然函数是非常直接的,例如投掷一枚硬币的实验。似然函数的硬币实验示例。(来源:https://zh.wikipedia.org/wiki/%E4%BC%BC%E7%84%B6%E5%87%BD%E6%95%B0)后验分布指定先验和似然函数,并收集数据之后,就可以得到后验分布。本文解释了如何将模型与数据拟合来获取后验分布、如何选择变量,以及为什么需要后验预测检验。模型构建是一个迭代的过程,任何贝叶斯模型都可以看做是一个占位符,可以在面对新数据或对现有数据拟合不足时进行改进,也可以仅通过模型改进( model refinement)过程来实现。在贝叶斯推断中,模型拟合的一种不错方法是马尔可夫链蒙特卡罗方法(MCMC)。MCMC 能够利用计算机模拟间接获取对后验分布的推断,下表 1 概述了基于 MCMC 和不基于 MCMC 的采样技术。表 1:基于 MCMC 和不基于 MCMC 的采样技术概览。下图展示了在博士延毕示例中使用 MCMC 方法的后验估计情况:此外,实现贝叶斯分析有很多标准计算包,参见下表 2:表 2:常用的开源贝叶斯软件程序包。后验预测检验获取特定模型的后验分布后,我们可以用它模拟基于这一分布的新数据,这有助于评估模型是否提供有效预测,对未来事件进行推断。这些模拟可用于多种目的,比如通过对比观测数据和模拟数据的核密度估计值来检验模拟数据是否类似于观测数据。在评估模型是否与数据生成机制有不错的拟合时需要更正式的后验预测检验方法。任何参数依赖的统计或差异都可用于后验预测检验。这与先验预测检验的使用方式类似,但在对比观测数据和模拟数据时要更加严苛。为了阐释后验预测分布的用法,本文展示了另一个示例:了解一个维基百科网页的浏览量,以及与浏览量相关的时间关联因素。图 6:基于当前观测数据进行后验预测检验和对未来页面浏览量进行预测。应用贝叶斯推断在多个科学领域得到了广泛应用,本文重点介绍了其在「社会和行为科学」、「生态学」和「遗传学」领域的应用,此处不再展开介绍。可复现性与数据处理恰当的统计信息报告(包括数据和脚本共享)对于研究的验证和可复现是关键因素。优秀的研究实践鼓励可复现性,其工作流程参见下图 7:图 7:研究工作流程中的可复现性因素。这里展示了贝叶斯研究阶段(图 1)和 WAMBS 检查表在更广泛的研究透明度中的应用,并提供了更新版的 WAMBS 检查表。WAMBS 检查表更新版。对人工智能的影响出于支持大规模应用的需要,贝叶斯概念已经利用了以深度学习为中心的新技术的发展,包括深度学习框架(TensorFlow、Pytorch),创建表示能力更强、数据驱动的模型。除了提供一个强大的工具来挑选灵活、模块化的生成模型之外,DNN 已被用于开发新的近似推理方法,并为贝叶斯实践提出了一种新的范式,该范式将统计建模和计算融入了其核心之中。一个典型的例子就是变分自编码器,它已经成功地应用于多个领域,比如单细胞基因组学,为这些领域提供一个通用的建模框架。该框架带来了很多扩展,包括 latent factor disentanglement。底层的统计模型是一个简单的贝叶斯分层潜变量模型,将高维观测值映射到通过 DNN 定义的函数假定正态分布的低维潜变量。变分推断被用于近似潜变量的后验分布。然而,在标准变分推断中,我们为每个潜变量引入一个局部变分参数,在这种情况下,计算需求将随着数据样本的数量的变化呈线性增长。变分自编码器使用一种名为 amortization 的近似过程,用一个单一全局参数集(一种识别网络)取代对许多单个变分参数的推断。该识别网络用于参数化 DNN,输出每个数据点的局部变分参数。值得注意的是,当把模型和推断结合到一起并解释时,作为编解码算法的变分自编码器有一种优雅的解释:它由一个概率编码器和一个概率解码器组成。概率编码器是一个 DNN,可以将每个观测数据映射至潜在空间中的分布;而概率解码器是一个补充性的 DNN,将潜在空间中的每个点映射至观测空间中的分布。因此,模型指定和推断与变分自编码器产生关联,这表明贝叶斯建模和深度学习技术之间的边界越发模糊。其他近期的例子还包括使用 DNN 来构建概率模型,通过应用一系列逆变换来构建复杂的概率分布,以及针对可交换序列数据定义模型。DNN 的表达能力及其在模型构建和推断算法中的应用需要作出一些妥协,而这需要贝叶斯研究。将模型与推断融合的趋势使得这些技术更多地应用于大规模数据问题,但是基础的贝叶斯概念仍然被完全纳入该范式中。尽管将贝叶斯方法应用于神经网络学习已经出现数十年了,但要想理解先验如何转换为特定的函数特性,我们仍需要进一步研究涉及复杂网络结构的现代贝叶斯深度学习模型的先验指定。最近人工智能领域的争论提到了对贝叶斯方法及其替代方法的需求。例如,深度集成被证明在处理模型不确定性时可作为贝叶斯方法的替代方法。但是,近期研究还表明深度集成实际上可以理解为近似贝叶斯模型平均。类似地,dropout 是一种在 DNN 训练过程中广泛使用的正则化方法,它通过在网络训练过程中随机丢弃节点来提升模型鲁棒性。实验表明,dropout 能够提升泛化性、降低过拟合。针对 dropout 也出现了贝叶斯解释:概率模型的贝叶斯近似形式——深度高斯过程。尽管贝叶斯定理并未完全泛化至人工智能领域的所有近期进展中,但贝叶斯思维被深深地嵌入了大量近期创新研究,这无疑是一种成功。下一个十年将出现新的浪潮——贝叶斯智能的创新性发展。关于贝叶斯统计,你还可以阅读这篇文章这篇文章一经发布就引起了广泛关注,但也存在一些瑕疵。例如,知名科学科普博主 @光头怪博士 指出了图 1 中的后验表示错误,并推荐了另一篇他认为不错的文章。这篇论文对 MCMC 方法进行了基础介绍,对 MCMC 方法试图解决的问题、为什么使用,以及 MCMC 方法在理论和实践中的工作原理提供了强大的概念性理解。论文链接:https://arxiv.org/pdf/1909.12313.pdf原文链接:https://www.nature.com/articles/s43586-020-00001-2
-
周志华等人一直在推动的深度森林,是探索神经网络以外 AI 领域重要的研究方向之一,在表格数据建模任务中已初现锋芒。但是,由于基于决策树的集成模型在具体实现当中,经常会遇到内存不足,硬件效率不如神经网络等问题,是推动其大规模应用的主要瓶颈之一。经过 LAMDA 徐轶轩等人的不懈努力,2021 年 2 月 1 日,新的深度森林软件包 DF21 在 GitHub 与开源中国同时开源了。该软件包尝试解决了这一方向在上述实际应用过程中所遇到的关键问题,未来在各类在数据建模过程中,我们也可以便捷地使用深度森林了。据介绍,该项目目前主要由南大徐轶轩进行开发和维护,在正式发布之前它已经在 LAMDA 内部经过测试和使用。· 项目地址:http://www.lamda.nju.edu.cn/deep-forest/· Gitee 地址:https://gitee.com/lamda-nju/deep-forest· Github 地址:https://github.com/LAMDA-NJU/Deep-Forest针对这一开源项目,深度森林参与者之一(现任创新工场南京 AI 研究院执行院长,倍漾资本创始人)冯霁博士告诉机器之心,「深度森林在表格数据建模上,相对传统算法效果显著,但是之前开源的代码主要用于算法验证,以及辅助其他科研工作者进行深度森林算法相关的研究,代码本身对内存和服务器性能要求较高。徐同学开源的这一版更为简单易用,做了很好的封装,同时进行了高性能优化,大幅降低了内存依赖,对于科研和实际落地应用都是很好的工具。」此外,针对深度森林固有的内存消耗、只能用 CPU 训练等问题,徐轶轩告诉机器之心,「这个模型的全名是:DF21: A Practical Deep Forest for Tabular Datasets。内存消耗是 DF21 主要解决的问题——此前的 gcForest 在处理百万级别的表格型数据集上,占用的内存可能会达到上百 GB。但在新版本中,在千万级别的表格型数据集上进行训练,占用的内存约为原来的十分之一左右。」以下为此开源项目的详细介绍。DF21项目介绍本项目中的 DF21 是深度森林的 2021.2.1 实现版本。深度森林是基于决策树的深度学习模型。使用树模型学习技术(如随机森林、GBDT 等)的应用都可以尝试使用 DF21。它具有以下优势:· 拥有比其他基于决策树的集成学习方法更好的性能· 拥有更少的超参数,并且无需大量的调参· 训练效率高,并且能够处理大规模的数据集安装教程深度森林的最新稳定版本已经发布在 PyPi (https://pypi.org/) 上,可以通过以下命令安装:$ pip install deep-forest关于 Nightly-Build 版本以及如何对源代码进行编译请参考官网的安装说明。使用说明深度森林采用了与 Scikit-Learn (https://scikit-learn.org/stable/) 类似的 API 设计。例如,下面的代码片段展示了在安装完成后,如何将深度森林利用在一个简单的数字分类数据集上:from sklearn.datasets import load_digitsfrom sklearn.model_selection import train_test_splitfrom sklearn.metrics import accuracy_scorefrom deepforest import CascadeForestClassifierX, y = load_digits(return_X_y=True)X_train, X_test, y_train, y_test = train_test_split(X, y, random_state=1)model = CascadeForestClassifier(random_state=1)model.fit(X_train, y_train)y_pred = model.predict(X_test)acc = accuracy_score(y_test, y_pred) * 100print("\nTesting Accuracy: {:.3f} %".format(acc))>>> Testing Accuracy: 98.667 %实验研究者使用 5 种流行的基于决策树的集成学习方法作为 baseline,在所有 baseline 上都保持决策树的数量相同,将其余超参数设置为其默认值。分类精度研究者在所选取的数据集上进行了测试,每个数据集的 SOTA 结果如加粗部分所示,运行时间训练阶段和评估阶段的运行时间。深度森林,机器学习的新方向深度森林的特点在于很少的超参数和自适应复杂度,在不同规模的模型上,深度森林都可以做得很好。近十几年来,深层神经网络的发展在机器学习领域取得了显著进展。通过构建分层或「深层」结构,该模型能够在有监督或无监督的环境下从原始数据中学习良好的表征,这被认为是其成功的关键因素。成功的应用领域包括计算机视觉、语音识别、自然语言处理等。大部分被广泛应用的深度神经网络都使用具有随机梯度下降的反向传播作为训练过程中更新参数的主力。实际上,当模型由可微分量(例如,具有非线性激活函数的加权和)组成时,反向传播似乎仍是当前的最佳选择。其他一些方法如目标传播已经被作为训练神经网络的替代方法被提出,但其效果和普及还处于早期阶段。但一些研究表明,目标传播最多可达到和反向传播一样的效果,并且实际上常常需要额外的反向传播来进行微调。换句话说,老掉牙的反向传播仍然是训练神经网络等可微分学习系统的最好方法。另一方面,探索使用非可微模块来构建多层或深度模型的可能性的需求不仅仅是学界的兴趣所在,其在现实应用上也有很大的潜力。例如,基于树的集成(例如随机森林或梯度提升决策树(GBDT)仍然是多个领域中建模离散或表格数据的主要方式,为此在这类数据上使用树集成来获得分层分布式表征是个很有趣的研究方向。在这样的案例中,由于不能使用链式法则来传播误差,反向传播不再可行。这引发了两个基本的问题:首先,我们是否可以用非可微组件构建多层模型,从而中间层的输出可以被当作分布式表征?其次,如果是这样,如何在没有反向传播的帮助下,联合地训练这种模型?本文的目的就在于提供这种尝试。2017 年,周志华和冯霁等人提出了深度森林框架,这是首次尝试使用树集成来构建多层模型的工作。具体来说,通过引入细粒度的扫描和级联操作(cascading operation),该模型可以构建多层结构,该结构具备适应性模型复杂度,且能够在多种类型的任务上取得有竞争力的性能。研究者们提出的 gcForest 模型利用了集成学习多样性增强的各种策略,然而该方法仅适用于监督学习设置。深度森林的模型框架。同时,该论文仍然不清楚如何利用森林来构建多层模型,并明确地测试其表征学习能力。由于很多之前的研究者认为,多层分布式表征可能是深度神经网络成功的关键,为此我们应该对表征学习进行这样的探索。2018 年,周志华等人又在研究《Multi-Layered Gradient Boosting Decision Trees》中探索了多层的决策树。该工作力求利用两个方面的优势:树集成的出色性能和分层分布式表征的表达能力(主要在神经网络中进行探索)。具体来说,该研究提出了首个多层结构,每层使用梯度提升决策树作为构造块,明确强调其表征学习能力,训练过程可以通过目标传播的变体进行联合优化。在不断努力下,研究人员已经证明了深度森林模型可以在有监督和无监督的环境下进行训练,人们可以使用决策树来获得分层和分布式表征。关于深度森林系列研究才刚刚开始,对于不可微分学习模块的探索,有待更多的科研人员加入。相关资源在相关资源推荐中,作者推荐了深度森林的相关论文与报告:论文:Deep Forest链接:https://arxiv.org/pdf/1702.08835.pdf报告:周志华:An exploration to non-NN deep models based on non-differentiable modules链接:https://aistats.org/aistats2019/0-AISTATS2019-slides-zhi-hua_zhou.pdf在此,我们也附上机器之心先前介绍深度森林的相关内容,以供大家学习。· 9 大数据集、6 大度量指标完胜对手,周志华等提出用深度森林处理多标签学习· 深度森林第三弹:周志华组提出可做表征学习的多层梯度提升决策树· 南京大学提出使用树型集成算法构建自编码器模型:对比 DNN 有更高的准确性和高效性· 从 Boosting 到 Stacking,概览集成学习的方法与性能
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第五期2026/09/04 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;蒋春阳-华为云AI开发者案例开发专家
本期直播内容: AI工具体验营 · 第5-8课连讲。Agent-Team 多智能体协作完成毕业设计实践
回顾中 -
华为云开发者AI素养ClassRoom·第六期2026/09/08 周二 19:00-20:00
樊渊-2026华为软件挑战赛冠军
高手来了:看软挑高手解析二维排样问题—从工业难题到算法突破
回顾中
热门标签