-
超越「预训练-调优」范式经过不断的迭代,虽然当前的 NLP 模型似乎已经达到了最先进的水平,但是 NLP 研究社区的主流观点仍然是:还有一些问题需要改进。由于我们经常使用对比基准来衡量任务的研究进展,我们渐渐遇到了一些棘手的情况,而且这些模型中有许多已经在现有的 NLP 对比基准上超过了人类的表现。那么我们应该怎么办呢?这就是 Zellers等人(https://arxiv.org/pdf/1905.07830.pdf)提出的问题,在早期的工作中,它为常识性的自然语言推理问题提供了一个挑战性的数据集,结果在发布后不就就发现 BERT 已经达到了与人类相近的表现。为了让问题变得更困难一点,作者发布了一个后续的数据集,该数据集使用一种叫做对抗性过滤的技术选择出令 BERT 和其它模型难以回答的示例。在这个过程中,他们大大增加了对比基准测试的复杂度。BERT 当然并非完美。Nangia 等人(https://arxiv.org/pdf/1905.10425.pdf)的研究表明,基于 BERT 的模型难以应对低资源(可用数据量较少)的句子分类任务,并提出了一个被称为「SuperGLUE」(https://arxiv.org/pdf/1905.00537.pdf)的后续的自然语言理解对比基准,专门对这种机制进行评价。McCoy 等人(https://arxiv.org/pdf/1902.01007.pdf)的另一项工作则说明了,应用于自然语言推理的 BERT 模型实际上学习到了非常简单的语法启发信息,但这些启发信息不能很好地泛化到其它的推演(entailment)例子中。他们也发布了一个评价数据集,从而确定模型是否采用在采用了这些启发信息后也没能解决更一般的推理问题。Min 和 Wallace 等人(https://arxiv.org/pdf/1906.02900.pdf)的另一篇相关论文说明了,许多针对 HotpotQA 数据集(一个多条问答对比基准)提出的模型,实际上并不需要执行多跳推理来获得良好的性能。总的来说,我认为现在大部分的模型仍然是在针对特定数据集做工作,而不是针对特定任务。我们建立的模型可以非常有效地收集和利用数据集特有的偏差。在这个过程中,我们的评价指标又为我们展示了相当具有误导性的分析结果。这让我想起了「古德哈特定律」 :当一项指标成为目标时,那么他就不再是一个好的指标(一项社会指标或经济指标,一旦成为一个用以指引宏观政策制定的既定目标,那么该指标就会丧失其原本具有的信息价值)。那么,接下来我们该如何做呢?考虑到这些评价对比基准对于自然语言任务发展的重要意义,以及模型开发的速度,假设对比基准一成不变似乎是不合理的。相反,我发现开发一套不断演化的、难度越来越大的对比基准,提高自然语言能力的门槛,是特别有前景的。也许从某种程度上来说,这就是我们实现令机器具有人类级别的自然语言能力的方式。转自,MrBear,https://www.leiphone.com/category/academic/6e0VKaqUCAEhjj0q.html
-
再次思考自然语言生成的评价与假设作为对话系统的从业者,在我看来,自然语言生成任务的复杂性是很棘手的。尤其是,对于研究社区来说,对模型的评价仍然是一个非常富有正义的问题,因此看到研究者们积极地改善现状是十分令人鼓舞的。对于初学者来说,Maxime Peyrard(https://www.aclweb.org/anthology/P19-1502)证明了,在评价特定得分范围内的性能时,某些用于文本自动摘要的自动化的评价指标存在不一致性。Clark 等人(https://homes.cs.washington.edu/~nasmith/papers/clark+celikyilmaz+smith.acl19.pdf)也提出了一种新的基于句子移动相似度(sentence mover’s similarity)的生成文本评价指标,该指标被证明比标准的 ROUGE 指标更符合人类的判断。模型生成的文本往往会出现「事实错误」(factual errors)和「虚假陈述」(spurious statements)的问题。因此,Falke 等人(https://leoribeiro.github.io/papers/acl19-summary-correctness.pdf)研究了是否可以用自然语言推理系统对输出进行重排序,从而解决该问题。他们发现现成的自然语言推理系统并不能适用于下游任务,并提供了一些使这些系统能够达到必要性能的工具。Maxime Peyrard 的更加基础的工作(https://www.aclweb.org/anthology/P19-1101)则在理论上严格地定义了本文自动摘要领域的某些概念(例如,冗余度、相关性、信息量)。除了模型评价,Sankar 等人(https://arxiv.org/abs/1906.01603)的优秀工作对「传统的基于循环神经网络」和「基于 Transformer」的序列到序列(Seq2Seq)的对话模型从对话历史中学到的某些假设提出了质疑。他们特别指出,这些模型对于某些应用于上下文的扰动并不十分敏感,这对目前的自然语言对话生成器提出了挑战。转自,MrBear,https://www.leiphone.com/category/academic/6e0VKaqUCAEhjj0q.html
-
模型的可解释性众所周知,神经网络是一种黑箱模型,因此很难真正理解所学到的决策函数。暂且不考虑完全可以解释这些模型是否是必要的,但我们至少可以认为,对模型内部在某种程度上的理解可以对未来的架构设计产生深远的影响。在本届 ACL 上,也有一些优秀的论文旨在解释一些现有的模型。Serrano 等人(https://arxiv.org/pdf/1906.03731.pdf)的工作向「注意力机制可以突显出模型的重要概念」的普遍看法提出了挑战,他们说明这种观点虽然有时是成立的,但是在有些情况下,其它的排序度量标准可能对于表示出模型的决策过程更加有效。另一方面,Jawahar(https://hal.inria.fr/hal-02131630/document)等人深入探讨了利用 BERT 学到的语言结构,说明了 BERT 的网络层学到了丰富的语言信息(例如,底层网络学习到了表面的语言特征,中间层网络学到了句法特征,顶层网络学到了语义特征)。作者认为,对于学习远距离依赖信息,使用更深的网络层架构是很有必要的。还有许多其它的工作也讨论了模型的可解释性。Gehrmann 等人(https://arxiv.org/pdf/1906.04043.pdf)研发了一种工具,它可以通过可视化预测单词的模型密度,来检测用神经网络生成的虚假文本,使人类用户可以将其检测率提升近 20%。Sydorova 等人(https://arxiv.org/pdf/1906.10924.pdf)在问答系统上研究了许多诸如「LIME」(https://github.com/marcotcr/lime)的事后解释方法,说明某些技术可以帮助人们从多个选项中找出优秀的问答系统模型。转自,MrBear,https://www.leiphone.com/category/academic/6e0VKaqUCAEhjj0q.html
-
NLP是什么?交叉学科: Computer Science,Artificial Intelligence and Computational Linguistics目标:解决计算机和人类((自然)语言的交互问题,尤其是自动处理大规模自然语言语料难点:语言本身复杂、语境相关、抽象概念联想、软硬件技术限制,等等.NLP解决的5个基本问题(摘自李航老师的总结)分类: assigning a label to a string匹配:matching two strings翻译:transforming one string to another·结构化预测:mapping string to structure马氏决策过程:deciding next state given previous state and action自然语言处理(简称NLP),是研究计算机处理人类语言的一门技术,包括:1.句法语义分析:对于给定的句子,进行分词、词性标记、命名实体识别和链接、句法分析、语义角色识别和多义词消歧。2.信息抽取:从给定文本中抽取重要的信息,比如,时间、地点、人物、事件、原因、结果、数字、日期、货币、专有名词等等。通俗说来,就是要了解谁在什么时候、什么原因、对谁、做了什么事、有什么结果。涉及到实体识别、时间抽取、因果关系抽取等关键技术。3.文本挖掘(或者文本数据挖掘):包括文本聚类、分类、信息抽取、摘要、情感分析以及对挖掘的信息和知识的可视化、交互式的表达界面。目前主流的技术都是基于统计机器学习的。4.机器翻译:把输入的源语言文本通过自动翻译获得另外一种语言的文本。根据输入媒介不同,可以细分为文本翻译、语音翻译、手语翻译、图形翻译等。机器翻译从最早的基于规则的方法到二十年前的基于统计的方法,再到今天的基于神经网络(编码-解码)的方法,逐渐形成了一套比较严谨的方法体系。5.信息检索:对大规模的文档进行索引。可简单对文档中的词汇,赋之以不同的权重来建立索引,也可利用1、2、3的技术来建立更加深层的索引。在查询的时候,对输入的查询表达式比如一个检索词或者一个句子进行分析,然后在索引里面查找匹配的候选文档,再根据一个排序机制把候选文档排序,最后输出排序得分最高的文档。6.问答系统: 对一个自然语言表达的问题,由问答系统给出一个精准的答案。需要对自然语言查询语句进行某种程度的语义分析,包括实体链接、关系识别,形成逻辑表达式,然后到知识库中查找可能的候选答案并通过一个排序机制找出最佳的答案。7.对话系统:系统通过一系列的对话,跟用户进行聊天、回答、完成某一项任务。涉及到用户意图理解、通用聊天引擎、问答引擎、对话管理等技术。此外,为了体现上下文相关,要具备多轮对话能力。同时,为了体现个性化,要开发用户画像以及基于用户画像的个性化回复。摘自 国际计算语言学协会(ACL)候任主席、NLP 领域资深研究者、MSRA副院长周明
-
一种新的 NLP 范式:先预训练、再调优正如 Krizhevsky 等人于 2011 年发表的开创性工作「ImageNet Classification with Deep Convolutional Neural Networks」一夜之间掀起了计算机视觉领域的革命,深度学习在自然语言处理领域的应用同样也处于爆炸性的快速增长期。从 2015 到 2017 年,NLP 领域中的大多数任务都可以通过一个相对简单的范式来解决:通过某种连续的向量表征嵌入文本输入,对这些表征进行编码,对编码后的表征应用注意力机制,对任务进行预测。Matthew Honnibal 的博文(https://explosion.ai/blog/deep-learning-formula-nlp)对介绍了这种范式。虽然从概念上说很简单,但「嵌入、编码、注意、预测」的范式似乎在 NLP 领域势不可挡,在所有类型的任务(例如机器翻译、问答系统、自然语言推理等等)上都取得了目前最先进的性能。这样的范式在过去一段时间内,似乎是无所不能的。现在,NLP 领域可谓是「城头变幻大王旗」了。随着强大的预训练表征的出现,一些使用语言建模目标进行训练(例如,ELMO,https://arxiv.org/abs/1802.05365),OpenAI GPT(https://s3-us-west-2.amazonaws.com/openai-assets/research-covers/language-unsupervised/language_understanding_paper.pdf),以及 BERT(https://arxiv.org/pdf/1810.04805.pdf)的 NLP 技术已经可以被直接使用,它们在大规模数据上进行预训练,然后在一些较小的领域内的语料库上针对任务进行调优。实际上,这种策略已经成功地在现有的 NLP 对比基准实验中取得了目前最先进的性能。在本届 ACL 上,这种策略的主导地位被一些已经发表的工作,以及人们对于 NLP 领域研究现状的普遍态度进一步强化了。其中,Dai 和 Yang 等人的工作试图进一步推动基于 Transformer 的超级模型的发展,极大地提升它们的运行速度,实现目前最先进的模型性能。这种新范式的另一个非常具有代表性的工作是 Liu 和 He 等人提出的「Multi-Task Deep Neural Networks for Natural Language Understanding」,他们利用一个基于 BERT 的架构成功登顶 GLUE 对比基准排行榜。(目前排名第3)除了这些工作本身,围绕会议产生的最多的讨论是,如果使用像 BERT这样的训练方法,研究者们之前提出的许多架构可以实现几个百分点的提升。那么问题来了:这种新的范式是否使许多 NLP 领域在建模方面的创新变得不值一提了?针对该问题,我个人持否定态度。总的来说,仍然有很多工作没有得到充分的研究,而这些工作对于推进 NLP 领域在未来的发展是至关重要的。下面,我将列举出其中的一些工作。转自,MrBear,https://www.leiphone.com/category/academic/6e0VKaqUCAEhjj0q.html
-
NLP 的丰富应用自然语言处理领域的研究现状令人欢欣鼓舞,因为我们在该领域开发的模型和工具有解决许多实际问题的潜力。看看本届会议展示的各种各样的 NLP 应用,这一点就愈发明显了。在这个充斥着假新闻和虚假的神经网络新闻的时代,验证陈述的真实性变得越来越重要。Shengli Hu 的工作「Detecting Concealed Information in Text and Speech」(https://www.aclweb.org/anthology/P19-1039)构建了一个利用声学和语言学特征识别文本和语音中的隐藏信息的系统,其性能相较于人类提升了 15%。在健康领域,Shardlow 等人(https://www.aclweb.org/anthology/P19-1037)开发了一种通过特定领域的短语表使得医生编写的临床文书对于患者来说更具可读性的神经网络模型。相关的工作还有,Du 等人(https://arxiv.org/pdf/1906.02239.pdf)提出了根据临床对话提取出疾病症状的任务,并给出了一些对比基线模型,这种手段可以减少初级保健医生花费在与临床文献记录系统交互的时间。今年的 ACL 还专门设立了一个将 NLP 技术应用于生物学问题的研讨会(https://aclweb.org/aclwiki/BioNLP_Workshop)。例如,Fauqueur 等人(https://arxiv.org/pdf/1907.01417.pdf)提出了用于在无需训练数据或手动设计的规则的条件下,从生物医学文献中提取出新的科学事实的技术。Rajagopal 和 Vyas 等人(https://www.aclweb.org/anthology/W19-5009)的另一篇优秀论文,则通过在大规模数据集上训练一个 LSTM-CRF 模型,然后在「低资源」(数据量较少的)语料库上进行调优,从而使语义角色标注系统适用于生物学过程,他们的模型性能在标准数据集上相较于以往的工作提高了 21 个百分点。除此之外,NLP 领域还有一些很酷炫的工作,包括 Zhang 等人的论文「This Email Could Save Your Life: Introducing the Task of Email Subject Line Generation」(https://arxiv.org/abs/1906.03497),他们介绍了电子邮件主题行生成的问题(不妨想一想电子邮件智能回复功能,只不过这里的任务是生成电子邮件的标题),并且针对该问题展示了第一个充满前景的模型,对该模型进行了自动和人工评估。转自,MrBear,https://www.leiphone.com/category/academic/6e0VKaqUCAEhjj0q.html
-
又是收获知识的一个月时间,AI 全栈成长计划第三阶段课程内容已经全部更新完毕。大家积极的学习态度,遇到问题及时在学习群内提出,让AI全栈第三阶段的课程可以顺利完成再次感谢大家:◎积极完成每章的随堂测验打卡,做到了课后的知识强化与巩固;◎认真完成每周读书笔记打卡,将自己的学习心得总结下来;现在,大家迎来了第三阶段考核,让我们来看一下考核的具体内容。在课程《2.1 NLP介绍》中,大家已经学习了自然语言处理(NLP, Natural Language Processing)领域的常见任务,并使用jieba分词工具实践了分词、关键词提取和词性标注三个基础任务。 在课程中已提到分词任务是一项基础工作,分词之后的结果可用于其他NLP任务。本次考核任务将需要同学们利用jieba分词的结果来实现一个生成词云图的任务。▶考核打卡时间:即日起 - 2020.12.13 23:59▶考核途径:按照指导流程,结合零一老师的直播,生成词云图。▶利用Python脚本生成词云图的步骤如下:1、点此链接下载词云图生成脚本,得到gen_wordcloud.ipynb;2、进入到ModelArts Notebook控制台页面,创建一个Notebook并打开,点击upload,将上一步下载的脚本进行上传,上传完成后,点击打开脚本,仔细阅读脚本中开头的“使用说明”;3、该脚本中的txt_path参数是必填的,你必须你自行准备一份文档数据txt(示例:三国演义.txt,如果你的浏览器打开三国演义.txt是乱码,则改成使用IE浏览器打开)文件上传到ModelArts Notebook中,然后将其路径填写到txt_path参数中;4、bg_img_path参数是用来设置掩模图,设置了掩模图之后,生成的词云图就更好看,比如上面用三国演义.txt生成的三足鼎词云图就是用了一张三足鼎的图片做掩模,该参数可选的,不是必填,如果设置为空字符串,生成的词云图则是一张方方正正的图;5、jieba的分词效果会影响词云图的生成效果,如果您觉得词云图生成得不好,可以调整jieba的分词效果,调整方式是使用jieba.load_userdict或jieba.suggest_freq方法;▶打卡要求:在本帖下方回复您的华为云ID,同时截图词云图界面,截图中需清晰显示您的华为云ID,同时与您回复的华为云ID保持一致,如下图所示:华为云ID:hw18853213 只有在按照要求进行打卡才会得到第三阶段考核证书!三个阶段的电子证书可以兑换实体证书哦,具体兑换方式等待三阶段考核结束后小助手在社群里通知~
-
JCJC错别字检测-华为的选择昨天去华为某研发中心做技术支持,看到JCJC错别字检测引擎集成在华为内部的工作流平台中的界面,心里还是挺激动的.创业三年以来,字根科技拒绝诱惑,聚精会神投入资源在一个点上:错别字检测的攻关研发.1000多个日日夜夜的努力中,伴随着枯燥和烦闷;1000多个与合作伙伴交流的日子中,伴随着喜悦和成长;公司创业开始,我们把公司名称选择为"字根",就是表明我们要把精力投入到"自然语言处理" NLP 中,以处理文字为根本,踏踏实实走好每一步.1000多天过去了,1000多个奋斗的过程凝聚成了"JCJC错别字检测"这款核心产品.这是一款"能打"的产品,资源消耗低,处理能力强,行业适用领域广泛.华为,浪潮,招商证券,荣之联,长沙晚报等知名企业的选择是对这款产品的认可,也是对我们鼓足勇气再战下一个1000天的支持.感谢每一个客户,感谢每一个 http://CuoBieZi.net 的用户,感谢过去1000个日日夜夜奋斗在一起的同事们.为梦想,一起加油!田春峰
上滑加载中
推荐直播
-
用码道,让你的AI作品三步上朋友圈2026/08/04 周二 19:00-20:00
林华鼎-华为云AI开发者运营负责人
从入门 · 到做AI应用 · 到企业级开发。不教编程,只教用AI · 零代码、有产出、能带走、可炫耀 · 每课人人动手实操
回顾中 -
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
基于华为云码道,构建你的定制化AI搭子2026/08/14 周五 09:00-11:30
明亮-华为云开发者发展与支持部部长
本期直播将向您全面介绍华为云码道产品,并基于码道手把手教你部署自己的定制化AI陪伴搭子。
回顾中
热门标签