-
python加入字典的代码怎么打啊
-
AI作诗实践已完成,大家加油,很有意义的活动
-
模糊控制概念“模糊”是人类感知万物,获取知识,思维推理,决策实施的重要特征。“模糊”比“清晰”所拥有的信息容量更大,内涵更丰富,更符合客观世界。模糊逻辑控制(Fuzzy Logic Control),简称模糊控制(Fuzzy Control),是以模糊集合论、模糊语言变量和模糊逻辑推理为基础的一种计算机数字控制技术。模糊控制理论是由美国著名的学者加利福尼亚大学教授Zadeh·L·A于1965年首先提出,它是以模糊数学为基础,用语言规则表示方法和先进的计算机技术,由模糊推理进行决策的一种高级控制策。在1968~1973年期间Zadeh·L·A先后提出语言变量、模糊条件语句和模糊算法等概念和方法,使得某些以往只能用自然语言的条件语句形式描述的手动控制规则可采用模糊条件语句形式来描述,从而使这些规则成为在计算机上可以实现的算法。1974年,英国伦敦大学教授Mamdani·E·H研制成功第一个模糊控制器, 并把它应用于锅炉和蒸汽机的控制,在实验室获得成功。这一开拓性的工作标志着模糊控制论的诞生并充分展示了模糊技术的应用前景。模糊控制的基本原理模糊控制是以模糊集合理论、模糊语言及模糊逻辑为基础的控制,它是模糊数学在控制系统中的应用,是一种非线性智能控制。模糊控制是利用人的知识对控制对象进行控制的一种方法,通常用“if条件,then结果”的形式来表现,所以又通俗地称为语言控制。一般用于无法以严密的数学表示的控制对象模型,即可利用人(熟练专家)的经验和知识来很好地控制。因此利用人的智力模糊地进行系统控制的方法就是模糊控制。它的核心部分为模糊控制器。模糊控制器的控制规律由计算机的程序实现,实现一步模糊控制算法的过程是:微机采样获取被控制量的精确值,然后将此量与给定值比较得到误差信号E;一般选误差信号E作为模糊控制器的一个输入量,把E的精确量进行模糊量化变成模糊量,误差E的模糊量可用相应的模糊语言表示;从而得到误差E的模糊语言集合的一个子集e(e实际上是一个模糊向量);再由e和模糊控制规则R(模糊关系)根据推理的合成规则进行模糊决策,得到模糊控制量u为:u=eR。式中u为一个模糊量;为了对被控对象施加精确的控制,还需要将模糊量u进行非模糊化处理转换为精确量:得到精确数字量后,经数模转换变为精确的模 拟量送给执行机构,对被控对象进行一步控制;然后,进行第二次采样,完成第二步控制,这样循环下去,就实现了被控对象的模糊控制。
-
嘿嘿嘿我的诗不错吧,
-
AI文字成图识别语言理解,yu'yan'chu'li
-
监督学习—分类与回归方法一样,你选择的结果是偏向于速度还是准确性。如果你在寻找准确性,你不仅可以选择核支持向量机,还可以使用之前提到的其他算法,如神经网络、梯度提升树和随机森林。现在,让我们来介绍一下这个新算法。Kernel Support Vector Machine(核支持向量机)在支持向量机模型中,通常使用核技术来连接线性和非线性。为了理解这一点,有必要知道SVM方法学习如何通过形成决策边界来分离不同的组。但是,当我们在一个维度较高的数据集面前,而且成本昂贵时,建议使用这种核方法。它使我们能够在原始特征空间中工作,而不必在高维空间中计算数据的坐标。它主要用于文本分类问题,因为大多数问题都可以被线性分离。当需要速度的时候,我们需要看看我们要采用的技术是否是可解释的,这意味着它可以解释你的模型中从头到尾发生了什么。在这种情况下,我们可能会使用决策树算法或Logistic回归算法。Logistic Regression(逻辑回归)当因变量是分类的时候,就会使用Logistic回归。通过概率估计,它有助于理解因变量和一个或多个自变量之间的联系。有三种不同类型的Logistic回归。二元逻辑回归,响应只有两个可能的值。多项式Logistic回归,三个或更多的结果,没有顺序。有序逻辑回归,三个或更多的类别,有顺序。逻辑回归算法在酒店预订中被广泛使用,它(通过统计研究)向你展示了你在预订中可能想要的选项,如酒店房间、该地区的一些行程等等。如果你只对问题的输入和输出感兴趣,你可以检查你所处理的数据是否太大。如果数量很大,你可以使用线性支持向量机。Linear Support Vector Machine(线性支持向量机)线性SVM用于线性可分离的数据。它在具有不同变量的数据(线性可分离数据)中工作,这些变量可以用一条简单的直线(线性SVM分类器)来分离。这条直线代表了用户的行为或通过既定问题的结果。由于文本通常是线性可分离的,并且有很多特征,因此线性SVM是用于其分类的最佳选择。在我们的下一个算法中,如果数据量大或者不大,你都可以使用它。Naïve Bayes(朴素贝叶斯)这种算法是基于贝叶斯定理的。它包括通过对象的概率进行预测。它被称为Naïve(朴素),是因为它假设一个特征的出现与其他特征的出现无关。这种方法深受欢迎,因为它甚至可以超越最复杂的分类方法。此外,它构造简单,可迅速建立。由于其易于使用和高效,它被用来做实时决策。与此同时,Gmail使用这种算法来知道一封邮件是否是垃圾邮件。Gmail垃圾邮件检测选择一组词或 "标记" 来识别垃圾邮件(这种方法也用于文本分类,它通常被称为词袋)。接下来,他们使用这些tokens(令牌),将其与垃圾邮件和非垃圾邮件进行比较。最后,使用Naïve Bayes算法,他们计算出该邮件是否是垃圾邮件的概率。
-
【功能模块】UAP或IVR【操作步骤&问题现象】X新建项目,8.15版本,计划与智能服务NLP对接,请提供一下对接方法,如果是IVR对接,请提供一下demo。【截图信息】无【日志信息】(可选,上传日志内容或者附件)无
-
自然语言处理( Natural Language Processing, NLP)是计算机科学领域与人工智能领域中的一个重要方向。它研究能实现人与计算机之间用自然语言进行有效通信的各种理论和方法。自然语言处理是一门融语言学、计算机科学、数学于一体的科学。因此,这一领域的研究将涉及自然语言,即人们日常使用的语言,所以它与语言学的研究有着密切的联系,但又有重要的区别。自然语言处理并不是一般地研究自然语言,而在于研制能有效地实现自然语言通信的计算机系统,特别是其中的软件系统。因而它是计算机科学的一部分自然语言处理的关键技术第一:词法分析,词法分析又分为两个方面,比如词型和词汇。词型一般指的是对单词的前缀,后缀的分析,而词汇主要是对整个词汇系统的控制。第二:句法分析,是大家在输入自然语言进行的一种词汇短语的分析,那么具有什么样的目的,主要是识别句子的句法结构,还可以实现全自动句法分析过程。第三:词义分析,是一种自然语言语义的分析法,词法分析和句子分析,会涉及到各个方面,比如单词,词组,句子以及段落等等。第四:语境分析,是指去查询语篇以外的空隙,还更正解释所要查询语言的技术,指一般的知识,特定领域的知识或者是我们去查询的知识。自然语言处理主要应用于机器翻译、舆情监测、自动摘要、观点提取、文本分类、问题回答、文本语义对比、语音识别、中文OCR等方面
-
最早的自然语言理解方面的研究工作是机器翻译 。1949年,美国人威弗首先提出了机器翻译设计方案 。其发展主要分为三个阶段。早期自然语言处理第一阶段(60~80年代):基于规则来建立词汇、句法语义分析、问答、聊天和机器翻译系统。好处是规则可以利用人类的内省知识,不依赖数据,可以快速起步;问题是覆盖面不足,像个玩具系统,规则管理和可扩展一直没有解决。 统计自然语言处理第二阶段(90年代开始):基于统计的机器学习(ML)开始流行,很多NLP开始用基于统计的方法来做。主要思路是利用带标注的数据,基于人工定义的特征建立机器学习系统,并利用数据经过学习确定机器学习系统的参数。运行时利用这些学习得到的参数,对输入数据进行解码,得到输出。机器翻译、搜索引擎都是利用统计方法获得了成功。神经网络自然语言处理第三阶段(2008年之后):深度学习开始在语音和图像发挥威力。随之,NLP研究者开始把目光转向深度学习。先是把深度学习用于特征计算或者建立一个新的特征,然后在原有的统计学习框架下体验效果。比如,搜索引擎加入了深度学习的检索词和文档的相似度计算,以提升搜索的相关度。自2014年以来,人们尝试直接通过深度学习建模,进行端对端的训练。目前已在机器翻译、问答、阅读理解等领域取得了进展,出现了深度学习的热潮华为云自然语言处理和自然语言处理的方法、难点。视频https://education.huaweicloud.com/courses/course-v1:HuaweiX+CBUCNXE177+Self-paced/courseware/6ca29e8127cb49cd9c1445fd42f96ecd/9fbd741452a34d3993a76d7c463a2a3b/
-
NLP任务可以大致分为词法分析、句法分析、语义分析三个层面。具体的,本文按照单词-】句子】文本做顺序展开,并介绍各个层面的任务及对应技术。本节上半部分的分词、命名实体识别、词向量等等可以视为NLP基础的任务。分词分词是指将文档划分为单个单词的列表。你可能想要删除停用词或为句子中的单个词查找词性标签。为此,你首先需要将句子分成单独的单词。为了分词,你可以使用NLTK库中的word_tokenize()方法来分词。停用词删除停用词是常用的词,例如a、is、am、it、he和she。这些词在训练深度学习算法时可能会也可能不会发挥任何作用,具体取决于手头的任务。有时,停用词会从数据集中完全删除。要删除停用词,你必须首先从NLTK下载停用词列表。接下来,你需要对文本进行分词,然后检查该词是否存在于停用词列表中。如果在停用词列表中找到该词,则忽略该词。否则,将该词添加到不是停用词的词列表中。词干提取和词形还原词干化是指将一个词缩减为其词干形式。例如,计算机、计算和计算这个词的词干是“计算”。要执行词干提取,你可以使用nltk.stem模块中的PorterStemmer。你想要应用词干提取的那个单词会被传递给PorterStemmer对象的stem()函数。词性标注和命名实体识别你经常需要查找句子中单词的词性。例如,你可能想要查找一个词是名词、代词还是人名等。使用NLTK,你可以轻松查找一个词是动词、名词、代词还是任何其他词性。要查找词性和命名实体,你可以使用NLTK模块中的pos_tags功能。你必须将分词后的单词传递给pos_tags函数。这里提供一个例子。文本语义相似度语义相似度是指不同文本文档在意义上的相似度。要查找语义相似性,你可以再次使用SpaCy库。Similarity函数返回的是两个文本之间的语义相似度。该方法返回一个介于0和1之间的值,其中1表示100%的相似性。词义消歧一个词在不同的语境中可以有不同的含义。例如,当你说“I live on a bank of reiver”时,你指的”bank”是河边。如果你说“I withdraw some money from my bank”,那么在这种情况下,bank这个词是指管理资金的地方。在给定上下文中识别单词正确含义的过程就叫做词义消歧。要执行词义消歧,你可以使用 pywsd 库,它代表“Python 词义消歧”。图片来源:https://github.com/aialgorithm/AiPy
-
早在20世纪50年代,随着电子计算机的出现,产生了许多自然语言处理的任务需求,其中最典型的就是机器翻译。当时存在两派不同的自然语言处理方法:**基于规则方法的符号派**和**基于概率方法的随机派**。受限于当时的数据和算力,随机派**无法发挥出全部的功力**,使得符号派的研究略占上风。体现到翻译上,人们认为机器翻译的过程是在解读密码,试图通过查询词典来实现逐词翻译,这种方式产出的翻译效果不佳、难以实用。当时的一些成果包括1959年宾夕法尼亚大学研制成功的TDAP系统(Transformation and Discourse Analysis Project,最早的、完整的英语自动剖析系统)、布朗美国英语语料库的建立等。IBM701计算机进行了世界上第一次机器翻译试验,将几个简单的俄语句子翻译成了英文。在这之后,苏联、英国、日本等国家也陆续进行了机器翻译试验。1966年,美国科学院的语言自动处理咨询委员会(ALPAC)发布了一篇题为《语言与机器》的研究报告,报告全面否定了机器翻译的可行性,认为机器翻译不足以克服现有困难,难以投人使用。这篇报告浇灭了之前的机器翻译热潮,许多国家开始削减这方面的经费投人,许多相关研究被迫暂停,自然语言研究陷人低谷。 许多研究者痛定思痛,意识到两种语言间的差异不仅体现在词汇上,还体现在**句法结构**的差异上,为了提升译文的可读性,应该加强语言模型和语义分析的研究。里程碑事件出现在1976年,加拿大蒙特利尔大学与加拿大联邦政府翻译局联合开发了名为TAUM-METEO的机器翻译系统,提供天气预报服务。这个系统每小时可以翻译6万-30万个词,每天可翻译1000-2000篇气象资料,并能够通过电视、报纸立即公布。在这之后,欧盟、日本也纷纷开始研究多语言机器翻译系统,但并未取得预期的成效。 到了90年代,自然语言处理进人了发展繁荣期。随着计算机的计算速度和存储量大幅增加、**大规模真实文本的积累产生,以及被互联网发展激发出的、以网页搜索为代表的基于自然语言的信息检索和抽取需求出现,人们对自然语言处理的热情空前高涨**。在传统的基于规则的处理技术中,人们引人了更多数据驱动的统计方法,将自然语言处理的研究推向了一个新高度。除了机器翻译之外,网页搜索、语音交互、对话机器人等领域都有自然语言处理的功劳。 进人2010年以后,基于大数据和浅层、深层学习技术,自然语言处理的效果得到了进一步优化。机器翻译的效果进一步提升,出现了专门的智能翻译产品。对话交互能力被应用在客服机器人、智能助手等产品中。 这一时期的一个重要里程碑事件是IBM研发的Watson系统参加**综艺问答**节目Joepardy。比赛中Watson没有联网,但依靠4TB磁盘内200万页结构化和非结构化的信息,成功战胜了人类选手取得冠军,向世界展现了自然语言处理技术的实力。机器翻译方面,谷歌推出的神经网络机器翻译(GNMT)相比传统的基于词组的机器翻译(PBMT),英语到西班牙语的错误率下降了87%,英文到中文的错误率下降了58%,取得了非常强劲的提升。 
-
处理自然语言的关键是要让计算机“理解”自然语言,所以自然语言处理又叫做自然语言理解(NLU,NaturalLanguage Understanding),也称为计算语言学(Computational Linguistics。一方面它是语言信息处理的一个分支,另一方面它是人工智能(AI, Artificial Intelligence)的核心课题之一。分类及国内概况按照技术实现难度的不同,这类系统可以分成简单匹配式、模糊匹配式和段落理解式三种类型。简单匹配式辅导答疑系统主要通过简单的关键字匹配技术来实现对学生提出问题与答案库中相关应答条目的匹配,从而做到自动回答问题或进行相关辅导。模糊匹配式辅导答疑系统则在此基础上増加了同义词和反义词的匹配。这样,即使学生所提问题中按原来的关键字在答案库中找不到直接匹配的答案,但是假若与该关键字同义或反义的词能够匹配则仍可在答案库中找到相关的应答条目。段落理解式辅导答疑系统是最理想的、也是真正智能化的辅导答疑系统(简单匹配式和模糊匹配式,严格说只能称之为“自动辅导答疑系统”而非“智能辅导答疑系统”)。但是由于这种系统涉及自然语言的段落理解,对于汉语来说,这种理解涉及自动分词、词性分析、句法分析和语义分析等NLP领域的多种复杂技术,所以实现难度很大。迄今为止,在国内的网络教学中还没有一个实用化的、能真正实现汉语段落理解的智能辅导答疑系统。但是在我国有些大学的人工智能实验室或中文信息处理实验室中,已有少数研究人员正在研发这类系统的实验原型。相信在不久的将来,就会有这一类的实用性智能系统问世。这是优质网络课程的重要研究方向之一。现实应用领域机器翻译机器翻译因其效率高、成本低满足了全球各国多语言信息快速翻译的需求。机器翻译属于自然语言信息处理的一个分支,能够将一种自然语言自动生成另一种自然语言又无需人类帮助的计算机系统。目前,谷歌翻译、百度翻译、搜狗翻译等人工智能行业巨头推出的翻译平台逐渐凭借其翻译过程的高效性和准确性占据了翻译行业的主导地位。自动问答传统的搜索引擎技术已经不能满足人们越来越高的需求,而自动问答技术成为了解决这一问题的有效手段。自动问答是指利用计算机自动回答用户所提出的问题以满足用户知识需求的任务,在回答用户问题时,首先要正确理解用户所提出的问题,抽取其中关键的信息,在已有的语料库或者知识库中进行检索、匹配,将获取的答案反馈给用户。打击垃圾邮件当前,垃圾邮件过滤器已成为抵御垃圾邮件问题的第一道防线。不过,有许多人在使用电子邮件时遇到过这些问题:不需要的电子邮件仍然被接收,或者重要的电子邮件被过滤掉。事实上,判断一封邮件是否是垃圾邮件,首先用到的方法是“关键词过滤”,如果邮件存在常见的垃圾邮件关键词,就判定为垃圾邮件。但这种方法效果很不理想,一是正常邮件中也可能有这些关键词,非常容易误判,二是将关键词进行变形,就很容易规避关键词过滤。自然语言处理通过分析邮件中的文本内容,能够相对准确地判断邮件是否为垃圾邮件。目前,贝叶斯(Bayesian)垃圾邮件过滤是备受关注的技术之一,它通过学习大量的垃圾邮件和非垃圾邮件,收集邮件中的特征词生成垃圾词库和非垃圾词库,然后根据这些词库的统计频数计算邮件属于垃圾邮件的概率,以此来进行判定。文本情感分析情感分析作为一种常见的自然语言处理方法的应用,可以让我们能够从大量数据中识别和吸收相关信息,而且还可以理解更深层次的含义。比如,企业分析消费者对产品的反馈信息,或者检测在线评论中的差评信息等。信息提取金融市场中的许多重要决策正日益脱离人类的监督和控制。算法交易正变得越来越流行,这是一种完全由技术控制的金融投资形式。但是,这些财务决策中的许多都受到新闻的影响。因此,自然语言处理的一个主要任务是获取这些明文公告,并以一种可被纳入算法交易决策的格式提取相关信息。例如,公司之间合并的消息可能会对交易决策产生重大影响,将合并细节(包括参与者、收购价格)纳入到交易算法中,这或将带来数百万美元的利润影响。内容参考百度百科
-
众所周知,BERT在预训练时会对某些单词进行拆分 (术语叫做“WordPiece”)。比如把“loved”、“loving”和“loves”拆分成“lov”、“ed”、“ing”和”es”。目的是缩减词表、加快训练速度,但这样一来,在某些时候反而会阻碍模型的理解能力。比如把”lossless”分成”loss”和”less”的时候。现在,来自哈工大和腾讯AI Lab的研究人员,尝试利用不做单词拆分的词汇表开发了一个BERT风格的预训练模型——WordBERT。结果,这个WordBERT在完形填空测试和机器阅读理解方面的成绩相比BERT有了很大提高。在其他NLP任务,比如词性标注(POS-Tagging)、组块分析(Chunking)和命名实体识别(NER)中,WordBERT的表现也都优于BERT。由于不用分词,这个WordBERT还可以直接进行中文训练。更值得一提的是,它在性能提升的同时,推理速度并没有变慢。可谓一举多得。NO WordPieces与BERT类似,WordBERT包含两个组件:词向量(word embedding)和Transformer层。和以前的模型一样,WordBERT采用多层双向Transformer来学习语境表示(contextualized representation)。word embedding则是用来获得单词向量表示的参数矩阵,与把单词分成WordPiece的BERT相比,WordBERT的词汇由完整的单词组成。他们用自然语言处理软件包Spacy处理数据,生成了两个词汇表,一个规模为500K,一个为1M。词汇表中还被单独添加了5个特殊单词:[PAD]、[UNK]、 [CLS]、[SEP]和[MASK]。通过不同的词汇表规模、初始化配置和不同语言,最后研究人员一共训练出四个版本的WordBERT:WordBERT-500K、WordBERT-1M、WordBERT-Glove和WordBERT-ZH。它们的配置如上,嵌入参数都是随机初始化的,嵌入维数和基准BERT保持一致。其中WordBERT-Glove用的词汇表是现成的Glove vocabulary,里面包含约190万个未编码的单词,该模型由相应的单词向量(word vectors)在WordBERT之上初始化而来。WordBERT-ZH则是用中文词汇训练出来的WordBERT,它也保持了768的词嵌入维数。性能与速度兼具在测试环节中,完形填空的测试数据集来自CLOTH,它由中学教师设计,通常用来对中国初高中学生进行入学考试。其中既有只需在当前句子中进行推理的简单题,也有需要在全文范围内进行推理的难题。WordBERT-1M获得了最佳成绩,并接近人类水平。它在高中题比BERT高了3.18分,初中题高了2.59分,这说明WordBERT在复杂任务中具有更高的理解和推理能力。在词性标注、组块分析和命名实体识别(NER)等分类任务中,WordBERT的成绩如下:相比来看,它在NER任务上的优势更明显一些(后两列)。研究人员推测,这可能是WordBERT在学习低频词的表征方面有优势,因为命名实体(named entities)往往就是一些不常见的稀有词。对于“中文版”WordBERT-ZH,研究人员在CLUE benchmark上的各种任务中测试其性能。除了BERT,对比模型还包括WoBERT和MarkBERT,这也是两个基于BERT预训练的中文模型。结果,WordBERT-ZH在四项任务中都打败了所有其他对比模型,在全部五项任务上的表现都优于基线BERT,并在TNEWS(分类)、OCNLI(推理)和CSL(关键字识别)任务上取得了3分以上的差距。这说明,基于词的模型对中文也是非常有效的。最后,实验还发现:性能不差的WordBERT,在不同任务上的推理速度也并未“落于下风”。
-
内容的有效界定日常生活中句子间的词汇通常是不会孤立存在的,需要将话语中的所有词语进行相互关联才能够表达出相应的含义,一旦形成特定的句子,词语间就会形成相应的界定关系。如果缺少有效的界定,内容就会变得模棱两可,无法进行有效的理解。例如他背着母亲和姐姐悄悄的出去玩了。这句话中如果不对介词“和”作出界定,就很容易形成母亲和姐姐两个人不知道他出去玩,或者是母亲不知道他和姐姐出去玩。消歧和模糊性词语和句子在不同情况下的运用往往具备多个含义,很容易产生模糊的概念或者是不同的想法,例如高山流水这个词具备多重含义,既可以表示自然环境,也能表达两者间的关系,甚至是形容乐曲的美妙,所以自然语言处理需要根据前后的内容进行界定,从中消除歧义和模糊性,表达出真正的意义。有瑕疵的或不规范的输入例如语音处理时遇到外国口音或地方口音,或者在文本的处理中处理拼写,语法或者光学字符识别(OCR)的错误。语言行为与计划句子常常并不只是字面上的意思;例如,“你能把盐递过来吗”,一个好的回答应当是把盐递过去;在大多数上下文环境中,“能”将是糟糕的回答,虽说回答“不”或者“太远了我拿不到”也是可以接受的。
-
虽然 1.3B 的 InstructGPT 在参数量上还不及 GPT-3 的百分之一,但它的表现可比 GPT-3 讨人喜欢多了。给定一些示例作为输入,GPT-3 等大型语言模型可以根据这些「提示(prompt)」去完成一系列自然语言处理任务。然而,它们有时会表现出一些出人意料的行为,如编造事实、生成有偏见或有害的文本,或者根本不遵循用户的指示。比如在下面这个例子中,用户给出的指示是:「用几句话向一个 6 岁的孩子解释一下登月」,GPT-3 的的输出显然是不着边际。 这是因为,GPT-3 被训练成基于互联网文本的大数据集预测下一个单词,而不是安全地执行用户想要它执行的语言任务。换句话说,这些模型的输出与用户的意图并不一致。对于在数百个应用中部署和使用的语言模型来说,避免这些意想不到的行为尤其重要。 通过训练语言模型按照用户的意图行动,OpenAI 在调整语言模型方面取得了新进展。这里的「意图」既有明确的(如遵循指令),也有隐含的(如尊重事实、不带有偏见或恶意等),他们希望改进后的模型是有用的(帮助用户解决他们的问题)、诚实的(不编造信息或误导用户)、无害的(不对人或环境造成身体、心理或社会伤害)。 为了达成这一目标,他们使用了利用人类反馈的强化学习方法(RLHF)对 GPT-3 进行微调,使其遵循广泛的书面指令。这项技术利用人类的偏好作为奖励信号来微调 GPT-3。这一过程让 GPT-3 的行为与特定人群(主要是 OpenAI 的标注者和研究人员)的既定偏好保持一致,而不是更广泛的「人类价值」概念。他们将得到的模型称为 InstructGPT。 在面对同一指令(用几句话向一个 6 岁的孩子解释一下登月)时,InstructGPT 给出了如下的输出结果: 研究者主要通过让标注者对测试集上的模型输出质量进行评分来评估模型,测试集包含来自「held-out」标注者的 prompt,还在一系列公共的 NLP 数据集上进行了自动评估。他们训练了三种尺寸的模型(1.3B、6B 和 175B 参数),所有的模型都使用 GPT-3 架构。其主要发现如下: 1、标注者明显更喜欢 InstructGPT 的输出,而不是 GPT-3。在测试集中,来自 1.3B InstructGPT 模型的输出优于来自 175B GPT-3 的输出,尽管前者的参数量还不到后者的 1/100。 2、与 GPT-3 相比,InstructGPT 输出的真实性有所提高。 3、与 GPT-3 相比,InstructGPT 输出的有害性略有改善,但偏见程度并没有。 4、可以通过修改 RLHF 微调过程来最小化模型在公共 NLP 数据集上的性能倒退。 5、模型可以泛化至「held-out」标注者的偏好,这部分标注者没有参与任何训练数据的生产。 6、公共的 NLP 数据集并不能反映 InstructGPT 语言模型的实际效果。 7、InstructGPT 模型显示出了泛化至 RLHF 微调分布之外的指令的潜力。 8、InstructGPT 仍然会犯一些简单的错误。 所以总的来看,通过人类的反馈进行微调是一个很有前途的方向,可以使语言模型与人类的意图保持一致,但在提高它们的安全性和可靠性方面还有很多工作要做。 方法 为了训练 InstructGPT 模型,研究者采用了人类反馈强化学习方法 ,即使用人类偏好作为奖励信号来微调模型。这一点很重要,因为要解决的安全和一致性问题是复杂的、主观的,并且不能完全被简单的自动度量捕获。 研究者首先用提交到 OpenAI API 的提示(prompt)做了一个人工编写的演示数据集,然后利用这个数据集来训练监督学习基线。接下来,他们又在一个更大的 API 提示集上收集两个模型输出之间的人工标注的对比数据集。然后,他们在这个数据集上训练了一个奖励模型(RM)来预测标注者更偏好的输出。最后,他们使用该 RM 作为奖励函数,并使用 PPO 算法微调他们的 GPT-3 策略以最大化该奖励。 这个过程可以这么理解:它「解锁」了 GPT-3 已经拥有的能力,但仅仅通过 prompt 工程很难激发出这些能力。这是因为,相对于在预训练中学到的能力,训练程序教授模型新能力的水准是有限的,因为它使用的计算量和数据相对于模型预训练只有不到 2%。 这种方法的一个局限性是,它会引入一种叫做「一致性税(alignment tax)」的东西,即如果仅仅让模型与用户任务达成一致,可能会使其在另外一些学术 NLP 任务上的表现更差。这是不可取的,因为如果文章中提到的一致性技术使模型在人们关注的任务上变得表现更糟,那么它们在实践中就不太可能被采用。 研究者发现了一个简单的算法调整方式,能够最大限度上减少这种「一致性税」: 在 RL 微调期间,研究者混合了一小部分用于训练 GPT-3 的原始数据,并使用正常的对数似然最大化在这些数据上进行训练。这大致保持了模型在安全性和人类偏好方面的表现,同时降低了模型在学术 NLP 任务上的性能损失,在有些情况下甚至超过了 GPT-3 基线。 结果 研究者首先通过让标注者将 InstructGPT 的输出与 GPT-3 的输出进行比较,来评估 InstructGPT 遵循用户指令的效果。结果发现,InstructGPT 模型显然更受欢迎。当向 GPT-3 的提示中添加前置信息以使其进入「指令遵循模式」时,这种情况仍然存在:对提交到 API 上 InstructGPT 模型的各种型号 (X 轴) 的模型输出按 1-7 比例 (Y 轴) 进行质量评级。在只有少量提示和没有提示以及模型微调与监督式学习的情况下,labeler 给出的 InstructGPT 输出得分远高于 GPT-3 的输出得分。对于提交到 API 上的 GPT-3 模型的提示,可以找到类似的结果。 为了衡量模型的安全性,研究者使用了一套公开可用数据集上的现有指标。与 GPT-3 相比,InstructGPT 产生的模仿性谎言更少 (TruthfulQA) ,而且毒性更小(RealToxicityPrompts)。研究者还对 API 提示分布进行了人工评估,发现 InstructGPT 编造事实(hallucinates) 的频率较低,并生成了更恰当的输出。评估 InstructGPT 的结果。图中是不同规模模型的结果组合。Toxicity、Hallucination 两个指标上,分数越低越好;TruthfulQA、Appropriateness 两个指标上,分数越高越好。 最后,研究者发现在用户分布中,InstructGPT 的输出优于 FLAN 和 T0 的输出。这表明,用于训练 FLAN 和 T0 的数据大多数是学术性 NLP 任务的,并不能完全代表部署语言模型在实践中的使用情况。 在更广泛的群体中的泛化效果 OpenAI 采取的流程使得该模型表现与标注者的偏好保持一致,标注者直接生成用于训练模型的数据,研究者则通过书面指示、具体例子的直接反馈以及非正式对话为标注者提供指导。此外,模型还受到用户和 API 策略中隐含的偏好的影响。研究者选择了那些在筛选测试中表现良好的标注者,他们在识别和回应敏感的提示方面表现出色。然而,这些对数据产生影响的不同来源并不能保证模型与任何更广泛群体的偏好保持一致。 研究者借助了两个实验来探究这个问题。首先,使用没有提供任何训练数据的 held-out 标注者来评估 GPT-3 和 InstructGPT,并发现这些标注者更喜欢 InstructGPT 模型的输出,其比率与训练数据标注者大致相同。然后,研究者使用来自一部分标注者的数据训练奖励模型,发现它们能很好地预测不同标注者子集的偏好。这表明该模型并没有过拟合训练数据标注者的偏好。然而,研究者还需要做更多的工作来研究这些模型在更广泛的用户群体中的表现,以及在人们对相同输入产生不同预期时模型会如何表现。 局限性 尽管已经取得了重大进展,但当前的 InstructGPT 模型还远远算不上与用户意图完全一致或对用户来说完全安全:它们仍然会产生有害、有偏见的输出,或者编造事实,并在没有明确警示的情况下产生色情、暴力内容。但是,机器学习系统的安全性不仅取决于底层模型的行为,还取决于这些模型的部署方式。OpenAI 表示,为了支持 OpenAI API 的安全性,他们将继续在应用程序上线之前对其进行审查,并提供内容过滤器来检测不安全的输出,监控其滥用情况。 训练模型遵循用户指示还有一个副作用:如果用户指示它们产生不安全的输出,它们可能更容易被误用。因此,研究者要教模型拒绝某些指令。如何可靠地做到这一点将是一个重要的开放性研究问题。 此外,在许多情况下,与标注者的平均偏好保持一致是不可取的。例如,当生成一定程度上影响了少数群体的文本时,该群体的偏好应该得到更多的权重。目前,InstructGPT 接受的是用英语进行指导的训练,因此,它更偏向于讲英语的人的文化价值观。研究者也在逐渐了解标注者偏好之间的差异和分歧,这样就可以根据更具体的人群的价值观来设置模型。一般来说,根据特定人类的价值观调整模型输出会面临社会影响方面的抉择,最终必须建立负责任的、包容性的处理程序来做出这些决定。 上述研究结果表明,这些技术在改善通用 AI 系统与人类意图的一致性方面是非常有效的。然而,这仅仅是个开始。研究者们还将继续推进这些技术,以改进当前和未来的模型,使之朝着对人类更安全、更有用的方向发展。
上滑加载中
推荐直播
-
用码道,让你的AI作品三步上朋友圈2026/08/04 周二 19:00-20:00
林华鼎-华为云AI开发者运营负责人
从入门 · 到做AI应用 · 到企业级开发。不教编程,只教用AI · 零代码、有产出、能带走、可炫耀 · 每课人人动手实操
回顾中 -
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
基于华为云码道,构建你的定制化AI搭子2026/08/14 周五 09:00-11:30
明亮-华为云开发者发展与支持部部长
本期直播将向您全面介绍华为云码道产品,并基于码道手把手教你部署自己的定制化AI陪伴搭子。
回顾中
热门标签