-
学习感悟很感谢华为云社区能给我一次免费提升自己的机会!在这短短的接近30天的日子里,我学到了,不少关于云服务的知识,正所谓:窥一斑而知全貌,在学习了华为云的云服务后,对于以前自己接触的其他云服务也有了一个清晰的认识,也使得自己在云服务领域的知识又前进了一大步。再次,非常感谢华为云社区开展的这次活动。这次的培训不是面对面的培训,而是通过网络平台,共同学习。可以适时安排自己的学习时间,更具人文性。同时这也是一次非常好的机会,有机会与其他优秀的同学交流探讨。新手上路的我,在云服务这方面遇到了不少问题,再加上我的工作领域问题。没有谁可以与我好好探讨,唯有自己慢慢摸索。毕竟自己的能力是有限的,有些问题可以解决,但是有些问题还是难以明了。这次的培训让我学到很多东西,不仅学会了大部分云服务的理论知识,还学到了课程标准在实际中的运用实践。之前曾经了解过一些云服务,但是接触的不是很深,对于一些云服务的理论和实际用途不是特别的理解。现在参加了《华为云HCIA职业认证训练营》后,结合训练营的“理论+实践”,我对于云服务的理解有所加深。但是因为自己在学习与工作之间精力的问题,在学习上面还是不够专注,对于一些细节知识还是没有理解的透彻,在主观能动性上还有些欠缺,少了主动查阅资料、反复观看视频学习的心态,对此,我感到非常惭愧 。《华为云HCIA职业认证训练营》是一个非常好的活动,活动的主题鲜明,也非常好的促进了,想提升自己对云服务认知的小伙伴儿之间的交流,尤其是交流群,同学之间经常性的交流探讨,相互请教,也很大部分提升了大家的云服务知识水平。华为云的教学水平与方式也是大家公认的,所以我就不提建议啦。在此我给下次参加训练营的小伙伴儿一些建议:多看文档。视频多看几次。自己动手多实践。多在群里请教大佬。最后,再次感谢华为云无私的教学培养,感谢群里的华为云助手小姐姐,感谢男姐、感谢july姐。谢谢!!!
-
来华为云赢$200HCIA职业认证考试券HCIA-Cloud Service V3.0职业认证训练营,速来报名!在家刷公众号。看到了这个推广活动。DevOps微认证让我收获到“可落地的端到端一站式开发方法论和工具链”的思想,从课程中我认识到开发和运维之间的“障碍”,学习了如何做好运维工作。活动时间内(10.25-12.5),完成沙箱实验《使用华为云DevCloud实现20分钟一行代码上云》,且实验进度100%,赠送微认证《黑白棋实时对战游戏开发》满38-38元代金券1张,限量前200名,每周一发放1次。>活动时间2021年10月25日-12月5日*本活动所有任务需在活动时间内完成方可获取活动激励>适合人群主要面向有认证需求的在校大学生、云计算初学者、开发者、云服务工程师、相关华为云伙伴等人员群体>结课证书参与训练营,通过结课考试,获取HCIA职业认证训练营结课证书(非HCIA职业认证证书)>学习感受有小助手随时随地更新最新课程/学习动态,有同类别的开发者一起分享学习心得和排忧解惑,更有华为云专家不定时空降!一站式在线学练考,零基础学习前沿技术,考取权威证书微认证或职业认证可以在写简历的时候可以作为一个证明,同时这些认证享有众多福利权限!对于学习这件事情最好是有规划且要耐心坚下去,因为信息技术计算机这个领域比较大,虽然很多的知识与技术是相互的,欢迎大家来批评吐槽,希望能和大家一起进步!一路陪伴,一路成长,收获知识和奖项,结识志同道合的伙伴。
-
来华为云赢$200HCIA职业认证考试券HCIA-Cloud Service V3.0职业认证训练营,速来报名!在家刷朋友圈看到朋友晒华为微认证的帖子。一时好奇,就点进去看了看。就顺着到官网了解了下。通过华为云微认证考试,获取官方认证证书。提供一站式在线学习、实验与考试零基础也可学习前沿技术知识,快速获得场景化的技能提升。含云计算、大数据、物联网、人工智能、软件开发、鲲鹏等多个领域。沙箱实验室一键预置功能很好,整个实验过程流畅,手册完善,沙箱稳定,自动检测完成度,给人感觉眼前一亮,这个设计很人性化。DevOps微认证让我收获到“可落地的端到端一站式开发方法论和工具链”的思想,从课程中我认识到开发和运维之间的“障碍”,学习了如何做好运维工作。活动时间内(10.25-12.5),完成沙箱实验《使用华为云DevCloud实现20分钟一行代码上云》,且实验进度100%,赠送微认证《黑白棋实时对战游戏开发》满38-38元代金券1张,限量前200名,每周一发放1次。>活动时间2021年10月25日-12月5日*本活动所有任务需在活动时间内完成方可获取活动激励>适合人群主要面向有认证需求的在校大学生、云计算初学者、开发者、云服务工程师、相关华为云伙伴等人员群体>结课证书参与训练营,通过结课考试,获取HCIA职业认证训练营结课证书(非HCIA职业认证证书)>学习感受有小助手随时随地更新最新课程/学习动态,有同类别的开发者一起分享学习心得和排忧解惑,更有华为云专家不定时空降!一站式在线学练考,零基础学习前沿技术,考取权威证书微认证或职业认证可以在写简历的时候可以作为一个证明,同时这些认证享有众多福利权限!对于学习这件事情最好是有规划且要耐心坚下去,因为信息技术计算机这个领域比较大,虽然很多的知识与技术是相互的,欢迎大家来批评吐槽,希望能和大家一起进步!一路陪伴,一路成长,收获知识和奖项,结识志同道合的伙伴。
-
自动机器学习(AutoML)的目标就是使用自动化的数据驱动方式来做出上述的决策。用户只要提供数据,自动机器学习系统自动的决定最佳的方案。领域专家不再需要苦恼于学习各种机器学习的算法。自动机器学习不光包括大家熟知的算法选择,超参数优化,和神经网络架构搜索,还覆盖机器学习工作流的每一步:自动准备数据自动特征选择自动选择算法超参数优化自动流水线/工作流构建神经网络架构搜索自动模型选择和集成学习
-
斯坦福的专家也在人工智能报告中得出结论:“越来越强大的人工智能应用,可能会对我们的社会和经济产生深远的积极影响,这将出现在从现在到 2030 年的时间段里。”1、CNTK它是计算网络工具包Computational Network Toolkit的缩写,CNTK 是一个微软的开源人工智能工具。不论是在单个 CPU和GPU、多个 GPU 或拥有多个 GPU 的多台机器上,它都有优异的表现。微软主要用它做语音识别的研究,但是它在机器翻译、文本处理、图像字幕、图像识别、语言理解和语言建模方面都有着良好的应用。2、DMTKDMTK 是Distributed Machine Learning Toolkit(分布式机器学习工具)的缩写,和 CNTK 一样,是微软的开源人工智能工具。用于大数据的应用程序,它的目标是更快的训练人工智能系统。DMTK 主要包括三个组件:DMTK 框架、LightLDA 主题模型算法、分布式(多义)字嵌入算法为了证明它的速度,微软声称在一个八集群的机器上,能够“用 100 万个主题和 1000 万个单词的词汇表(总共 10 万亿参数)训练一个主题模型,在一个文档中收集 1000 亿个符号,”。3、CaffeCaffe是由贾扬清在加州大学伯克利分校读博时创造的, 是一个基于表达体系结构和可扩展代码的深度学习框架。使它声名鹊起的是速度,这使它非常受到研究人员和企业用户的欢迎。4、Deeplearning4jDeeplearning4j 是一个 java 虚拟机(JVM)的开源深度学习库。它运行在分布式环境并且集成在Apache Spark和Hadoop中。这使它可以配置深度神经网络,并且它与Scala 、Java和 其他 JVM 语言兼容。5、Mahout它是 Apache 基金会项目,Mahout 是一个开源机器学习框架。据其官方网站所言,Mahout 有三个主要的特性:一个构建可扩展算法的编程环境、像 Spark 和 H2O 一样的预制算法工具一个叫 Samsara 的矢量数学实验环境目前使用 Mahout 的公司有 埃森哲咨询公司、Adobe、英特尔、领英、Twitter、Foursquare、雅虎和其他许多公司。6、H20相比起科研,H2O 更注重将 AI 服务于企业用户,因此 H2O 有着大量的公司客户,比如美国第一资本金融公司、Nielsen Catalina、思科、PayPal 和泛美等等,都是它的用户。它有两种开源版本:Sparking Water 版和标准版 H2O ,被集成在 Apache Spark 中。也有付费的企业用户支持。7、MLlib因为它的速度,Apache Spark 成为目前最流行的大数据处理工具。MLlib 是 Spark 的可扩展机器学习库。它集成了 Hadoop 并可以与 NumPy 和 R 进行交互操作。它包括了许多机器学习算法如分类、决策树、推荐、主题建模、集群、功能转换、模型评价、生存分析、ML 管道架构、ML 持久、频繁项集和序列模式挖掘、分布式线性代数和统计。8、OpenNN作为一个为开发者和科研人员设计的具有高级理解力的人工智能,OpenNN 是一个实现神经网络算法的 c++ 编程库。其关键特性包括深度的架构和快速的性能。其网站上可以查到丰富的文档,包括一个解释了神经网络的基本知识的入门教程。OpenNN 的付费支持由一家从事预测分析的西班牙公司 Artelnics 提供。9、NuPIC由 Numenta 公司管理的 NuPIC 是一个基于分层暂时记忆Hierarchical Temporal Memory,HTM理论的开源人工智能项目。从本质上讲,HTM 试图创建一个计算机系统来模仿人类大脑皮层。他们的目标是创造一个 “在许多认知任务上接近或者超越人类认知能力” 的机器。除了开源许可,Numenta 还提供 NuPic 的商业许可协议,并且它还提供技术专利的许可证。10、Oryx 2构建在 Apache Spark 和 Kafka 之上的 Oryx 2 是一个专门针对大规模机器学习的应用程序开发框架。它采用一个独特的三层 λ 架构。开发者可以使用 Orys 2 创建新的应用程序,另外它还拥有一些预先构建的应用程序可以用于常见的大数据任务比如协同过滤、分类、回归和聚类。大数据工具供应商 Cloudera 创造了最初的 Oryx 1 项目并且一直积极参与持续发展。11、OpenCyc由 Cycorp 公司开发的 OpenCyc 提供了对 Cyc 知识库的访问和常识推理引擎。它拥有超过 239,000 个条目,大约 2,093,000 个三元组和大约 69,000 owl:这是一种类似于链接到外部语义库的命名空间。它在富领域模型、语义数据集成、文本理解、特殊领域的专家系统和游戏 AI 中有着良好的应用。该公司还提供另外两个版本的 Cyc:一个可免费的用于科研但是不开源,和一个提供给企业的但是需要付费。12、SystenML最初由 IBM 开发, SystemML 现在是一个 Apache 大数据项目。它提供了一个高度可伸缩的平台,可以实现高等数学运算,并且它的算法用 R 或一种类似 python 的语法写成。企业已经在使用它来跟踪汽车维修客户服务、规划机场交通和连接社会媒体数据与银行客户。它可以在 Spark 或 Hadoop 上运行。13、TorchTorch 把自己描述为:“一个优先使用 GPU 的,拥有机器学习算法广泛支持的科学计算框架”,特点是灵活性和速度。Torch可以很容易的通过软件包用于计算机视觉、机器学习、信号处理、并行处理、视频、图像、音频和网络等方面。依赖一个叫做 LuaJIT 的脚本语言,而 LuaJIT 是基于 Lua 的。14、TensorFlowTensorFlow 是一个谷歌的开源人工智能工具。提供了一个使用数据流图进行数值计算的库。
-
数据采集,又称数据获取,是利用一种装置,从系统外部采集数据并输入到系统内部的一个接口。数据采集技术广泛应用在各个领域。比如摄像头,麦克风,都是数据采集工具。被采集数据是已被转换为电讯号的各种物理量,如温度、水位、风速、压力等,可以是模拟量,也可以是数字量。采集一般是采样方式,即隔一定时间(称采样周期)对同一点数据重复采集。采集的数据大多是瞬时值,也可是某段时间内的一个特征值。准确的数据测量是数据采集的基础。数据量测方法有接触式和非接触式,检测元件多种多样。不论哪种方法和元件,均以不影响被测对象状态和测量环境为前提,以保证数据的正确性。数据采集含义很广,包括对面状连续物理量的采集。在计算机辅助制图、测图、设计中,对图形或图像数字化过程也可称为数据采集,此时被采集的是几何量(或包括物理量,如灰度)数据。在互联网行业快速发展的今天,数据采集已经被广泛应用于互联网及分布式领域,数据采集领域已经发生了重要的变化。首先,分布式控制应用场合中的智能数据采集系统在国内外已经取得了长足的发展。其次,总线兼容型数据采集插件的数量不断增大,与个人计算机兼容的数据采集系统的数量也在增加。国内外各种数据采集机先后问世,将数据采集带入了一个全新的时代。ModelArts平台提供的自动难例发现功能,能够在一批输入旧模型的推理数据中,通过内置规则筛选出可以进一步提升旧模型精度的数据。自动难例发现功能可以有效减小模型更新时需要的标注人力。对于旧模型的推理数据,尽可能地发掘有利于提升模型精度的部分数据。您只需要对这部分数据进一步的确认标注,然后将其加入训练数据集中,在重新训练后,就能够得到精度更高的新模型。针对部署为在线服务的模型,调用URL或通过Console输入预测的数据,可通过数据采集功能,将此类数据采集或筛选出难例,并输出至数据集,用于后续的模型训练。针对在线服务的数据采集,如图1所示,支持如下几个场景。数据采集:开启数据采集任务。将调用在线服务产生的数据,按配置规则进行采集并存储。同步数据至数据集:针对数据采集的结果数据,支持将此数据同步至某一数据集中,统一管理和应用。数据采集并筛选难例:开启数据采集任务,同时启用难例筛选功能,将采集的数据通过内置算法,筛选出难例。最后将难例数据以及采集的数据存储至对应数据集中,用于重新训练。反馈难例:当您调用在线服务进行预测时,可将预测不准确的图片数据,作为难例反馈,存储至对应数据集。
-
深度神经网络是机器学习(ML, Machine Learning)领域中一种技术特点多层的好处是可以用较少的参数表示复杂的函数。在监督学习中,以前的多层神经网络的问题是容易陷入局部极值点。如果训练样本足够充分覆盖未来的样本,那么学到的多层权重可以很好的用来预测新的测试样本。但是很多任务难以得到足够多的标记样本,在这种情况下,简单的模型,比如线性回归或者决策树往往能得到比多层神经网络更好的结果(更好的泛化性,更差的训练误差)。非监督学习中,以往没有有效的方法构造多层网络。多层神经网络的顶层是底层特征的高级表示,比如底层是像素点,上一层的结点可能表示横线,三角; 而顶层可能有一个结点表示人脸。一个成功的算法应该能让生成的顶层特征最大化的代表底层的样例。如果对所有层同时训练,时间复杂度会太高; 如果每次训练一层,偏差就会逐层传递。这会面临跟上面监督学习中相反的问题,会严重欠拟合。
-
联邦学习技术及数据隐私保护大会上明确提出了“联邦机器学习”这个概念。数据是机器学习的基础 。而在大多数行业中,由于行业竞争、隐私安全、行政手续复杂等问题,数据常常是以孤岛的形式存在的。甚至即使是在同一个公司的不同部门之间实现数据集中整合也面临着重重阻力。在现实中想要将分散在各地、各个机构的数据进行整合几乎是不可能的,或者说所需的成本是巨大的。随着人工智能的进一步发展,重视数据隐私和安全已经成为了世界性的趋势。每一次公众数据的泄露都会引起媒体和公众的极大关注,例如Facebook的数据泄露事件就引起了大范围的抗议行动。 同时各国都在加强对数据安全和隐私的保护,欧盟最近引入的新法案《通用数据保护条例》(General Data Protection Regulation, GDPR)表明,对用户数据隐私和安全管理的日趋严格将是世界趋势。要解决大数据的困境,仅仅靠传统的方法已经出现瓶颈。两个公司简单的交换数据在很多法规包括GDPR框架下是不允许的。用户是原始数据的拥有者,在用户没有批准的情况下,公司间是不能交换数据的。针对数据孤岛和数据隐私的两难问题,多家机构和学者提出解决办法。针对手机终端和多方机构数据的隐私问题,谷歌公司和微众银行分别提出了不同的“联邦学习”(Federated Learning)算法框架。谷歌公司提出了基于个人终端设备的“联邦学习”(Federated Learning)算法框架,而AAAI Fellow 杨强教授与微众银行随后提出了基于“联邦学习”(Federated Learning)的系统性的通用解决方案,可以解决个人(2C)和公司间(2B)联合建模的问题。在满足数据隐私、安全和监管要求的前提下,设计一个机器学习框架,让人工智能系统能够更加高效、准确的共同使用各自的数据。
-
2021了,还有同学在问为什么要学python?作为编程语言界新贵,python的简单易学、精炼高效不得不提python对初入门的编程小白非常友好,0基础也可以学!用途也超越了一般语言,应用场景非常丰富!最吸引人还在于它的数据分析能力,对于非编程人员,也是大有助益可以帮未来要面对繁琐数据、表格的同学提高工作效率让你加薪不在话下!!!话说了那么多,重点介绍一下本次python学习赛本次华为云python学习赛从理论出发,让你0基础学python,并通过实操项目,让你学练一体,完成python入门分享学习心得还可拿大奖本贴盖楼更有好礼相送!>>戳此处立即报名大赛<<学习经验、实验问题对软件行业的看法、为未来工作场景的好奇统统可以发表在此贴的评论区快在评论区燥起来喽~【盖楼有奖】参与方式:在本贴当中分享学习心得、未来求职、编程、对程序员工作的好奇,通通都可以!楼层为8、18可获得华为攻城狮行李牌1个;楼层为68、88可获得帆布包1个;楼层为188、288、688,可获得智能水杯一个!!盖楼领奖方式:请关注站内私信,活动于12月7日结束后,将在14个工作日内私信领奖事宜。(分割线)以下规则针对参与大赛并提交作品同学们必看内容哦~>>戳此处立即报名大赛<<【大赛规则】1、本次学习赛分为三个赛题:Python在线课堂、Python在线实验和Python开发技能测评;2、完成所有环节的内容,得分占总比分≥60%,可获得华为云官方结业证书(电子版),本次活动为湘潭理工学院专场,本校学生上传学习心得还可获得学校社会实践学分;3、心得分享评分标准:请同学们按照学习经验、真实体验反馈、遇到的问题等这几个维度发表学习感受;4、完成在线课程学习且得分占总比分≥70%的同学,还有机会获得华为云活动奖品。活动奖品规则具体如下:竞答有奖奖项数量奖品得分≥总分60%不限华为云官方结业证书+社会实践学分得分≥总分70%20华为云官方结业证书+社会实践学分+50元京东卡得分≥总分80%10华为云官方结业证书+社会实践学分+Nova音箱得分≥总分90%8华为云官方结业证书+社会实践学分+200元京东卡满分5华为云官方结业证书+社会实践学分+ Xsport运动蓝牙耳机说明:(1)活动分数在活动结束后由华为云后台统计;(2)奖品将在大赛结束后统一发放;(3)如因缺货等原因导致奖品缺失,将替换为等价值其他奖品;(4)社会实践学分将在活动结束后统计成绩及心得体会,统一汇总至学院学工处审核后安排发放。【心得分享示例模板】我的华为云账号:xxx我的分享:本次学习经验、实验问题、对软件行业的看法、为未来工作的好奇等等不限,如:本次实验比较复杂,但很有学习意义,尤其在###环节,很有收获。有任何问题请添加本次活动交流群,群内@华为云小助手
-
前列腺癌是男性常见的癌症,其变化多端,因人而异,难以预料,大多数潜伏期很长,但有些生长速度快。和其它很多癌症一样,可能早期没有症状,一旦有症状就到了晚期。近日,美国一个联合团队开发了一款机器学习分析模型可用于前列腺癌症的预测和评估。经过验证发现,该模型性能优于已知其它深度机器学习模型。研究人员称,这一模型以及相关研究方法,也有望推广至多种癌症类型
-
### **监督学习** 监督学习是机器学习中应用最广泛及成熟的,它是从有标签的数据样本(x,y)中,学习如何关联x到正确的y。这过程就像是模型在给定题目的已知条件(特征x),参考着答案(标签y)学习,借助标签y的监督纠正,模型通过算法不断调整自身参数以达到学习目标。 监督学习常用的模型有:线性回归、朴素贝叶斯、K最近邻、逻辑回归、支持向量机、神经网络、决策树、集成学习(如LightGBM)等。按照应用场景,以模型预测结果Y的取值有限或者无限的,可再进一步分为分类或者回归模型。 **分类模型** 分类模型是处理预测结果取值有限的分类任务。如下示例通过逻辑回归分类模型,根据温湿度、风速等情况去预测是否会下雨。 - 逻辑回归简介 逻辑回归虽然名字有带“回归”,但其实它是一种广义线性的分类模型,由于模型简单和高效,在实际中应用非常广泛。 逻辑回归模型结构可以视为双层的神经网络(如图4.5)。模型输入x,通过神经元激活函数f(f为sigmoid函数)将输入非线性转换至0~1的取值输出,最终学习的模型决策函数为Y=sigmoid(wx + b) 。其中模型参数w即对应各特征(x1, x2, x3...)的权重(w1,w2,w3...),b模型参数代表着偏置项,Y为预测结果(0~1范围)。 模型的学习目标为极小化交叉熵损失函数。模型的优化算法常用梯度下降算法去迭代求解损失函数的极小值,得到较优的模型参数。  - 代码示例 示例所用天气数据集是简单的天气情况记录数据,包括室外温湿度、风速、是否下雨等,在分类任务中,我们以是否下雨作为标签,其他为特征(如图4.6)  ``` import pandas as pd weather_df = pd.read_csv('./data/weather.csv') weather_df.head(10) from sklearn.linear_model import LogisticRegression x = weather_df.drop('If Rain', axis=1) y = weather_df['If Rain'] lr = LogisticRegression() lr.fit(x, y) print("前10个样本预测结果:", lr.predict(x[0:10]) ) ``` 以训练的模型输出前10个样本预测结果为: \[1 1 1 1 1 1 0 1 1 1\],对比实际前10个样本的标签: \[1 1 1 1 1 0 1 0 0 1\],预测准确率并不高。在后面章节我们会具体介绍如何评估模型的预测效果,以及进一步优化模型效果。 **回归模型** 回归模型是处理预测结果取值无限的回归任务。如下代码示例通过线性回归模型,以室外湿度为标签,根据温度、风力、下雨等情况预测室外湿度。 - 线性回归简介 线性回归模型前提假设是y和x呈线性关系,输入x,模型决策函数为Y=wx+b。模型的学习目标为极小化均方误差损失函数。模型的优化算法常用最小二乘法求解最优的模型参数。 - 代码示例 ``` from sklearn.linear_model import LinearRegression x = weather_df.drop('Humidity', axis=1) y = weather_df['Humidity'] linear = LinearRegression() linear.fit(x, y) print("前10个样本预测结果:", linear.predict(x[0:10]) )
-
1)机器学习 使分析模型构建自动化。它使用来自神经网络,统计学,运筹学和物理学的方法来查找数据中的隐藏见解,而无需明确地为在哪里寻找或得出的结论进行编程。 2)神经网络是一种由相互连接的单元(如神经元)组成的机器学习,该单元通过响应外部输入,在每个单元之间中继信息来处理信息。该过程需要对数据进行多次遍历才能找到连接并从未定义的数据中获取含义。 3)深度学习使用具有多层处理单元的巨大神经网络,利用计算能力的进步和改进的训练技术来学习大量数据中的复杂模式。常见的应用包括图像和语音识别。 4)认知计算是AI的一个子领域,它致力于与机器进行自然的,类似于人的交互。使用AI和认知计算,最终目标是使机器能够通过解释图像和语音的能力来模拟人类过程,然后做出连贯的回应。 5)计算机视觉依赖于模式识别和深度学习来识别图片或视频中的内容。当机器可以处理,分析和理解图像时,它们可以实时捕获图像或视频并解释其周围环境。 6)自然语言处理 (NLP)是计算机分析,理解和生成人类语言(包括语音)的能力。NLP的下一个阶段是自然语言交互,它允许人类使用日常的日常语言与计算机进行通信以执行任务。
-
K近邻算法模型搭建不管是K近邻算法还是机器学习算法,我们一般搭建机器学习模型都分为2个步骤。第1步,划分训练集与测试集,第2步完成模型的搭建.下面我们具体实现,代码如下:import cv2 import pandas as pd from sklearn.model_selection import train_test_split from sklearn.neighbors import KNeighborsClassifier as KNN df = pd.read_excel("手写字体识别.xlsx") # 提取特征变量,识别数字时,其特征就是1024个0,1数据,而目标变量就是1024个数字组成对应的结果数字 X = df.drop(columns="对应数字") Y = df['对应数字'] x_train, x_test, y_train, y_test = train_test_split(X, Y, test_size=0.2, random_state=111) knn = KNN(n_neighbors=5) knn.fit(x_train, y_train) answer=knn.predict(img_array) print("图中的数字是:"+str(answer[0])) 这里,我们首先读取手写字体识别的数据集,然后提取特征变量与目标变量。再然后,使用train_test_split函数将获取的数据集分为测试集与训练集,test_size=0.2表示将20%的数据划为测试集,训练集返回x_train,y_train,测试集返回x_test,y_test。接着,使用训练集数据建模fit,这里K近邻算法n_neighbors=5,表示选取5个近邻点来决定数字图片的分类,或者说识别判断。建模完成之后,可以将上面转换图片的一维数组,直接代入到knn.predict函数中,得到预测的结果。我们测试的图片如下:运行之后,得到的结果如下:作者:极客学编程链接:https://juejin.cn/post/6990199241796747278来源:稀土掘金著作权归作者所有。商业转载请联系作者获得授权,非商业转载请注明出处。
-
K近邻算法机器学习算法是从数据中产生模型,也就是进行学习的算法。我们把经验提供给算法,它就能够根据经验数据产生模型。在面对新的情况时,模型就会为我们提供预测的结果。例如,识别数字,文字时,其实识别它们并不需要颜色,使用二值图像就行,而二值图像的数字文字都是0,1组成,机器学习会根据0与1的位置匹配最相近的文字或者数字,从而得出结果。而机器学习中的K近邻算法最适合识别图像中的文字或者数字信息。K近邻算法又称为KNN算法,是非常经典的机器学习算法。其原理非常简单:对于一个新样本,这里可以理解为一个新数字图像或文字图像,K近邻算法会在已有数据中寻找与它最相似的K个数据,或者说离它最近的K个数据,如果这K个数据大多数属于某个类别,则该样本也属于这个类别。作者:极客学编程链接:https://juejin.cn/post/6990199241796747278来源:稀土掘金著作权归作者所有。商业转载请联系作者获得授权,非商业转载请注明出处。
-
从历史角度来讲,模型越来越大。GPT-3已经这么大了,我们还能做得更大吗?当然如果未来计算设备的硬件的问题解决了,可以更大,但是近期内呢?更大的模型应该是什么样子?我设想的一种方式就是分布式,把模型分布到很多机器上计算,就像搜索引擎一样。像BERT这一类模型如何再把它训练的更大?现在最大的几个预训练语言模型都是GPT类的,BERT这一类模型很难做得更大,一些工程上的问题目前还是很难解决的。那么未来我们是否可能训练更大的BERT类的模型?小模型相反, BERT这类模型可以压缩的很小,GPT模型就很难压缩。BERT这个模型的压缩是不是还有潜力可以挖掘?另外知识融入是一个很有意思的问题。知识融入人们做了很多工作,实际上我是不太满意的。因为很多工作只是在解决知识类的问题效果比较好, 一般的 NLP的问题,知识融入的作用并不是那么大,所以希望知识融入能够解决一般的 NLP的问题。还有就是知识应该如何表示?现在大部分人认为知识都是三元组,我觉得这个是存在争议的,三元组实际上能够表达的知识其实非常有限。比如序列关系、空间关系、集合关系、数值关系等等关系知识都是很难学到的。关于搜索引擎,我希望以后预训练语言模型可以和搜索引擎结合起来,预训练语言模型就是个能够回答任何问题的搜索引擎。最后就是多模态预训练,希望将来它能带来无限的想象空间。
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第五期2026/09/04 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;蒋春阳-华为云AI开发者案例开发专家
本期直播内容: AI工具体验营 · 第5-8课连讲。Agent-Team 多智能体协作完成毕业设计实践
回顾中 -
华为云开发者AI素养ClassRoom·第六期2026/09/08 周二 19:00-20:00
樊渊-2026华为软件挑战赛冠军
高手来了:看软挑高手解析二维排样问题—从工业难题到算法突破
回顾中
热门标签