-
然而,经验风险最小化很容易导致过拟合。高容量的模型会简单地记住训练集。在很多情况下,经验风险最小化并非真的可行。最有效的现代优化算法是基于梯度下降的,但是很多有用的损失函数,如 0 − 1 损失,没有有效的导数(导数要么为零,要么处处未定义)。这两个问题说明,在深度学习中我们很少使用经验风险最小化。反之,我们会使用一个稍有不同的方法,我们真正优化的目标会更加不同于我们希望优化的目标。
-
机器学习算法的目标是降低式 (8.2) 所示的期望泛化误差。这个数据量被称为风险(risk)。在这里,我们强调该期望取自真实的潜在分布 pdata。如果我们知道了真实分布 pdata(x, y),那么最小化风险变成了一个可以被优化算法解决的优化问题。然而,我们遇到的机器学习问题,通常是不知道 pdata(x, y),只知道训练集中的样本。将机器学习问题转化回一个优化问题的最简单方法是最小化训练集上的期望损失。这意味着用训练集上的经验分布 pˆ(x, y) 替代真实分布 p(x, y)。现在,我们将最小化经验风险(empirical risk):Ex,y∼pˆdata [L(f(x; θ), y)] = 1其中 m 表示训练样本的数目。基于最小化这种平均训练误差的训练过程被称为经验风险最小化(empirical risk minimization)。在这种情况下,机器学习仍然和传统的直接优化很相似。我们并不直接最优化风险,而是最优化经验风险,希望也能够很大地降低风险。一系列不同的理论构造了一些条件,使得在这些条件下真实风险的期望可以下降不同的量。
-
用于深度模型训练的优化算法与传统的优化算法在几个方面有所不同。机器学习通常是间接作用的。在大多数机器学习问题中,我们关注某些性能度量 P,其定义于测试集上并且可能是不可解的。因此,我们只是间接地优化 P。我们希望通过降低代价函数 J(θ) 来提高 P。这一点与纯优化不同,纯优化最小化目标 J 本身。训练深度模型的优化算法通常也会包括一些针对机器学习目标函数的特定结构进行的特化。通常,代价函数可写为训练集上的平均,如J(θ) = E(x,y)∼pˆdata L(f(x; θ), y),中 L 是每个样本的损失函数,f(x; θ) 是输入 x 时所预测的输出,pˆdata 是经验分布。监督学习中,y 是目标输出。在本章中,我们会介绍不带正则化的监督学习,L的变量是 f(x; θ) 和 y。不难将这种监督学习扩展成其他形式,如包括 θ 或者 x 作为参数,或是去掉参数 y,以发展不同形式的正则化或是无监督学习。
-
深度学习算法在许多情况下都涉及到优化。例如,模型中的进行推断(如 PCA)涉及到求解优化问题。我们经常使用解析优化去证明或设计算法。在深度学习涉及到的诸多优化问题中,最难的是神经网络训练。甚至是用几百台机器投入几天到几个月来解决单个神经网络训练问题,也是很常见的。因为这其中的优化问题很重要,代价也很高,因此研究者们开发了一组专门为此设计的优化技术。会介绍神经网络训练中的这些优化技术。如果你不熟悉基于梯度优化的基本原则,简要概述了一般的数值优化。主要关注这一类特定的优化问题:寻找神经网络上的一组参数 θ,它能显著地降低代价函数 J(θ),该代价函数通常包括整个训练集上的性能评估和额外的正则化项。
-
正切传播也涉及到双反向传播(Drucker and LeCun, 1992) 和对抗训练(Szegedy et al., 2014a; Goodfellow et al., 2014b)。双反向传播正则化使Jacobian矩阵偏小,而对抗训练找到原输入附近的点,训练模型在这些点上产生与原来输入相同的输出。正切传播和手动指定转换的数据集增强都要求模型在输入变化的某些特定的方向上保持不变。双反向传播和对抗训练都要求模型对输入所有方向中的变化(只要该变化较小)都应当保持不变。正如数据集增强是正切传播非无限小的版本,对抗训练是双反向传播非无限小的版本。
-
近日,美国斯坦福大学李飞飞等百余位学者联名发布《基础模型的机遇与挑战》一文,论述在人工智能基础模型成为趋势的环境下,其发展面临的机遇与挑战。文章指出,基础模型的应用使得自监督学习+预训练模型微调适配方案逐渐成为主流,并带来了智能体认知能力的进步。但同时由于基础模型的任何一点改进会迅速覆盖整个AI社区,其隐患在于基础模型的缺陷也会被所有下游模型所继承。斯坦福大学学者谈到的基础模型,国际上也称预训练模型,也被国内研究者称为大模型。那么,什么是人工智能大模型,与小模型相比有哪些优势?为何大模型会成为趋势,在行业中有哪些应用?未来又面临怎样的机遇和挑战?像发电厂一样源源不断供应“智力源”大模型成了最近AI产学界刷屏率颇高的词汇。需要更大算力、更大数据集的大模型,为何可能是未来AI最好的伙伴?这要从AI开发者们的一次次挫败与碰壁说起。深度学习技术兴起的近10年间,AI模型基本上是针对特定应用场景需求进行训练的小模型。小模型用特定领域有标注的数据训练,通用性差,换到另外一个应用场景中往往不适用,需要重新训练。另外,小模型的训练方式基本是“手工作坊式”,调参、调优的手动工作太多,需要大量的AI工程专业人员来完成。同时,传统模型训练需要大规模的标注数据,如果某些应用场景的数据量少,训练出的模型精度就会不理想。“小模型的这些问题,导致当前AI研发整体成本较高,效率偏低。由于AI人才短缺以及成本昂贵,对于中小行业用户来说,小模型的这些问题阻碍了行业用户采用人工智能技术的脚步,成为AI普惠的障碍。”北京智源人工智能研究院院长黄铁军在接受科技日报记者采访时指出。虽然,之前全球呈现“千村万户大炼模型”的热闹场面,但这种“自家炼钢自己用”的作坊方式显然不符合现代产业发展规律。黄铁军进一步解释道:“大模型可以解决这些问题,其泛化能力强,可以做到‘举一反三’,同一模型利用少量数据进行微调或不进行微调就能完成多个场景的任务,中小企业可以直接调用,不需要招聘很多AI算法专业人员就能进行应用开发,显著降低中小企业的研发门槛,促进AI技术落地。”得益于这些优势,人工智能的发展已经从“大炼模型”逐步迈向“炼大模型”的阶段。以美国OpenAI、谷歌、微软、脸书等机构为代表,布局大规模智能模型已成为全球引领性趋势,并形成了GPT-3、Switch Transformer等千亿或万亿参数量的大模型。可以说,人工智能大模型时代正在到来!“人工智能大模型是‘大数据+大算力+强算法’结合的产物,是集成大数据内在精华的‘隐式知识库’,也是实现人工智能应用的载体。大模型是连接人工智能技术生态和产业生态的桥梁,向下带动基础软硬件发展,向上支撑了智能应用百花齐放,是整个人工智能生态的核心。”黄铁军表示。北京智源人工智能研究院理事长张宏江博士指出:“未来,大模型会形成类似电网的智能基础平台,像发电厂一样为全社会源源不断地供应‘智力源’。”超大模型“通用智能”能力应用前景广阔类比人的教育培养,大模型所完成的培训就如同基础性、通识性的大学本科培养,“学成”后的大模型具备处理一般事物的能力。如果要完成更专业、更高级的任务,大模型还需要“研究生”阶段的专业培养。黄铁军进一步指出:“AI大模型通常是在大规模无标注数据上进行训练,学习数据中蕴含的特征、结构和知识。基于大模型进行应用开发时,将大模型进行微调(在下游针对特定任务利用小规模数据进行二次训练)或者不进行微调,就可以满足多种应用任务的需要。”“从‘大炼模型’到‘炼大模型’,北京智能研究院推出的悟道系列大模型成为这一进程中的标志性成果。”张宏江指出,大模型、大平台、大数据的系统性的生态蓬勃的发展势头,验证了在AI研究与创业领域新机遇正在降临。在这一趋势下,北京智源人工智能研究院2021年3月发布悟道1.0,是中国首个人工智能大模型,取得多项国际领先的AI技术突破;2021年6月发布的悟道2.0,参数规模达到1.75万亿,是OpenAI的GPT-3模型的10倍,一跃成为世界最大模型。北京智源人工智能研究院学术副院长、清华大学教授唐杰表示,大模型可以包含更多数据,表示更多信息,模型往超大规模发展是一个必然的趋势。智源在布局万亿级模型,包括配套的高性能算力平台。目前,悟道团队一方面扩大模型的规模,让模型的表示能力更强,一方面针对实际应用,提高精度。此外,团队还在模型微调算法上进行了创新,希望早日打通百亿级模型和万亿级模型的桥梁。“超大规模预训练模型的出现,很可能改变信息产业格局,即基于数据的互联网时代、基于算力的云计算时代之后,接下来可能将进入基于大模型的AI时代。”唐杰认为。据介绍,超大规模智能模型的“通用智能”能力在医疗、金融、新闻传播等行业应用前景广阔。例如,在医疗健康领域,大模型在医疗数据格式化、病历自动解读与分析、自动问诊系统等方面都可以发挥巨大效用。在金融、法律、财务、人力资源、零售等传统行业领域,大模型能提供高性能的智能信息解析和提取、智能数据整合、自动机器翻译、辅助决策等功能,提升业务流程效率和水平。在新闻传播领域,基于模型可实现智能新闻线索收集、机器写作、辅助编辑、虚拟主播等应用。目前,智源悟道大模型,也在为北京冬奥会提供新场景下的人工智能服务应用;并正在以大模型黑科技,开启手机AI语音技术新路径,赋能智能终端新一轮AI体验革新。在9月24日举行的2021中关村论坛“人工智能与多学科协同创新论坛”上,智源“悟道”大模型与OPPO小布助手合作,基于“悟道”大模型开启“生成式回答系统”,全面功能上线后一举解决了行业共通性的长尾问题,单条回答建设成本降低99%。转发自https://www.sina.com.cn/
-
从给定的训练数据集中学习出一个函数(模型参数),当新的数据到来时,可以根据这个函数预测结果。监督学习的训练集要求包括输入输出,也可以说是特征和目标。训练集中的目标是由人标注的。监督学习就是最常见的分类(注意和聚类区分)问题,通过已有的训练样本(即已知数据及其对应的输出)去训练得到一个最优模型(这个模型属于某个函数的集合,最优表示某个评价准则下是最佳的),再利用这个模型将所有的输入映射为相应的输出,对输出进行简单的判断从而实现分类的目的。也就具有了对未知数据分类的能力。监督学习的目标往往是让计算机去学习我们已经创建好的分类系统(模型)。 监督学习是训练神经网络和决策树的常见技术。这两种技术高度依赖事先确定的分类系统给出的信息,对于神经网络,分类系统利用信息判断网络的错误,然后不断调整网络参数。对于决策树,分类系统用它来判断哪些属性提供了最多的信息。 常见的有监督学习算法:回归分析和统计分类。最典型的算法是KNN和SVM。
-
Pix2seq: A Language Modeling Framework for Object Detection原文链接:https://arXiv.org/abs/2109.10852Abstract本文提出了一种简单而通用框架Pix2Seq用于目标检测,不同于已有显式集成先验知识的方案,我们将目标检测任务转换成了基于观测像素输入的语言模型任务 。关于目标的描述(比如边框、类别)将被描述为离散token序列,我们训练了一个神经网络去感知图像并生成期望的序列。该方法主要基于这样的直觉:如果神经网络知道目标在哪、目标是什么,那么我们仅需要教它如何进行解析 。除了实用任务相关数据增广外,该方法对任务做了最小假设,相比高度优化的检测方案,所提方法在COCO数据集上取得了极具竞争力的结果。Method正如前面所提到,Pix2Seq将目标检测任务转换为基于像素输出的语言模型任务。如上图所示,该方案包含四个主要成分:图像增广 :正如其他CV模型一样,我们采用图像增广提升训练集的样本丰富,比如随机缩放、随机裁剪;序列构建与增广 :由于图像中的目标标注通常为边框与类别集合,因此我们将其转换为离散token序列;网络架构 :我们采用了编码-解码架构,其中编码器用于感知像素输入,解码器用于生成目标序列;损失函数 :模型通过最大化token的对数似然进行训练。
-
ResRep: Lossless CNN Pruning via Decoupling Remembering and Forgetting论文:https://arxiv.org/abs/2007.03260代码:https://github.com/DingXiaoH/ResRepResRep这个名字包括两部分:Res指的是Gradient Resetting,本文提出的一种魔改SGD更新规则;Rep指的是Convolutional Re-parameterization,也就是本文的核心。所以,这一方法也是“重参数化宇宙”的一部分,可以看成重参数化方法论在剪枝领域的成功应用。我想到这个idea主要是是因为我想用结构重参数化来做剪枝,拓展重参数化的应用领域,觉得这样做很有意思。顺便再提一下结构重参数化代表作,一叠3x3卷积堆起来的RepVGG,GitHub 2000star,最新版达到84.16% ImageNet top-1,反超若干Transformer!RepVGGplus的工作正在进展中!清华&旷视提出RepVGG:让你的CNN一卷到底!重参宇宙的简要介绍:https://zhuanlan.zhihu.com/p/361090497Motivation:解耦“记忆”和“遗忘”这一方法多多少少跟神经科学研究有关:动物脑中的记忆和遗忘是两个相对独立的过程,由不同的机制和化学物质控制,并不是说我们记住了什么东西就会自然而然地“覆盖”掉什么记忆。这似乎意味着,如果我们把CNN类比于动物脑,CNN的结构类比于脑结构,CNN的训练(让一些参数变大,一些变小)类比于脑的记忆(一些突触变强,一些变弱),CNN的剪枝(去掉一些结构,如链接、kernel、通道)类比于脑的遗忘(一些神经元和突触的失活),我们就会想到:让CNN中的不同结构负责“记忆”和“遗忘”应该是有好处的。但是在大多数现有的剪枝方法中,“记忆”和“遗忘”是耦合的。例如,一些方法在卷积层的kernel上加一个惩罚项,如L1/L2/Lasso,然后先通过训练使一些通道变小(也就是说,使其对应的参数张量接近0)再剪枝。这样的解决方案是自然的,因为剪掉小的通道造成的精度损失自然就小。问题是,在这一训练过程中,每一个通道的参数既参与了“记忆”(计算原目标函数,导出与目标函数相关的梯度,用这部分梯度更新参数)又参与了“遗忘”(计算惩罚项,导出与惩罚项相关的梯度,用这部分梯度更新参数)。这就造成了一个左右为难的困境:模型既“记不好”(该变小的通道变小了,不该变小的也变小了,精度降低)又“忘不掉”(该变小的也没变得足够小,剪的时候依然有性能损失)。(如下图A)ResRep提出的解决方案是:将原CNN等价拆分成负责“记忆”(保持精度不降低)的部分和负责“遗忘”(去掉某些通道)的部分,前者进行“记忆训练”(不改变原目标函数、不改变训练超参、不改变更新规则),后者进行“遗忘训练”(一种基于SGD的魔改更新规则,即Res),应该能取得更好的效果(更高压缩率、更少精度损失)。然后,如果我们能将“记忆”和“遗忘”部分等价合并成一个更小的模型,不就能实现剪枝了吗?(如下图B)
-
现实生活中常常会有这样的问题:缺乏足够的先验知识,因此难以人工标注类别或进行人工类别标注的成本太高。很自然地,我们希望计算机能代我们完成这些工作,或至少提供一些帮助。根据类别未知(没有被标记)的训练样本解决模式识别中的各种问题,称之为无监督学习。 常用算法 常用的无监督学习算法主要有主成分分析方法PCA等,等距映射方法、局部线性嵌入方法、拉普拉斯特征映射方法、黑塞局部线性嵌入方法和局部切空间排列方法等。 从原理上来说PCA等数据降维算法同样适用于深度学习,但是这些数据降维方法复杂度较高,并且其算法的目标太明确,使得抽象后的低维数据中没有次要信息,而这些次要信息可能在更高层看来是区分数据的主要因素。所以现在深度学习中采用的无监督学习方法通常采用较为简单的算法和直观的评价标准。 聚类 无监督学习里典型例子是聚类。聚类的目的在于把相似的东西聚在一起,而我们并不关心这一类是什么。因此,一个聚类算法通常只需要知道如何计算相似度就可以开始工作了。聚类算法一般有五种方法,最主要的是划分方法和层次方法两种。划分聚类算法通过优化评价函数把数据集分割为K个部分,它需要K作为 输人参数。典型的分割聚类算法有K-means算法, K-medoids算法、CLARANS算法。层次聚类由不同层次的分割聚类组成,层次之间的分割具有嵌套的关系。它不需要输入参数,这是它优于分割聚类 算法的一个明显的优点,其缺点是终止条件必须具体指定。典型的分层聚类算法有BIRCH算法、DBSCAN算法和CURE算法等。
-
人工智能增强的系统使医生可以花更少的时间搜索临床信息,而将更多的时间花在治疗患者上。 麻省理工学院和贝斯以色列女执事医疗中心的研究人员正在结合机器学习和人机交互来创建更好的电子健康记录 (EHR)。他们开发了 MedKnowts,该系统将查找医疗记录和记录患者信息的过程统一到一个单一的交互式界面中。 在人工智能的驱动下,这种“智能”电子病历会在临床医生需要时自动显示定制的、针对特定患者的医疗记录。MedKnowts 还为临床术语提供自动完成功能,并使用患者信息自动填充字段以帮助医生更有效地工作。 为了设计一个有益于医生的 EHR,研究人员创建了一个带有侧面板的笔记编辑器,可以显示患者病史中的相关信息、历史信息以卡片的形式出现,专注于特定的问题或概念。 例如,如果 MedKnowts 将文本中的临床术语“糖尿病”识别为临床医生类型,系统会自动显示一张“糖尿病卡片”,其中包含药物、实验室值以及与糖尿病治疗相关的过去记录的片段。 称为筹码的交互式文本片段用作相关卡片的链接。当医生输入注释时,自动完成系统会识别临床术语,例如药物、实验室值或条件,并将它们转换为芯片。每个芯片都显示为一个单词或短语,根据其类别以某种颜色突出显示(红色表示医疗状况,绿色表示药物,黄色表示手术等)通过使用自动完成,无需医生额外的费力即可收集有关患者状况、症状和药物使用情况的结构化数据。
-
机器学习的概念:机器学习是一种统计学方法,计算机利用已有数据得出某种模型,再利用此模型预测结果。特点:随经验的增加,效果会变好。简单模型举例:决策树模型预测班车到达时间的问题描述: 每天早上七点半,班车从 A 地发往 B 地,到达 B 地的时间如何准确预测?如果你第一次乘坐班车,你的预测通常不太准。一周之后,你大概能预测出班车 8:00 左右到达 B 地;一个月之后,随着经验的增加,你还会知道,周一常堵车, 会晚 10 分钟,下雨常堵车,会晚 20 分钟。于是你画出了如下的一张树状图,如 果是周一,还下了雨,班车会 8:30 到达;如果不是周一,也没有下雨,班车会 8:00 到达。机器学习和传统计算机运算的区别:传统计算机是基于冯诺依曼结构,指令预先 存储。运行时,CPU 从存储器里逐行读取指令,按部就班逐行执行预先安排好的 指令。其特点是,输出结果确定,因为先干什么,后干什么都已经提前写在指令 里了。机器学习三要素:数据、算法、算力 深度学习的概念:深层次神经网络,源于对生物脑神经元结构的研究。人脑神经网络:随着人的成长,脑神经网络是在渐渐变粗变壮。生物学中的神经元:下图左侧有许多支流汇总在一起,生物学中称这些支流叫做 树突。树突具有接受刺激并将冲动传入细胞体的功能,是神经元的输入。这些树突汇总于细胞核又沿着一条轴突输出。轴突的主要功能是将神经冲动由胞体传至 其他神经元,是神经元的输出。人脑便是由 860 亿个这样的神经元组成,所有的 思维意识,都以它为基本单元,连接成网络实现的。计算机中的神经元模型:1943 年,心理学家 McCulloch 和数学家 Pitts 参考了 生物神经元的结构,发表了抽象的神经元模型 MP。神经元模型是一个包含输入, 输出与计算功能的模型。输入可以类比为神经元的树突,输出可以类比为神经元 的轴突,计算可以类比为细胞核。人工智能 Vs 机器学习 Vs 深度学习 的对比:人工智能,就是用机器模拟人的意识和思维。机器学习,则是实现人工智能的一种方法,是人工智能的子集。深度学习就是深层次神经网络,是机器学习的一种实现方法,是机器学习的子集。 机器学习的典型应用1、应用领域 计算机视觉、语音识别、自然语言处理2、主流应用:(1) 预测(对连续数据进行预测) 如,预测某小区 100 平米的房价卖多少钱。 根据以往数据(红色●),拟合出一条线,让它“穿过”所有的点,并且与各个点 的距离尽可能的小。我们可以把以前的数据,输入神经网络,让他训练出一个模型,比如这张图中红 色点表示了以往的数据,虚线表示了预测出的模型 Y = ax + b ,大量历史数据 也就是面积 x 和房价 y 作为输入,训练出了模型的参数 a = 3.5, b = 150,则 你家 100 平米的房价应该是 3.5 * 100 + 150 = 500 万。 我们发现,模型不一定全是直线,也可以是曲线;我们还发现,随着数据的增多, 模型一般会更准确。(2) 分类(对离散数据进行分类) 如,根据肿瘤患者的年龄和肿瘤大小判断良性、恶性。 红色样本为恶性,蓝色样本为良性,绿色分为哪类?假如让计算机判断肿瘤是良性还是恶性,先要把历史数据输入到神经网络进行建 模,调节模型的参数,得到一条线把良性肿瘤和恶性肿瘤分开。比如输入患者的 年龄、肿瘤的大小 还有对应的良性肿瘤还是恶性肿瘤,使用神经网络训练模型 调整参数,再输入新的患者年龄和肿瘤大小时,计算机会直接告诉你肿瘤是良性 还是恶性。比如上图的绿色三角就属于良性肿瘤。
-
深度学习训练过程语音2006年,Hinton提出了在非监督数据上建立多层神经网络的一个有效方法,具体分为两步:首先逐层构建单层神经元,这样每次都是训练一个单层网络;当所有层训练完后,使用wake-sleep算法进行调优。将除最顶层的其他层间的权重变为双向的,这样最顶层仍然是一个单层神经网络,而其他层则变为了图模型。向上的权重用于“认知”,向下的权重用于“生成”。然后使用wake-sleep算法调整所有的权重。让认知和生成达成一致,也就是保证生成的最顶层表示能够尽可能正确的复原底层的节点。比如顶层的一个节点表示人脸,那么所有人脸的图像应该激活这个节点,并且这个结果向下生成的图像应该能够表现为一个大概的人脸图像。wake-sleep算法分为醒( wake)和睡(sleep)两个部分。wake阶段:认知过程,通过外界的特征和向上的权重产生每一层的抽象表示,并且使用梯度下降修改层间的下行权重。sleep阶段:生成过程,通过顶层表示和向下权重,生成底层的状态,同时修改层间向上的权重。自下上升的非监督学习就是从底层开始,一层一层地往顶层训练。采用无标定数据(有标定数据也可)分层训练各层参数,这一步可以看作是一个无监督训练过程,这也是和传统神经网络区别最大的部分,可以看作是特征学习过程。具体的,先用无标定数据训练第一层,训练时先学习第一层的参数,这层可以看作是得到一个使得输出和输入差别最小的三层神经网络的隐层,由于模型容量的限制以及稀疏性约束,使得得到的模型能够学习到数据本身的结构,从而得到比输入更具有表示能力的特征;在学习得到n-l层后,将n-l层的输出作为第n层的输入,训练第n层,由此分别得到各层的参数。自顶向下的监督学习就是通过带标签的数据去训练,误差自顶向下传输,对网络进行微调。基于第一步得到的各层参数进一步优调整个多层模型的参数,这一步是一个有监督训练过程。第一步类似神经网络的随机初始化初值过程,由于第一步不是随机初始化,而是通过学习输入数据的结构得到的,因而这个初值更接近全局最优,从而能够取得更好的效果。所以深度学习的良好效果在很大程度上归功于第一步的特征学习的过程。
-
问题现象训练作业mox的Tensorflow版本在运行的时候,会先执行“50steps” 4次,然后才会开始正式运行。warmup即先用一个小的学习率训练几个epoch(warmup),由于网络的参数是随机初始化的,如果一开始就采用较大的学习率会出现数值不稳定的问题,这是使用warm up的原因。等到训练过程基本稳定之后就可以使用原先设定的初始学习率进行训练。原因分析Tensorflow分布式有多种执行模式,mox会通过4次执行50 step记录执行时间,选择执行时间最少的模型。处理方法创建训练作业时,在“运行参数”中增加参数“variable_update=parameter_server”来关闭Mox的warmup。
-
介绍 很多时候,我们希望能够查看一下自己使用的设备的信息,特别是训练的时候,可能要看看显卡的显存的使用率和利用率。这个相信大家都很熟悉了,就是nvidia-smi命令,打开终端,执行即可。但这条命令只能查看目前的,无法实时查看,持续刷新。那这就要用到另一条命令了,打开终端,输入即可。watch -n 0.1 nvidia-smi 你会得到信息 当然,这不是重点,重点是,希望看到CPU信息。很简单,使用s-tui库就行了,安装特别方便。打开终端,执行:pip install s-tui 运行也特别简单,直接执行s-tui命令 你会得到 按下键盘的向下的箭头键,你还可以看到每个Core的信息规格 是不是很详细,我使用的是免费体验规格,可以看到使用的是Intel Xeon E5-2690v4 @2.60GHz的处理器,8核,服务器级处理器,性能稳定,频率稳定在2.60GHz,紫色的部分是每个Core的频率,可以看到基本不变,绿色部分是使用率,不错吧,这处理器比绝大多数笔记本和台式机的处理器要好,起码核多呀,这样在训练是读取数据可以使用多线程,大大提高读取数据的速度,节约训练时间。
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第三期2026/08/21 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;念擎-华为云AI开发者运营案例开发专家
本期直播内容:AI六层能力首次详细解读 + 新一代华为云开发者空间亮相 + 校园案例直播带练
回顾中
热门标签