• [技术干货] Sora文生视频:重新定义视频创作的边界
    前言随着数字技术的飞速进步,视频创作已经从专业领域的专属工具,逐渐转变为大众皆可参与的创意表达平台。而在这个变革的浪潮中,Sora文生视频凭借其独特的技术优势和创新的理念,正重新定义着视频创作的边界。Sora文生视频不仅仅是一个视频编辑工具,它更是一个集创意、协作与分享于一体的综合性平台。通过Sora,用户可以轻松地将自己的想法和故事转化为生动的视频作品,与全世界分享自己的创意和热情。一、技术驱动的创意表达Sora文生视频拥有强大的技术支撑,其基于深度学习的图像处理和语音识别技术,使得视频编辑变得更加智能化和高效。用户无需具备专业的视频制作技能,只需要通过简单的拖拽和选择,就能实现复杂的视频剪辑和特效制作。在Sora平台上,用户可以轻松调整视频的色彩、光线和构图,实现电影级的视觉效果。同时,平台还提供了丰富的音效库和背景音乐选择,让视频作品更加生动和感人。除了基础的编辑功能,Sora还支持AI驱动的自动化编辑。通过智能识别视频内容,Sora能够自动添加合适的特效、转场和字幕,大大提升了视频制作的效率和便捷性。二、协作与分享的社区精神Sora文生视频非常注重用户之间的协作与分享。平台提供了多人在线编辑功能,使得团队成员可以实时协作,共同完成一个视频项目。这种协作模式不仅提高了工作效率,也让创意的碰撞和融合成为可能。同时,Sora还建立了一个充满活力的创作者社区。在这个社区里,用户可以浏览和分享其他创作者的作品,互相学习、互相启发。这种分享和互动的精神,让Sora成为了一个创意的聚集地,吸引着越来越多的创作者加入其中。三、教育与培训的广阔应用除了个人创作者和团队协作,Sora文生视频在教育和培训领域也有着广泛的应用。教师可以利用Sora平台制作生动有趣的课件和教学视频,提高学生的学习兴趣和效果。学生也可以利用Sora平台自主创作学习视频,巩固和拓展学科知识。此外,Sora还可以作为企业和机构的内部培训工具。通过制作定制化的培训视频,企业可以更加高效地进行员工培训和能力提升。四、展望未来随着技术的不断发展和市场的不断拓展,Sora文生视频的未来充满了无限可能。首先,随着5G、云计算等技术的普及,视频创作和分享将变得更加便捷和高效。Sora平台将能够支持更高清、更流畅的视频制作和分享,为用户提供更加优质的视频体验。其次,随着AI技术的不断进步,Sora的自动化编辑功能将更加智能和精准。未来,我们甚至可以期待通过语音或文字描述,就能自动生成高质量的视频作品。最后,随着全球创作者社区的不断扩大和成熟,Sora将成为一个真正的全球创意交流平台。在这个平台上,不同文化、不同背景的创作者可以相互碰撞、相互学习,共同推动视频创作艺术的进步和发展。结语Sora文生视频以其独特的技术优势和创新的理念,正在重新定义视频创作的边界。它不仅提供了一个高效便捷的视频编辑工具,更建立了一个充满活力和创意的社区。在这个平台上,每个人都可以成为创作者,用视频表达自己的想法和故事。随着技术的不断进步和市场的不断拓展,我相信Sora文生视频将会在未来继续引领视频创作的新潮流,为我们带来更多惊喜和感动。
  • [互动交流] 在ECS windows部署Llama2 尝试使用MLC运行,但出现以下报错,求助
    在ECS windows部署Llama2 尝试使用MLC运行,但出现以下报错,求助
  • [技术干货] 2024年1月人工智能问题总结合集
    一月问题总结如下:【1】用华为atlas300-3010 用于训练失败cid:link_3【2】如何展示这些图片呢cid:link_4【3】云平台第一次用,求助怎么导入transformers库啊?cid:link_0【4】 atlas 200 DK 制卡完成后启动不了cid:link_1【5】请问下,新人申请预测大模型一般几天可以通过申请。cid:link_2
  • [其他] 浅谈机器学习工具
    了解一些该领域的常用工具开源工具Python – 由于其易用性,灵活性和开源特性,Python是当今行业数据科学中最主要的语言之一。它已经在ML社区中迅速普及并被广泛接受。 R – 它是数据科学中另一种非常常用且受人尊敬的语言。R有一个蓬勃发展且被极大支持的社区,附带了许多软件包和库,支持大多数的机器学习任务。Apache Spark – Spark由加州大学伯克利分校于2010年开源,此后已成为最大的大数据社区之一。它被称为大数据分析的“瑞士军刀”,因为它具有多种优势,例如灵活性、速度、计算能力等。Julia – 它是一种即将到来的语言,被捧为Python的继承者。目前它仍处于起步阶段,观察其在未来的表现将会是一件有趣的事。Jupyter Notebooks – 这些笔记本广泛用于Python编程。尽管它主要用于Python,但它也支持其他语言,Julia,R等。收费工具SAS – 这是一个非常受欢迎且功能强大的工具。在银行和金融部门中被普遍使用。它的使用在美国运通,摩根大通,西格玛,苏格兰皇家银行等私人组织中占有很高的份额。SPSS – SPSS是“社会科学统计软件包”的缩写,在2009年被IBM收购。它提供高级统计分析、庞大的机器学习算法库、文本分析等。Matlab – Matlab在组织机构的领域里确实被低估了,但在学术界和研究部门中得到了广泛的使用。最近相较于Python,R和SAS,Matlab已经阵地失守,但是大学(尤其在美国)仍在使用Matlab教授许多本科课程。
  • [其他] 浅谈多模态模型
    CLIPCLIP是OpenAI提出的连接图像和文本特征表示的对比学习方法。论文: https://arxiv.org/abs/2103.00020ViLBERTViLBERT修改BERT中query条件下的key-value注意力机制,将其发展成一个多模态共注意transformer模块。LXMERTcross-attention在cross操作后加入一个全连接层,同时融合了图片和文字的信息。增加了一些预训练任务目标,比如Masked Cross-Modality LM。增加图像问答任务到预训练任务中(引入vqa等数据集的训练集)。论文:https://arxiv.org/abs/1908.07490VL-BERT模型在BERT的基础上在输入中嵌入一种新的视觉特征来适应视觉的相关内容。与BERT类似,模型主要由多层双向Transformer编码器组成。但与BERT只处理句子单词不同,VL-BERT把视觉元素和语言元素都作为输入,模型分别在图像的感兴趣区域(RoIs)和输入句子中的单词上定义相应特征。UNITER创新点:a) 有文本的预训练任务比没有文本的预训练任务效果更好b) Vison+Language 组合的预训练效果要好于单独的 Vision/Languagec) 最好的预训练组合是:MLM+ITM+MRC-kl+MRFPd) 将上面提到的四个数据一起训练效果最好,这也证明数据越多效果越好e) 扩大的数据集任务:a) MLM(conditioned on image,遮字模型)b) MRM(Mask Region Model,预测图像,回归或分类,有三种变体)--MRC(Mask Region Cls),MRFR(Mask Regin Feature Regress),MRC-KL(MRC + KL divergency)c) ITM(Image Text Match,图文是否一致)d) WRA(Word Region Alignment,字和图像的对齐任务)论文:https://arxiv.org/pdf/1908.08530.pdfImageBERT主要在与数据量,作者从网络上收集了一个大型的弱监督图像-文本数据集LAIT,包含了 10M(1千万)的 Text-Image pairs,这也是目前最大的一个数据集。论文:https://arxiv.org/abs/2001.07966Pixel-BERT论文:https://arxiv.org/abs/2004.00849a) 句子编码:采用跟bert一样的编码方式。b) 图片编码:对图片进行卷积,池化,最后得到一个特征矩阵(元素为特征向量),对其进行采样后,每个元素与一个semantic embedding相加,相当于一种偏置。最后展平,得到最终的像素特征编码。c) 多模态编码:将两种表示拼接在一起,过TRM,得到最终的表示。d) 任务:MLM任务和图片-文本匹配任务。Oscar: Object-Semantics Aligned Pre-training for Vision-Language Tasks ECCV 2020 motivation:提出了一种新的学习方法Oscar,它用图像中检测到的对象标签作为锚点,在一个共享的语义空间中对齐图像和语言模态。在一个有650万个图像-文本对的公共语料库上对Oscar模型进行了预训练,验证了Oscar的有效性。method&task:将词符、对象标签、区域特征作为输入,增加mask token loss和contrastive loss。论文:https://arxiv.org/abs/2004.06165InterBERT提出跨度更大的mask和高阶交互特征后保持模态独立性方法。 论文:https://arxiv.org/abs/2003.13198ViLT文本特征输入部分,将文本看成一个词序列,通过word embedding matrix转化成word embedding,然后和position embedding进行相加,最后和modal-type embedding进行concate。图像特征输入部分,将图像切块看成一个图像块序列,通过linear projection转化成visual embedding,然后和postion embedding进行相加,最后和modal-type embedding进行concate。其中word embedding和visual embedding通过可学习的modal-type embedding标志位来区分,其中0标志位表示word embedding部分,1标志位表示visual embedding部分。word embedding和visual embedding分别都嵌入了一个额外的可学习[class] embedding,方便和下游任务对接。类似clip单流
  • [公告] 【获奖公示】1.5号直播 / DTSE Tech Talk丨NO.51:华为云DTT年度收官盛典:AI创造无限可能
    中奖结果公示感谢各位小伙伴参与本次活动,本次活动获奖名单如下所示。请获奖的伙伴在1月14日之前点击此处填写收货地址,如逾期未填写视为弃奖。再次感谢各位小伙伴参与本次活动,欢迎关注华为云DTSE Tech Talk 技术直播更多活动~【报名转发抽奖】奖项名单华为云账号昵称奖品hw090512683yd_235942659华为云定制Polo衫hid_a0211e-bd-x__swyd_230717006华为云定制Polo衫hid_y_w9dg_leuhuf8o小云悠悠zZ华为云定制Polo衫hw71474994yd_267218756华为云定制Polo衫hw053453872yd_224714878华为云定制Polo衫【我与DTT的独家记忆】奖项名单(奖品:华为云云宝公仔一套) 点击链接查看【专家坐堂有奖】奖项名单(奖品:华为云定制长袖卫衣) 点击链接查看【有奖调研】奖项名单账号奖品xiaozhongy华为云无线鼠标hw008562287华为云无线鼠标hid__cn8cjapw6ba12c华为云无线鼠标jackie306华为云无线鼠标linghz666华为云无线鼠标
  • [技术干货] 实验探索:利用GAN随机生成指定图像的优化思路
    我想使用GAN实现指定一个粒径和棱角性(比如我指定粒径是4.75,棱角性是1200),然后它可以随意生成想要集料形状和棱角性大小,如下图所示:我设计的GAN在训练过程中生成器图像分类Loss很容易出现欠拟合,该如何优化呢?我使用了3600张图像用作训练,判别器的分类效果一直很好,生成器训练几十轮后就会出现欠拟合。我目前怀疑模型在反向传播过程中使用多个loss会互相干扰,但是不知道从哪方面下手,末尾附注Notebook链接。
  • [互动交流] 人工智能服务的价格计费模式是怎样的?
    人工智能服务的价格计费模式是怎样的?
  • [互动交流] 如何使用人脸识别、语音识别、自然语言处理等人工智能服务?
    如何使用人脸识别、语音识别、自然语言处理等人工智能服务?
  • [互动交流] 华为云提供哪些人工智能相关的服务和产品?
    华为云提供哪些人工智能相关的服务和产品?
  • [问题求助] 你好,请问晟腾这边有什么支持的 LLM serving framework吗?
    在晟腾910 npu服务器上安装vllm提示需要CUDA,当前是否有其他的可替代框架?
  • [问题求助] DV安装时报错
    【问题来源】中讯网联【问题类别】DV【AICC解决方案版本】23.200【UAP解决方案版本】UAP9600 V300R001C02SPC102【CTI完整完成解决方案版本】ICD V300R008C25SPC019【期望解决时间】尽快【问题现象描述】DV虚拟机在CloudSOP-UniEP部署产品软件时Zenithdb安装失败,去到PostInstall-DVEngineeringService.log.err日志查看显示以下内容2023-12-12 11:02:23 [INFO] info retry execute DV_V8_I2000_Product Install 1 times.2023-12-12 11:02:23 [ERROR] [Failed] install DV_V8_I2000_Product failed.提示DV_V8_I2000_Product安装失败实例名称:SOP/DVEAM/ies_om_zenith(取消)SOP/DVEngineeringServicePackage/ies_om_global(失败)【日志或错误截图】
  • [其他] 浅谈召回率和准确率以及应用场景
    召回率(Recall)召回率是评估分类模型对正类别的识别能力的指标。它回答了一个问题:“在所有实际为正类别的样本中,模型有多大程度上能够正确地将其预测为正类别?”考虑一个二分类问题,例如医学诊断中的肿瘤检测。在这个场景中,正类别是患有肿瘤的病人。召回率的计算公式如下:True Positives (TP):模型正确预测为正类别的样本数。False Negatives (FN):实际为正类别但模型预测为负类别的样本数。示例: 假设在肿瘤检测中,有100名患有肿瘤的病人。模型成功识别其中的80人,但漏掉了20人。那么,召回率为0.8 或 80%这意味着模型成功捕捉到了实际肿瘤患者中的80%。准确率(Precision)准确率是评估分类模型在预测为正类别的样本中的准确性的指标。它回答了一个问题:“在模型预测为正类别的样本中,有多大程度上是真正的正类别?”准确率的计算公式如下:权衡与应用在某些情况下,更关注召回率可能是关键,例如在医学诊断中,避免漏诊是至关重要的。在其他情况下,更关注准确率可能更合适,尤其是在资源有限且需要确保预测准确性的场景中。综合考虑召回率和准确率,可以使用 F1 分数,它是召回率和准确率的调和平均数,提供了对模型整体性能的更全面的评估。应用召回率和准确率在不同的应用场景中都有其重要性,选择使用哪个指标取决于任务的性质和业务需求。以下是一些常见情况下可能需要考虑这两个指标的情况:1.医学诊断:召回率: 在医学领域,召回率可能更为关键,因为在疾病诊断中,漏诊可能导致严重的后果。高召回率确保尽可能多的真实患者被正确识别。准确率: 准确率同样重要,以确保预测的患者确实患有疾病,以避免误诊。2.垃圾邮件检测:召回率: 在垃圾邮件检测中,避免将正常邮件误判为垃圾邮件是关键的,因此高召回率是重要的。准确率: 准确率同样重要,以确保用户不会错过重要的邮件,避免将正常邮件错误地分类为垃圾邮件。3.金融欺诈检测:召回率: 在金融欺诈检测中,尽早发现潜在的欺诈行为是至关重要的,因此高召回率是关键。准确率: 准确率同样重要,以确保在采取行动之前确实存在欺诈行为,避免误报。4.搜索引擎结果排序:召回率: 在搜索引擎中,希望返回与用户查询相关的尽可能多的结果,因此高召回率是重要的,以确保包含所有相关信息。准确率: 准确率同样重要,以确保用户在搜索结果中找到的是真正相关的信息,避免垃圾信息的干扰。5.客户反馈分类:召回率: 在分类客户反馈时,高召回率确保尽可能多的关键问题被发现,以便及时解决。准确率: 准确率同样重要,以确保回应的问题真正是用户关心的,避免误解用户需求。其他关键指标当评估分类模型性能时,召回率和准确率是关键指标,但有一些其他方面和注意事项也值得考虑:F1 分数: F1 分数是召回率和准确率的调和平均数,可以帮助平衡两者。在某些情况下,特别是当类别不平衡时,F1 分数可能更有代表性。ROC 曲线和AUC: 受试者工作特征曲线(ROC 曲线)和曲线下面积(AUC)是用于评估二分类模型性能的另一种方式。它们考虑了不同阈值下的真正例率和假正例率。混淆矩阵: 混淆矩阵提供了更详细的信息,包括真正例、真负例、假正例和假负例的数量,可以帮助进一步分析模型的性能。类别不平衡: 如果数据集中的类别分布不均匀,单纯使用准确率可能会误导评估。在这种情况下,需要特别关注召回率和其他适应类别不平衡的指标。业务目标: 在选择评估指标时,始终牢记业务目标。某些情况下,更注重召回率,而在其他情况下,更注重准确率可能更符合实际需求。交叉验证: 使用交叉验证来评估模型的稳定性和泛化性能。将数据集划分为训练集和测试集,并多次进行交叉验证,以减少评估结果的随机性。特定领域考虑: 考虑到特定领域的特殊需求,可能需要调整模型的性能指标。例如,在某些医学应用中,对误诊的容忍度可能较低。
  • [技术干货] 人工智能关键技术进展及应用 【转】
    一、什么是人工智能(一)图灵测试图灵测试在 20 世纪 50 年代已经提出,那时没有计算机。图灵测试指测试者与被测试者(一个人或一台机器)隔开的情况下,通过一些装置(如键盘)向被测试者随意提问。进行多次测试后,如果机器让平均每个参与者做出超过 30% 的误判,那么这台机器就通过了测试,并被认为具有人类智能。以前有一些人可能不理解,但到今天就很明白,像小度音箱如果你连问三次今天温度怎样,它的回答是一样的;但你问家人同一个问题三遍,他的回答可能是“你是否有毛病 ? 一个问题问三遍”,这就是人和机器的区别。图灵曾经预测,人类用 50 年左右的时间可能完成图灵测试, 但是实际结果不太理想,人类用了 60 多年的时间才完成了图灵测试。(二)人工智能的应用人工智能的应用领域非常广泛,如人脸识别和跟踪、遥感影像中的目标检测、医学领域中的病灶识别和分类、材料领域的新材料发现。除此之外,人工智能在机器人领域的应用更为广泛 , 对机器人的发展而言 , 从机械角度来讲,目前的机器人灵活度和稳定度已经做的非常好,比在机器人脑部方面的进展要快 , 然而决定机器人水平的主要依据是其智能水平。这和人一样,医院神经科的医生地位通常更高,因为神经科的病人特别多;且这些病相对来讲比较难治疗,因为人脑结构非常复杂。所以从人工智能类脑计算出发,实现仿人机器人还有漫长的路要走。人工智能也是影视娱乐领域的一个重要话题,典型代表是 2004 年的好莱坞电影《我,机器人》,影片中对人工智能有超前认识,讲的是机器和人最终的区别是情感区别。如果有一天机器也有情感会怎样?显然 , 推进人工智能发展 , 预测人工智能的未来需要工科与人文社科研究人员共同努力和协调发展。二、人工智能背后的技术原理(一)机器学习今天人工智能发展的如火如荼,核心原因是机器学习理论。我们要研究人工智能无非就是做一个仿人机器人,让机器达到和人几乎一样的功能。人之所以聪明,最根本的原因是会学习。怎么教会机器学习?从我们小时候教育的过程就可以理解机器和人学习的过程。小学一年级学习加法时,老师课后会布置大量作业,做错了很正常 , 继续修改就行;通过大量训练和纠错 , 到小学三年级大家就掌握了加法的本质原理 , 基本不会犯错了 , 那么学习的目的就达到了。人对世界的认知就是一个学习过程,这个学习有一个特点是小样本学习,需要较少的例子就可以学会 ( 当然存在特殊情况 , 智力有问题的人通常难以有效学习 )。比如人对猫和狗的识别,通常看几张图片就认识了。机器怎么学习?例如利用机器学习的方法可以对图像进行分类,然而当模型过于简单(智力水平低)时,训练好的模型只能识别常规的猫和狗,如果对图像进行各种退化处理或者尺度放缩及形变,模型往往会出错,而人通常可以应对各种外界环境的干扰做出正确识别。这就说明一个问题,人的大脑学习是很聪明的过程,看两三张照片就掌握了规律,是小样本学习。机器要完成对猫和狗的正确识别,需要海量训练样本(图片),同一张图在训练前需要做各种尺度、旋转、仿射变换等(数据增强策略),只有输入大量图片机器才能有效掌握识别猫和狗的规律。如同班上聪明的学生通常只需做两三道题就能掌握这种类型题,而智力水平低的学生需要做几百道同类型的题才能掌握规律,当前的机器学习好比智力水平较低的学生。第二个区别,鲁棒性。比如给机器一个辨别色盲的照片,机器大概率会出错,因为它应对各种新情况能力较弱,而人应对外界环境变化的能力远高于机器。目前的深度学习技术在鲁棒性方面已经有了明显改进,比如人脸识别,回顾 10 年前的人脸识别系统,戴口罩根本无法识别,而现在可以正确识别,说明当前的机器学习水平已经比过去提高很多。机器学习还有一个重要概念是泛化能力,比如我现在认识你,你带了一个小伙子来了,我说这是你儿子,因为和你长的像;而机器通常对它没有见过的东西,出错概率比人要高的多。如果我们训练好一个模型,机器可以对这张图片进行一个正确识别;而像漫画形式的,机器出错的概率就非常高。学习的过程就是总结规律、反复纠错的过程。小学生如果错一个字老师可能会让他写几十遍,说明大脑可以被认为是一个模型,这个模型本来不健全,通过不断学习,模型稳定后就不再出错,这是一个反复纠错的过程。机器也一样,现在的人脸识别模型就是一个复杂函数,里面有很多参数,只要调整参数值整个判别函数就变了。所以,我们要学习模型里不同参数值,参数初始值是随意给的,而机器学习在第一次的学习过程中(例如 1+1=3),错了就对参数进行修改;第二次学习过程中又一个样本学习错了(例如 2+5=9),继续再修正参数;一直下去,直到发现它能连续多次正确就不再修改模型里的参数,这是学习的最基本过程。图 1 误差函数的变化机器学习涉及到的三要素是数据、模型和算法。比如要对一些图片进行识别,把猫识别出来,就需要大量样本,就好比学生学习需要大量题库,如果题库都没有做过,怎么可能掌握基本知识,所以样本可以认为是最基本的素材。进入大数据时代,由于计算机成像技术的快速发展,获取图像、语音、文本的方式越来越简单,因此各种媒体数据量不断增加。其次是模型。模型很简单,就是一个函数。例如,我们可以看到一个简单函数、一个复杂函数,简单函数是线性的;复杂函数是非线性的。简单函数可以认为是一个智力水平低的小孩,辨别能力差表现在这个分类的模型很简单;复杂模型类似于一个智力水平很高的科学家,对各种各样的事都可以做出正确判断和处理,这就是简单模型和复杂模型的区别。深度学习的过程就是要把简单模型变成复杂模型,这样就不容易出错。机器学习最后一个要素是学习算法,例如同样一个班的学生,为什么有的学生成绩好,有的学生成绩不好,就是因为学习方法不同,这是有差异的。在实际过程中也是一样的,我们在训练模型时用不同算法去做,效率不同,有时训练机器 2 小时就可以收敛,有时训练 10~20 个小时还不能收敛。所以,选择一个很好的算法很重要。(二)机器学习系统以人脸识别为例,首先进行数据收集,需要收集大量的人脸数据,被称为历史数据。历史数据包括训练数据和验证数据,训练数据相当于我们平时做的题库;验证数据相当于模拟考试。对模型学习的过程中就是对它的参数不断进行调整。调整的方法是,对错的东西进行惩罚,不断把错的东西变成正确的。等题库里的题做完了就开始验证,通过验证发现成绩还是不行,说明老师有问题,或者说家长有问题,或者学习的环境有问题,这些外界因素就如同模型的超参数。通过调整这些超参数后再进行学习,直到成绩可以了,就能够参加最终测试。(三)神经网络机器学习里有很多种方法和工具,其中最核心的就是神经网络。生物学家发现,人脑本身就是一个复杂网络,如何模拟人脑的网络去工作,这是科学家一直奋斗的目标。这方面的工作可以追溯到上世纪三四十年代,模拟人脑的功能网络。从最早的感知器,到今天的深度学习,其原理都是在模拟人的大脑工作机理。人的大脑大约有 860 亿个神经元。基于神经元的工作机理,数学家们将其抽象为人工神经元数学模型,这是人脑工作最基本的机理,这个工作机理就是加权求和的过程。比如开会投票,六个评委每个人打分,最后的打分结果不是直接求平均值,而是带有权重的平均。由于线性运算难以表达复杂模型,因此神经元还涉及到是否激活的问题,这个激活是个非线性运算。因此一个神经元首先通过加权求和的线性运算;其次通过一个非线性运算;最终输出结果,这就是神经元的最终工作流程。神经网络经历了三次热潮,同时也经历了二次寒冬。图灵在 1936 年提出图灵机,人工智能从此开始进入第一次热潮。随着计算机技术的发展,人工智能也在不断向前发展。到 1974 年经历了一次寒冬,因为最早的神经网络只能对线性可分的数据进行分类,学者们就认为神经网络应用具有较大的局限性,而专家系统可以解决更为复杂的问题。直到 BP 神经网络出现后,其成功地解决了线性不可分数据的正确分类,神经网络迎来了第二次热潮。1987 年,由于神经网络需要更多的训练数据,且识别精度有限,而支持向量机(SVM)是小样本学习方法,且表现出更好的分类性能,因此神经网络一度被质疑,进入了第二次寒冬。直到 2006 年,因为神经网络层的设计不能太深,而人脑的工作机理是深层网络,中间的参数是指数级增长,计算量和模型的复杂性也都是指数级增长;以往的神经网络很难进行深层设计,原因在于无法进行有效训练,而 Hinton 提出深度学习的概念,通过逐层训练结合微调的方式实现了深层网络的训练,由此人工智能进入了第三次黄金时代。进入深度学习时代后,人工智能迎来快速发展,在传统的 BP 神经网络中,我们通常需要人工进行特征提取,然后设计神经网络实现数据分类或回归。比如做人脸识别,实际上是想办法把一个人脸的照片转换成一个向量,在非深度学习的时代这个过程被称为手工提取特征。提取人脸特征后,要对这些特征进行分类,因此需要训练一个分类器,整个提取特征和特征分类分开执行,而深度学习可以把这两个任务融为一体,让机器全部自动学习。尤其是怎么把人脸变成一个向量让机器自己学习,而不需要人帮助,这就是深度学习和传统机器学习最本质的区别,因为它能够自动学习,所以学习出来的特征往往比人工设计的特征要好很多。深度学习是信息时代的必然产物。21 世纪是大数据时代,随着成像技术的发展,我们对图像数据、视频数据和文本数据的获取很容易,数据获取方式更为简单,获取大数据集变得越来越容易。有了数据,还要有算力。所谓训练过程就是计算过程,以前训练一个模型要两天,到现在 2 个小时就可以结束。有了数据和算力,还要有算法进行支撑。进入深度学习后,可以设计深度学习模型,尤其是各种学习理论做支撑。三者同时发展,就有了今天人工智能高速发展的结果。深度学习的代表性方法是深度神经网络。深度神经网络最大的成功在于分层表达,当前的深度神经网络可以做到几千层。层的作用就是认知的过程,层越多模型就越复杂,表达能力就越强。比如进行数字识别,第一层里对这个数字的认识就是不同颜色块,说它有什么特征我不知道;第二层就有一种高级信息,有形状和纹理;第三层就是高级语义信息。深度学习繁荣发展的历程。李飞飞的主要贡献是整理了一个图像库 ImageNet,里面大概有1500万张图像,而且对很多图像做了标注(共标注了大约 120 万张图像)。有了这个超级大库后,学者们就可以验证深度学习的有效性。没有大数据作支撑,无法验证各种深度模型的好坏。因此自 2010 年后,学者们相继参加 ImageNet 比赛,直到 2017 年图像分类错误率已降到了非常低的量级,比赛停止。三、人工智能技术现状首先是数据的现状,GPT 的训练数据大约 80万张网页,GPT-2 的训练数据大概 800 万张网页,GPT-3 的训练数据达到 45TB。大数据一旦到来后,只有大公司高投入才能做这样的事情。现在的机器学习方法有监督式学习和非监督式学习两大类。所谓监督式学习分为分类和回归两个问题。回归问题预测的是一个数值,比如天气预报、股票开盘价预测。机器学习里的两大任务,无非就是分类问题和回归问题。监督学习类似于我们的课堂教育,由老师教给你,错了马上指出,不断让你纠错。这样的学习方式成本高,要交学费,还需要很多老师;非监督学习相反,不需要老师、课堂,自学成才。通常非监督学习不如监督学习,因为自学成才的人较少,而且难度大。但是非监督学习是我们奋斗的目标,让机器能自动学习,而不是不断教它。介于监督学习和非监督学习中间的是弱监督学习,其分为三种,第一种是不完整的监督,做标记时只有一部分进行标记。比如一套题库中,10 套有答案,10 套没有答案,这是不完整监督。第二种是不确切监督。给一个大概的答案,可以很具体地标猫和狗,但也可以笼统地标为动物;类似于老师不教步骤,只讲方法。第三种是不正确监督,即老师也有讲错题的时候。深度学习繁荣发展。谷歌是全球最大的互联网公司,一直走在人工智能领域的最前端,近年来先后提出了 Transformer、Bert 等。除了谷歌,2017 年微软投入 10 亿美金给 OpenAI 做研发,从而促进了该公司在人工智能领域的崛起,尤其是 GPT-3 的提出,实现了人工智能大踏步前进。除了 OpenAI 公司,还有很多公司也做的非常好,例如苹果、华为的诺亚方舟、京东的探索研究院等。人工智能的发展可以分为弱人工智能、强人工智能和超人工智能三个层次。个人粗略认为,2020年以前人工智能一直处于弱人工智能。所谓弱人工智能就是下棋、人脸识别这种单项任务。强人工智能就是类人的活动,尤其是多任务执行,例如机器人可以实现自己编程序、语音聊天、自动驾驶等。现在已经步入了强人工智能时代。未来的人工智能应该步入的是超人工智能。所谓超人工智能就是在各领域全面超越人类,或者超过我们的大脑。人工智能现在存在的问题主要表现在三个方面,一是模型很大,参数量多,内存消耗高;二是数据标注成本较高;三是多任务执行比较难。现在能见到的机器人有送菜机器人、巡警机器人、捡垃圾机器人,一个机器人能不能完成所有的功能?所以多任务执行比较困难。最大问题是它的计算量太大,耗能方面目前是一个严重问题。AlphaGO 下一盘棋的电费大约 3 000 美元。抛开 AlphaGO 我们看GPT-3,它的参数量是 1 750 亿,人类只有大约 860亿神经元。这个模型训练一次成本很高,用电需要19 万度,碳排放是 8.5 万公斤,相当于一辆车从月球开到地球一个来回的碳排放。在碳中和的年代,如何发展人工智能?显然未来我们需要有新的技术作支撑。四、人工智能技术的应用人工智能如果可以全面用于无人驾驶,会产生非常大的经济效益,但也可能存在很多问题。现在百度、小米都在造汽车,考虑的是未来的新能源及自动驾驶,成本很低。人工智能在医疗领域,从商业价值来讲是最有意义的一个应用。在疾病预测和影像分析领域,人工智能已经表现出明显的优势,尤其某些诊断已全面超过人类,如青光眼的筛查比人类专家水平还高。考虑到责任问题,人工智能在医学里只能作为辅助手段,为医生提供各种参考,最终诊断由医生确定。1:智慧医疗在智慧医疗方面,我们开发了一套面向肝功能辅助评估的在线分析系统,输入病人肝脏影像后,直接可以打出结构化报告,如果依赖人工去做,传统方法需要 1~2 天才能完成。因此这套影像分析系统可以极大提高医生的工作效率。2:金属及泡沫材料属性分析根据金属材料扫描电镜图像,研究金属材料单物理属性,需要分析其中的孔洞分布,手动去量通常非常困难,通过人工智能的方法可以做一个有统计意义的分析结果。我们利用计算机视觉技术成功帮助材料研究人员自动分析金属材料属性,为他们提供非常客观的测量数据,误差率降低了一个数量级。此外,对网状结构的泡沫材料(中间的孔洞更多)也可进行智能分析。3:智能地层驱油分析通过给地层注入水(红色是油的分布,蓝色是水,背景是地层)后可以把油驱出,这就是采油的原理。实际中,研究人员把地层结构做成芯片放到实验室,用照相机进行拍照分析地层中水驱油的变化。我们做了一个智能系统可以分析油路走向,通过之前和之后的图像对比,利用人工智能技术找出前后的变化趋势,找到油路的走向,帮助工作人员找到最佳取油路径。五、人工智能的未来人工智能的未来是可信人工智能、超级深度学习和量子机器学习。京东探索研究院联合中国信通院在 2021 年发布了可信人工智能白皮书。为什么是可信人工智能?比如无人驾驶必须要识别街区场景,如果各种标识牌上贴了小广告,这种情况下智能车通常就会识别错误,发生的后果可能会很严重。这个责任怎么去划分?所以这方面有很多问题,比如可信可视、多元包容等。当前,数据不断在增长,模型参数也在增长,计算机的计算性能也在增长。因为有计算性能做支撑,所以不害怕数据增长和模型提升,未来的深度学习可以执行的任务非常多,学习能力也很强,能够达到接近人的学习能力,最终实现整体人工智能产业链的布局。量子机器学习。中国科技大学潘建伟教授开发出国内第一台量子计算机,其计算性能是现有计算机的 1 亿倍。发展量子计算机是人工智能未来的方向,因为计算效率高、功耗低。
  • [问题求助] 话务签入报错
    【问题来源】   厦门国际银行 【问题简要】话务签入报错【问题类别】  话务条【AICC解决方案版本】【必填】   ICD V300R008C25【问题现象描述】【必填】        话务条签入时会报:webSocket connection to "wss://xxx.xxx.xxx.xxx:8043/agentgateway/ccgateway/agent/103" faile:Error in connection establishment:net::ERR_CERT_AUTHORITY_INVALID,然后将wss://xxx.xxx.xxx.xxx:8043/agentgateway/ccgateway/agent/103链接改成https://xxx.xxx.xxx.xxx:8043/agentgateway/ccgateway/agent/103放入地址栏中访问,就可以正常签入了,但是一旦清除浏览器缓存,再签入就又会报上面的错误,然后又需要执行上面操作,是证书有问题吗?
总条数:7868 到第 页
上滑加载中