• [体验官] 与PaaS产品一起成长的故事:Z市台风模型应用一体化平台技术咨询实战“术”分享——两大基石之AI工程平台MA配置
    它山之石可以攻玉!模型需要训练和调试,众所周知。 在不同平台上,开发部署训练调试模型,所经历的过程是不一样的。这里我们介绍一下在国内五彩斑斓的云环境下如何“借鸡下蛋”。在2017年,国内云市场不如现在百花齐放,云的概念还没有普及。在Z市台风模型一体化平台上曾经借助OWS云开发环境,开发业务模型,这是当时为数不多在国内企业B端市场上活跃的一朵云。有公有云和私有云两种场景,这里介绍这个平台的开发模式,供读者参照对比。当时私有云部署不多,硬件平台也不具备条件,大多数企业采用公有云开发,在公有云上训练模型算法。项目平台基本的业务架构和AI架构都已设计好后,接下来就是逐步搭建云平台能力,让AI模型运行起来。首先配置平台,这是AI模型配置部署运行流水线。 配置有两种形式,一种是在华为云私有云部署配置,适用本地数据不允许外发到互联网的场景;一种是数据外发到华为内部,在内部云上进行模型部署配置。这是集众多AI模型功能于一体的平台,本咨询项目涉及到AI Galley和流水线。流水线要配置数据处理全周期,数据选型、数据清洗和数据存储三部分。数据选型是对AI模型的训练数据和测试数据进行选型,这个功能提供了用户选用地质数据的范围,并且按照理论化的配置,80%用于训练,20%用于测试。这个基础上,再设计模型数据的分类,数据选型前就已经搭好数据湖设计,则按地质业务,训练数据分为图表和文字这两类结构化数据,这是由于当时云环境还不支持非结构化数据。
  • [其他] deepseek确实比较快
    感觉它吐内容,比我用的其他AI工具要明显快很多。为什么这么快,可以看下下面的解释,仅供参考:Mixture-of-Experts (MoE)架构,一种将LLM分割成多个子网络(或称为“专家”)的方法,每个子网络专注于处理输入数据的一个子集,以共同完成特定任务。(1)专家系统:MoE架构包含多个专家,每个专家都是一个独立的神经网络,能够处理特定的任务或数据类型。有多达256个专家,每个专家专注于处理特定任务。(2)动态路由:不是所有的专家都会参与到每一次的计算中,而是通过一种路由机制动态选择一部分专家进行计算。每次计算会选取前8个最相关的专家(topk=8)参与。(3)效率与性能:主要优势在于它减少了预训练和推理期间的计算成本。它通过有选择地激活特定任务所需的专家,而不是每次任务都激活整个神经网络,从而提高了效率。(4)参数激活:拥有671B的总参数,但每个任务仅激活37B参数,这优化了效率和性能。(5)负载平衡:引入了无辅助损失的负载平衡策略,动态监控和调整专家的负载,以平衡的方式利用它们,而不牺牲整体模型性能。DeepSeek-V3中的MoE架构通过将大模型分解为专家网络,并根据任务需求动态激活这些专家,实现了计算效率和性能的提升。
  • [其他] 人工智能干货合集(2024年12月)
    1. AI开发平台ModelArts新功能2024年11到12月份ModelArts发布的新功能。11月发布的新功能比较多,一共有11项。 12月没有发布新功能。ModelArts Notebook支持创建定时任务Lite Cluster节点支持批量计费Snt9b硬件故障支持在线服务故障自动重启通过VPC访问通道的方式访问在线服务MindSpore预置框架支持msrun和torchrun启动方式训练作业支持配置卡死检测时间训练作业支持批量录入超参和环境变量自定义镜像训练作业支持配置节点间SSH免密互信下面3项是关于MaaS的:MaaS支持免费体验预置服务:ModelArts Studio大模型即服务平台给新用户分配了每个模型100万Tokens的免费调用额度,无需部署即可一键体验通义千问、Llama、ChatGLM等预置模型服务。MaaS支持扩缩容模型服务的实例数MaaS模型服务提供内容审核服务2. 人工智能相关直播合集昇腾云服务ModelArts深度解析:理论基础与实践应用指南https://bbs.huaweicloud.com/live/cloud_live/202412031400.html如何快速创建和部署模型,管理全周期AI工作流呢?聚焦华为昇腾云服务ModelArts一站式AI开发平台功能介绍,同时结合基于ModelArts 的实践性实验,帮助开发者从理论到实验更好地理解和使用ModelArts。人工智能应用测试深度解析:理论基础与实践应用指南 https://bbs.huaweicloud.com/live/cloud_live/202412061430.html结合理论及人工智能的相关实验,给大家讲述AI应用测试的主要流程和方法。帮助开发者了解AI应用测试的理论及方法,和AI应用测试在模型迭代调优过程中的作用。这个对于对AI测试兴趣的朋友,一定要来看看,里面很多有用的知识。基于华为云AI的在线实验教学https://bbs.huaweicloud.com/live/cloud_live/202412101600.html如何部署ModelArts中开源大模型来完成智能问答任务,及如何调用华为云EI-自然语言处理服务的API接口呢?手把手带领大家一步步进行实验操作,深入体验基于华为云AI的实验过程。这个是具体的实验实操,可以跟着动手做一下。里面有一些有用的技巧。
  • [其他] LangChain 的组件亮点
    LangChain 的亮点组件是其核心优势所在,它们以模块化的方式简化了复杂语言模型应用的开发。以下是 LangChain 中一些关键组件的详细介绍:1. Models(模型)LangChain 提供了统一的接口来调用多种语言模型,包括 OpenAI、Hugging Face、Anthropic 等。开发者可以轻松切换不同的模型,而无需修改大量代码。此外,LangChain 还支持自定义模型的集成,为开发者提供了极大的灵活性。亮点:标准化接口,支持多模型切换,降低模型依赖风险。2. Prompts(提示词)提示词是语言模型应用的核心。LangChain 提供了 PromptTemplate 组件,允许开发者动态生成提示词。通过模板,可以将用户输入、上下文信息或外部数据嵌入到提示词中,从而优化模型的输出。亮点:支持动态提示词生成,提升模型输出的准确性和相关性。3. Chains(链式任务)Chains 是 LangChain 的核心组件之一,用于将多个任务串联起来,形成自动化工作流。例如,可以构建一个链式任务,先从数据库中检索信息,再生成提示词,最后调用模型生成回答。LLMChain 是最常用的链,它将提示词与模型调用结合。亮点:简化复杂流程,支持任务自动化,提升开发效率。4. Memory(记忆机制)Memory 组件使应用能够在多轮交互中记住上下文信息。LangChain 提供了多种记忆机制,如 ConversationBufferMemory(短期记忆)和 VectorStoreMemory(长期记忆),帮助开发者实现上下文感知功能。亮点:支持短期和长期记忆,增强交互体验。5. Indexes(索引)Indexes 组件用于与外部数据源(如向量数据库)集成,使应用能够访问实时或特定领域的数据。通过 RetrievalQA,开发者可以快速构建基于检索的问答系统,将模型与外部知识库结合。亮点:支持数据检索,增强模型的知识覆盖范围。6. Agents(代理)Agents 是 LangChain 的高级组件,允许模型根据输入动态选择工具或动作。例如,一个代理可以决定是先调用搜索引擎还是直接生成回答。通过 Tool 和 AgentExecutor,开发者可以构建智能代理,实现更复杂的任务。亮点:支持动态决策,提升应用的智能化水平。7. Callbacks(回调)Callbacks 组件允许开发者在模型调用过程中插入自定义逻辑,例如日志记录、性能监控或错误处理。通过回调,开发者可以更好地控制和调试应用的行为。亮点:支持自定义逻辑,增强应用的可控性和可调试性。8. Utilities(实用工具)LangChain 提供了一系列实用工具,如文本分割器、向量化工具和 API 集成工具,帮助开发者处理数据、优化流程并扩展功能。亮点:提供开箱即用的工具,减少重复开发工作。总结LangChain 的亮点组件以模块化的方式解决了语言模型应用开发中的常见问题。无论是模型调用、提示词管理、任务自动化,还是数据检索和记忆机制,这些组件都显著降低了开发复杂度,让开发者能够更专注于构建创新应用。如果你正在探索大语言模型的潜力,LangChain 的这些组件无疑会成为你的得力助手。
  • [其他] LangChain如何简化复杂应用开发
    LangChain 是一个强大的框架,旨在简化复杂语言模型应用的开发流程。通过提供模块化组件和标准化接口,LangChain 让开发者能够更轻松地构建、扩展和部署基于大语言模型(LLMs)的应用。以下是 LangChain 如何将复杂任务简单化的几个关键方面:1. 模块化设计,降低开发门槛LangChain 将复杂的语言模型应用拆分为多个模块,如模型调用、提示词管理、记忆机制、数据检索和链式任务等。开发者无需从头构建每个功能,只需根据需求组合这些模块即可。例如,通过 LLMChain,开发者可以快速将提示词与模型调用结合,而无需关注底层细节。2. 标准化接口,提升开发效率LangChain 提供了统一的接口,支持多种语言模型(如 OpenAI、Hugging Face 等)和数据源(如向量数据库、API 等)。开发者只需学习一次接口,即可在不同模型和工具之间无缝切换,避免了重复学习成本。3. 链式任务,简化复杂流程LangChain 的 “Chain” 功能允许开发者将多个任务串联起来,形成自动化工作流。例如,可以构建一个链式任务,先从数据库中检索信息,再生成提示词,最后调用模型生成回答。这种设计让复杂流程变得清晰易管理。4. 记忆机制,增强交互体验LangChain 提供了短期和长期记忆机制,使应用能够在多轮对话中记住上下文。通过 ConversationBufferMemory 或 VectorStoreMemory,开发者可以轻松实现上下文感知功能,而无需手动管理状态。5. 数据检索,整合外部知识LangChain 支持与向量数据库(如 Pinecone、Weaviate)和 API 的集成,使应用能够访问外部知识库。通过 RetrievalQA,开发者可以快速构建基于检索的问答系统,将模型与实时数据结合。6. 提示词管理,优化模型输出LangChain 提供了提示词模板和优化工具,帮助开发者设计更有效的输入提示。通过 PromptTemplate,可以动态生成提示词,提升模型的输出质量。7. 开源社区,加速问题解决作为一个开源项目,LangChain 拥有活跃的社区支持。开发者可以快速找到解决方案、学习最佳实践,甚至贡献自己的代码,进一步降低开发难度。总结LangChain 通过模块化设计、标准化接口和丰富的功能,将复杂语言模型应用的开发过程简化为可管理的步骤。无论是构建对话系统、自动化工作流,还是整合外部数据,LangChain 都能显著降低开发门槛,让技术爱好者更专注于创新而非底层实现。如果你正在探索大语言模型的应用,LangChain 无疑是一个值得尝试的工具。
  • 面向对象检测的AI算法常用经典模型
    面向对象检测的AI算法有许多经典模型,以下是一些常见的:基于锚点的物体检测器Faster R-CNN:这是一种两阶段的目标检测模型,利用区域提议网络(RPN)生成候选框,再通过全卷积网络(FCN)进行分类和定位。YOLO(You Only Look Once):这是一种单阶段的目标检测模型,以其快速的检测速度和较高的准确性而闻名。YOLO系列包括YOLOv1、YOLOv2、YOLOv3、YOLOv4等版本,每个版本都有不同的改进和优化。SSD(Single Shot Multibox Detector):这也是一种单阶段的目标检测模型,通过单个神经网络进行预测,解决了多尺度目标检测的问题。无锚式物体检测器CenterNet:这种模型消除了对预定义的锚框的需要,直接预测对象的中心或角。FCOS(Fully Convolutional One-Stage Object Detection):这是一种全卷积的一级目标检测模型,直接预测对象的中心及其高度和宽度,而不依赖于预定义的锚。CornerNet:这种模型通过预测对象的角来检测对象,而不依赖于预定义的锚。基于Transformer的检测器DETR(Detection Transformer):这是一个完整的对象检测框架,其中整个检测过程(包括特征提取、对象检测和边界框预测)都是使用transformers完成的。DETR消除了对区域建议网络、锚框或非最大抑制的需要。Vision Transformer (ViT):将图像视为一系列面片,并使用Transformer对全局关系进行建模,用于对象检测任务。Swin Transformer:一个分层的Transformer,在非重叠窗口上运行,使其计算效率更高,更适合下游对象检测任务。其他经典模型Mask R-CNN:这是一个强大的通用对象实例分割框架,不仅可对图像中的目标进行检测,还可以对每一个目标给出一个高质量的分割结果。R-FCN(Region-based Fully Convolutional Network):这是一种基于区域的全卷积网络,通过全卷积神经网络生成一个3x3的位置敏感卷积实现对位置信息编码,完成预测,实现对象检测。EfficientDet:这是一种一阶段的对象检测网络,基于EfficientNet网络作为基础网络,使用多尺度双向金字塔特征融合技术,其中权重特征融合使用了交叉尺度链接与权重快速归一化融合。这些模型各有优缺点,适用于不同的应用场景。在选择模型时,需要根据具体的任务需求、计算资源和数据集特点来进行选择。
  • 自监督学习与监督学习
    自监督学习和监督学习是机器学习领域中的两种不同的学习范式,它们在数据标注需求、学习方法、应用场景和数据要求等方面存在显著差异。自监督学习与监督学习的对比对比维度自监督学习监督学习数据标注需求无需人工标注需要大量人工标注数据学习方法利用数据自身生成监督信号根据预先标记的数据进行训练应用场景无监督环境下的特征学习分类、回归和预测等问题数据要求无需人工标记的数据,但需要能够从数据本身派生标签的数据需要有大量标记的数据进行训练模型训练包括预训练和微调两个步骤直接使用标记数据进行训练常见任务对比学习、预文本任务等分类、回归等优势降低人工标注成本,提高模型表征能力训练数据集的标签准确可靠,模型精度和泛化能力高挑战任务设计复杂,训练资源需求大,可解释性问题依赖高质量标注数据,标注成本高昂未来方向跨学科结合,高效模型设计,可解释性增强优化模型结构,提升模型性能自监督学习与监督学习的选择自监督学习的优势:自监督学习在没有人工标注的情况下,通过从输入数据本身派生标签进行学习,特别适用于数据标注成本高昂、专业标注人员稀缺的情况。自监督学习能够从无标签数据中挖掘有用的信息,提高模型表征能力,同时避免了人工标注的繁琐工作。监督学习的优势:监督学习在训练数据集已知的情况下,通过学习输入与输出之间的映射关系来进行模型训练,适用于数据标注充足且明确的任务。监督学习的模型具有较高的精度和泛化能力,因为训练数据集的标签是准确可靠的。大规模数据集的选择对于大规模数据集,自监督学习可能更为适用,因为:标注成本:大规模数据集的标注成本通常很高,自监督学习可以通过设计预训练任务,从未标注的数据中生成标签,从而降低标注成本。模型性能:自监督学习能够学习到更加通用的数据表示,从而提升下游任务的性能,这对于大规模数据集来说尤为重要。数据多样性:大规模数据集通常具有更高的数据多样性,自监督学习可以通过对比学习等方法,更好地捕捉数据的内在结构和特征。然而,监督学习在某些情况下仍然是不可替代的,例如在需要高精度预测的场景下,监督学习的模型可能会表现得更好。因此,在实际应用中,需要根据具体任务的特点和数据的实际情况来选择合适的学习方法。
  • [其他] 系统优化的关键:降低精度与算子融合
    系统优化的关键:降低精度与算子融合在大规模机器学习模型的训练和推理过程中,系统优化是提升效率、降低成本的重要手段。其中,低精度计算和算子融合是两项具有重大实践价值的技术,它们通过减少计算复杂度和内存开销,显著提升了系统性能。1. 低精度计算:平衡效率与准确性低精度计算的核心思想是通过降低数值表示的精度来加速计算并减少内存占用。传统的深度学习模型通常使用32位浮点数(FP32)进行计算,但这种高精度表示会带来较大的计算和存储开销。16位浮点数(FP16)是一种常用的低精度格式。通过将矩阵运算从FP32降至FP16,可以显著提升计算速度并降低内存占用。这是因为FP16所需的内存带宽和计算资源更少,同时现代硬件(如GPU)对FP16的支持也更加高效。然而,低精度计算也面临一个关键挑战:数值精度不足可能导致模型训练不稳定或精度损失。为了解决这个问题,研究人员采用了一种精妙的策略:混合精度训练。在这种方法中,计算过程使用FP16,但模型权重和梯度更新仍保持在FP32。这样既利用了FP16的计算效率,又通过FP32确保了权重更新的准确性,从而在保证模型质量的同时大幅提升了训练效率。2. 算子融合:减少内存访问开销在深度学习模型的传统实现中,每个操作(如矩阵乘法、激活函数等)都需要与GPU内存进行数据交互。这种频繁的数据移动会显著增加内存带宽的压力,成为性能瓶颈。算子融合技术通过将多个操作合并处理,减少了内存访问次数,从而提升了计算效率。例如,在一个典型的神经网络层中,矩阵乘法和激活函数通常是分开执行的,这意味着需要将中间结果从GPU内存中读取和写入多次。通过将这两个操作融合为一个单一的内核函数,可以避免中间结果的频繁读写,显著减少内存带宽的占用。算子融合不仅减少了内存访问开销,还优化了计算资源的利用率。现代GPU的并行计算能力非常强大,但频繁的内存访问会限制其性能发挥。通过融合操作,可以更好地利用GPU的计算单元,提升整体吞吐量。
  • [其他] 大语言模型的缩放法则:计算资源分配的科学
    大语言模型的缩放法则:计算资源分配的科学在大语言模型(LLM)的研究中,一个重要的发现是:模型性能的提升遵循可预测的缩放法则。这一规律不仅为理论研究提供了新的视角,也为工程实践中的资源分配提供了科学依据。1. 缩放法则的核心规律缩放法则的核心在于,模型性能的提升与计算资源、模型参数量和训练数据量之间呈现出对数线性关系。具体来说,当增加计算资源时,模型性能的提升并不是线性的,而是以对数形式增长。这意味着,随着资源投入的增加,性能提升的幅度会逐渐减小。2. 最优训练配置的发现通过大量实验,研究人员确定了最优的训练配置:每个模型参数大约需要对应20个训练token。这一比例意味着,模型参数的数量和训练数据的规模需要保持一定的平衡,才能达到最佳的训练效果。然而,当考虑到推理阶段的计算成本时,这个比例可能会提高到1:150。3. 缩放法则的实践意义缩放法则的发现具有重要的实践意义,因为它让我们能够科学地规划资源分配。具体来说,缩放法则为工程实践提供了以下指导:资源分配的优化:在有限的计算资源下,如何分配资源(如计算能力、模型参数、训练数据)以达到最佳性能,是一个关键问题。缩放法则为这一问题提供了科学依据,帮助团队做出最优的架构选择。性能预测:通过缩放法则,研究人员可以预测模型在增加资源后的性能提升,从而更好地规划实验和项目。成本效益分析:缩放法则还可以用于分析不同资源配置的成本效益。例如,在推理阶段,减少模型参数的数量可能会显著降低计算成本,而性能的损失可以通过增加训练数据的规模来弥补。4. 缩放法则的挑战与未来方向尽管缩放法则为LLM的研究和实践提供了重要指导,但它也面临一些挑战。例如,缩放法则的适用性可能受到模型架构、训练任务和数据质量等因素的影响。此外,随着模型规模的进一步扩大,缩放法则是否仍然适用,也是一个需要进一步研究的问题。未来,研究人员可能会探索更复杂的缩放法则,以更好地描述模型性能与资源投入之间的关系。同时,如何在实际应用中更有效地利用缩放法则,也是一个重要的研究方向。
  • [其他] 后训练优化的双重范式:SFT和RLHF
    后训练优化的双重范式:SFT和RLHF在预训练模型的基础上,将其转化为实用的AI助手,需要经过两个关键的优化阶段:监督微调(SFT)和基于人类反馈的强化学习(RLHF)。这两个阶段各有侧重,共同作用,使模型能够生成更符合人类预期的回答。1. 监督微调(SFT):教会模型“如何回答”监督微调是后训练优化的第一阶段。这一阶段的目的是教会模型如何以特定的方式回答问题,而不是学习新知识。预训练模型已经通过海量数据获取了广泛的知识,SFT更像是为模型提供一种“表达方式”的指导。一个令人惊讶的发现是,SFT阶段只需要2000-5000条高质量的人工标注数据就能取得显著效果。这是因为模型在预训练阶段已经掌握了大量的知识,SFT的主要任务是调整模型的输出风格和格式,使其更符合人类的需求。例如,教会模型如何生成简洁、清晰、符合语境的回答,而不是冗长或模糊的表述。SFT的关键在于数据的质量而非数量。高质量的人工标注数据能够有效引导模型,使其在特定任务上表现更好。这一阶段的优化为后续的RLHF奠定了基础。2. 基于人类反馈的强化学习(RLHF):让模型更符合人类偏好RLHF是后训练优化的第二阶段,也是使模型生成更符合人类预期回答的关键步骤。RLHF的核心思想是通过人类反馈来优化模型的行为,使其输出更符合人类的偏好。RLHF的过程可以分为三个主要步骤:收集人类偏好数据:首先,需要收集人类对模型不同输出的偏好数据。例如,给定一个问题,模型生成多个回答,人类标注者会根据回答的质量进行排序或打分。这些数据用于训练一个奖励模型。训练奖励模型:奖励模型的目标是量化模型输出的质量。通过人类偏好数据,奖励模型学习如何评估模型回答的好坏。例如,简洁、准确、符合语境的回答会获得更高的奖励分数。优化模型行为:最后,使用强化学习算法(如PPO或DPO)来优化模型的行为。模型会根据奖励模型的反馈,调整其参数,以生成更符合人类偏好的回答。3. DPO算法:简化RLHF实现传统的RLHF方法(如PPO)实现复杂度较高,需要大量的计算资源和工程优化。然而,直接偏好优化(DPO)算法的提出极大简化了这一过程。DPO通过直接优化模型输出与人类偏好之间的对齐,避免了复杂的奖励模型训练和强化学习循环。这使得开源社区也能够实现高质量的模型对齐,推动了AI技术的普及和应用。4. 总结SFT和RLHF是后训练优化的双重范式,共同作用将预训练模型转化为实用的AI助手。SFT通过少量高质量数据教会模型“如何回答”,而RLHF通过人类反馈使模型生成更符合人类偏好的回答。DPO算法的提出进一步简化了RLHF的实现,降低了技术门槛。这两个阶段的优化,使得像ChatGPT这样的对话模型能够生成高质量、符合人类预期的回答,推动了AI技术的广泛应用。通过SFT和RLHF的结合,AI模型不仅能够掌握知识,还能够以更自然、更符合人类习惯的方式与用户交互。这种双重优化范式为AI助手的未来发展提供了坚实的基础。附:文中简写的全称如下:SFT:Supervised Fine-Tuning(监督微调)RLHF:Reinforcement Learning from Human Feedback(基于人类反馈的强化学习)PPO:Proximal Policy Optimization(近端策略优化)DPO:Direct Preference Optimization(直接偏好优化)
  • [其他] 数据预处理流水线的挑战:从原始网络数据到高质量训练语料
    数据预处理流水线的挑战:从原始网络数据到高质量训练语料在当今的大数据时代,互联网已成为获取信息的主要来源。然而,将海量的原始网络数据转化为高质量的训练语料,却是一个极其复杂且充满挑战的过程。当前的互联网包含约2500亿个网页,总计接近1PB的数据。这些数据不仅规模庞大,而且形式多样、质量参差不齐。因此,构建一个高效的数据预处理流水线,是确保最终训练语料质量的关键。1. 数据提取:从HTML到有意义的文本数据预处理的第一步是从原始网页中提取有意义的文本内容。虽然HTML是网页的基础结构,但其中包含了大量的噪音,如广告、导航栏、脚本代码等。准确提取有用的文本内容,需要专门的工具和算法。例如,使用BeautifulSoup或Scrapy等库可以有效地解析HTML并提取文本。然而,即使是这些工具,在面对复杂的网页结构时也可能遇到困难。特别是对于包含数学公式、代码片段或多媒体内容的网页,需要开发专门的解析方案,以确保这些内容的准确提取和保留。2. 数据净化:过滤不良内容和敏感信息提取出的文本内容往往包含大量的噪音和不良信息,如广告、垃圾邮件、恶意软件等。因此,数据净化的第一步是过滤这些不良内容。此外,还需要去除个人敏感信息,如姓名、地址、电话号码等,以保护用户隐私。这一过程通常需要结合规则过滤和机器学习模型,以确保高效且准确地识别和去除不良内容。3. 数据去重:识别和去除重复内容互联网上的信息重复现象非常普遍,同一个内容可能出现在多个不同的网页上。因此,数据去重是数据预处理流水线中的一个关键步骤。去重不仅需要处理完全相同的文本内容,还需要识别不同URL下实质相同的内容。例如,同一篇新闻文章可能被多个网站转载,虽然URL不同,但内容几乎完全一致。去重算法通常基于文本的哈希值或语义相似度,通过比较文本的特征向量来识别重复内容。4. 质量评估:筛选高质量的训练语料在数据净化和去重之后,还需要对剩余的内容进行质量评估,以筛选出高质量的训练语料。质量评估通常基于一系列启发式规则和机器学习模型。例如,可以通过文本的长度、语法正确性、信息密度等特征来评估内容的质量。此外,还可以使用预训练的语言模型对文本进行打分,以进一步筛选出高质量的内容。最终,只有经过层层筛选的极小部分数据才会被用于训练。5. 工程处理与持续优化数据预处理流水线的每一个环节都需要细致的工程处理和持续的优化改进。例如,在数据提取阶段,可能需要针对不同类型的网页开发不同的解析器;在数据净化阶段,可能需要不断更新过滤规则和模型,以应对新出现的不良内容;在数据去重阶段,可能需要优化算法,以提高去重的准确性和效率;在质量评估阶段,可能需要不断调整评估标准,以适应不同的训练需求。6. 总结从原始网络数据到高质量训练语料的转化过程,是一个复杂且充满挑战的任务。数据预处理流水线的每一个环节都需要细致的工程处理和持续的优化改进。只有通过高效的预处理流水线,才能从海量的网络数据中筛选出高质量的训练语料,为后续的模型训练提供坚实的基础。这一过程不仅需要强大的技术支持,还需要不断的实践和优化,以应对互联网数据的多样性和复杂性。
  • [其他] 观点分享:数据、评估和系统工程的重要性
    真正重要的是数据、评估和系统工程,而不是模型架构。这个观点强调了在AI开发中,数据、评估和系统工程的重要性,超越了对模型架构的过度关注。数据质量至关重要:无论模型架构如何先进,低质量的数据都会导致不良的结果。数据的清洁、完整性和无偏性是模型性能的基础。在实际应用中,数据处理和管理可能占据项目大量时间,影响最终效果。评估方法的现实意义:学术界常依赖标准基准测试,但这些测试可能与实际应用场景脱节。有效的评估应反映真实世界的使用情况,确保模型在实际中表现良好。系统工程的不可或缺性:涵盖模型部署、集成、可扩展性和性能优化等方面,确保模型在实际环境中有效运行。在工业应用中,系统工程的挑战可能超过模型选择本身。资源分配的再思考:传统上,学术研究可能过度关注模型架构的创新,而忽视数据和系统工程。更合理的资源分配应平衡这些关键领域,以提升整体性能。模型架构的角色:模型架构仍重要,定义了模型的能力和学习效率,但不应成为唯一的关注点。某些架构可能更适应特定数据或任务,需综合考虑。行业与学术的差异:工业界更注重数据和系统工程,而学术界可能更追求模型创新。二者应互补,推动AI技术的全面进步。** reproducibility 危机的反思**:数据处理、评估方法和系统配置的差异可能导致研究结果难以复现。强调这些方面有助于提高研究的可靠性和可重复性。教育和职业发展的调整:AI教育应增加数据管理、评估技术和系统工程的培训,以培养全面的AI专业人才。数据作为竞争优势:在许多实际应用中,数据是企业的核心竞争力,高质量的数据管理能带来显著优势。综上所述,该观点倡导一种更为全面的AI开发方法,强调数据、评估和系统工程的协同作用,以实现更强大、可靠和实用的AI系统。这种视角提醒我们,在追求模型创新的同时,不应忽视其他关键环节的优化。
  • [体验官] 与PaaS产品一起成长的故事:Z市台风预测模型实战分析——模型的云能力PAAS中心能力如何构建
    上回我们谈到AI模型的两大基石之一,云能力,而云能力分为边缘计算能力和PAAS层中心能力。在咨询项目中,如何构建PAAS层中心能力。从当时地质业务需求来看,中心层能力是大模型计算的核心能力,依赖机房的计算存储平台,大模型可以按需运算并预测结果。    由于部署了台风预测模型,业务侧需要分钟级输出未来30天的预测结果,每分钟计算资源要非常充足。因此,给每个因子每个场景配置了4VPU,128flop/VCPU;由于地质勘查图片量非常大,要一分钟内分析上千份图片,因此计算速度用最快的NPU,9XX型号的算力卡,20张/秒的分析速度,1200张/分钟。有了超级快的计算能力外,还要有海量的存储单元,分为块存储、文件存储和缓存三种类型。其中块存储的空间需求最多,因为它非常灵活,可以存放多种格式的数据;按10M/图片来计算,块存储空间预留500T空间,存储15年的图片数据。     硬件平台讲了这么多,其实都是为PAAS层能力服务。为了让业务侧具备自主编程和调试台风预测模型的能力,PAAS层配备了微服务流水线的能力,codearts, 微服务架构。这也是因为地质行业数据是保密数据,不允许外发到专有云外,因此必须在本地训练。同时业务场景层出不穷,目前只是梳理了5种场景:全球场景、局部场景、自然灾害场景、山体滑坡场景和泥石流场景。未来模型应用的场景会逐步增多,新场景除了模型泛化能力支持外,还要进行算法调优或RAG等技术辅助。欢迎点赞和关注公众号“科技江河”,如果喜欢,在公众号打赏下呗,感谢华为云App
  • [其他] Scaling Law经验法则
    Scaling Law(扩展定律或尺度定律)在机器学习和人工智能领域,特别是在大型语言模型(LLMs)的研究中,是用来描述模型性能如何随着模型规模(如参数数量)、训练数据量和计算资源的增加而提升的一组经验法则。具体来说,Scaling Law涉及以下几个方面:模型性能与资源规模的关系:Scaling Law表明,模型的性能与计算量、模型参数量和数据大小之间存在幂律关系。这意味着,当不受其他因素制约时,增加这些资源可以显著提升模型的性能。经验法则:Scaling Law是一种经验法则,它基于大量的实验数据和观察,提供了在不同规模下预测系统性能变化的规律。训练与推理的扩展定律:传统的Scaling Law主要关注模型训练过程,即训练数据越多、算力越强、模型参数越大,最终的模型性能就越好。而推理扩展定律(Inference Scaling Law)则指出,通过增加推理时间和计算资源,可以显著改善模型输出的质量。成本-性能权衡:在给定相同的计算预算下,较小的模型可以胜过较大的模型,并且较小的模型与高级推理算法配对可以产生Pareto最优的成本-性能权衡。模型结构与性能:Scaling Law还表明,模型的最终性能主要与计算量、模型参数量和数据大小三者相关,而与模型的具体结构(如层数、深度、宽度)基本无关。资源扩展的比例关系:在计算预算增加了10倍的情况下,如果想保持效果,模型的大小应增加5.5倍,而训练token的数量仅需增加1.8倍。综上所述,Scaling Law为我们提供了一个框架,用以理解和预测在机器学习模型中,如何通过增加模型规模、数据量和计算资源来提升模型性能。这对于设计和训练大型语言模型尤其重要,因为它可以帮助研究者和工程师更有效地分配资源,以达到最佳的性能提升效果。
  • [其他] AGI和AIGC的区别
    AGI(Artificial General Intelligence,通用人工智能)和AIGC(Artificial Intelligence Generated Content,人工智能生成内容)是两个不同的概念,它们在人工智能领域中有着各自的定义和应用。AGI(通用人工智能)AGI指的是一种具有与人类相当或更高的认知能力的智能系统,能够理解、学习、计划和解决问题。 AGI的目标是实现类似于人类的广泛智能,使其能够在各种不同领域和任务中表现出色。 这种智能系统不仅能够学习和适应新的任务,还能够像人类一样进行推理、解决问题和创造新的想法。 AGI是人工智能研究的最终目标之一,也是科幻小说和未来研究的一个共同主题。AIGC(人工智能生成内容)AIG指的是利用AI技术,尤其是机器学习和深度学习模型,自动生成内容,如文本、图像、音乐或视频。 AIGC通常专注于特定的创作任务,而不具备AGI的广泛智能和通用学习能力。 它通过从大量数据中学习,模仿人类行为,生成各种新的内容,包括文字、图像、音视频、游戏、代码等多种内容形态。 AIGC的高速发展减少了人类创作内容的时间和成本,也降低了内容创作门槛,激发了全民的使用热情。共同点AGI和AIGC都属于人工智能的范畴,但它们的侧重点、技术和应用领域有很大的区别。AGI的核心在于其通用性和自我学习的能力,而AIGC则更多地体现AI在特定任务上的生成能力。 两者的共同发展,合力推动着人工智能产业实现更大程度的成长。
总条数:3409 到第 页
上滑加载中