-
评估分类模型性能的关键指标是什么?
-
深度学习中如何解决过拟合问题?
-
自然语言处理中常用的词嵌入方法?
-
计算机视觉中流行的目标检测算法?
-
边缘AI部署面临的主要挑战及解决方案?
-
先说结论根本区别:sigmoid 是平滑的、指数计算的非线性函数;hardsigmoid 是 sigmoid 的一个分段线性近似,计算更高效,但牺牲了平滑性。选择:在需要精确梯度或进行严谨科学计算时用 sigmoid;在追求推理速度、部署到移动端或低精度环境时,hardsigmoid 是一个优秀的替代品。下面我们从定义、计算、输出范围、梯度等方面进行详细对比。特性TensorFlow tf.sigmoid (以及 PyTorch torch.sigmoid)PyTorch torch.nn.Hardsigmoid函数类型平滑的、S型的(Smooth, S-curve)分段线性的(Piecewise Linear)数学定义σ(x)=11+e−x\sigma(x) = \frac{1}{1 + e^{-x}}σ(x)=1+e−x1Hardsigmoid(x)={0if x≤−31if x≥+3x6+12otherwise\text{Hardsigmoid}(x) = \begin{cases} 0 & \text{if } x \le -3 \\ 1 & \text{if } x \ge +3 \\ \frac{x}{6} + \frac{1}{2} & \text{otherwise} \end{cases}Hardsigmoid(x)=⎩⎪⎪⎨⎪⎪⎧016x+21if x≤−3if x≥+3otherwise输出范围(0, 1) - 渐近线,永不等于0或1[0, 1] - 在边界处确实会达到0和1计算复杂度较高,涉及指数运算极低,仅涉及比较和线性运算梯度(导数)σ′(x)=σ(x)⋅(1−σ(x))\sigma'(x) = \sigma(x) \cdot (1 - \sigma(x))σ′(x)=σ(x)⋅(1−σ(x))平滑变化,在 x=0 处最大为 0.25Hardsigmoid′(x)={0if x≤−30if x≥+316otherwise\text{Hardsigmoid}'(x) = \begin{cases} 0 & \text{if } x \le -3 \\ 0 & \text{if } x \ge +3 \\ \frac{1}{6} & \text{otherwise} \end{cases}Hardsigmoid′(x)=⎩⎪⎪⎨⎪⎪⎧0061if x≤−3if x≥+3otherwise是常数或零,存在梯度截断主要应用场景1. 需要精确概率输出的模型(如逻辑回归)2. 科学研究、原型开发3. 对梯度平滑性要求高的场景1. 模型量化 和 移动端部署2. 低精度计算(如 INT8)3. 需要极致推理速度的场景深入解析1. TensorFlow / PyTorch 的 sigmoid特性:它是一个经典的、平滑的激活函数。其输出是一个介于 0 和 1 之间的连续概率值,但永远不会真正达到 0 或 1。优点:平滑的梯度:梯度是连续变化的,这对于基于梯度的优化算法(如SGD)非常友好,训练过程更稳定。明确的概率解释:输出可以直观地解释为概率。缺点:计算成本高:指数计算在CPU/GPU上比简单的算术运算要慢。梯度消失:当输入 xxx 的绝对值很大时,函数曲线变得非常平缓,梯度接近于零,这可能导致网络深层无法更新(虽然不如 tanh 严重)。2. PyTorch 的 hardsigmoid特性:它是 sigmoid 的一个硬版本或近似版本。它用三段直线来模拟 S 形曲线。当 x<−3x < -3x<−3 时,直接输出 0。当 x>3x > 3x>3 时,直接输出 1。在中间区域 [−3,3][-3, 3][−3,3],是一条斜率为 1/61/61/6,截距为 1/21/21/2 的直线。优点:极高的计算效率:没有指数运算,只有比较、加法和乘法,速度非常快。这在移动端和嵌入式设备上至关重要。对量化友好:在模型量化(将FP32模型转换为INT8等低精度格式)时,线性运算比非线性指数运算稳定得多,精度损失小。hardsigmoid 是许多移动端推理框架(如 TFLite)的推荐激活函数。缺点:梯度不连续:在 x=−3x = -3x=−3 和 x=3x = 3x=3 这两个点,梯度从 1/61/61/6 突然变为 0,这在数学上是不连续的。虽然在实际训练中影响可能不大,但在理论上不如 sigmoid 完美。表达能力稍弱:由于是线性近似,其非线性拟合能力略逊于标准的 sigmoid。代码示例以下是在 PyTorch 中的对比,TensorFlow 的 tf.sigmoid 行为与 torch.sigmoid 一致。import torch import torch.nn as nn import matplotlib.pyplot as plt # 生成测试数据 x = torch.linspace(-6, 6, 100, requires_grad=True) # 计算两种 sigmoid sigmoid_out = torch.sigmoid(x) hardsigmoid = nn.Hardsigmoid() hardsigmoid_out = hardsigmoid(x) # 绘制函数图像 plt.figure(figsize=(12, 4)) plt.subplot(1, 2, 1) plt.plot(x.detach().numpy(), sigmoid_out.detach().numpy(), label='sigmoid', linewidth=2) plt.plot(x.detach().numpy(), hardsigmoid_out.detach().numpy(), label='hardsigmoid', linestyle='--') plt.title("Forward Pass") plt.legend() plt.grid(True) # 计算梯度并绘制 # 为了计算梯度,我们需要一个标量输出,所以我们求和 sigmoid_out.sum().backward(retain_graph=True) sigmoid_grad = x.grad.clone() x.grad.zero_() # 清零梯度 hardsigmoid_out.sum().backward() hardsigmoid_grad = x.grad plt.subplot(1, 2, 2) plt.plot(x.detach().numpy(), sigmoid_grad.detach().numpy(), label='sigmoid gradient') plt.plot(x.detach().numpy(), hardsigmoid_grad.detach().numpy(), label='hardsigmoid gradient') plt.title("Gradients") plt.legend() plt.grid(True) plt.tight_layout() plt.savefig('sigmoid_comparison.png', dpi=300, bbox_inches='tight') plt.show() 运行这段代码,你会清晰地看到:左图:hardsigmoid(虚线)是 sigmoid(实线)的一个很好的线性近似,但在两端被“夹紧”了。右图:sigmoid 的梯度是平滑的钟形曲线,而 hardsigmoid 的梯度在中间是平的(值为 1/61/61/6),在两端是 0。
-
在一个材料介绍里看到有Davinci core(16^3 cube)的字样,这里的16^3 cube是什么含义呢?原来,在昇腾AI处理器中,达芬奇核心是其执行矩阵计算的关键单元。括号内的“16^3 cube”是对该核心计算架构的具体描述。它指的是一个三维的并行计算结构,其含义并非指一个物理立方体,而是代表其在一个时钟周期内能够处理的计算规模。具体来说,它可以被理解为能够同时执行一个16x16的矩阵与另一个16x16的矩阵之间的乘法运算。整个计算过程是高度并行的:为了得到结果矩阵中每一个16x16=256个位置上的数值,核心需要为每个位置执行一次长度为16的向量点积运算。因此,在一个时钟周期内,它能并行完成256个独立的点积运算,而每个点积又涉及16次乘加操作。这构成了总共16 x 16 x 16 = 4096次的并行乘加运算能力。这种结构旨在高效处理神经网络中普遍存在的大规模矩阵与卷积运算。这种计算模式与常见的CPU顺序计算有根本区别。CPU可能需要通过循环和反复存取数据来完成同样规模的矩阵运算,而达芬奇核心的立方体结构将其转化为一次性的、大规模并行操作。这显著降低了执行复杂数学运算所需的时间与能耗,其设计目标直接服务于人工智能计算中数据密集和计算密集的特性。在实际运行中,为了驱动这个计算立方体,需要高效的数据供给。因此,达芬奇核心通常与专用的内存 hierarchy 和数据搬运通路紧密耦合。数据会被提前安排成核心能够直接处理的块(Tile),从而确保计算单元在绝大部分时间里都处于忙碌状态,而非等待数据。这种计算与数据流的协同设计,是使其能够持续发挥高算力的关键支撑。
-
能不能将这个赛题的一些专业名词给一些拓展资料,胖树、ring算法这些感觉读到之后都有点不明所以然(指完全没接触过AI infra的人)。希望组委会可以考虑一下
-
你们在使用MCP的时候,有没有经常碰到循环调用一直无法跳出的问题?如果有你们是怎么解决的?
-
在决定使用微调(Fine-tuning)还是知识库(Knowledge Base, KB)来增强模型能力时,需综合考虑任务需求、数据资源、计算成本、实时性要求及可维护性等因素。以下是具体对比与选择建议:一、核心对比维度维度微调知识库核心目标通过调整模型参数,使其适应新任务或领域数据,提升泛化能力。通过外部知识源(如文档、数据库)提供结构化信息,增强模型的事实准确性。数据依赖需要大量标注或领域内文本数据(如数千至数百万条样本)。依赖高质量、结构化的知识源(如维基百科、专业文档),数据量可大可小。计算成本高(需训练/微调模型,显存占用大,训练时间长)。低(仅需查询知识库,推理阶段无额外计算开销)。实时性推理速度受模型大小影响(大模型可能延迟较高)。查询速度快(尤其适合结构化知识,如FAQ检索)。知识更新需重新训练模型以更新知识(成本高)。可动态更新知识库内容(如添加新条目),无需修改模型。可解释性模型决策过程黑盒,难以追溯知识来源。知识来源明确(可定位到具体文档或条目),便于调试和纠错。适用场景任务复杂、需模型生成或推理的场景(如对话生成、代码补全)。事实性问答、规则明确的任务(如客服FAQ、医疗诊断辅助)。二、选择依据与场景示例1. 选择微调的场景任务复杂度高:示例:需要模型理解上下文并生成连贯文本的任务(如写故事、代码生成)。原因:微调可让模型学习领域内的语言模式和隐含规则,而知识库仅能提供离散事实,无法处理复杂逻辑。数据充足且领域专一:示例:法律文书生成、医疗报告撰写(需大量专业语料)。原因:微调能通过大量数据捕捉领域特征,而知识库可能覆盖不全或需频繁更新。需模型自主推理:示例:数学题解答、逻辑推理任务(如Raven推理测试)。原因:微调可训练模型的推理能力,知识库仅能提供公式或规则,无法自主推导。长期任务适配:示例:持续学习的聊天机器人(需不断适应新用户偏好)。原因:微调可通过增量学习逐步优化模型,知识库需手动维护用户偏好数据。2. 选择知识库的场景事实性问答需求强:示例:客服FAQ、百科问答(如“北京天气如何?”)。原因:知识库可快速检索准确答案,避免模型生成错误信息(如幻觉)。知识更新频繁:示例:金融产品信息、疫情数据(需实时更新)。原因:知识库可动态修改条目,而微调需重新训练模型,成本高昂。计算资源有限:示例:边缘设备(如手机、IoT设备)上的轻量级应用。原因:知识库查询无需模型推理,节省计算资源。规则明确的任务:示例:税务计算、航班查询(需严格遵循规则)。原因:知识库可编码规则,而微调可能因数据偏差导致规则违反。三、混合方案:微调 + 知识库在多数实际场景中,结合微调与知识库可发挥各自优势:微调增强模型能力:通过微调让模型理解领域语言风格和任务逻辑(如医疗对话中的共情表达)。知识库提供事实支撑:在模型生成回答后,通过知识库验证事实准确性(如药物剂量、手术流程)。动态路由机制:根据问题类型自动选择处理方式:事实性问题 → 查询知识库;开放性问题 → 模型生成 + 知识库校验。示例:智能医疗助手:微调模型学习医患对话模式;知识库存储药品说明书、诊疗指南;模型生成建议后,知识库校验剂量和禁忌症。四、决策流程图是否是否是否是否任务需求需复杂推理或生成?选择微调需实时更新知识?选择知识库计算资源充足?考虑混合方案?微调+知识库最终选择五、总结建议优先微调:任务复杂、需模型自主推理、数据充足且计算资源允许时。优先知识库:事实性问答、知识更新频繁、计算资源有限或规则明确时。混合方案:多数实际场景下,结合两者可平衡性能、成本与可维护性。
-
LoRA(Low-Rank Adaptation)作为一种高效的微调方法,在保持模型性能的同时显著降低了计算和存储成本,但其应用也存在一定局限性。以下是LoRA的优缺点详细分析:一、LoRA的核心优点参数效率极高参数量减少90%以上:通过低秩分解(如 ( \Delta W = BA )),仅需训练 ( r \times (d + k) ) 个参数(( r \ll \min(d, k) )),远少于全量微调的 ( d \times k )。示例:在Qwen-7B模型上,使用LoRA微调仅需训练约0.2%的参数(约140万参数),而全量微调需训练全部70亿参数。计算资源需求低显存占用小:低秩矩阵的显存消耗远低于全量权重,支持在单张消费级GPU(如RTX 4090)上训练数十亿参数的模型。训练速度快:参数减少导致梯度计算和反向传播的复杂度降低,训练时间可缩短至全量微调的1/10甚至更低。模型性能损失小实验验证:在多数任务(如文本分类、代码生成)中,LoRA在减少90%参数的情况下,性能损失通常小于1%,部分任务甚至优于全量微调。原因:预训练模型的权重更新矩阵本身具有低秩特性,LoRA通过近似捕捉了这一特性。灵活性与可扩展性强多任务适配:可为不同任务分配独立的LoRA模块(如独立的 ( A ) 和 ( B ) 矩阵),共享原始模型知识,避免灾难性遗忘。模块化设计:可针对特定层(如注意力机制中的Q、K、V矩阵)应用LoRA,进一步优化效率。权重合并:推理阶段可将低秩更新合并到原始权重中,无需额外计算,与原始模型完全兼容。易于实现与部署代码简洁:仅需在原始模型中插入低秩矩阵层,无需修改核心架构。兼容性强:支持与量化(如QLoRA)、蒸馏等技术结合,进一步压缩模型规模。二、LoRA的潜在缺点任务敏感性低秩近似的局限性:对更新矩阵不满足低秩特性的任务(如某些生成任务或复杂推理任务),LoRA可能无法充分捕捉权重变化,导致性能下降。解决方案:动态调整秩 ( r )(如AdaLoRA)或结合其他方法(如全量微调关键层)。超参数调优复杂秩 ( r ) 的选择:( r ) 过小会导致欠拟合,过大则可能失去参数效率优势。需通过实验确定最优值(通常 ( r \in [4, 64] ))。缩放系数 ( \alpha ):控制更新强度的超参数,需根据任务调整以避免梯度消失或爆炸。架构限制线性层依赖:LoRA主要适用于线性变换(如Transformer的注意力权重),对非线性层(如激活函数、LayerNorm)的优化需额外设计。非线性任务适配:在涉及复杂非线性交互的任务(如图像生成、多模态学习)中,LoRA的效果可能受限。多任务冲突风险任务间干扰:当多个任务的LoRA模块共享同一原始模型时,可能因任务差异导致权重更新冲突,需通过任务特定初始化或正则化缓解。长期适应能力有限持续学习场景:在需要模型不断适应新数据(如在线学习)的场景中,LoRA的固定低秩结构可能无法动态扩展容量,需定期重新训练或结合其他方法。三、LoRA的适用场景与改进方向适用场景低资源微调:数据量小(如数千条样本)或计算资源有限(如单卡训练)时,LoRA是首选方案。多任务学习:需快速适配多个任务且避免模型膨胀的场景(如客服机器人、代码生成工具)。模型压缩:结合量化(如QLoRA)可在4-bit精度下微调33B参数模型,显存占用从80GB降至单卡可训练范围。改进方向动态秩调整:如AdaLoRA通过梯度信息动态分配秩,优化资源分配。混合微调:对关键层(如注意力头)使用全量微调,其余层使用LoRA,平衡性能与效率。非线性扩展:探索将LoRA应用于非线性层(如通过低秩分解激活函数参数)的方法。
-
LoRA(Low-Rank Adaptation)是一种针对大型预训练模型的高效微调方法,其核心原理是通过引入低秩矩阵分解,在保持原始模型参数不变的前提下,仅训练少量新增参数来实现模型对新任务的快速适配。以下是其原理的详细阐述:一、核心思想:低秩近似与参数高效性LoRA基于一个关键假设:模型在适应新任务时,权重更新矩阵具有低秩特性。这意味着,原始预训练模型的权重矩阵(如Transformer中的注意力权重或前馈网络权重)在微调时,其变化可以通过两个低秩矩阵的乘积来近似表示,而非直接更新整个高维矩阵。数学表达:设原始权重矩阵为 ( W_0 \in \mathbb{R}^{d \times k} ),传统微调会将其更新为 ( W_0 + \Delta W )。LoRA将 ( \Delta W ) 分解为两个低秩矩阵的乘积:[\Delta W = BA \quad \text{其中} \quad B \in \mathbb{R}^{d \times r}, \quad A \in \mathbb{R}^{r \times k}, \quad r \ll \min(d, k)]这里 ( r ) 是秩(通常远小于 ( d ) 和 ( k )),决定了新增参数的规模。参数效率:原始参数量为 ( d \times k ),而LoRA仅需训练 ( r \times (d + k) ) 个参数。例如,当 ( d = k = 4096 )、( r = 8 ) 时,参数量仅为原始模型的 0.2%,显著降低了计算和存储成本。二、训练与推理流程训练阶段:冻结原始权重:保持 ( W_0 ) 不变,仅训练 ( A ) 和 ( B )。前向传播:输入 ( x ) 经过原始权重和低秩更新的叠加:[h = W_0 x + BA x = W_0 x + B(Ax)]反向传播:仅更新 ( A ) 和 ( B ) 的梯度,原始权重不参与计算。推理阶段:权重合并(可选):将 ( BA ) 直接合并到 ( W_0 ) 中,得到新权重 ( W_0 + BA ),此时推理无需额外计算。保持分离:若需多任务切换,可保留 ( A ) 和 ( B ) 的独立参数,灵活调整模型行为。三、技术优势计算效率高:仅训练低秩矩阵,参数量减少90%以上,训练速度提升显著。例如,在单张3090 GPU上,2小时即可微调Qwen-7B模型(3000条客服对话数据),准确率从62%提升至89%。内存需求低:低秩矩阵的显存占用远小于全量微调,支持在消费级硬件(如RTX 4090)上训练数十亿参数的大模型。模型性能保持:实验表明,LoRA在减少90%参数的情况下,性能损失通常小于1%,部分任务甚至优于全量微调。灵活性强:支持多任务学习:为不同任务分配独立的 ( A ) 和 ( B ) 矩阵,共享原始权重。模块化设计:可针对特定层(如注意力机制中的Q、K、V矩阵)应用LoRA,进一步优化效率。易于实现与部署:代码实现简洁,仅需在原始模型中插入低秩矩阵层。权重合并后,推理阶段与原始模型完全兼容,无需额外推理成本。四、应用场景低资源微调:在数据量较小(如数千条样本)或计算资源有限(如单卡训练)的场景下,LoRA是首选方案。多任务适配:为不同任务(如文本分类、代码生成)训练独立的LoRA模块,共享原始模型知识,避免灾难性遗忘。模型压缩:结合量化技术(如QLoRA),可在4-bit精度下微调33B参数模型,显存占用从80GB降至单卡可训练范围。五、局限性任务敏感性:对低秩近似不敏感的任务(如某些生成任务)可能效果有限,需调整秩 ( r ) 或结合其他方法(如AdaLoRA动态调整秩)。架构限制:主要适用于线性层(如Transformer的注意力权重),对非线性层(如激活函数)的优化需额外设计。超参数调优:秩 ( r ) 和缩放系数 ( \alpha )(控制更新强度)需根据任务调整,不当设置可能导致欠拟合或过拟合。
-
1. AI开发平台ModelArts新功能2025年11月份没有发布新功能。有连续2个月没有发布新功能了,也许在规划中,还在深蹲。2. 人工智能相关直播合集11月份的相关整理如下:仓颉编程语言入门级开发者认证—考试辅导https://bbs.huaweicloud.com/live/cloud_live/202510311600.html体系化梳理仓颉编程语言入门级开发者认证课程,清晰解读其发展历程、核心概念与典型应用场景,并提供通关指南,助您全面掌握认证考核要点与学习路径。昇腾适配Kimi-K2-Thinking模型实践解读cid:link_1对KIMI模型和昇腾支持感兴趣的可以看过来生态大讲堂系列 第六讲:无开源不AI,无IP不开源https://bbs.huaweicloud.com/live/dks_live/202511111700.html对人工智能创新生态建设与知识产权治理的一些思考,感兴趣的可以看看 CANN Meetup 北京站cid:link_2美女主持人,还有对CANN感兴趣的一定要看过来,里面有很多有趣的领域,干货满满!核心算子如何优化?专家带你深度解析昇腾AI算法挑战赛进阶赛战鼓催征!华为算子专家王老师,为你深度剖析Matmul、wholereducesum等核心算子的底层原理与优化技巧,直击赛题核心。想提升代码效率、冲击更高排名?锁定直播,带你掌握方法!这一个直播也是我强烈推荐的!因为里面非常系统的讲解了CANN算子开发,非常系统的、非常全面的,从硬件到软件到优化,都有讲到。cid:link_0
-
李飞飞主导创建的ImageNet数据集于2009年发布,该数据集包含超过1400万张标注图像,覆盖2万多个类别。这一规模化的标注数据为计算机视觉研究提供了重要的训练资源。数据集的构建过程动员了全球167个国家的近5万名工作者,通过亚马逊 Mechanical Turk 平台进行人工标注。杰弗里·辛顿团队在2012年ImageNet竞赛中采用了AlexNet架构。该网络包含5个卷积层和3个全连接层,首次在图像识别任务中成功应用了ReLU激活函数和Dropout正则化方法。训练过程中使用了两块GTX 580 GPU进行并行计算,耗时5-6天完成。ImageNet数据集的出现恰逢深度学习发展的关键时期。该数据集每年举办的ILSVRC竞赛成为衡量算法性能的重要平台,推动了物体检测、图像分类等技术指标的快速提升。数据规模的量变最终引发了算法能力的质变。辛顿团队的工作展示了深度卷积神经网络在处理大规模视觉任务上的优势。AlexNet在ImageNet测试集上的top-5错误率为15.3%,较传统方法降低了约10个百分点。这项成果直接激发了工业界对深度学习技术的投入,包括后来出现的深度残差网络等改进架构。可以看到,开源模式在人工智能领域已成为基础性的协作机制。ImageNet数据集从建立之初就遵循开放获取原则,该数据集网站明确标注"面向全球研究人员免费提供用于非商业用途"。这种开放策略使得包括辛顿团队在内的众多研究组能够基于统一基准开展比较研究,有效加速了算法迭代进程。辛顿团队在2012年竞赛后立即公开了AlexNet的模型架构和实现细节。这份技术报告促使Caffe、Torch等开源深度学习框架迅速集成相关算法,伯克利视觉与学习中心的贾扬清在开发Caffe框架时就直接借鉴了这些设计。开源社区的集体智慧随后催生了VGG、GoogLeNet等改进架构,这些成果也都以开源形式发布。开源生态与硬件发展形成了良性循环。NVIDIA在AlexNet公布后注意到GPU在深度学习训练中的潜力,随即加大了对CUDA平台的投入。这种开放协作的传统在后续生成式AI发展中得到延续。工业界也逐步调整开源策略。Meta开源的PyTorch框架已成为学术研究的主要平台,特斯拉发布的HydraNet多任务网络展示了产业界与学术界的知识共享。这种开放与商业化的平衡机制,持续推动着整个领域的技术透明度和可复现性。
-
直接给你总结成blog给你看了,简直不要太方便,你就说行不行吧: 网站是 https://www.alphaxiv.org/overview/2510.18234 后面的数字替换为对应的论文
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第三期2026/08/21 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;念擎-华为云AI开发者运营案例开发专家
本期直播内容:AI六层能力首次详细解读 + 新一代华为云开发者空间亮相 + 校园案例直播带练
回顾中
热门标签