-
在PKI(公钥基础设施)体系中,CA证书、证书和私钥是三个核心概念,它们的区别和关系如下:1. 证书(Certificate)定义:数字证书是用于证明实体(如服务器、个人、设备)身份的电子文档,遵循X.509标准。内容:公钥(Public Key):用于加密或验证签名。持有者信息(Subject):如域名、组织名称等。颁发者信息(Issuer):签发证书的CA信息。有效期(Validity Period):起止日期。签名算法:CA使用的签名算法(如SHA-256-RSA)。CA的数字签名:确保证书未被篡改。作用:验证身份、建立信任链。文件格式:.crt, .pem, .cer(通常为Base64编码的文本文件)。2. CA证书(CA Certificate)定义:由根CA(Root CA)或中间CA(Intermediate CA)持有的证书,用于签发其他实体证书。特点:CA证书本质也是一种证书,但它是信任锚点。根CA证书自签名,中间CA证书由上级CA签发。客户端(如浏览器、操作系统)会内置受信任的根CA证书列表。作用:验证终端实体证书的合法性(通过签名链)。构建信任链(如:网站证书 → 中间CA证书 → 根CA证书)。常见文件:ca-bundle.crt(CA证书链文件)。3. 私钥(Private Key)定义:与证书中的公钥配对的机密密钥,必须严格保密。作用:解密:用公钥加密的数据,需私钥解密。签名:生成数字签名(如TLS握手时的服务端签名)。文件格式:.key, .pem(通常注明PRIVATE KEY)。安全要求:绝对不能泄露或共享。需加密存储(如使用密码保护的.pfx/.p12文件)。三者关系图示根CA证书(自签名) ↓ 签发 中间CA证书 ↓ 签发 终端实体证书(如域名证书) ← 配对 → 私钥(仅持有者拥有)关键区别总结概念持有者内容是否公开主要用途CA证书根CA/中间CACA的公钥+CA信息+签名是签发其他证书,构建信任链证书服务器/个人/设备公钥+持有者信息+CA签名是验证身份,加密通信(如HTTPS)私钥证书持有者机密密钥否解密数据或生成签名实际应用示例(HTTPS)服务端配置:提供证书(包含公钥)和私钥(用于TLS握手签名)。中间CA证书需一并发送,以构建完整信任链。客户端验证:用内置的根CA证书验证服务端证书的签名链。确认证书有效且域名匹配后,使用证书中的公钥加密数据。注意事项私钥泄露:等同于身份被盗用,需立即吊销证书。证书过期:需在到期前续订,否则服务中断。信任链断裂:若中间CA证书未正确部署,客户端会提示“不受信任的证书”。理解这三者的区别有助于正确配置SSL/TLS、排查证书错误(如ERR_CERT_AUTHORITY_INVALID)或安全审计。
-
要编译安装 Flash-Attention 并生成 .whl 文件,以下是详细的步骤。此过程适用于支持 CUDA 的 PyTorch 环境1. 环境准备确保你的环境中已经安装了以下依赖:Python 3.8+(建议使用虚拟环境)PyTorch(确保版本与 CUDA 兼容,例如 torch>=1.13)CUDA Toolkit(根据 PyTorch 版本选择对应的 CUDA 版本)CMake(用于编译 C++ 代码)Ninja(加速编译)wheel(构建 .whl 文件)setuptools(构建工具)# 安装依赖(以 Ubuntu 为例) sudo apt-get update sudo apt-get install -y cmake ninja-build python3-dev python3-pip2. 安装 PyTorch 和依赖确保安装了与 CUDA 兼容的 PyTorch 版本。例如:# 安装 PyTorch(以 CUDA 12.1 为例) pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu1213. 克隆 Flash-Attention 仓库从 GitHub 克隆 Flash-Attention 源码:git clone cid:link_0.git cd flash-attention4. 编译和安装方法 1:直接使用 PyPI 安装(推荐)如果不需要自定义编译,可以跳过源码编译,直接通过 PyPI 安装:pip install flash-attn方法 2:从源码编译并生成 .whl 文件如果需要自定义编译(例如修改代码),请按以下步骤操作:编译生成 .whl 文件pip install wheel pip install ninja python setup.py bdist_wheel生成的 .whl 文件会位于 dist/ 目录中。例如:dist/flash_attn-<version>-cp39-cp39-linux_x86_64.whl安装上述生成的.whl文件即可安装 flash-attnpip install flash_attn-<version>-cp39-cp39-linux_x86_64.whl5. 验证安装安装完成后,可以用以下代码验证是否成功:import flash_attn print(flash_attn.__version__) 如果未报错,说明安装成功。6. 常见问题编译失败:检查 CUDA 是否正确安装,并确认 CUDA_HOME 环境变量是否存在。# 设置 CUDA 路径(根据你的安装路径调整) export CUDA_HOME=/usr/local/cudaPyTorch 版本不兼容:确保 PyTorch 版本与 CUDA 版本匹配。7. 注意事项Windows 支持:Flash-Attention 在 Windows 上可能需要手动配置 CUDA 和 CMake,且性能可能不如 Linux。自定义编译选项:可以通过修改 setup.py 或来调整编译配置。如有其他问题,可以参考 Flash-Attention 官方 GitHub 仓库。
-
2025年4月29日,qwen团队发布了新一代开源大模型 qwn3系列旗舰模型 Qwen3-235B-A22B 在代码生成、数学推理以及通用任务等多项基准测试中,展现出与 DeepSeek-R1、o1、o3-mini、Grok-3 和 Gemini-2.5-Pro 等主流大模型相当甚至更优的性能。从评测结果来看,能力极强本次使用 ollama 部署qwen3:32b-q8_0首页下载并安装ollama:curl -fsSL https://ollama.com/install.sh | sh 上述命令会自动安装ollama检查ollama 版本:ollama -v得到如下结果:ollama version is 0.6.6启动ollama 服务:ollama serve接下来拉取并运行qwen3:32b-q8_0:ollama run qwen3:32b-q8_0下载完成后,即可成功运行qwen3:32b-q8_0还可以使用/no_think禁用模型思考这次发布的深度思考和简单思考,可以随便切换,提高了模型回答问题的准确度。不过要注意,运行此qwen3:32b-q8_0 模型,需要显存大概40GB左右。qwen3还有其他系列,最小的qwen3:0.6b在手机端部署效果也不错。速度很快,回答问题准确总结最新发布的Qwen3系列模型,不仅在技术上实现了重大突破,而且在应用层面展现了极大的灵活性和适应性。这一系列模型通过引入思考模式 (用于复杂逻辑推理、数学和编码)与非思考模式 (用于高效通用对话)之间的无缝切换机制 ,显著提升了模型处理各类任务的准确性和效率。用户可以根据具体的应用场景和需求,灵活选择合适的运行模式,从而在保证性能的同时,合理管理计算资源的使用。Qwen3系列的技术亮点双模式自由切换:提升效率与准确性Qwen3支持两种主要工作模式:思考模式(Reasoning Mode) 和 非思考模式(Chat Mode) 。前者专为需要深度逻辑分析的任务设计,如数学运算、代码生成、数据分析等;后者则面向日常交流、简单问答等交互场景,强调响应速度与流畅体验。这种设计让用户能够根据任务复杂度动态调整“思考预算”,在关键任务中投入更多算力,在日常对话中实现更快速响应。更为重要的是,Qwen3实现了这两种模式之间的无缝切换 。用户只需通过简单的参数控制即可实现不同模式的切换,无需重新加载模型或中断流程,极大提升了实际使用中的便捷性与实用性。多版本模型布局,全面覆盖各种硬件环境Qwen3系列共包含8款模型,涵盖6个稠密模型(Dense)以及2个专家混合模型(Mixture-of-Experts, MoE),参数规模从0.6B到32B不等,能够灵活适配从嵌入式设备到高性能服务器等多种应用场景。对于低配置终端设备 (如入门级PC或手机),推荐部署轻量级模型如Qwen3:0.6B,这类模型在保持较高响应速度的同时,对系统资源的需求极低。针对中等性能设备 (如主流笔记本或边缘计算节点),可选择4B或8B版本,在性能与资源消耗之间取得良好平衡。而对于高性能服务器集群 ,则推荐使用Qwen3:32B-Q8_0版本,以获得最强的模型能力,适用于企业级AI服务、大模型微调与推理等复杂任务。部署方案与硬件要求服务器端部署:高精度与低资源占用并存以Qwen3:32B-Q8_0为代表的大型模型,其原生BF16精度通常需要非常高的显存支持。为降低部署门槛,该模型采用了量化技术 (如Q8_0量化格式),使其在保持较高推理质量的同时,将所需显存压缩至约40GB左右。这意味着即使没有顶级显卡(如A100/H100),也可以借助适当的工具(如Ollama、llama.cpp等)进行高效部署。移动端与边缘设备部署:轻量化与高效能兼得Qwen3:0.6B作为整个系列中最小的成员,特别适合在移动端或嵌入式设备上运行。它具有以下优势:体积小,启动快,响应迅速;对内存和处理器的要求极低;在低端设备上也能提供高质量的自然语言理解和生成能力。
-
通过命令 ollama serve -h获取帮助root@root:ollama serve -h Start ollama Usage: ollama serve [flags] Aliases: serve, start Flags: -h, --help help for serve Environment Variables: OLLAMA_DEBUG Show additional debug information (e.g. OLLAMA_DEBUG=1) OLLAMA_HOST IP Address for the ollama server (default 127.0.0.1:11434) OLLAMA_KEEP_ALIVE The duration that models stay loaded in memory (default "5m") OLLAMA_MAX_LOADED_MODELS Maximum number of loaded models per GPU OLLAMA_MAX_QUEUE Maximum number of queued requests OLLAMA_MODELS The path to the models directory OLLAMA_NUM_PARALLEL Maximum number of parallel requests OLLAMA_NOPRUNE Do not prune model blobs on startup OLLAMA_ORIGINS A comma separated list of allowed origins OLLAMA_SCHED_SPREAD Always schedule model across all GPUs OLLAMA_FLASH_ATTENTION Enabled flash attention OLLAMA_KV_CACHE_TYPE Quantization type for the K/V cache (default: f16) OLLAMA_LLM_LIBRARY Set LLM library to bypass autodetection OLLAMA_GPU_OVERHEAD Reserve a portion of VRAM per GPU (bytes) OLLAMA_LOAD_TIMEOUT How long to allow model loads to stall before giving up (default "5m") 核心用法启动服务:ollama serve默认会监听 127.0.0.1:11434,加载模型并处理推理请求。快速调试:OLLAMA_DEBUG=1 ollama serve开启调试模式,输出更详细的日志。关键环境变量详解1. 网络与部署配置OLLAMA_HOST作用:绑定服务器监听的主机名/IP 和端口。示例:OLLAMA_HOST=0.0.0.0:11434 ollama serve # 使服务对局域网客户端可用 适用场景:多实例部署或需跨机器访问时。OLLAMA_ORIGINS作用:设置允许跨域请求的来源(CORS 配置)。示例:OLLAMA_ORIGINS="http://localhost:3000,https://example.com" ollama serveOLLAMA_NOPRUNE作用:禁用启动时自动清理模型缓存(*.blob 文件)。场景:需要保留模型临时文件用于调试或恢复。2. 资源管理与性能优化OLLAMA_KEEP_ALIVE作用:模型未被访问时保留在内存的时间(默认 5m)。调整策略:高频并发:增大(如 30m)以减少加载开销。资源紧张:减小(如 1m)以腾出内存。示例:OLLAMA_KEEP_ALIVE=30m ollama serveOLLAMA_MAX_LOADED_MODELS作用:每块 GPU 上最大并发加载模型数。示例:OLLAMA_MAX_LOADED_MODELS=4 ollama serve # 适合 8GB 显存的 GPU OLLAMA_GPU_OVERHEAD作用:每块 GPU 预留的 “安全显存”(单位:字节)。场景:防止显存不足导致模型加载失败,尤其对多任务环境有效。OLLAMA_SCHED_SPREAD=1作用:强制将模型负载均匀分配到所有 GPU,避免单卡过载。适用场景:多 GPU 系统(如 4x A6000)。OLLAMA_FLASH_ATTENTION=1作用:启用 Flash Attention 优化机制(需 CUDA 支持)。效果:加速推理,尤其对长文本场景显著(如 LLaMA-3 的 80亿参数模型)。3. 模型缓存与量化OLLAMA_KV_CACHE_TYPE作用:Key/Value 缓存的量化类型(默认 f16)。支持值:f16(16位浮点)、q4_0(4位无量化)、llmquant(自定义量化方案)。选择策略:f16:精度高,显存消耗大(适合显存 >16GB 的 GPU)。q4_0:极致性能,可能损失精度(适合低显存场景如 4GB 显存)。OLLAMA_LLM_LIBRARY作用:手动指定 LLM 库(如 cublas、llama.cpp),覆盖自动检测逻辑。场景:混合硬件环境(如 CPU + GPU)或强制使用特定后端。4. 请求队列与负载控制OLLAMA_MAX_QUEUE作用:等待处理的请求最大数量(队列上限)。调整:高并发场景:增大(如 200)。降低丢包率:确保 OLLAMA_NUM_PARALLEL < OLLAMA_MAX_QUEUE。OLLAMA_NUM_PARALLEL作用:同时处理的请求数(并行度)。示例:OLLAMA_NUM_PARALLEL=8 ollama serve # 利用多核 CPU 或多 GPU 的并发能力 OLLAMA_LOAD_TIMEOUT作用:模型加载超时时间(需自定义添加扩展支持)。提示:若加载超时,检查 GPU 显存分配限制。5. 高级调试与开发OLLAMA_LOG_LEVELS=DEBUG作用:设置日志粒度(如 DEBUG、INFO),配合调试工具(如 strace)。日志位置:默认输出到控制台,可通过 > debug.log 捕获。OLLAMA_DUMP_TENSOR=1作用:输出中间张量数据(需手动编译带 -D_DEBUG 选项的源码)。场景:调试模型精度问题或自定义层实现。典型性能调优流程# Step 1: 确认硬件限制 nvidia-smi # 查看 GPU 显存占用 # Step 2: 启动高性能配置 OLLAMA_KEEP_ALIVE=30m \ OLLAMA_MAX_LOADED_MODELS=4 \ OLLAMA_GPU_OVERHEAD=1073741824 \ OLLAMA_SCHED_SPREAD=1 \ OLLAMA_FLASH_ATTENTION=1 \ OLLAMA_KV_CACHE_TYPE=q4_0 \ OLLAMA_NUM_PARALLEL=8 \ ollama serve总结:选型建议场景推荐配置4GB 显存 GPUOLLAMA_MAX_LOADED_MODELS=1, OLLAMA_KV_CACHE_TYPE=q4_0, OLLAMA_KEEP_ALIVE=2m多 GPU 集群OLLAMA_SCHED_SPREAD=1, OLLAMA_GPU_OVERHEAD=2000000000跨地域调用OLLAMA_HOST=0.0.0.0, OLLAMA_ORIGINS="*"高并发 API 服务OLLAMA_NUM_PARALLEL=16, OLLAMA_MAX_QUEUE=200混合 CPU+GPU 推理OLLAMA_LLM_LIBRARY=cublas, OLLAMA_DEBUG=1通过精细调整上述参数,可平衡性能与资源消耗,最大化 OLLaMA 的推理效率。在生产环境中建议进行 A/B 测试(如不同 KV_CACHE_TYPE),记录吞吐量与 P99 延迟指标,找到最佳配置。
-
【活动福利】1、 邀请报名有礼:送最高1000元云资源代金券/工作级开发者认证代金券。2、 考证积分有礼(含邀请好友考证):最高送华为手表FIT3,更有2000+份礼品/云资源代金券/开发者认证代金券等,积分越高礼品越丰厚。3、开发者空间案例实践抽奖:赢华为手环9/华为耳机/定制双肩包/华为云云宝盲盒等精美礼品。4、昇腾AI专区课程学习抽奖:赢华为手环9/华为耳机/定制双肩包/定制雨伞/华为云云宝盲盒等精美礼品。5、专属福利:工作级开发者认证通过后,岗位直推,更多职位机会等你来挑战!点击查看本次推荐。活动链接: cid:link_0一、活动公示信息1、积分进度公示及邀请好友考证数据,见本论坛贴附件22、邀请好友领云资源券公示,见本论坛贴附件43、昇腾A专区课程学习抽奖中奖公示,见本论坛贴附件54、积分兑换云资源券已填写问卷且符合条件的用户公示,见本论坛贴附件6说明:不在公示名单内,可能是未填写积分兑换云资源问卷或积分数不符合要求,积分兑换问卷将于5月18日(含)停止收集,请及时填写积分兑换问卷特别提醒:对以上任意获奖公示有疑问的学员务必在2025年5月23日(含)前反馈至小助手,逾期未反馈视为放弃奖励!二、【积分兑换实物奖品获奖公示】【公示时间】积分兑换实物奖品已于 2025年4月27日18:00 停止,获奖公示时间为2025年4月28日—2025年5月11日,请大家及时查看获奖公示,逾期反馈不予处理,请知悉!【奖品发放】活动奖品在所有奖励公示结束后统一发放! 积分兑换实物公示名单见本论坛贴附件3特别提醒:对以上任意获奖公示有疑问的学员务必在2025年5月11日(含)前反馈至小助手,逾期未反馈视为放弃奖励!(若对获奖名单存有异议可咨询小助手)三、为了后续给大家提供更好的活动体验,欢迎大家积极填写活动满意度调查问卷:cid:link_2
-
TinyVue是一个跨端跨框架的企业级UI组件库,基于renderless无渲染组件设计架构,实现了一套代码同时支持Vue2和Vue3,支持PC和移动端,包含100多个功能丰富的精美组件,可帮助开发者高效开发Web应用。 4月28日晚19点,泽瑞科技前端架构师、鸿蒙开源布道师、阿里友盟KOL将为大家分享如何基于TinyVue组件库定制企业级UI体系,欢迎大家进入直播间一起讨论
-
本月话题:谈谈大家对2025HDC华为开发者大会的期待内容技术的力量,始于微小,成于坚持。2025年6月,共赴东莞松山湖,在华为开发者大会(HDC 2025)的舞台上,与全球开发者一起,用代码编织智慧时代的经纬。谈谈大家有没有什么期待学习、想要了解的内容
-
GaussDB 集中式安装部署小实践及常见错误解决cid:link_2GaussDB的Publication/Subscription与PostgreSQL的兼容性差异cid:link_3如何在GaussDB中配置Publication/Subscriptioncid:link_4在GaussDB中JSON和JSONB类型cid:link_5如何在BearPi-Pico H3863上实现多任务处理cid:link_6GaussDB中要只输出驼峰格式的数据方法cid:link_7鲲鹏920通过NUMA绑定或调度策略减少核间延迟的方法cid:link_8GaussDB 集中式下载安装小实践cid:link_0GaussDB函数定义和权限设置cid:link_9GaussDB数据库中怎么查看当前用户的权限cid:link_10解密数据库的MPP模式cid:link_1一招解决MRS作业中shell节点获取Hive SQL执行结果cid:link_11Redis小知识分享cid:link_12一文比较Redis和Memcached的区别cid:link_13Redis的通信协议小知识cid:link_14Redis Cluster数据集cid:link_15Redis Zset的实现cid:link_16华为Ascend 310B与PyTorch兼容性及训练和推理能力分析cid:link_17
-
一、华为Ascend 310B与PyTorch兼容性1. 硬件与软件支持华为Ascend 310B是一款专为AI推理设计的高能效、高集成度的AI处理器,主要用于边缘计算场景。虽然Ascend 310B本身没有直接运行PyTorch的原生能力,但借助华为的异构计算架构(CANN)和相关工具,用户可以在Ascend 310B上运行PyTorch模型。2. 模型转换与环境配置在Ascend 310B上运行PyTorch模型,需要进行模型转换和环境配置。具体步骤如下:模型转换:使用华为的模型转换工具ATC(Ascend Tensor Compiler)将PyTorch模型转换为Ascend 310B支持的格式(如OM模型)。ATC工具位于ascend-cann-toolkit包中,支持将Caffe、MindSpore、TensorFlow和ONNX等多种框架的模型转换为Ascend设备可用的模型。环境配置:配置Ascend 310B的运行环境涉及安装驱动程序、固件和相关的库文件。例如,设置环境变量、更新驱动版本等。此外,还需要安装Ascend PyTorch镜像,该镜像提供了在Ascend设备上运行PyTorch的环境。3. 实际案例与操作指南许多用户已经成功在Ascend 310B上运行了PyTorch模型。例如,在目标检测和图像分类任务中,通过将PyTorch模型转换为Ascend 310B支持的格式,并进行相应的环境配置,实现了高效的推理。详细的操作指南和案例可以在华为的官方文档和相关论坛中找到,如《如何在华为Ascend设备上运行模型》。二、使用PyTorch进行训练和推理1. 训练能力Ascend 310B主要用于推理,其设计重点在于高效的计算能力和低功耗。虽然可以通过转换工具在Ascend 310B上运行PyTorch模型,但由于硬件架构和计算资源的限制,通常不用于大规模的模型训练任务。对于训练任务,华为提供了Ascend 910,这是一款专为训练设计的AI处理器,具备更高的计算能力和更大的内存。2. 推理能力Ascend 310B在推理任务中表现出色。用户可以将PyTorch模型转换为Ascend 310B支持的格式(如OM模型),然后使用Ascend 310B进行高效的推理。在推理过程中,Ascend 310B利用其强大的计算能力和优化的指令集,快速处理输入数据并生成结果。这种推理能力在图像识别、自然语言处理等领域具有广泛的应用前景。3. 性能优化为了在Ascend 310B上实现最佳的推理性能,用户可以利用Ascend PyTorch Profiler接口工具采集并解析性能数据,使用mstt的msprof-analyze工具统计、分析以及输出相关的调优建议,使用MindStudio Insight工具对性能数据进行可视化展示。此外,还可以对模型进行量化、剪枝等优化操作,以减少模型的计算量和存储需求,提高推理速度。三、原生ACL支持训练功能吗?1. ACL框架简介ACL(Ascend Computing Language)是华为Ascend AI处理器的编程框架,提供了一系列C++接口,用于管理设备、上下文、流和内存,加载和执行模型或算子等。ACL框架主要用于在Ascend设备上进行模型的推理和执行,原生并不直接支持训练功能。2. 训练替代方案虽然ACL不直接支持训练,但用户可以通过其他方式在Ascend平台上进行模型训练:使用Ascend 910进行训练:Ascend 910是华为专为训练设计的AI处理器,具备更高的计算能力和更大的内存,适用于大规模的模型训练任务。用户可以在Ascend 910上使用MindSpore、PyTorch等框架进行模型训练,然后将训练好的模型转换为Ascend 310B支持的格式,以便在Ascend 310B上进行推理。利用TBE DSL和TIK进行训练:在Atlas 200 DK(Soc=Ascend 310)上,可以使用TBE DSL(Tensor Boost Engine Domain Specific Language)和TIK(Tensor Iterator Kernel)进行模型训练。这两种方法相对复杂,但提供了更底层的控制和优化能力,适用于对性能要求较高的场景。总结综上所述,华为Ascend 310B本身不能直接运行PyTorch,但通过模型转换和环境配置,可以在Ascend 310B上运行PyTorch模型并进行推理。然而,由于硬件架构和计算资源的限制,Ascend 310B通常不用于大规模的模型训练任务,训练任务推荐使用Ascend 910。此外,ACL作为Ascend AI处理器的编程框架,原生不支持训练功能,但用户可以通过其他方式在Ascend平台上实现模型训练。
-
TinyVue是一个跨端跨框架的企业级UI组件库,基于renderless无渲染组件设计架构,实现了一套代码同时支持Vue2和Vue3,支持PC和移动端,包含100多个功能丰富的精美组件,可帮助开发者高效开发Web应用。4月22日19点,云计算高级前端开发工程师,TinyVue 项目成员郑志超、申君健老师,将为大家分享 TinyVue 多端模板与模式切换,并与大家介绍 TinyVue 轻量图标库的使用。本次直播将围绕 TinyVue 的最新版本展开。首先,为大家介绍 TinyVue 多端模板架构,接着为大家讲解 Mobile-First 多端模板用法,并通过实际案例向大家演示 UI 效果对比,当然还有图标库分享等着大家。同时,直播过程中还会设置技术答疑环节,欢迎大家积极提问,我们将现场为大家答疑解惑。无论你是技术大牛,还是初学者,相信这场直播都会让你收获满满!直播详情直播时间:2025年4月22日19点直播地址:http://live.bilibili.com/31174756直播讲师:云计算高级前端开发工程师 郑志超、云计算高级前端开发工程师 申君健直播议题:TinyVue多端能力及深色模式介绍TinyVue轻量图标库分享关于OpenTiny欢迎加入 OpenTiny 开源社区。添加微信小助手:opentiny-official 一起参与交流前端技术~OpenTiny 官网:https://opentiny.designOpenTiny 代码仓库:https://github.com/opentinyTinyVue 源码:https://github.com/opentiny/tiny-vueTinyEngine 源码: https://github.com/opentiny/tiny-engine欢迎进入代码仓库 Star🌟TinyEngine、TinyVue、TinyNG、TinyCLI、TinyEditor~ 如果你也想要共建,可以进入代码仓库,找到 good first issue标签,一起参与开源贡献~
-
“【摘要】 鲲鹏DevKit针对不同的业务场景,提供了应用迁移和系统迁移两套解决方案,帮忙开发者快速从X86平台迁移至鲲鹏平台,通过详细的迁移建议降低迁移门槛,可视化展示迁移进度,打消鲲鹏平台开发的顾虑。”在DTSE Tech Talk技术直播课第69期《鲲鹏DevKit,助力开发者基于鲲鹏服务器实现一站式应用开发》中,华为鲲鹏DTSE技术布道师Hank Hou,与鲲鹏生态开发者交流如何在鲲鹏服务器上快速开展应用开发,跟大家分享鲲鹏DevKit工具链的特性功能,以及这些特性功能能够解决哪些开发中遇到的问题,助力鲲鹏生态快速发展。鲲鹏生态开发面临的挑战开发者在基于鲲鹏服务器进行应用开发时,面临软件跨平台迁移的挑战,包括指令差异、性能调优、服务器性能瓶颈等问题。人工分析投入大、周期长,对专业技能要求高,反复定位试错效率低。• 软件迁移的挑战:人工分析:人工检索软件依赖的第三方软件,并替换鲲鹏版本,工作量巨大编译选项:人工逐行筛查,需编译运行后才能发现兼容性问题移植的汇编代码:对技能要求高,需汇编指令集、一个个去替换从迁移到调优的整个过程都很繁琐:周期长、效率低、技术门槛高• 性能调优的挑战:性能工具零散:没有一站式全量性能统计工具,对于CPU、网卡等设备需要不同的调优工具学习成本高:众多工具学习成本高,数据不互通,无法全局分析依赖经验:对于应用的深度调优,依赖开发人员的技术储备应用+系统极速迁移方案针对鲲鹏生态开发遇到的挑战,鲲鹏DevKit针对不同的业务场景,提供了应用迁移和系统迁移两套解决方案,帮忙开发者快速从X86平台迁移至鲲鹏平台,通过详细的迁移建议降低迁移门槛,可视化展示迁移进度,打消鲲鹏平台开发的顾虑。1. 应用迁移快速扫描海量代码,提供专业迁移指导报告,自动分析出需修改的代码内容,给出修改建议;无源码应用基于ExaGear动态二进制翻译工具,低成本解决应用的平滑迁移,释放鲲鹏平台澎湃算力。2. 系统迁移全栈迁移能力,自动采集和分析系统成分,实现OS和主流中间件自动迁移、主流商业数据库自动部署、应用层待迁移信息全量扫描并指导修改,助力业务系统快速迁移。全流程开发工具助力极简开发鲲鹏DevKit为开发者提供了全流程的开发工具,从代码开发、性能调优、测试诊断、流水线等代码开发各个阶段,均提供了对应的开发工具,助力开发者持续且首发性能领先的鲲鹏商用版本,加速原生开发。1. 开发• 鲲鹏DevKit针对高频开发场景提供场景化SDK、代码样例,功能齐全、注释完整,帮助开发者快速上手鲲鹏开发• 鲲鹏亲和检查,多维度扫描优化打造鲲鹏亲和应用• 面向不同技术路线,提供三款鲲鹏架构优化的编译器工具链,包括毕昇编译器、毕昇JDK、GCC for openEuler• Java UT用例自动生成支持一键自动生成Java全量测试用例,核心代码行覆盖率80%,支持增量UT生成快速拦截代码改动引入的质量问题,保障业务质量2. 性能调优• 自动采集系统数据,分析出系统性能指标,定位到瓶颈点及热点函数,给出调优建议,从而达到软件和鲲鹏平台融合的最佳性能。• AITunner:AI on CPU加持场景化调优,性能平均提升20%• 性能采集库(libkperf) 以内存方式管理采集数据,减少IO开销;提供通用化接口设计,便于使用;与linux发行版解耦,轻依赖,低耦合,可兼容多OS3. 系统诊断分析系统运行指标,识别异常点,例如:内存泄漏、内存越界、网络丢包等,并给出优化建议。支持压测系统,如:网络IO、存储IO,评估系统最大性能。4. 快速接入流水线基于鲲鹏硬件+openEuler+鲲鹏DevKit +鲲鹏BoostKit构建1套软件工程流水线,实现1套代码开发、多平台运行,助力伙伴持续且首发性能领先的鲲鹏商用版本鲲鹏DevKit为开发者提供了一套全面的工具和解决方案,以实现高效、快速的应用迁移和开发,特别是在高性能计算、金融、大数据、云计算等领域。通过自动化、智能化的方法,DevKit显著提升了开发效率和软件性能,降低了开发和维护成本。
-
在华为云生态大会2025公布了最新研发的CloudMatrix 384超节点,其总体算力远超其他厂商,大家对未来需求更多的算力有什么看法?
-
【直播回放】直播回放地址【总结简报】华为开发者布道师技术沙龙·直播间精彩回顾【第1期】联接高校人才培养与前沿产业技术,成就学生未来 / 李一浩老师【第2期】逐梦之旅:学生开发者到华为开发者布道师的蜕变 / 杨阳同学【第3期】昇思MindSpore:AI 领域的创新力量与跨平台之路 / 陈新杰同学【第4期】基于OpenHarmony计算机学科人才培养经验分享 / 周睿老师【第5期】计算机核心课程贯通式实践教学体系介绍 / 赵欢老师、李博经理、杨科华老师【第6期】OpenHarmony应用开发之网络数据请求与数据解析 / 倪红军老师【第7期】华为开发者空间玩转DeepSeek / 马欣老师【第8期】基于能力图谱的openGauss项目闯关 / 马瑞新老师【第9期Day1】基于开源鸿蒙+海思星闪开发板:嵌入式系统开发实战 / 齐耀龙老师【第9期Day2】基于开源鸿蒙+海思星闪开发板:嵌入式系统开发实战 / 齐耀龙老师【第10期】基于华为云+DeepSeek大模型的脑肿瘤分割实验教学案例 / 林承德老师官网直播间观众问题回答摘要:序号问题答复16251+轻量化微调与传统微调有什么不同吗?轻量化微调与传统微调的主要区别在于计算资源的使用和模型更新的范围。轻量化微调通过减少模型调整的规模,提升了效率和资源利用率,适合资源有限的场景;而传统微调则能更全面地调整模型,适用于对性能要求较高的任务。22457+Transformer结构在微调过程中有什么作用?在使用LoRA(Low-Rank Adaptation)微调大模型时,安装Transformer库是非常重要,主要作用在于:Transformer库提供了基本的模型结构和预训练模型;LoRA微调过程需要修改大模型中Transformer的权重;Transformer库提供了模型微调的工具和接口。3做这类实验没有华为云上的算力怎么办?此次案例是基于华为云上的算力开展的,可以通过开发者布道师计划、百校种子计划、产学合作协同育人计划等活动来获取华为云的算力券支持。4对于没有华为云使用经验的学生,如何快速上手本实验?华为云社区提供有预置镜像,可快速完成基础环境配置,基于Ascend 910A的DeepSeek-Distill系列模型部署指南可以帮助快速上手https://git.openi.org.cn/OpenIOSSG/Ascend910A-DeepSeek-Service#user-content-%E9%95%9C%E5%83%8F%E4%B8%8B%E8%BD%BD5我看sft的数据集都是一些问答对,对模型能力的提升明显么有一定的提升作用,可以从增大微调数据集体量,增加微调轮次等方式来进一步提升效果。62457+脑肿瘤分割数据集中的类别不平衡,如何优化呢?对肿瘤区域过采样,结合旋转、弹性形变等增强技术;或使用图像生成模型合成多样化的肿瘤样本。引入注意力机制或自适应特征融合结构,强化模型对少数类特征的捕捉能力。76251+可以在模型中实现多任务学习吗,如同时做分割和分类?本案例中的脑肿瘤分割案例只涉及到分割任务用于实验教学,并未涉及到分类任务。可以参阅最新多任务学习的论文来进行这方面研究。8分割模型和ai助手的大语言模型,是两个模型吧?是的,分割模型和 AI 助手的大语言模型属于两种不同的模型。前者主要负责医学影像的分割任务,提取图像中肿瘤的具体区域;而后者则处理语言理解与生成,用于辅助答疑。9请问从论文到高质量数据集,具体是如何实现的?论文的内容一定是丰富的,是如何抽象成一些问答对的?首先收集相关领域论文,利用业界主流的先进大模型分析这些论文生成Alpaca格式问答对,然后通过人工对问答对进行校验,保证数据集的质量。101860+对于没有华为云使用经验的学生,如何快速上手本实验?华为云社区提供有预置镜像,可快速完成基础环境配置,基于Ascend 910A的DeepSeek-Distill系列模型部署指南可以帮助快速上手https://git.openi.org.cn/OpenIOSSG/Ascend910A-DeepSeek-Service#user-content-%E9%95%9C%E5%83%8F%E4%B8%8B%E8%BD%BD114008+如何处理肿瘤区域在 3D 空间中的不规则形状?采用3D卷积神经网络结合多尺度特征提取技术,从不同角度捕捉不规则形状的特征。辅助使用形态学处理和表面重建方法,可以更准确地描述肿瘤区域的3D结构。126139+假如需要设计其他专业课程的实验,该如何借鉴您这个案例的方案呢?只需要更换下数据集即可。模型部署、微淘等流程不变。132457+在联合学习中怎么防止模型参数泄露?可以通过安全多方计算、同态加密和差分隐私等技术加密模型参数,并在汇总过程中确保各方无法直接访问单个参数。同时,严格控制数据通信和权限管理,确保所有中间信息匿名化处理,有效防止模型参数泄露。142457+如何评估模型在小样本条件下的分割性能?可以使用交叉验证和留一法来充分利用有限样本数据,确保模型稳定性。结合Dice系数、IoU等指标来评估分割准确率,并计算置信区间判断模型泛化能力。155193 + 在 DeepSeek 和华为云的合作中,面临的最大技术挑战是什么?例如模型兼容性、数据迁移、性能优化等。早期开展这类案例开发的时候,社区资料较少,在工具平台的版本适配方面的摸索需要花一些时间,但是现在社区中的DeepSeek相关资源日益丰富,提供了更加丰富多样的部署方案。此外,如何在迁移后的脑肿瘤分割模型上做进一步优化,以提升性能,对于实验者存在较大挑战。166139+假如需要设计其他专业课程的实验,该如何借鉴您这个案例的方案呢?只需要更换下数据集即可。模型部署、微淘等流程不变。171860+对于没有华为云使用经验的学生,如何快速上手本实验华为云社区提供有预置镜像,可快速完成基础环境配置,基于Ascend 910A的DeepSeek-Distill系列模型部署指南可以帮助快速上手https://git.openi.org.cn/OpenIOSSG/Ascend910A-DeepSeek-Service#user-content-%E9%95%9C%E5%83%8F%E4%B8%8B%E8%BD%BD184392 + 在数字化转型过程中,企业如何利用华为云与DeepSeek提供的解决方案,实现业务流程的智能化重构和创新?企业可以尝试利用华为云平台构建弹性低成本的IT基础设施,并借助DeepSeek大模型进行智能数据整合与分析,从而自动化业务流程和实现精准决策。通过这种端到端的数字化转型方案,企业可重构传统业务模式、提高运营效率,并推动组织管理的创新升级。194392 + 华为云结合DeepSeek后,AI训练用架构如何搭建?AI训练架构可以主要依托ModelArts和MindSpore平台来进行构建。204392 + 在华为云平台上部署DeepSeek时,有哪些关键的技术挑战需要克服?华为云提供了哪些解决方案来应对这些挑战?核心挑战包括大模型计算资源消耗高、分布式训练效率优化及模型适配异构硬件。华为云通过ModelArts提供弹性算力与自动分布式训练框架,结合MindSpore的图算融合优化技术,降低显存占用并提升训练速度;同时支持昇腾芯片深度适配,通过软硬协同优化解决性能瓶颈。215193 + 云上部署deepseek具体如何确保了数据的安全性?华为云上部署deepseek及微调过程所面临的数据完全是由华为云来保障的。华为云提出“数据中立”原则,秉承“客户内容数据为客户所有,为客户所用,为客户创造价值”的理念,从“客户数据上云安全可靠,客户云上数据安全自主可控,云上数据操作透明可视”三个层面建设华为云的数据安全体系。https://www.huaweicloud.com/securecenter/data_protection_new.html225193 + 部署好DeepSeek后,怎么把它训练成垂直领域的专家?通过收集垂直领域的数据对DeepSeek大模型进行LoRA微调,使其学习到垂直领域知识,从而实现对垂直领域问题的专业作答。231462+该模型是如何提取脑肿瘤的特征的?在多模态MRI数据融合方面,模型是如何处理不同模态数据之间的互补信息和共有信息的本实验教学案例中的脑肿瘤分割任务只是涉及到MRI数据,并未涉及到多模态诊疗数据。基于多模态诊疗数据的脑肿瘤分割的确是一个很有价值的前沿研究方向,建议参阅相关学术论文做进一步研究。244392 + 在华为云上使用DeepSeek时,如何进行资源成本优化?有哪些策略可以降低开发和运营成本?在华为云上使用DeepSeek时,可通过弹性算力调度与混合精度训练减少显存占用;结合模型压缩技术及预训练权重复用降低训练成本。此外,利用ModelArts资源监控工具优化存储与计算效率,进一步节省费用。254392 + 普通用户怎么才能掌握和使用DeepSeek带来的便利性?普通用户直接采用提示词工程的方式使用DeepSeek官网或者第三方大厂封装的大模型服务(无需编程),对于涉及到垂直领域专有知识问答的场景可以通过大模型微调或者检索增强(RAG)的方式来实现。263318 deepseek这个模型的大小实际有多大,在云上实验案例用到的DeepSeek-R1-Distill-Qwen-7B版本的文件大小约15G,不同版本DeepSeek的文件大小会有所不同。
-
你是否还在为AI开发的高门槛发愁?看着心动却无从下手?由华为云学堂技术团队精心打造的DeepSeek大模型部署系列课程,融合实战经验,体验在线实操,边学边练,为你扫清学习障碍。一次学习终身受用,省去万元试错成本,职业竞争力飙升!本课程将深入探讨DeepSeek大模型的本地部署与API调用,帮助开发者从入门到实践,掌握这一强大工具的核心技能。课程目标:1、熟悉DeepSeek大模型的基本概念和应用场景;2、掌握如何使用不同的工具和框架实现大模型高效部署;3、掌握如何通过接口与模型交互,实现功能调用,并处理常见问题;4、了解各行各业应用案例与未来发展方向。点击课程链接学习,开启你的AI模型部署高光时刻!
-
告别天价算力,从入门到实战,手把手教你解锁大模型。由华为云学堂技术团队精心打造的DeepSeek大模型部署系列课程,融合实战经验,体验在线实操,边学边练,为你扫清学习障碍。一次学习终身受用,省去万元试错成本,职业竞争力飙升!本课程将深入探讨Agent与大模型的构建及应用。从Agent的基础概念入手,讲解其定义、组件与应用场景,为理解Agent在现代人工智能中的作用奠定基础。并进一步详解大模型Agent的构建原理,包括提示工程、工具接口编写以及Agent的组装,重点突出提示模板设计和工具接口在Agent功能实现中的关键作用。课程目标:1、了解Agent的基础概念2、了解Agent与大模型的构建原理3、了解Agent的执行原理4、掌握搭建一个可用的Agent系统的方法5、具备独立开发Agent应用的能力点击课程链接学习,开启你的AI模型部署高光时刻!
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第五期2026/09/04 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;蒋春阳-华为云AI开发者案例开发专家
本期直播内容: AI工具体验营 · 第5-8课连讲。Agent-Team 多智能体协作完成毕业设计实践
回顾中 -
华为云开发者AI素养ClassRoom·第六期2026/09/08 周二 19:00-20:00
樊渊-2026华为软件挑战赛冠军
高手来了:看软挑高手解析二维排样问题—从工业难题到算法突破
回顾中
热门标签