• 想问下notebook停止之后 还在消耗金额吗?
    想问下notebook停止之后 就是现在这种状态下 还在消耗金额吗?
  • [问题求助] 想问下notebook的实例最多72个小时吗?
    想问下notebook实例最多只能租72小时吗 那我要做的实验需要跑超过72h怎么办呢?
  • [问题求助] modelarts如何快速上传文件
    您好,我目前使用modelarts notebook,需要上传2t左右数据。目前发现可以直接在notebook创建过程中创建一个较大的EVS,然后ssh连接notebook,并上传文件。此外还可以创建obs,用obs browser+上传,然后再拷贝到notebook的云硬盘上。但我尝试下来,这两种方法上传都比较慢。然后由于我使用的是校园网,ipv4限速而ipv6不限速,请问有没有办法通过ipv6上传数据到notebook的云硬盘中?
  • 二十九期能使用第三方库吗?
    如题,二十九期能使用第三方库吗?如果能,应该如何说明,使得判题系统能正常运行?
  • [问题求助] llamafactory-cli api 运行 qwen3 8b 推理速度很慢
    [ma-user work]$cat start-wismodel.sh#!/bin/bash# source /usr/local/Ascend/ascend-toolkit/set_env.shsource /home/ma-user/anaconda3/etc/profile.d/conda.shconda activate llamafactoryexport ASCEND_LAUNCH_BLOCKING=1export ASCEND_SLOG_PRINT_TO_STDOUT=1export FLASH_ATTENTION=enableexport FRAMEWORK_VERSION=6.5.905+export API_HOST=0.0.0.0export API_KEY=XXXexport API_MODEL_NAME=XXXexport API_VERBOSE=DEBUGexport LLAMAFACTORY_VERBOSITY=DEBUGexport ENABLE_ATB_GRAPH_MODE=1        # 一次性编译整图,后续无 python 调度export ATB_GRAPH_COMPILE_PARALLEL=8   # 用 8 核并行编译,首次启动 2 min 左右for i in `seq 0 4`do        export ASCEND_RT_VISIBLE_DEVICES=$i        export API_PORT=$(echo $((18000 + i)) )        nohup llamafactory-cli api wismodel_gen.yml >> log.${API_MODEL_NAME}-$i 2>&1 &done[ma-user work]$cat wismodel_gen.yml.bak model_name_or_path: /home/ma-user/work/model/XXXtemplate: qwen3infer_backend: huggingfacetrust_remote_code: truedo_sample: truetemperature: 0.7top_p: 0.8top_k: 20repetition_penalty: 1.05max_new_tokens: 512max_length: 8800use_unsloth: falsenv 3090 推理用 3 秒, ascend llamafactory-cli api 推理需要 30 秒,如何解决?
  • [问题求助] Ascend9b3,部署cosyvoice 单卡推理报错、速度慢
    下面是我的详细操作步骤,使用的镜像是:pytorch_2.1.0-cann_8.1.rc1-py_3.10-euler_2.10.11-aarch64-snt9b实例ID:7f74bd20-15bf-485a-9007-a437e1d8c04e创建镜像conda create -n cosyvoice python==3.10 -y 2. 克隆仓库git clone --recursive https://github.com/FunAudioLLM/CosyVoice.git # If you failed to clone the submodule due to network failures, please run the following command until success cd CosyVoice git submodule update --init --recursive 3. 去掉不适配的requriements.txt包# --extra-index-url https://download.pytorch.org/whl/cu121 # --extra-index-url https://aiinfra.pkgs.visualstudio.com/PublicPackages/_packaging/onnxruntime-cuda-12/pypi/simple/ # https://github.com/microsoft/onnxruntime/issues/21684 # tensorrt-cu12==10.0.1; sys_platform == 'linux' # tensorrt-cu12-bindings==10.0.1; sys_platform == 'linux' # tensorrt-cu12-libs==10.0.1; sys_platform == 'linux' # onnxruntime-gpu==1.18.0; sys_platform == 'linux' # onnxruntime==1.18.0; sys_platform == 'darwin' or sys_platform == 'win32' # gradio==5.4.0 conformer==0.3.2 deepspeed==0.15.1; sys_platform == 'linux' diffusers==0.29.0 fastapi==0.115.6 fastapi-cli==0.0.4 gdown==5.1.0 grpcio==1.57.0 grpcio-tools==1.57.0 hydra-core==1.3.2 HyperPyYAML==1.2.2 inflect==7.3.1 librosa==0.10.2 lightning==2.2.4 matplotlib==3.7.5 modelscope==1.20.0 networkx==3.1 omegaconf==2.3.0 onnx==1.16.0 onnxruntime==1.18.0; openai-whisper==20231117 protobuf==4.25 pyarrow==18.1.0 pydantic==2.7.0 pyworld==0.3.4 rich==13.7.1 soundfile==0.12.1 tensorboard==2.14.0 torch==2.1.0 torchaudio==2.1.0 transformers==4.51.3 uvicorn==0.30.0 wetext==0.0.4 wget==3.2  4. 下载requirement source /usr/local/Ascend/ascend-toolkit/set_env.shpip install -r requirements.txtpip install soxpip install torch-npu==2.1.0 5. 修改NPUTorch,使用下面这段推理代码 CosyVoice/cosyvoice/cli/model.py  Line36self.device = torch.device('cuda' if torch.cuda.is_available() else 'cpu') 修改为self.device = 'npu'  import sys sys.path.append('third_party/Matcha-TTS') from cosyvoice.cli.cosyvoice import CosyVoice, CosyVoice2 from cosyvoice.utils.file_utils import load_wav import torch_npu import torchaudio cosyvoice = CosyVoice2('pretrained_models/CosyVoice2-0.5B', load_jit=False, load_trt=False, load_vllm=False, fp16=False) # NOTE if you want to reproduce the results on https://funaudiollm.github.io/cosyvoice2, please add text_frontend=False during inference # zero_shot usage prompt_speech_16k = load_wav('./asset/zero_shot_prompt.wav', 16000) for i, j in enumerate(cosyvoice.inference_zero_shot('收到好友从远方寄来的生日礼物,那份意外的惊喜与深深的祝福让我心中充满了甜蜜的快乐,笑容如花儿般绽放。', '希望你以后能够做的比我还好呦。', prompt_speech_16k, stream=False)): torchaudio.save('zero_shot_{}.wav'.format(i), j['tts_speech'], cosyvoice.sample_rate) # save zero_shot spk for future usage assert cosyvoice.add_zero_shot_spk('希望你以后能够做的比我还好呦。', prompt_speech_16k, 'my_zero_shot_spk') is True for i, j in enumerate(cosyvoice.inference_zero_shot('收到好友从远方寄来的生日礼物,那份意外的惊喜与深深的祝福让我心中充满了甜蜜的快乐,笑容如花儿般绽放。', '', '', zero_shot_spk_id='my_zero_shot_spk', stream=False)): torchaudio.save('zero_shot_{}.wav'.format(i), j['tts_speech'], cosyvoice.sample_rate) cosyvoice.save_spkinfo() # fine grained control, for supported control, check cosyvoice/tokenizer/tokenizer.py#L248 for i, j in enumerate(cosyvoice.inference_cross_lingual('在他讲述那个荒诞故事的过程中,他突然[laughter]停下来,因为他自己也被逗笑了[laughter]。', prompt_speech_16k, stream=False)): torchaudio.save('fine_grained_control_{}.wav'.format(i), j['tts_speech'], cosyvoice.sample_rate) # instruct usage for i, j in enumerate(cosyvoice.inference_instruct2('收到好友从远方寄来的生日礼物,那份意外的惊喜与深深的祝福让我心中充满了甜蜜的快乐,笑容如花儿般绽放。', '用四川话说这句话', prompt_speech_16k, stream=False)): torchaudio.save('instruct_{}.wav'.format(i), j['tts_speech'], cosyvoice.sample_rate) 出现问题:无法推理 使用下面方式解决后,推理速度极慢:export OMP_NUM_THREADS=1 
  • [问题求助] 租硬盘扩充内存
    您好,在使用华为云服务器ModelArts的过程中,发现服务器内存不够使用,可以单独租一个硬盘用来保存文件吗?有没有具体的操作流程?
  • [问题求助] torch 和 torch_npu 无法正常 import
    镜像:mindspore_2.6.0rc1-cann_8.1.rc1-py_3.10-euler_2.10.11-aarch64-snt9b修改:手动安装 cann 8.2.rc1,以及 MindSpeed-LLM 要求的 torch 2.6.0 和 torch_npu。报错如下:>>> import torchTraceback (most recent call last):  File "/home/ma-user/miniforge3/envs/dnallm/lib/python3.10/site-packages/torch/__init__.py", line 2756, in _import_device_backends    entrypoint = backend_extension.load()  File "/home/ma-user/miniforge3/envs/dnallm/lib/python3.10/importlib/metadata/__init__.py", line 171, in load    module = import_module(match.group('module'))  File "/home/ma-user/miniforge3/envs/dnallm/lib/python3.10/importlib/__init__.py", line 126, in import_module    return _bootstrap._gcd_import(name[level:], package, level)  File "<frozen importlib._bootstrap>", line 1050, in _gcd_import  File "<frozen importlib._bootstrap>", line 1027, in _find_and_load  File "<frozen importlib._bootstrap>", line 1006, in _find_and_load_unlocked  File "<frozen importlib._bootstrap>", line 688, in _load_unlocked  File "<frozen importlib._bootstrap_external>", line 883, in exec_module  File "<frozen importlib._bootstrap>", line 241, in _call_with_frames_removed  File "/home/ma-user/miniforge3/envs/dnallm/lib/python3.10/site-packages/torch_npu/__init__.py", line 41, in <module>    import torch_npu.npu  File "/home/ma-user/miniforge3/envs/dnallm/lib/python3.10/site-packages/torch_npu/npu/__init__.py", line 476, in <module>    from .memory import *  # noqa: F403  File "/home/ma-user/miniforge3/envs/dnallm/lib/python3.10/site-packages/torch_npu/npu/memory.py", line 16, in <module>    from ._memory_viz import memory as _memory, segments as _segments  File "/home/ma-user/miniforge3/envs/dnallm/lib/python3.10/site-packages/torch_npu/npu/_memory_viz.py", line 11, in <module>    import yamlModuleNotFoundError: No module named 'yaml'The above exception was the direct cause of the following exception:Traceback (most recent call last):  File "<stdin>", line 1, in <module>  File "/home/ma-user/miniforge3/envs/dnallm/lib/python3.10/site-packages/torch/__init__.py", line 2784, in <module>    _import_device_backends()  File "/home/ma-user/miniforge3/envs/dnallm/lib/python3.10/site-packages/torch/__init__.py", line 2760, in _import_device_backends    raise RuntimeError(RuntimeError: Failed to load the backend extension: torch_npu. You can disable extension auto-loading with TORCH_DEVICE_BACKEND_AUTOLOAD=0. 如果手动安装 conda install yaml pyyaml,则报错变为:>>> import torchSegmentation fault
  • [问题求助] 需要 CANN = 8.2RC1 的镜像
    MindSpeed-LLM 要求 CANN 的 8.2RC1 版本,我自己在 ModelArt 的 8.1 镜像上无法正常安装需求版本的 cann 和 torch
  • [技术干货] 基于昇腾云部署Rerank和Emnedding模型(Qwen系列)
    一、 环境开通1、Server 资源开通流程图2、Server 资源开通流程阶段任务准备工作1、申请开通资源规格2、资源配合提升3、基础权限开通4、配置ModelArts委托授权购买Server5、在ModelArts控制台购买资源池 步骤 1:申请开通资源规格       请联系客户经理/接口人确认Server资源方案、申请要开通资源的规格(如果无客户经理可提 交工单)。步骤 2:资源配额提升       由于Server所需资源可能会超出默认提供的资源(如ECS、EIP、SFS、内存大小、CPU 核数),因此需要提升资源配额。n  1 登录云管理控制台。n  2 在顶部导航栏单击“资源 > 我的配额”,进入服务配额页面。n  3 单击右上角“申请扩大配额”,填写申请材料后提交工单。说明 配额需大于需要开通的资源,且在购买开通前完成提升,否则会导致资源开通失败。                                                 ----结束n  3:基础权限开通(若主账号/已有iam子账号可忽略)基础权限开通需要登录管理员账号,为子用户账号开通Server功能所需的基础权限 (ModelArts FullAccess/BMS FullAccess/ECS FullAccess/VPC FullAccess/VPC Administrator/VPCEndpoint Administrator),即允许子用户账号同时可以使用这些 云服务。步骤1 登录统一身份认证服务管理控制台。步骤2 单击目录左侧“用户组”,然后在页面右上角单击“创建用户组”。步骤3 填写“用户组名称”并单击“确定”。步骤4 在操作列单击“用户组管理”,将需要配置权限的用户加入用户组中。步骤5 单击用户组名称,进入用户组详情页。步骤6 在权限管理页签下,单击“授权”。步骤7 在搜索栏输入“ModelArts FullAccess”,并勾选“ModelArts FullAccess”。图 2-3 ModelArts FullAccess以相同的方式,依次添加:BMS FullAccess、ECS FullAccess、VPC FullAccess、VPC Administrator、VPCEndpoint Administrator。(Server Administrator、DNS Administrator为依赖策略,会自动被勾选)。步骤8 单击“下一步”,授权范围方案选择“所有资源”。步骤9 单击“确认”,完成基础权限开通。----结束步骤 4 在 ModelArts 上创建委托授权       ModelArts Lite Server在任务执行过程中需要访问用户的其他服务,典型的就是容器 使用过程中需要到SWR服务拉取镜像。在这个过程中,就出现了ModelArts“代表” 用户去访问其他云服务的情形。从安全角度出发,ModelArts代表用户访问任何云服务 之前,均需要先获得用户的授权,而这个动作就是一个“委托”的过程。用户授权 ModelArts代表自己访问特定的云服务,以完成其在ModelArts平台上执行的AI计算任 务。● 新建委托第一次使用ModelArts时需要创建委托授权,授权允许ModelArts代表用户去访问 其他云服务。进入到ModelArts控制台的“权限管理”页面,单击“添加授权”, 根据提示进行操作。 ● 更新委托如果之前给ModelArts创过委托授权,此处可以更新授权。a. 进入到ModelArts控制台的“资源管理>AI专属资源池>弹性节点 Server”页 面,查看是否存在授权缺失的提示。       图 2-4 弹性节点 Server 权限缺失提示b. 如果有授权缺失,根据提示,单击“此处”更新委托。根据提示选择“追加 至已有授权”,单击“确定”,系统会提示权限更新成功。              图 2-5 追加授权步骤 5:购买弹性节点 Server 资源       购买弹性节点Server资源的过程即创建资源过程。l  登录ModelArts管理控制台。l  在左侧导航栏中,选择“资源管理 > AI专属资源池 > 弹性节点 Server”,进入“节 点”列表。单击节点列表页右上角的“购买AI专属节点”,进入“购买AI专属节点”页面,在该 页面填写相关参数信息。(根据申请的区域(贵阳 乌兰察布 华东))二、 软件安装1、NPU 服务器上配置 Lite Server 资源软件环境  安装驱动l   wget "https://ascend-repo.obs.cn-east-2.myhuaweicloud.com/Ascend HDK/Ascend HDK 23.0.3/Ascend-hdk-910b-npu-driver_23.0.3_linux-aarch64.run"l   sudo sh Ascend-hdk-910b-npu-driver_23.0.3_linux-aarch64.run --full --install-for-all 安装完毕后需重启服务器(可输入指令 reboot 重启服务器)验证l  npu-smi info检查 npu-smi 工具完整输出上图内容则为正常l  安装固件l  wget "https://ascend-repo.obs.cn-east-2.myhuaweicloud.com/Ascend HDK/Ascend HDK 23.0.3/Ascend-hdk-910b-npu-firmware_7.1.0.5.220.run"l  sudo sh Ascend-hdk-910b-npu-firmware_7.1.0.5.220.run --full       查看安装结果,如图l  npu-smi info -t board -i 1 | egrep -i "software|firmware"       图 查看固件和驱动版本       l  安装CANN# install CANN Toolkitl  wget https://ascend-repo.obs.cn-east-2.myhuaweicloud.com/Milan-ASL/Milan-ASL%20V100R001C17SPC701/Ascend-cann-toolkit_8.0.RC1.alpha001_linux-"$(uname -i)".runl  bash Ascend-cann-toolkit_8.0.RC1.alpha001_linux-"$(uname -i)".run –install# install CANN Kernelswget cid:link_1 bash Ascend-cann-kernels-910b_8.0.RC1.alpha001_linux.run –install#注意安装顺序,先安装Toolkit 在安装Kernels#配置昇腾开发工具包运行所需的环境变量l  source /usr/local/Ascend/ascend-toolkit/set_env.sh 安装dockerl  yum install -y docker-engine.aarch64 docker-engine-selinux.noarch docker-runc.aarch64#配置Ascend-docker-runtime。#下载Ascend-docker-runtimel  wget cid:link_0l  chmod 700 *.run l  ./ Ascend-docker-runtime_5.0.RC2_linux-aarch64.run --install 检查安装Ascend-docker-runtimedocker info |grep Runtime Ascend-docker-runtime 查询配置docker将新挂载的盘设置为docker容器使用路径{        "data-root": "/home/docker",        "default-runtime": "ascend",        "default-shm-size": "8G",        "insecure-registries": [                "ascendhub.huawei.com"        ],        "registry-mirrors": [                "https://90c2db5e37a147c6afd970e45c68e365.mirror.swr.myhuaweicloud.com"        ],        "runtimes": {                "ascend": {                        "path": "/usr/local/Ascend/Ascend-Docker-Runtime/ascend-docker-runtime",                        "runtimeArgs": []                }        }} #保存后,执行如下命令重启docker使配置生效。l  systemctl daemon-reload && systemctl restart docker  二、 模型部署部署Qwen3-Embedding-8B模型       权重文件下载在huggingface或者魔塔社区modelscope 下载权重文件modelscope 地址:https://modelscope.cn/models/Qwen/Qwen3-Embedding-8B  相关依赖库安装1、  torch-npu和torch相关的安装#安装torchpip install torch==2.5.1#安装torch-npu 依赖pip install pyyamlpip install setuptools#安装torch-npu pip install torch-npu==2.5.12、  安装vllm和vllm-ascend(1)、安装系统依赖yum update  -yyum install -y gcc g++ cmake wget git(2)、pip安装vllm和vllm-ascendpip install vllm==0.9.0pip install vllm-ascend==0.9.0rc2       (3)、查看vllm serve 服务是否正常       执行vllm serve --help   显示如下图即为安装完成加载华为昇腾环境变量# 配置CANN环境,默认安装在/usr/local目录下source /usr/local/Ascend/ascend-toolkit/set_env.sh# 配置加速库环境source /usr/local/Ascend/nnal/atb/set_env.sh 通过vLLM部署API接口启动服务nohup python3 -m vllm.entrypoints.openai.api_server \    --model /home/liboran/Qwen3/Qwen3-Embedding-8B \    --served-model-name Qwen3-Embedding-8B \    --host 0.0.0.0 \    --port 8083 \    --dtype bfloat16 \    --tensor-parallel-size 8 \    --max-num-seqs 128 \    --max-model-len 32768 \    --max-num-batched-tokens 32768 \    --block-size 128 \    --gpu-memory-utilization 0.9 \    --enable-prefix-caching \    --trust-remote-code \> /home/Qwen3/logs/embedding_api.log 2>&1 & 执行上述启动命令,查看日志显示如下图,说明运行成功验证服务请求示例:curl http://127.0.0.1:8083/v1/embeddings \-H "Content-Type: application/json" \-d '{"input": "Your text string goes here","model": "Qwen3-Embedding-8B"}' 服务正常运行。接口返回如下:  部署Qwen3-Reranker-8B模型权重文件下载在huggingface或者魔塔社区modelscope 下载权重文件modelscope 地址:https://modelscope.cn/models/Qwen/Qwen3-Reranker-8B 相关依赖库安装1、安装torch-npu和torch#安装torchpip install torch==2.5.1#安装torch-npu 依赖pip install pyyamlpip install setuptools#安装torch-npupip install torch-npu==2.5.1#安装transformerspip install transformers==4.51.02、  安装相关依赖服务pip install fastapipip install pydanticpip install typing   加载华为昇腾环境变量# 配置CANN环境,默认安装在/usr/local目录下source /usr/local/Ascend/ascend-toolkit/set_env.sh# 配置加速库环境source /usr/local/Ascend/nnal/atb/set_env.sh     启动部署模型通过FastAPI部署启动模型,新建启动文件,示例代码如下:     使用uvicorn启动服务器,示例命令如下:nohup uvicorn rerank:app --reload --host 0.0.0.0 --port 8084 > /home/liboran/Qwen3/logs/rerank_server.log 2>&1 &     验证服务请求示例:curl -s -X POST "http://127.0.0.1:8084/v1/rerank" \  -H "Content-Type: application/json" \  -d '{  "model":"Qwen3-Reranker-8B",  "query":"中国的首都是什么?",  "documents":["中国的首都是北京.","重力是一种使两个物体相互吸引的力","法国首都是巴黎"]}'服务正常运行。接口返回如下:
  • [问题求助] mac笔记本连接云服务器报错
    使用mac笔记本连接华为云服务器(huaweicloud-910b)失败 ,下面是报错日志,请问是什么原因?要怎么解决?2025-09-07 20:35:24.435 [error] Error installing server: Failed to connect to the remote SSH host. Please check the logs for more details.2025-09-07 20:35:24.435 [info] Retrying connection in 5 seconds...2025-09-07 20:35:29.440 [info] Deleting local script /var/folders/y_/x2m2sfln3c5gw00qjt64x23r0000gn/T/cursor_remote_install_4c0c5ce5-07db-4e98-b5e2-810e5d8ab100.sh2025-09-07 20:35:29.441 [info] Using askpass script: /Users/sunxiao/.cursor/extensions/anysphere.remote-ssh-1.0.27/dist/scripts/launchSSHAskpass.sh with javascript file /Users/sunxiao/.cursor/extensions/anysphere.remote-ssh-1.0.27/dist/scripts/sshAskClient.js. Askpass handle: /var/folders/y_/x2m2sfln3c5gw00qjt64x23r0000gn/T/cursor-ssh-dt0408/socket.sock2025-09-07 20:35:29.446 [info] Launching SSH server via shell with command: cat "/var/folders/y_/x2m2sfln3c5gw00qjt64x23r0000gn/T/cursor_remote_install_abc21a0b-9caa-422a-b082-0537e7193f1c.sh" | ssh -T -D 54168 huaweicloud-910b bash --login -c bash2025-09-07 20:35:29.446 [info] Establishing SSH connection: cat "/var/folders/y_/x2m2sfln3c5gw00qjt64x23r0000gn/T/cursor_remote_install_abc21a0b-9caa-422a-b082-0537e7193f1c.sh" | ssh -T -D 54168 huaweicloud-910b bash --login -c bash2025-09-07 20:35:29.446 [info] Started installation script. Waiting for it to finish...2025-09-07 20:35:29.446 [info] Waiting for server to install...2025-09-07 20:35:29.555 [info] (ssh_tunnel) stderr: ssh: connect to host dev-modelarts.cn-east-4.huaweicloud.com port 31628: Connection refused
  • [问题求助] LLaMA-Factory推理
    使用LLaMA-Factory进行推理的时候出现下面的错误是什么原因?要怎么解决?AssertionError: Torch not compiled with CUDA enabled    return func(*args, **kwargs)  File "/home/ma-user/anaconda3/envs/LLaMA-Factory-sunxiao/lib/python3.10/site-packages/transformers/modeling_utils.py", line 842, in _load_state_dict_into_meta_model    param = param[...]  File "/home/ma-user/anaconda3/envs/LLaMA-Factory-sunxiao/lib/python3.10/site-packages/torch/cuda/__init__.py", line 289, in _lazy_init    raise AssertionError("Torch not compiled with CUDA enabled")    _error_msgs, disk_offload_index, cpu_offload_index = load_shard_file(args)AssertionError  File "/home/ma-user/anaconda3/envs/LLaMA-Factory-sunxiao/lib/python3.10/site-packages/transformers/modeling_utils.py", line 974, in load_shard_file: Torch not compiled with CUDA enabled    param = param[...]  File "/home/ma-user/anaconda3/envs/LLaMA-Factory-sunxiao/lib/python3.10/site-packages/torch/cuda/__init__.py", line 289, in _lazy_init    raise AssertionError("Torch not compiled with CUDA enabled")
  • [问题求助] obs如何跨节点传输
    obs数据丢失,想要从别的节点将数据直接传输带MA环境里
  • [问题求助] ModelArts和SFS Turbo使用
    我希望在ModelArts里使用SFS Turbo的存储,是否必须购买专属资源池才能连通到SFS Turbo?现在没有资源可以购买的话,有其它方式可以使用SFS Turbo吗?
  • [技术干货] AI Agent智能体系列解读 | ModelArts Versatile--AI原生应用引擎——知识库/RAG能力详解
    NO.2 篇 知识库/RAG能力详解 <ModelArts Versatile-AI原生应用引擎 体验入口>华为开发者空间 -- 开发平台 --Versatile Agent ( 请在PC端打开 ) 什么是AI AgentAI Agent人工智能体,是一种能够自主感知环境、制定目标、规划行动、执行任务并持续学习的智能程序或系统。比如,告诉AI Agent帮忙下单一份外卖,它就可以直接调用 APP选择外卖,再调用支付程序下单支付,无需人类去指定每一步的操作。从本质上来讲,大模型作为大脑发号施令,推理能力决定它的决策能力上限,工具模块决定他行动能力的上限、可完成任务的横向宽度、操作场域。而记忆(Memory)模块作为信息存储库,将多次交互的短期和长期信息保存与共享,决定了它规划和决策的准确度与速度,从而实现更个性化的响应。 · AI Agent之ModelArts VersatileModelArts Versatile-AI原生应用引擎是一站式企业级全生命周期的智能体平台,为企业专属大模型应用开发的工具链,提供灵活的画布式AI Agent开发能力,让Agent能够准确解决复杂的业务场景问题。提供从Agent开发,使用,运营和运维的全生命周期管理能力。   快速了解 AI Agent—知识库/RAG · 知识库——信息的“蓄水池”知识库是组织、存储及管理知识的系统,涵盖文档、图片、视频等信息的分类整理,可以帮助用户高效管理大量的信息。在Agent中添加知识库,使其与用户提供的专业知识库进行交互,可以显著提升Agent的准确度和专业度。知识库的数据来源分为直接接入源数据和选择知识数据集两种。 专业领域的知识库已不再是简单的数据堆砌,需要智能化、高效率的知识管理和利用。知识库具体指的是存储过往交互、知识片段和任务状态(可能利用向量数据库)。知识库本身是静态的存储,要让其中的知识,尤其是海量非结构化知识,能够被大模型或RAG系统高效地理解和利用,就需要更智能的检索技术——这正是向量数据库大显身手之处。 --结构化知识库:通常指关系型数据库(如 MySQL、PostgreSQL),数据以表格形式组织,具有严格的模式和关系定义,擅长存储交易,记录、用户信息等高度规整的数据。--非结构化知识库:存储文档、PDF、PPT、网页、图片、音视频等原始形态的数据。文件系统、文档管理系统、对象存储等都属于此类。它们容量巨大,但信息组织相对松散,直接利用效率较低。  · 知识数据集知识数据集是组成知识库的重要元素,其核心是将零散知识(如文档、图片、视频等)加工成结构化知识单元:通过本地上传或OBS接入数据,经预处理后切片拆分为更小的知识单元,并配置索引以便Agent快速定位所需知识。完成知识数据集创建后,将其关联至知识库,形成可调用的知识体系。   · RAG——为模型注入精准信息RAG(Retrieval-Augmented Generation)即检索增强生成,是一种结合信息检索与文本生成的人工智能技术框架,通过动态引入外部知识库来增强大语言模型的输出质量,旨在解决大语言模型在回答问题时,因知识更新不及时、缺乏特定领域知识或事实性错误等问题,通过在生成回答之前检索相关外部知识源来增强回答的准确性和可靠性。RAG可以在 AI 接收到问题时,动态地从外部知识库中查找相关信息,然后把这些信息加到提示词里一起交给 AI 处理,从而提高回答质量。RAG本质上是通过工程化手段,解决LLM知识更新困难的问题。其核心手段是利用外挂于LLM的知识数据库(通常使用向量数据库)存储未在训练数据集中出现的新数据、领域数据等。通常而言,RAG将知识问答分成三个阶段:索引、知识检索、基于内容的问答。‌其应用优势‌在于解决大模型幻觉问题,提升专业领域回答准确性‌;支持私有化知识库与通用模型的融合应用‌;相比微调更具成本效益和灵活性。  RAG类型:VectorRAG(向量RAG)、GraphRAG(知识图谱RAG)--VectorRAG(向量检索增强生成)向量RAG,是一种结合了向量化和大语言模型的RAG技术。VectorRAG将非结构化的数据转化为结构化的向量空间,利用向量库实现高效的信息检索。‌技术原理‌:通过向量数据库将文本数据转换为高维向量,基于语义相似度检索相关片段‌‌核心优势‌:处理非结构化文本效率高(如文档问答、FAQ系统);实现简单且计算资源需求较低 -- GraphRAG(基于图谱的检索增强生成)知识图谱RAG,是一种结合了知识图谱和大语言模型的RAG技术。GraphRAG能够处理各种类型的文档,从中提取实体(文档中具体的对象或概念)、关系以及文本内容构建知识图谱(一种结构化的知识表示方式),从而增强大语言模型对复杂信息的理解和推理能力。‌技术原理‌:构建知识图谱存储实体关系,通过图数据库(如Neo4j)执行多跳推理检索‌‌核心优势‌:擅长处理结构化/半结构化数据(如知识图谱问答);支持复杂逻辑推理和全局语义理解  · RAG(检索增强生成)与知识库的关系——通过技术互补实现协同增效‌功能定位的差异与互补:‌知识库作为静态信息存储系统,主要承担结构化数据的精确检索功能(如企业文档查询)‌,而RAG则通过动态检索外部知识库内容,结合大语言模型生成自然语言回答。这种组合既保留了知识库的检索效率,又解决了大模型的幻觉问题。 技术实现的依赖关系:‌RAG通常以知识库为数据基础,通过知识库文档分块及向量化存储‌、用户查询时进行语义相似度检索、将检索结果作为上下文输入大模型生成最终答案等流程实现知识增强,这种架构使得知识库成为RAG的“数据基础设施”‌。 在智能体架构中,‌知识库是静态的知识载体,而RAG是动态的知识调用机制‌。两者的结合实现了“存储-检索-生成”的闭环,既扩展了大模型的能力边界,又保障了输出的准确性与可追溯性。未来随着多模态知识库的发展,RAG的应用场景将进一步扩展。    ModelArts Versatile--AI原生应用引擎 知识库/RAG的竞争力优势Versatile Agent沉淀行业Know-How(专长),通过知识工程提升大模型的表现,进一步支撑行业应用创新。行业/企业经验提取,持续积累企业场景经验模板,动态经验知识库迭代。知识库RAG 技术优势01超高效率:企业知识库持续学习,天级迭代;场景学习,周级迭代;领域学习,季度级迭代。 02 RAG: 领域知识库&检索引擎,让大模型输出结果更可靠。RAG检索增强实践成效:准确率从50%提升到83%。输出结果准确率提升明显;行业知识动态持续更新;检索生成结果速度更快。 03 接入多类实时知识库,更实时、更准确的生成式答案ModelArts Versatile-AI原生应用引擎接入多类型知识库,充分获取企业最新知识,增强实时性和准确性;灵活可配置的融合检索策略。 04 行业知识赋能大模型ModelArts Versatile-AI原生应用引擎通过RAG赋能增强大模型行业知识,提升行业理解能力和业务准确性。融入企业业务场景,从企业业务场景经验提取,“经验模板” 迭代优化,形成企业经验模板库(专属知识库)。 相关特性知识数据集管理:接入源数据、数据加工、知识数据集基础操作知识库管理:接入源数据或选择知识数据集、知识库的基础操作、索引字段配置、检索方式、能力开放。三方知识库接入:三方知识库API接入- 适配第三方图数据库。 --选择知识数据集-创建知识库:在“选择知识数据集”面板,勾选目标数据集,并选择数据集版本及索引配置。当知识库RAG类型为“VectorRAG”时,按照混合检索、语义检索、全文检索多模式开展。当知识库RAG类型为“GraphRAG”时,默认为“语义检索”方式。--接入数据源-创建知识库:选择数据源的接入方式,支持以下两种方式,01 本地上传:数据文件在本地,从本地选择文件进行上传;02 OBS接入:数据文件存放在华为云OBS桶,从OBS桶接入数据。  知识飞轮 技术优势超高效率,知识飞轮帮助企业知识库周级创建、天级迭代。--数据积累与回流:采集增量业务数据和用户反馈数据,提炼知识,提供给大模型,支撑大模型能力持续增强。--多轮迭代机制:支持天级持续学习(自动)、周级场景学习、季度级领域学习三轮循环迭代机制,持续提升模型能力、应用效果。 针对反馈数据的提炼和学习,ModelArts Versatile-AI原生应用引擎通过多工具预集成、主流模型集成、业务应用信息抽取插件、智能应用反馈插件、自动化调度等能力构建知识飞轮,将业务人员在日常作业过程中积累的增量数据和用户反馈提炼为企业知识,不断供给大模型开展多轮循环学习实现天级迭代,持续提升智能应用体验与效果。    Versatile--AI原生应用引擎 知识库/RAG 主要解决什么问题(知识中心) 结构化知识存储‌领域知识库(如医疗术语库、法律条款)提供专业认知基础‌企业知识库(产品手册、业务流程)支撑特定场景服务‌用户画像知识库(偏好记录、行为模式)实现个性化交互‌‌动态知识演进‌短期记忆沉淀为长期知识(如对话摘要转为用户特征向量)‌通过知识图谱自动更新实体关系(如新增"用户-宠物-用品"关联)‌ ‌功能边界突破‌突破LLM原生知识限制(通过企业私域知识库回答内部流程问题)‌支持多模态知识融合(图文知识库+语音交互记忆)‌‌持续学习基础‌为模型微调提供高质量训练数据(清洗后的用户交互记录)‌构建可解释的知识溯源链条(决策依据可关联到具体知识条目)‌ ModelArts Versatile-AI原生应用引擎知识中心,内置知识库+RAG技术突破大模型的知识局限和幻觉问题。它的核心思想并非让模型死记硬背所有知识,而是赋予它"按需查找"的能力,极大地提升了大模型在特定领域或依赖精确事实场景下的表现力和可靠性,巧妙地将大模型的强大语言生成能力与结构化/非结构化外部知识源的丰富性结合起来,实现了"1+1>2"的效果。同时提升了 AI 的交互能力,还为其在各种复杂场景中的应用提供了可能性,包括上下文连续性‌、‌复杂任务处理‌、‌长期项目管理、认知能力增强‌等能力。  结语ModelArts Versatile-AI原生应用引擎,以知识库融合RAG技术,担当智能体大脑的“第二存储”,搭建与业务场景融合的知识库,融会贯通行业特有经验沉淀,实现快速检索访问获取信息,增强Agent自主执行能力与结果可靠性。通过知识工程提升大模型的表现,进一步支撑行业应用创新。同时,Versatile助力广大开发者将Agent开发简化并内化成基础技能,快速搭建各领域智能应用,辐射千行万业,变革智能生产力。   点击可前往>>华为云ModelArts Versatile-AI原生应用 引擎官网    系列文章推荐:AI Agent智能体系列解读 | ModelArts Versatile插件类——MCP/工具能力详解
总条数:3403 到第
上滑加载中