-
1.dms-collection、dwscontroller、dbsevent、dbsinsight、dbsmonitor、ecfclustermanager等组件升级失败,后台服务状态也在滚动重启中2.登录一个异常容器,cd logs,日志未发现明显异常3.查看其中一个容器日志,最后一步解密很慢4.登录dwsmaintain容器,java -jar AESTool.jar,需要很久才能加载完成5.cat /proc/sys/kernel/random/entropy_avail,熵值为30,至少得10006.登录dwsmaintain容器得node节点,查看haveged:systemctl status haveged.service,服务未启动7.按照如下步骤启动该服务 7.1 ldd /usr/sbin/haveged 7.2 cd /usr/local/lib 7.3 mv libhavege.so.1 libhavege.so.1.a 7.4 ldd /usr/sbin/haveged 7.5 systemctl restart haveged 7.6 systemctl status haveged.service 8.需要排查dws、ecf空间得所有node节点,cdk-集群管理-集群运维-(ei-dbs-region-node)-找到是dws、ecf得,主机名称下面得IP登录,按照第6、7点排查
-
1.升级前检查失败2.具体为cpu、内存、磁盘等检查失败3.根据任务详情,手动登录节点,执行top、free -m、df -h检查资源使用情况,若正常则,则跳过该工步;若不正常则定位不正常原因并解决
-
1.serviceOM上找到DWS-Region_Node 节点IP,后台以opadmin登录,结果登录不上2.该节点opadmin得密码可能已经被修改,但修改后得密码忘记3.按照下面得方法修改成其它节点得opadmin得密码:3.1在serviceOM上以VNC登录或后台以root登录3.2使用passwd修改成其它密码,修改5次3.3第6次再修改成需要得密码
-
参数上传->ECF->ECF-CM01登录失败优先联系clouddb人排查serviceOM--》虚拟机--》按名称过滤“ECF-CM”获取ECF-CM01,ECF-CM02分别登录ECF-CM01,ECF-CM02 查看mysql进程是否存在切到mysql用户,执行Get_db_status.py或dbstatus,备节点关注:备ip status:Slave IO=Yes,Slave_SQL=Yes,正常两个都是Yes,否则需要停掉备库(主正常情况下),然后重建备库 停库:Stop_mysql_force.py 停完后检查:Get_db_status.py,确认备库是Offline,Unknow,Unknow 重建备库:python /usr/local/bin/MHA_RebuildSlave.py ip //ip为对应主节点对应的ip 重建备库如果提示:/tmp/CloudDB_MySOL_KA2WAMHAVIP.1og 限问题,chown mysql:mysql /tmp/CloudDB_MySOL_KA2WAMHAVIP.1og 然后垂试 .检查备节点HA状态,Get_HA_status.py,关注备库信息:MHA service is online,主的应该是offline 如果备不是online,Get_db_status.py检查备库是否重建好,如果没有则按照第1步停掉备库然后重建,重建后如果备库HA仍然是offlin,重建好了执行 StartMHACluster.py 手动拉
-
1.软件包分发失败,为子任务dws bms 业务镜像注册失败,日志显示框架有问题,定位是cps密码获取失败,联系框架得人修改密码(曹安安 WX540396 马聪 30002027)2.日志报错:request failed ,url=/services/cps/componenttemplates/cps-web/params,status_code=4013.根据页面日志路径,查看日志:显示框架有问题,定位是cps密码获取失败,联系框架得人修改密码
-
1、简述:在ETL脚本开发过程中,经常涉及到获取某张表的字段以及字段定义的字符串,从而方便拼出希望创建的表;下文提供了一种获取方法,供参考。注:本SQL脚本使用了gsql的逻辑控制元命令,因此,需要使用gsql执行;假设该脚本保存在test.gsql文件中,那么,执行方式如下: gsql -d {库名} -p {端口号} -U {用户名} -W {密码} --dynamic-param -f test.gsql2、SQL脚本正文:select a.attname || E'\x0A'AS "COL_NAME", a.attname || ' ' || concat('', case when t.typname='bpchar' then 'char' else t.typname end, substring(format_type(a.atttypid,atttypmod) from '\(.*\)')) || E'\x0A' as "COL_NAME_AND_TYP" from pg_class c, pg_attribute a,pg_type t where c.relname = 'nation_tmp' and a.attnum > 0 and a.attrelid = c.oid and a.atttypid = t.oid order by a.attnum ;3、原表定义:4、执行结果:4.1 执行上述SQL后,获取到的纯字段如下:4.2 执行上述SQL后,获取到的字段以及字段定义如下:
-
前言在数据库系统中,故障分为事务内部故障、系统故障、介质(磁盘)故障。对于事务内部故障和系统故障,使用日志自动恢复,不需要人工参与。但对于介质故障,需事先备份数据。那么对于DWS来说是如何进行备份的呢?以及备份的过程中容易出现哪些问题,又怎样去排查、解决呢?本文主要讲述了DWS备份工具roach的备份的原理,以及常见的问题处理套路和相关案例。一、备份原理全量备份本文主要说的备份均为物理备份,即通过物理文件拷贝的方式对数据库进行备份,通过备份的数据文件和日志等文件,数据库可以进行完全恢复。全量备份大致分几个阶段:备份行存、创建barrier点、备份xlog、备份列存。备份行存:每个节点的主DN的数据,压缩存到rch文件中创建barrier点:保证CNDN上的所有的事务处于一致的状态,恢复到这个点比较可靠,创建时会在XLog中写入一条记录。备份xlog:备份startLSN和stopLSN之间的xlog备份列存:由于列存不写xlog,因此放在最后,其中列存的cudesc文件已在备份行存阶段备份整体流程如下图所示 容易出现的问题:禁用xlog回收容易造成集群只读延迟DDL也会引起集群只读注意的点:备份过程必须开启FPW备份XLog拷贝start_lsn和end_lsn之间的xlog备份列存的时候才会开启DDL为什么要有延时DDL?DDL操作:alter/truncate/autovacuum/drop/vacuum full/insert overwrite 这些会改变relfilenode的语句,DDL操作在拿到行列存清单后,如果用户进行drop操作,为了保证文件存在,所以要开启延迟DDL增量备份增量备份是基于某次备份进行的,在增量备份的命令中需要增加参数--prior-backup-key来表明是基于哪一次的备份。采用cbm文件识别增量页面。增量备份分为累计增量和差分增量两种累计增量:每次备份都是基于同一个全量备份,备份的内容为全量备份与当前时刻的数据修改差分增量:每次备份都是基于上一次的备份,备份的内容为两次备份之间的数据修改增量备份的原理:只拷贝上次并备份至今的数据修改部分,拷贝最小单位是block(8KB)集群首次备份时,GaussDB内核会开启guc参数,enable_cbm_tracking=on,然后内核会持续记录数据库文件哪些block被修改过,记录在pg_cbm目录下。增量备份时,查询cbm文件精准获得修改过的block存入内存,然后实施lz4/zlib压缩算法,写入备份介质。增量恢复时,从增量备份集获取各个增量的block内容,对应修改数据库文件相应的block。注意:该guc参数被关闭,或cbm文件被误删后,只能重新做全量备份,无法继续做增量cbm文件是什么?changed block map,对外提供数据页面的修改情况,并提供外部接口,根据cbm信息可以直接获取两次备份之间发生对于数据文件(行存、列存)的增量修改信息,并备份备份对于系统的影响:备份占用系统IO,业务慢延迟DDL,导致xlog积压,磁盘空间上涨增量备份易造成cbm文件积压,导致集群只读二、问题定位套路1)备份调用流程DWS管控面/FI管控面-> GaussRoach.py/SyncDataToStby.py -> gs_roach内核管控面调用roach的python脚本,python脚本进行解析参数,并调用内核侧的gs_roach命令。2)备份失败需要查看日志路径:HC/HCS/HCSO集群管控面调用日志: 沙箱外 /home/Ruby/log/cloud-dws-deploy.log管控面归档日志:沙箱外 /home/Ruby/archivelog内核日志:沙箱内 /var/chroot/DWS/manager/backup/log线下集群内核日志:$GAUSSLOG/roach/agentPython侧日志:$GAUSSLOG/roach/controllerobs日志:沙箱内 cd $GAUSSLOG/bin/gs_obsvi gs_obs.run.log查看对应的出错号此处注意的是obs日志需要到具体出错节点上查看3)常用grep命令: 查看主节点ip: grep "Master Ip" roach_agent*.log 查看备份进度:grep "Setting agent state to" roach_agent*.log 查看备份时间:grep "Time taken" roach_agent*.log | grep "MASTER" 查看备份是否成功:grep "Backup operation SUCCESSFUL. Backup key" roach_agent*.log 查看roach_client ip:grep "Success to connected Remote Media" roach_agent*.log 查看线程分配情况:grep "allotInstanceForMyProc" roach_agent*.log 查看备份命令参数:grep "command_dict" roach_controller*.log 如果文件被打包,使用“zgrep命令查看即可”4)备份关键日志关键字说明Creating Thread Roach Agent开始创建agent进程RAGENT_EXEC_PREPARING_METADATA com开始准备metadata清单enter the callback of rowstore copy开始备份行存performBackup enter真正开始执行落盘到rchstart delay ddl recycle before col file copy开启延迟DDLSetting agent state to [AGENT_CREATING_BARRIER]开始创建barrierRAGENT_EXEC_BACKUP_XLOGFILES comeagent开始备份xlogenter the callback of colstore copy开始备份列存stop delay ddl recycle after having copied all col files关闭延迟DDLSetting Master state to [PERFORM_BOOKKEEPING_INFO]备份结束,master节点开始汇总结果三、相关案例(1)细粒度备份报错Failed to connect to gauss(xxx) via libqp【问题描述】备份时agent报错Failed to connect to gauss(host:local , port: 25308) via libpq, ERROR: connection pointer is NULL【排查方案】由于报错连接时“host:25308”,因此查看对应时间节点的cn日志cn报错 FATAL: "base/2278052" is not a valid data directory,怀疑是该数据库的问题手动连接该数据库,发现也连不上dn实例目录下查看该目录并不存在,为残留导致drop database删除该数据库后备份成功【问题原因】数据库存在残留文件【规避方法】删除该数据库下的残留文件(2)备份随机失败【问题描述】NBU 问题导致备份随机失败【排查方案】查看controller日志,显示第一个报错的节点为xx.xx.xx.148到上述节点查看agent日志,发现日志指向media server,因此查看roach client日志 怀疑是nbu的问题,到对应的roach_client节点查看相应日志,通过grep "Success to connected Remote Media" roach_agent*.log,找到roach_client的ip地址,ssh到对应的roach_client节点,对应的报错为NBU内的报错,协同NBU侧的同事排查 【问题原因】一般情况下,上述情况是由于roach侧并发太大,导致NBU负载大,备份报错,但具体细节还得协调NBU同时排查【规避措施】如果是并发问题,建议调大filesplit-size参数并减小parallel-process参数,重新拉起备份什么情况下协同NBU同事排查?一般roach_client日志出现xbsa 、或者create file等关键字时(3)master和agent连接失败导致备份失败【问题描述】master和agent连接失败导致备份失败【涉及版本】【排查方案】日志报错Master和agent连接失败,Agents did not connect in 600 seconds.【问题原因】HCS环境下只开放了55000和56000端口,端口未开放导致报错【问题规避】方案1:修改roach命令端口方案2:开放对应端口(4)细粒度备份找不到文件信息报错【问题描述】细粒度备份时报错Error:Getting file info failed.【涉及版本】【排查方案】查看报错节点agent日志,出现Backup main fork of relation xxx failed, Error: Getting file info failed.【问题原因】细粒度备份期间不支持DDL操作。细粒度备份前会生成所有表的MAP文件,记录涉及的表名、以及表的相关表等信息,所有涉及到修改relfilenode的DDL操作的语句都会导致备份失败,例如alter/truncate/autovacuum/drop/vacuum full/insert overwrite等【问题规避】方案1:备份和涉及到DDL的业务时间错开方案2:适当减少每次备份涉及的表,可以降低由于DDL引起的备份失败率(5)备份过程报错内存暂时不可用【问题描述】备份dump元数据阶段报错 memory is tempararily unavailable.【排查方案】 controller报错 memory is tempararily unavailable.【问题原因】参数cpu-cores过大,导致内存慢【问题规避】调小cpu-cores参数(6)大集群下roach读取cms频繁导致集群状态不稳定【问题描述】备份发起时,管控面显示集群状态异常,大集群下gs_roach启动时会频繁访问cms读取集群状态,导致cm_ctl查询集群状态不稳定【涉及版本】821以下版本(不包括821版本)【排查方案】查询cm_server日志(roach启动之后的时间点) $GAUSSLOG/bin/cm_ctl日志 【问题原因】在roach启动期间,频繁调用cm_ctl命令,而集群节点数多,并发数高,会导致页面集群状态监测的脚本执行cm_ctl失败【问题规避】升级到821版本四、案例汇总相关文档:华为云数仓GaussDB(DWS)备份恢复的实现:cid:link_0数仓GaussDB(DWS)全量备份总结:cid:link_1
-
【问题现象】迁移后外表报错:ERROR: HDFS keytab file "/MRS/xxxxx/user.keytab" does not exist.【问题根因】迁移后/MRS/xxxxx/elk-site.xml配置文件未修改路径【规避措施】手动修改/MRS/xxxxx/elk-site.xml
-
【问题描述】容灾异常:后台日志显示master和agent连接超时【问题根因】56000端口未开启【规避措施】每个节点vi /etc/sysconfig/iptables将56000添加到端口里然后执行 systemctl restart iptables.service检查56000端口是否配置完成 iptables -L
-
【问题现象】 标准交付场景下,BMS规格都已预置在管理侧数据库中,无需再录入数据库。如果某局点交付后有新增的非标BMS机器,除了在Service OM的“裸金属服务”页面录入规格后,还需要在Service OM的“数据仓库服务”页面进行BMS规格的配置。【常见版本】全版本 【定位思路】 1、 华为云Stack X.X.X 技术中台与AI数据中台服务软件安装指南参见(可选)配置裸金属规格章节https://support.huawei.com/enterprise/zh/doc/EDOC1100268211
-
问题现象遇到执行慢的语句主要以分析执行计划为主,该执行计划中比较可疑的算子为第3行的nested loop 为27行的xxx_ent_info_tmp表和其他表join结果,该表跟第2行我们进行update的表为同一张表,且在关联关系中,与11行的tt表为同一张表。原理分析在本地通过简单模拟类似场景,当我们再update语句的from中加上进行update操作的这张表,执行计划中会有nestloop算子,在这个场景中没有条件,没有等值关联,最后走了nestloop产生笛卡尔积。规避措施改写SQL使得不要再次from做update操作的这张表
-
hive版本:3.1.0FusionInsight HD:6.5.1.6GausssDB 200:6.5.1.5问题描述如题,此外除了datax有没有其他工具或许法子可以提供写入速度。使用datax写入任务平均流量为100KB/S,写入速度为 1600rsc/s
-
1.登录RegionLB-LVS-012.查看信息:ipvsadm -ln3.过滤DWS服务端口 31417,31418 可获得浮动ip4.将浮动IP填入工步里,重试工步
-
1.工步详情及日志如下2.确认相关IP及密码都正确,重试仍然报一样的错误;日志提示ecf_common_db_vip为空3.servicom找到ecf-common-db节点,连上查看Get_db_status.py,浮动IP正常挂载,但备库节点异常,修复备库后重试仍然失败4.重启hcsu,再次重试成功
-
认识GaussDB(DWS)官网成长地图开发者论坛问答机器人产品试用开发者认证介绍LINKLINKLINKLINKLINKLINKGaussDB(DWS)初阶工程师快速上手指南SQL语法手册客户端下载初阶问题自助解决 LINKLINKLINKLINK GaussDB(DWS)中阶工程师HCCDP开发者认证LINKGaussDB(DWS)高阶工程师建设中,敬请期待专题学习DWS技术架构专题对象设计专题性能调优专题数据访问专题安全专题资源管控专题LINKLINKLINKLINKLINKLINK高可用专题备份容灾专题监控运维专题迁移工具故障处理案例集LINKLINKLINKLINKLINKLINK其他学习资源产品文档直播课程实验实践 LINKLINKLINK 交流平台公众号视频号B站wx交流群(添加小助手加入专家交流群) LINK
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第五期2026/09/04 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;蒋春阳-华为云AI开发者案例开发专家
本期直播内容: AI工具体验营 · 第5-8课连讲。Agent-Team 多智能体协作完成毕业设计实践
回顾中 -
华为云开发者AI素养ClassRoom·第六期2026/09/08 周二 19:00-20:00
樊渊-2026华为软件挑战赛冠军
高手来了:看软挑高手解析二维排样问题—从工业难题到算法突破
回顾中
热门标签