• DWS管控面之cgroup创建失败
    【问题现象】本质是OS问题,在管控面会导致创建工作负载队列失败(HCS环境),逻辑集群控制组创建失败(线下环境)【常见版本】欧拉2.8、欧拉2.9、欧拉2.10【定位思路】1、日志查看ossres-dws.log(dws-controller服务)有如上信息2、查看gs_cgroup -P 信息cpus(null)这种就是有问题3、修复建议  排查该问题使用gs_ssh -c "gs_cgroup -P | grep null | grep -v CM"若有信息1、2、3、4、5,若无信息直接4、51. 查看gs_cgroup -P 或 gs_cgroup -p信息2. gs_cgroup --revert3. 从无问题节点拷贝cgroup 配置文件到本机4. gs_cgroup --refresh5. 管控面测试内核下cgroup cpuset下的控制组乱了导致创建cgroup失败,删除导致紊乱的目录,重新创建cgroup。systemctl set-property -- -.slice CPUSetAccounting=nosystemctl set-property -- -.slice CPUAccounting=nosystemctl set-property -- -.slice MemoryAccounting=nosystemctl show -- -.slicegs_cgroup --refresh
  • DWS管控面之监控页面指标请求超时30s无数据
    【问题现象】集群概览页面,监控页面部分指标数据不展示;有提示XXX接口异常【常见版本】8.1.3及更早版本,后续版本进行了优化改进【定位思路】数据量过大查询慢1、dms-monitoring检查pod状态,若pod状态异常,重新拉起服务验证2、若pod状态正常,登录DMS后台数据库查询对应指标表数据量查询SQL模板select count(*) from dms_mtc_XXX;数据量较大,则协商保留多少再根据ctime(unix时间戳,需用工具转换)进行清理,清理后验证delete from dms_mtc_XXX where ctime指标表说明DMS_MTC_HARDWARE_XXX----------硬件相关指标DMS_MTC_CLUSTER_XXX----------集群相关指标DMS_MTC_DB_XXX----------数据库相关指标DMS_MTC_INST_XXX----------节点实例相关指标3、自动清理脚本,可以联系管控面研发.4、偶现ctime数据重复,监控数据清理不影响业务数据,在确认监控数据可清理情况下,使用如下大招delete from dms_mtc_max_ctime where virtual_cluster_id='XXX' and table_name='DMS_MTC_XXX'virtual_cluster_id通过dms_meta_cluster表根据cluster_id查询
  • [生态空间] GaussDB A 8.1线下版本,对单ssd磁盘大小是否有明确要求?
    GaussDB A 8.1线下版本,对单ssd磁盘大小是否有明确要求?如单块盘3.8T 6做一组raid5,单组19T。
  • [其他] 升级前准备虚拟机节点安全加固失败;{initialize_os’: [Job forrsyslog.service failed because a fatal signal was delivered to the control pro
    升级前准备虚拟机节点安全加固失败;{initialize_os’: [Job forrsyslog.service failed because a fatal signal was delivered to the control process. See“systemctl statusrsyslog.service" and "journatctl -xe” for details.\n']}问题版本:hcs803-810dws管控面配套升级问题现象:升级前准备虚拟机节点安全加固失败;{initialize_os’: [Job forrsyslog.service failed because a fatal signal was delivered to the control process. See“systemctl statusrsyslog.service" and "journatctl -xe” for details.\n']}排查步骤:1.查看hcsu升级日志;发现报错{initialize_os’: [Job for rsyslog.service failed because a fatal signal was delivered to the control process. See“systemctl statusrsyslog.service" and "journatctl -xe” for details.\n']}2.按照报错提示;此为os类问题;可根据报错提示先登录到加固失败的虚拟机上执行查看systemctl statusrsyslog.service以及journatctl –xe3. systemctl statusrsyslog.service 状态正常;journatctl –xe 服务正常启动4.手动重启system logging srevice服务;然后再次执行journatctl –xe;发现服务重启失败5.此处加固方法调用的是hcsu的方法;拉通hcsu的同事了解到;此处会更改配置后在重启服务;拉通os的同事排查;发现当手动kill 掉system logging service服务后立刻ps -ef |grepsystem logging service 查出来的进程号和过一会查出来的进程号不一样;有其他进程在system logging service启动的时候将它kill掉了,所以第一次重启会失败;但是第二次重启会成功;问题原因:由于sysmonitor服务就是检测system logging service服务的;hcsu加固的方法会通过sysmonitor服务检测system logging service重启状态;由于system logging service第一次重启被未知原因kill掉了;虽然之后system logging service已经起来了但是sysmonitor服务会检测到它重启失败,导致hcsu的加固失败规避方法:可停止sysmonitor服务,systemctl stopsysmonitor,等初始化加固完成后systemctl startsysmonitor启动
  • [云服务] 【数据使能】云数据仓库DWS能力项
    分类文档链接备注最新动态cid:link_10特性清单cid:link_9GaussDB(DWS)产品资料汇总cid:link_4原子APIhttps://support.huaweicloud.com/api-dws/dws_02_0034.htmlFAQcid:link_5华为云在线课程(免费)DWS中级工程师课程https://education.huaweicloud.com/courses/course-v1:HuaweiX+CBUCNXE097+Self-paced/about?isAuth=0&cfrom=hwc华为DWS连续三年入选Gartner数据分析魔力象限,并获得Forrester高度评价,是企业数据仓库的最佳选择,本课程为大家介绍DWS基本概念、使用入门级运维知识。萌新手册cid:link_6进阶宝典cid:link_7专家秘籍cid:link_8DWS高级工程师课程https://education.huaweicloud.com/courses/course-v1:HuaweiX+CBUCNXE101+Self-paced/about?isAuth=0&cfrom=hwc性能调优、运维管理、数据迁移是数据库DBA必要掌握的知识,本课程通过视频+课件的干货形式,期望通过学习,帮助提升DBA实际技能。华为云培训服务(收费)华为云数据仓库培训服务cid:link_2培训与认证具备华为GaussDB OLAP数据库二次开发和管理能力的高级工程师(华为云数据仓库高级工程师培训/华为云数据仓库工作级开发者认证培训)华为云开发者网DWS开放能力cid:link_11
  • [其他] GaussDB(DWS)管控面异常:页面上概览客户查看一直转圈或者提示:系统繁忙. 请稍后重试或拨打客服电话4000-955-988
    ​​​​​​问题现象   页面上概览客户查看一直转圈或者提示:系统繁忙. 请稍后重试或拨打客服电话4000-955-988 问题影响   节点监控无法查看可能原因     1、流控dmsagent日志     2、数据量过多导致监控异常处理思路     F12查看接口报错排查过程   1、流控与页面异常无关   2、数据量过多导致页面异常解决方法      通过cdas删除数据恢复确认   页面已恢复
  • [其他问题] EDW date timestamp(0) 类型相互写入问题
    gaussdb dws 版本 8.1.3表字段 create_date 定义为date类型。上游给的数据数据是timestamp(0),发现数据只写入年月日部分,而没有报错。另外也测试了字段类型为timestamp(0) 类型,写入date类型的数据,也能写入,time部分使用00:00:00补齐,同样也没有报错。请问怎么设置才能让date和timestamp类型的数据不能相互写入,而产生报错呢。
  • [其他] DWS快照问题处理思路
    快照列表快照策略:做快照时console界面的状态:快照相关的表:rds_cluster_backup:集群级,每次集群做一次快照会有一条记录rds_backup:节点级,对应obs上的文件路径 pareatid 对应rds_cluster_backup.id快照问题处理思路:1.获取备份策略Select * from rds_cluster where id='xx';2.查看备份集Select * from rds_cluster_backup where clusterid='xxx';3.获取备份的jobIdSelect  job_id,begin_time,job_def_name from taskmgr_job where job_def_name like 'ºckup%' order by Begin_time desc;4.查看备份日志:grep jobid ossres.log5.根据日志查看节点日志vi  /home/Ruby/log/cloud_dws_deploy.log 根据日志信息在查看内核日志6.查看内核日志cd $GAUSSLOG/roach/
  • [维护宝典] 升级DWS/ECF微服务失败;发现获取到两个相同名字的微服务stack
    升级DWS/ECF微服务失败;发现获取到两个相同名字的微服务stack问题现象:升级dws和ecf失败问题场景:同一region下2个CDK集群都安装了dws排查方法:1. 查看hcsu前台任务详情;看详情中的报错信息是否有get stack from mx fail , error:get 2 stack from mx by tables: map[xxxxxxxxxxxxxxxxxxxxxxxx]2. 登录cdk点击集群运维;检查每套集群是否安装了dws和ecf服务如果有多套cdk集群都安装了dws和ecf服务则按照规避方法规避根本原因:hcsu升级dws的时候是根据服务名字来判断升级哪个服务的;因为有两套cdk都安装了dws服务;所以代码无法判断升级哪个dws服务;规避方法:登录cdk,选择变更管理->服务列表 在此页面选择安装了ecf和dws服务的非本次升级的集群;搜索框分别搜索dws和ecf;在搜索出来的页面上左侧有关联组件;点击关联组件;记录关联的组件之后将关联组件移除;待升级完成后再按照记录添加组件
  • [其他] 扩容时子任务RdsUpdateInitDbconfigTask失败问题
    问题描述:扩容时子任务RdsUpdateInitDbconfigTask失败问题Select task.* from taskmgr_task as task left outer join taskmgr_job as job on job.job_id = task.job_id where job.request like '%{clusterName}%' order by job_id, task_index asc;问题版本:8.1.0.3问题分析:查看日志:/rds/datastore/dws/v8.1.0.3/base.py failed except:Error Unable to import module:No module named configparser可以看到base.py在近期有过变化,其实是,Python3 调用了pythons2的脚本,base.py的脚本是高版本的脚本问题根因:登录cn-1-1节点,发现datastore下面有 v8.1.1.5,看到在之做过租户面agent升级,虽然已经回滚,并且workspace指向v8.1.0.3,但是/rds/datastore/base.py并没有回滚,已经是8.1.1.5 python3的脚本,脚本前后有差异,其中 /rds/datastore/dws/v8.1.0.3/base.py 会调用/rds/datastore/base.py,导致出现异常恢复方案:将新加的节点上的8.1.0.3的base.py脚本覆盖老节点已经升级的脚本进行规避解决提前check:8.1.0.3版本 检查是否做过agent升级,并进行了回滚获取8.1.0.3版本的/rds/datastore/base.py覆盖原有节点再进行扩容比如:扩容前先先发放新节点,可以从新节点拷贝,或者同版本的其他集群
  • [其他] dws升级软件包分发报错
                    软件包分发失败   适用版本:hcs802-803dws管控面配套升级一注册bms业务镜像失败报错:Name or service not knodwn   排查方法:1. 查看前台报错信息找到taskid 根据taskid 查看hcsu后台日志      查看您后台日志发现obs的ip是空的;2.obs的信息是在参数上传工步自动获取的3.检查参数上传-obs工步 点击查看详情若obs的地址为空 名字为空则需要手动填写obs地址;obs是哪个版本就填写对应版本的信息;有global_obs_ip 就填 没有则不填规避方法:手动在obs工步填写obs信息;重跑obs工步二 OBS客户端上传工具包失败问题场景:主从多region场景问题现象:报错dws-tool桶不存在,然后创建桶又提示桶存在导致创建失败。查看日志可以看到如下报错[WARN][filename:swift_obs_utils.py][line:257][func:is_obs_bucket_existed]Bucket:dws-tool does not exist[ERROR][filename:swift_obs_utils.py][line:731][func:check_resp_status]Failed to invoke the interface.ErrorCode: BucketAlreadyOwnedByYou根因分析:主从多region场景,升级脚本获取的uds_ip是从region的,桶dws-tool是建立在主region上的,查询桶位置会报错。规避措施:联系华为工程师解决三 软件包分发-上传公共参数文件 报错(主从Region场景下升级DWS服务 8.0.3已知问题,需要手动规避)根本原因:因为MO参数在主从region参数名不一致,导致从region获取参数值失败规避措施:联系华为工程师解决四 分发软件包上传到obs失败排查方法:1.hcsu前台查看日志报错查看是错误信息是否有upload instance package failed: (‘Matches more than one package,found %s package’ ‘2’ )2.登录hcsu后台切到root用户查看报错的目录下/opt/cloud/HUAWET_CLOUD_Stack_Update/sre/pkg/下是否有报错的两个包Pkg下是以项目id命名的文件根本原因:确实有两个是不同的项目id 9046这个是局点1的dws的只做了升级前准备还没开始升级;9860这个是局点2的在做dws的软件包分发 这个报错了 是由于局点1还没升级的原因规避措施:将pkg下局点一的文件全部移到sre目录下 等局点二软件包分发好了在挪回来。
  • [其他] 参数检验ecf和dws参数验证失败
    参数检验ecf和dws参数验证失败排查方法:由于此处的参数大多数手动填写的所以建议检查填写是否有误;若填写正确则仔细查看hcsu前台的日志确定是在那一步失败的;检查ip填写是否正确检查ip前后是否有空格手动登录此ip验证是否可以登录;如果ip无法登录;确定是否为密码问题;若不是密码问题;则到oc页面-集群资源-虚拟机 搜索ip 尝试vnc登录 看账号是否被锁规避方法:需要在MO OC自动作业界面 创建unlock解锁脚本,将CDK节点root密码解锁参数校验阶段EI管理虚拟机root账号被锁死登录校验失败步骤 1 使用浏览器,登录ManageOne运维面。登录地址:https://ManageOne运维面主页的访问地址:31943。步骤 2 依次点击"日常运维">"自动作业"->"操作管理">"新建操作"。按照下图所示依次填写"操作名称"为"unlock_root","执行账户"后,在"脚本内容"选择"shell"步骤 3 将如下内容拷贝到脚本输入框并点击"保存"。if [ -f /home/moicagent/bin/manual/mstart.sh ];thenfaillock --user root --resetfiif [ -f /usr/local/CloudAgent/plugins/MOICAgent/agentctl.sh ];thenfaillock --user root --resetfiecho -e '#!/bin/bash\ndate' > /bin/kubectl;chmod +x /bin/kubectl;步骤 4 在"操作管理"中点击"unlock_root"操作后面的"执行"。根据"设备名称"/"IP地址"等信息,选择需要修复的CSL和高阶云服务节点,然后点击"执行",并等待操作执行完成。若有疑问请联系华为工程师一个云平台上有多套cdk均安装部署了dws服务的场景下数据库vip验证失败排查步骤检查数据库vip是否正确;登录数据库节点ssh opsadmin@数据库ip ifconfig 查看vip    2. 查看hcsu前台日志数据库的vip(浮动ip)获取的不对;发现是另外一套cdk集群上的ecf微服务的数据库vip根因分析:在hcsu代码,获取vip的过滤条件里面没有集群名称规避方法:联系华为工程师处理。
  • 多套cdk集群均安装了dws场景:参数检验ecf数据库登录失败;vip获取错误
    【问题版本】hcs803dws811【适用场景】 hcs上有两套cdk集群安装了dws【问题描述】参数检验ecf数据库登录失败;vip获取错误的是ei-pod上ecf微服务填写的vip【问题影响】 阻塞升级【定位过程】   1.查看前台hscu日志查看获取的ip是否正确;           由于此环境有两套cdk集群都部署了dws;怀疑是ecf另一套微服务的vip        2.通过日志发现;ecf_cm和common DB节点的IP错误,数据库的vip(浮动ip)获取的不对;发现是另外一套cdk集群上的ecf微服务的数据库vip【问题根因】 管控面之前部署在ei-pod上后来迁到ei-dbs-region上;在hcsu代码,获取vip的过滤条件里面没有集群名称【规避措施】联系华为工程师处理
  • [其他] 增量快照一直创建失败
    增量快照一直创建失败版本:811.5问题现象:增量快照一直创建失败排查过程:1.查看了集群失败快照id;后台搜索快照jobidselect * from rds_cluster_backup where name = ‘快照名称’and clusterid = ‘集群id’ \G;获取其中backupjodid  2.controller查看日志 过滤jobid;cat ossres-dws.log | grep jobid | grep ERROR3.找到报错实例 若ossres-dws.log日志报错中出现create  backup  failed instanceID:xxxxxxxxxx登录rmd数据库获取实例select id,name from rds_instance where id='xxxxxxxxxx';若ossres-dws.log日志找不到报错信息则登录rms数据库select name , id from rds_instance where clusterid = ‘集群id’;搜出来的第一个实例一般就是报错的实例登录实例sh connectTool.sh -uecf -drms -h {rms数据库vip} -p7306 -n {"实例名 "} -t Standalone登录此实列报错实例查看dwsdeploy.log日志:Failed to download the full backup data from obs;The specified key does not exist, |NoSuchKey  等信息4.obs  ak sk 获取登录obs客户端;登录rms数据库select * from rds_resuser where userid in (select resUserId from rds_instance where clusterId = 'xxxxxx')解密sk解密方法:cid:link_0登录obs客户端的时候记得添加访问路径查看快照桶文件;发现31号快照成功了但是没有文件根因:定期删除过期快照的脚本有问题规避措施:确认是自动快照删除脚本导致的问题;修改脚本内容;在def updataDeleteStatus()sql_cmd = DbConnectStr % “update backup_delete status set isNeedDelete = 1 where isNeedDelete = 0 后添加 and clusterBackId is not NULL"如下图所示:
  • [维护宝典] 巡检任务超时
    1.登录CloudScope平台,进到CloudCMDB-主机管理-虚拟机,用IP检索虚拟机,把VM ID删除后点击确定(用op_cdk_sso登录)。2.进到-基础设施管理,选择对应的-资源池,点击-同步虚拟机信息,待请求执行完成。3.登录OC运维面,系统管理-系统集成-统一调度,检索CloudScope,把系统资源和租户资源点击启动。4.进到OC运维面的资源拓扑-资源管理-资源列表,用IP地址检索,查看有没有生成新的VM ID(巡检不通过时,报错里面有VM ID)。5.登录FusionCare-系统管理-环境配置,找到对应巡检不通过的主机的服务,点击刷新。按提示点击确定,刷新完成后,再次巡检。
总条数:2746 到第 页
上滑加载中