-
【问题背景】管控面集群显示待重启状态第一步:为了压测压满,管控面修改CN max_connections为100,管控面显示集群待重启,此时客户为主动重启;第二步:压测过程中,由于某些原因导致CN重启,max_connections管控面修改被动生效,且与max_wal_senders相等,导致CN重启失败挂掉;第三步:在后台将CN max_connections修改回来,并做CN实例修复,集群状态在后台成功恢复正常;第四步:发现管控面任然显示待重启状态集群成功点击监控面板无数据;【常见版本】HCS 8.1.3【解决方案】1、集群状态显示待重启,后台改参数重启导致,需要登录rms数据库,然后把statusDetail更新成Normal;查询SQL为:select id,name,status,statusDetail from rds_cluster where id='集群编号';select id,name,status,statusDetail from rds_cluster where status='200';修改SQL为:update rds_cluster set statusDetail='Normal' where id='集群ID';2、集群详情面还是显示待重启,还需要改rds_configuration_relation表configurationStatus状态为In-Sync;查询SQL为:select * from rds_configuration_relation where objId='集群ID';修改SQL为:update rds_configuration_relation set configurationStatus='In-Sync' where objId='集群ID';3、两个改好后用户集群状态全部显示可用;4、还可以排查以下几个表:rds_configuration_guc_recordrds_configuration_guc_historyrds_action
-
【问题描述】修改参数enable_resource_record,保存时界面报DWS.0046 该集群正在进行其他操作或集群内部的节点故障,无法执行该操作,请稍后重试。【问题版本】 HCS811【解决方案】1、登录rms数据库查询rds_instance表,节点状态是否正产;select id,name,status from rds_instance;2、查看dwscontroller日志,搜TroveConfigurationsController.updateForCluster字段,发现报错信息存在reset_password字段;3、登录rms数据库查询rds_action表,存在5月份的reset_password事件,影响改参数,删除该事件,重新修改参数成功;select * from rds_action where id='集群id';delete from rds_action where id='事件id';
-
【问题描述】dws下发集群提示系统繁忙,集群状态创建中,到84%不动了【问题版本】DWS811【解决方案】1、让用户查询rms库查询任务执行记录,发现是RdsCheckClusterStatusTask稽核集群状态的任务失败;select job.job_id, job.job_def_name, right(job.server_hostname, 5) as pod, -- job.fail_reason, -- job.fail_detail, inst.id as instId, inst.name as instName, task.task_name, task.task_index as i, task.execution_status as status, task.begin_time, task.end_time, task.listener_num as l, task.retry_num as rfrom taskmgr_job as job left join taskmgr_task task on job.job_id = task.job_id left join (select id, name, jobId from rds_instance) inst on job.job_id = inst.jobIdwhere job.request like '%集群id%' -- and task.execution_status = 'FAIL'order by job.begin_time, job.job_id, task.task_index;2、monitor容器查看hamonitor-ecf.log,日志搜begin register all new clusters,没查到集群数据;3、登后台monitor数据库,查询无新建群信息,cluster_info和status_change_event表缺少字段cluster_extra_info,加上后,集群创建成功;CDK参数搜spring查monitor数据库IP,登录monitor数据库,select * from cluster_info where cluster_name = '集群名';cluster_info和status_change_event表字段cluster_extra_info添加SQL脚本:-- begin cluster extra infoSET @s = (SELECT IF((SELECT COUNT(1)FROM INFORMATION_SCHEMA.COLUMNSWHERE table_schema = DATABASE()AND table_name = 'cluster_info'AND column_name = 'cluster_extra_info') > 0, "SELECT 'The column `cluster_extra_info` already exist in table `cluster_info`'","ALTER TABLE cluster_info ADD cluster_extra_info text default null"));PREPARE stmt FROM @s;EXECUTE stmt;SET @s = (SELECT IF((SELECT COUNT(1)FROM INFORMATION_SCHEMA.COLUMNSWHERE table_schema = DATABASE()AND table_name = 'status_change_event'AND column_name = 'cluster_extra_info') > 0, "SELECT 'The column `cluster_extra_info` already exist in table `status_change_event`'","ALTER TABLE status_change_event ADD cluster_extra_info text default null"));PREPARE stmt FROM @s;EXECUTE stmt;-- end cluster extra info
-
【问题现象】 扩容节点成功后,执行重分布任务有一张复制表sys_ordersoure 重分布失败【常见版本】DWS820 【定位思路】1、查询重分布任务进度;gsql -dpostgres -p 8000 -c 'SELECT * FROM redis_progress ORDER BY name;'2、进沙箱查询重分布日志$GAUSSLOG/bin/gs_redis/gs_redis-2023-08-01-151302.log报错日志;3、多次重试重分布任务,还是失败;nohup gs_expand -t redistribute --fast-redis --parallel-jobs=16 --redis-mode=insert --dws-mode &4、手动重分布规避;1)创建临时表复制public.sys_ordersource表所有信息;select count(1) from public.sys_ordersource;alter table public.sys_ordersource set (append_mode=read_only);create table tmp_sys_ordersource_bak (like public.sys_ordersource including all);insert into tmp_sys_ordersource_bak select * from tmp_sys_ordersource_bak;select count(1) from tmp_sys_ordersource_bak;truncate table public.sys_ordersource;set enable_cluster_resize=on;alter table public.sys_ordersource to group group_version_20230811_134740_1953060;\d+ public.sys_ordersource;insert into public.sys_ordersource select * from tmp_sys_ordersource_bak;2)起一个事物手动创建复制表sys_ordersource插入数据:start transaction;alter table sys_ordersource set (append_mode=off);truncate sys_ordersource;alter table sys_ordersource to group group_version_20230811_134740_1953060;insert into sys_ordersource select * from tmp_sys_ordersource_bak;commit;\d+ sys_ordersource;3)删除临时表drop tabletmp_sys_ordersource_bak;5、重新拉起重分步:nohup gs_expand -t redistribute --redis-mode=insert --dws-mode --parallel-jobs=4 --fast-redis&6、查看后台日志$GAUSSLOG/om/gs_expand-2023-03-01_100253.log确认重分步完成
-
数据在数据仓库服务中安全吗?有采取哪些管控措施或者说管理方法去保障数据安全,这个可以展开说下吗?
-
本期“今天打卡了吗?”互动活动已经结束,感谢各位小伙伴的参与!获得本期活动奖励的名单如下,恭喜以下小伙伴~请各位中奖的小伙伴填写问卷反馈收货信息哦^_^ 请小伙伴们在2023年9月30日24时前反馈收货信息,逾期礼品作废哦^_^ 礼品邮寄时间:15个工作日内完成邮寄。问卷反馈:链接【获奖名单】获奖等级姓名电话分数合计礼品一等奖陈明浩188****275654.7定制咖啡杯、雨伞、笔记本套装、鼠标垫二等奖姚圣伟132****894524定制咖啡杯、笔记本套装、鼠标垫先生134****886617.3定制咖啡杯、笔记本套装、鼠标垫高河186****360917定制咖啡杯、笔记本套装、鼠标垫三等奖薛之谦171****309612笔记本套装、鼠标垫蔡李俊136****665011.7笔记本套装、鼠标垫张紫玄132****995811笔记本套装、鼠标垫刘楠136****874910笔记本套装、鼠标垫参与奖张一135****43929雨伞任腾187****60566雨伞刘彬177****04206雨伞金勇171****63556雨伞邀请礼邀请人电话礼品刘德生150****8158雨伞刘楠136****8749雨伞翁志成135****5539保温杯刘洁187****6769帆布袋------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------答题活动开始啦,添加小助手微信,加入交流群,一起来玩吧~
-
【问题描述】build失败 【问题分析】build对应日志为$GAUSSLOG/bin/gs_ctl[2023-08-07 14:11:54]connected to serverdn_6069_6070: could not openfile "/srv/BigData/hadoop/data5/slave5/global/pg control- for reading: No such file or directorygs_rewind receive FATAL, it will exitgs_ctl: connect to server,build started.xlog start point: 14A/2E000028Bs_ctl: starting background MAL receivergs_ctl: receiving and unpacking files.gs_ctl: could not get WALend position froa server: FATAL: dn_6069_6070: [FATAL] archive member "core.7662" to0 large for tar format (2623-08-07 14:17:22)stop fa1led, k111ing gaussdb by force ..server stopped[2023-09-07 14:17:23)connected to server【问题原因】主DN实例存在超大core文件导致build不通过,日志如图:【解决方案】删除主DN实例历史core文件
-
1 问题描述集群状态显示DN实例一直处于catchup状态。2 机制说明主备DN实例为保证数据双副本和一致性原则,需要将主DN产生的事务日志及时同步给备机,备机实例接受不及时,或备实例故常重新恢复后,会重新追赶主实例的数据,来到达主备一致状态,追赶的过程就是我们在查询集群状态时看到的Catchup状态。 主备追赶分两种类型,一种是xlog追赶,一种是数据页追赶。 更深入的机制原理,有兴趣的小伙伴可以在社区留言问题或者浏览社区精品机制原理文章。3 问题分析切换omm加载环境变量,查询集群状态,其中DN实例6021主备关系如图: 登录数据库查询catchup追赶 虽然catchup是备DN实例,但catchup线程是在主DN实例,分析dn_6021日志,发现cacthup线程在反复重启,如图: 图片详细信息,直接上文字:2023-08-09 20:38:28.893 64d377f3.5009 [unknown] 281467704376880 [unknown] 0 dn_6021_6022 00000 0 [BACKEND] LOG: catchup process start to search all bcm files. 2023-08-09 20:38:29.936 64d377f3.5009 [unknown] 281467704376880 [unknown] 0 dn_6021_6022 01000 0 [BACKEND] WARNING: page verification failed, calculated checksum 42173 but expected 56380 2023-08-09 20:38:29.936 64d377f3.5009 [unknown] 281467704376880 [unknown] 0 dn_6021_6022 XX001 0 [BACKEND] WARNING: invalid page in block 16178 of relation base/16538/13642638, try to remote read 2023-08-09 20:38:29.936 64d377f3.5009 [unknown] 281467704376880 [unknown] 0 dn_6021_6022 00000 0 [REMOTE] L0G: remote read page, file base/16538/13642638 block 16178 from :25512 2023-08-09 20:38:29.937 64d377f3.5009 [unknown] 281467704376880 [unknown] 0 dn 6021 6022 58030 0 [REMOTE] ERROR: remote read failed from :25512, remote data checksum error, maybe remote data corrupted 2023-08-09 20:38:31.941 64d377f3.5009 [unknown] 281467704376880 [unknown] 0 dn 6021 6022 00000 0 TBACKEND] LOG: catchup process start to search all bcm files. 2023-08-09 20:38:32.995 64d377f3.5009 [unknown 281467704376880 [unknown] 6 dn 6021 6022 01000 0 [BACKENDJ WARNING: page verification failed, calculated checksum 42173 but expected 56380 2023-08-09 20:38:32.995 64d377f3.5009 [unknown] 281467704376880 [unknown] 0 dn 6021 6022 XXO01 0 [BACKEND1 WARNING: invalid page in block 16178 of relation base/16538/13642638, try to remote read4 问题根因主备DN有磁盘或历史磁盘故障引起;5 解决方法1、需要查询物理文件对应表是否存在; 2、备份主备DN实例报错物理文件和bcm文件; 3、此步骤属于高危操作,请联系华为工程师处理;
-
【问题现象】 有一个节点重启了(有内存告警),缺少了一条路由,网络侧同事加回去了,客户说ELB方测试端口是通了,但是ELB的健康检查显示离线,他们删了重新加回去时选不到该CN节点;(弹性负载均衡->负载均衡->后端服务器组->健康检查结果->离线)【常见版本】DWS811 【定位思路】 1、 首先确认CN节点是否真实离线 登录RMS数据库select id,name,status from rds_instance where clusterid='XXX' order by name; 字段status状态为200即为正常2、添加CN到ELB后端服务器组(有具体变更实施方案)3、网络侧同事可进行CN节点8000端口抓包测试 抓包测试结果表现如果是请求消息可以正常发送但是无返回消息进行下一步排查(这也是健康检查结果离线的原因) 如果不是上述表现则需进一步网络排查 4、在离线节点检查策略路由 route -n ip ruleip route show table 100如果仅有bond0的默认路由则存在问题,需添加请求端路由一般为bond0.xxxx(仅用默认路由会判定返回无效消息) route add -net xx.xxx.xxx.0 netmask 255.255.255.0 dev bond0.xxxx ip route add default via xx.xx.xx.xx dev bond0.xxxx table 100route add -net xx.xx.xx.xx/24 gw xx.xx.xx.xx dev bond0.xxxx到此已经可以恢复网络连通性,页面已经显示在线,但仍需检查添加路由文件和定时任务 5、查看添加路由文件 cat /etc/init.d/addRoute 需要将/usr/sbin/ip route add 0/0 via 192.168.x.1 table 100改为 /usr/sbin/ip route add 0/0 via 192.168.x.1 table 100 onlink dev bond0.xxxx 6、防止后面机器重启的时候出现/etc/init.d/addRoute脚本执行有问题;建议:最好加一下该脚本的定时任务;或者机器重启后执行该脚本;也可以加到/etc/rc.d/rc.local文件;也可以加定时任务;
-
数据库、数据仓库、数据湖、湖仓一体分别是什么?
-
COPY语句堆积,COPY语句对应的等待状态都是wait cmd;已排除上游数据流发送慢问题。wait cmd状态是等数据发送过来,上游发送性能无问题,基本确定是在中间网络部分出现问题。netstat 抓业务侧与数据库的连接,业务侧有发数据,数据库侧没有接受数据。业务通过LVS连接数据库,安装LVS要求关闭客户端、LVS主备节点以及CN的bond网卡和物理网卡的lro、gro 、gso 、tso参数,现场没有全关闭导致接受数据慢,关闭参数后COPY性能恢复。
-
【问题现象】:替换管理节点安装manager报错:Failed to install oms patch【处理步骤】:1.查看tomcat日志提示wcc解密失败:Run decryptCommandLine exceprtion2.日志打印wcc解密有问题,fail to get database password3.以omm用户分别登录主管理节点及新替换节点,执行ls -l $BIGDATA_HOME/common查看runtime软链接的指向发现不一致(升级上来得集群,替换管理节点存在此问题)【操作步骤如下】 执行OMS安装脚本前,需要先检查主OMS节点runtime软链接的指向。若原集群是升级而来的集群,则必须执行此步骤。如果OMS节点软链接“${BIGDATA_HOME}/common/runtime”指向“${BIGDATA_HOME}/common/runtime1”(升级上来的环境可能会有这种情况),在被更换节点解压软件包后(例如解压到“/opt”),需要执行以下步骤修改被更换节点runtime软链接的默认指向:进入“/opt/FusionInsight_Manager/software/om/package”目录。cd /opt/FusionInsight_Manager/software/om/package解压om.tar.gz软件包。tar -zxf om.tar.gz进入“/opt/FusionInsight_Manager/software/om/package/om/inst/func”目录。cd om/inst/func修改“/opt/FusionInsight_Manager/software/om/package/om/inst/func/constants.sh”文件中默认的软链接指向,把文件中的COMMON_WORKSPACE_NAME_0="runtime0"修改为COMMON_WORKSPACE_NAME_0="runtime1"。进入“/opt/FusionInsight_Manager/software/om/package”目录。cd /opt/FusionInsight_Manager/software/om/package重新打包om.tar.gz软件包。tar -czf om.tar.gz om删除om目录。rm -rf om
-
实验名称地址快速入门数据仓库服务GaussDB(DWS)链接体验GaussDB(DWS)云原生数仓-存算分离链接数据仓库服务GaussDB(DWS)权限管理链接如何实现GaussDB(DWS)性能调优链接GaussDB(DWS)集群间的数据迁移实践链接GaussDB(DWS)基于gds实现跨集群数据互联互通链接沙箱实验体验如何?后续期望我们有哪些沙箱实验?您都可以通过问卷调查反馈给我们。问卷调查链接:cid:link_6
-
1.升级工步任务的dws db升级和dws dms db升级报错DWS dms db升级处理:1.登录一个dms节点,切到root用户,/tmp/exec_db.log,报错:ERROR:canceling statement due to statement force abort timeout2.切到dbadmin用户,dbstatus命令,数据库状态正常3.连上dms库,show statement_timeout为1mingsql -U dbadmin -W Manager@123或gsql -p 8635 -U dbadmin -WManager@123 -d dms3.查询表数量许久没反应,将该表删除掉,重试任务成功DWS db升级处理:1.dws db任务报错详情报错,failed to upgrade or roll back the DMS Gauss DB2.dws-db01节点的/tmp/exec_db.log:提示很多字段在namespace表里已存在3.登录rms库:select * from namespace;结果如下,有两条数据,重复了4.删除重复数据delete from namespace limit 15.重试工步
-
1.工步详情2.去到gaussdb库的主节点,手动执行:gsql -d dms -U dbadmin -W Manager@123 -p 8635 -f /tmp/dws-upgrade/dms/upgrade.sql3.手动修改文件:/tmp/dws-upgrade/dms/upgrade.sql,去掉primary key原因:DWS-Gauss-DB节点,切到dbadmin用户,然后连上库:gsql -d dms -U dbadmin -W Manager@123,select * from dms_meta_agent_version; 看是否有数据,正常应该没有
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第五期2026/09/04 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;蒋春阳-华为云AI开发者案例开发专家
本期直播内容: AI工具体验营 · 第5-8课连讲。Agent-Team 多智能体协作完成毕业设计实践
回顾中 -
华为云开发者AI素养ClassRoom·第六期2026/09/08 周二 19:00-20:00
樊渊-2026华为软件挑战赛冠军
高手来了:看软挑高手解析二维排样问题—从工业难题到算法突破
回顾中
热门标签