• [运维管理] gaussdb 8.0.0.9 什么情况下ctime为空?
    gaussdb 8.0.0.9 什么情况下ctime为空?
  • [其他] 【DWS】sql杀不掉处理方法
    【应用场景】本篇主要针对正在执行的sql或者残留sql,通过select pg_terminate_backend(pid); select pg_cancel_backend(pid); 等正常查杀方式都杀不掉的场景【问题影响】单个语句执行时间长占用资源或者持锁阻塞其他语句【原因】一般常规手段杀不掉的情况都是不响应信号导致【应急处理】1.处理前再次尝试通过常规手段查杀,查看是否能被杀掉,如果正常结束则处理完毕;2.如果正常查杀仍然未结束则说明不响应信号,通过query_id执行等待视图获取lwtidCN上杀不掉,queryid和coorname换成对应的select * from pgxc_thread_wait_status where query_id = queryid and node_name = coorname; DN上残留且杀不掉,执行下面select * from pg_thread_wait_status where query_id = queryid;3.保留堆栈信息(云上需在沙箱外)以供分析执行 gstack $lwtidlwtid为第二步获取的4.kill或者重启对应残留或者不响应CN/DN实例(该操作会导致业务闪断,需业务同意),一般同一个query在多个DN上残留,kill一个DN后其他相关残留线程也会同步退出
  • [其他] DWS查询HDFS外表慢——域名解析慢
    现象:DWS查询外表普遍慢,且打印执行计划均慢在外表扫描,打印堆栈分析,观察堆栈是否卡在res_nsearch && res_context_search,可参照如下方式,解决外表查询慢的问题原因:跨集群访问HDFS外表时,需要进行域名解析,目前现象为域名解析服务器没有找到对应的映射关系导致性能劣化解决方法:方式1:获取hdfs server配置文件(配置文件路径可从pg_foreign_server中查询对应server的配置文件路径)krb5.conf文件中对应的域名信息[domain_realm]部分,并在所有节点的 /etc/hosts文件中添加,ip 域名的映射关系(ip地址默认为1.1.1.1 域名为此前获取的域名信息)方式2:修改/etc/resolv.conf文件,添加配置项options timeout:1 attempts:1 rotate;该配置项作用为域名解析超时为1秒,重试次数1次注:方式1若未明显提升外表查询效率后,尝试结合方式2解决;云上环境沙箱内外均需修改相应文件,否则无法生效
  • [其他] 升级后观察期期间新特性不生效
    升级8.2.1之后在观察期内(未点确定,还可以回退回老版本),使用821审计新特性审计语句中所有对象的列及其在语句中使用的类型,按文档操作后object_details中未能查到相应记录SET audit_object_details = on;SELECT object_name,object_details,result_rows,error_code,command_text FROM pg_query_audit('2023-05-12-03 8:00:00','2023-05-12 22:55:00') where command_text like '%student%';原因是处在升级观察期内,新特性不生效,如果生效版本回退后再查审计日志会出现异常,需确认后生效才能记录。
  • [其他] hcs管控面升级案例汇总
    升级前准备    ECF参数校验:ECF服务得某个节点报错脚本异常,请查看日志    https://bbs.huaweicloud.com/forum/thread-0249126944914663051-1-1.html    DWS参数校验:EI-RegionLB-LVS的浮动IP不通    https://bbs.huaweicloud.com/forum/thread-0211126946023116033-1-1.html    软件包分发:dws bms 业务镜像注册失败    https://bbs.huaweicloud.com/forum/thread-0220127358295788034-1-1.html    参数上传:ECF失败    https://bbs.huaweicloud.com/forum/thread-0284125064787257001-1-1.html    参数上传:ECF-CM01登录失败    https://bbs.huaweicloud.com/forum/thread-0235127361804923034-1-1.html    参数上传:DWS-Region_Node 连接失败    https://bbs.huaweicloud.com/forum/thread-0235127362276975035-1-1.html升级前检查    升级前检查:DWS检查失败     https://bbs.huaweicloud.com/forum/thread-0218127365181705066-1-1.html升级    许多组件升级失败:dms-collection、dwscontroller、dbsevent、dbsinsight等组件升级失败     https://bbs.huaweicloud.com/forum/thread-0205127366817865050-1-1.html    DWS-upgrade-dms-dbm-job升级:升级dms组件,执行sql失败    https://bbs.huaweicloud.com/forum/thread-0283127375647370004-1-1.html    instanc-package-register失败:注册dws实例失败    https://bbs.huaweicloud.com/forum/thread-0275124710019775007-1-1.html    ECF.decrease-replication失败:升级dwsmaintain失败    https://bbs.huaweicloud.com/forum/thread-0265124710117505007-1-1.html    upgrade-cluster-manager-dbm-job任务失败:升级cluster-manager-dbm失败   https://bbs.huaweicloud.com/forum/thread-0212125812302889038-1-1.html    dws db升级和dws dms db升级报错:dws db升级和dws dms db升级报错    https://bbs.huaweicloud.com/forum/thread-0205127377077351001-1-1.html
  • [其他] 修改ttl报错Failed to update task interval and what, the scheduler task was not found.
    【 问题现象】在修改自动分区表的ttl时报错Failed to update task interval and what, the scheduler task was not found. 是因为pg_task中这张表的任务被删除,可能由于一些级联删除操作删除了要修改表的列导致pg_task中任务也被级联删除。【 原因分析】模拟复现如下create table t1 (a int, b int);create table t2 (id int, par timestamp without time zone, tbl t1) with (period = '1 day',ttl = '30 days') partition by range(par);此时查询pg_task可以发现有两个定时任务修改t2表ttl,不报错,pg_task正常更新级联删除t1表,再修改ttl,发生报错,pg_task中记录不存在。【 处理方法】先将自动分区参数reset,再set即可
  • [集群性能] SQL查询字段过多,排序下盘问题
    【 问题现象】某业务语句如下update t1 set t1.order = t2.rn from(select *, row_number(partition by phone_id,salecode order by customers) as rn from to_order where series_code not in ('A1','A2') and phone_id is not null) t2where t1.customers_id = t2.customers_id and t1.id = t2.id and t1.series_code not in ('A1','A2') and t1.phone_id is not null;执行是会产生大量的下盘,打印执行计划发现下盘发生在sort部分,也就是窗口函数排序过程。【 原因分析】分析语句,这个update实际只需使用t2查询的三个字段,而该查询查出了表的全部字段,在开窗排序时额外排了很多不需要使用的字段造成下盘。【 处理方法】所以可以减少t2查询选取的字段数,将语句调整为如下语句可有效减少排序数据量,从而减少或避免下盘。update t1 set t1.order = t2.rn from(select customers_id, id, row_number(partition by phone_id,salecode order by customers) as rn from to_order where series_code not in ('A1','A2') and phone_id is not null) t2where t1.customers_id = t2.customers_id and t1.id = t2.id and t1.series_code not in ('A1','A2') and t1.phone_id is not null;
  • [运维管理] 813及以上memory is temporarily unavailable问题排查
    问题现象客户端以及后台日志中存在报错memory is temporarily unavailable,内存不足。排查过程1.查看日志中报错的dn日志,找到报错的位置,在813及以上版本会打印出debug的信息,我们可以通过搜关键字abnormal来找到当时使用最高的语句,如下图我们可以找到thread id,再查找thread id 找到对应query id2.上一步可以看到最大的SQL占的内存,结合总共使用的内存,若该SQL占的内存多,通过topsql查找对应的query id,来找到对应的SQL语句,并通过unique_sql_id找到同一类型的SQL,进行分析整改;3.若第2步中占用最高的SQL使用 内存占比也比较低,我们可以将排查方向放到并发量上,建议控制最大活跃SQL的并发量,分批调度任务。来规避某一时刻的内存使用大的情况结论及规避措施1.单语句消耗内存大,通过找到消耗内存大的一类语句进行整改,2.单语句消耗内存小但是并发高,导致整体内存使用超出可以内存,控制活跃语句并发量。
  • [其他] DWS扩容失败报静态文件与XML不一致
    【问题现象】             扩容点击后,执行失败,后台看日志报错        Failed to check static configuration on node [host-192-168-xx-xx] ,Error:        The cluster static configuration does nat match new configuration file.【常见版本】DWS820 【定位思路】1、查询gs_expand日志发现日志报如下错:        Failed to check static configuration on node [host-192-168-xx-xx] ,Error:        The cluster static configuration does nat match new configuration file.        得出静态文件的错,有可能是静态文件与XML不一致导致;2、对比新老节点监听IP,发现新老节点的ListenIps不一致;3、在一个实例节点在沙箱内/opt/dws/xml/cluster.xml文件中添加缺少的三个ListenIps地址;4、将已修改的节点的XML文件拷贝到所有节点,执行以下命令:        gs_ssh -c "scp -r Ruby@host-192-168-xx-xx:/opt/dws/xml/cluster.xml /opt/dws/xml/"5、最后在serviceCM扩容失败的任务点击重试,若界面点不了重试,可在后台节点执行如下Python3命令(此命令可以ps ux查询);6、等一段时间扩容成功;
  • [其他] dws周报服务矩阵
     框架/HCSU工具:曹安安 WX540396    马聪 30002027 陈延鹏 wx1087268 赵陇强 wx780900 console:石志龙 30008908、王业涛 30036132 cps/openstack:余德元 00534420 李怡飞 30005308 cdk/CloudScope:王亮 wx1189835、孟世显 wx1026592、谢燊博 30007601、蒋瑞斌 wx1257330 MOAPIG/dmk:张奔 30034802,HCS的人协调,岳举荣 84259463、杨欣 wx1210544、崔琛 wx1058687  clouddb:涂程 李航航 刘星 何群星 统一备份:对按ManageOne统一备份失败,可能周因:1.网络异常 2.ManageOne统一备份服务异常。找工具得人看,国网升级可以找华腾飞看 ManageOne/MOICAgent/IAM:刘琪 00467847、吕国辉 30007802、佘明亮 30008780、赵磊 wx294046 iam:安全认证,通过iam获取一个token,cdk上-变更管理-服务升级-dms-monitor容器搜iam参数?op_svc_dws账号 obs排班:https://clouddevops.huawei.com/domains/28941/wiki/8/WIKI2021070100149 cac:吴代兵 wx1228924、 serviceOM:晁飞鹏 30006816 vpc:余渝栋(30033628)   AOM:王柄 30015046 CCE:崔凯 WX1245936/翟豹 30005612 DCS:王磊 30036605 ServiceStage:杜潇 84242483 SWR:陈美彬 00541253、高敏键 30005527、张森 WX1098406、崔凯 WX1245936 edkm:吴代兵 wx1228924、肖忠飞 30022596 dms:计家和 董炳晨 赵健 张东方 
  • [其他] 【通信】【查杀报错】报错terminating connection due to xxx / canceling statement due to xxx
    本篇主要分析下DWS使用中报错 FATAL:terminating connection due to xxx / ERROR: canceling statement due to xxx 的原因;这两种报错一般都是收到信号查杀语句报出来的【FATAL:terminating connection due to xxx】一般此类报错有以下几种场景:【场景一】调用pg_terminate_backend(pid) 函数查杀可能原因:(1)人为手动调用pg_terminate_backend 查杀;(2)排查现场是否有部署超时查杀脚本之类的任务,里面是否调用pg_terminate_backend 查杀;(3)cm_agent在检测磁盘超过阈值(默认90%)场景下,会调用命令“select pg_terminate_backend(pid) from pg_stat_activity where usesysid <> 10”终止当前CN上所有非omm用户的SQL,同时打印调用日志“cancel session ok”,排查cma日志,报错时间点是否出现过cma终止当前cn所有非omm用户sql的打印。并未发现日志打印,说明cma并没有发送终止命令。排查方案:在对应报错实例的日志排查,grep pg_terminate_backend如果能找到对应的调用函数,且时间线程能对上则确定根因。【场景二】调用了clean connection to all force 清理所有连接;一般现网通过clean connection to all for database xxx; 清理空闲连接,但是如果加上force,clean connection to all force for database xxx; 则为清理全部连接,活跃连接也会被清理报错;可能原因:该接口数据库内没找到任何调用接口,是人为调用了clean connection to all force 清理所有连接,一般是为了应急恢复;排查方法:可在各cn日志搜索clean connection日志,且同一时间任务全部报错,都是一个现场下发的信号;【场景三】session_timeout超时,数据库侧主动断开此链接;可能原因:此类场景比较特殊,session_timeout为idle链接保留的最大时间,超过后数据库侧会主动断开此链接;可能场景为客户端与数据库侧已经建立连接,但是长时间没有进行数据交互(从别处抽数等),再次使用此连接,但是数据库侧已经断开报错;前几种情况都排查过后再考虑此类情况;排查方法:报错实例日志,排查报错前是否有Session unused timeout关键字【场景四】集群停止shutdown排查方案:集群停止shutdown场景,分析全量日志,查看报错时间是否有任何集群停止命令对应日志,若没有则排查该原因。【ERROR: canceling statement due to xxx 】【场景一】调用pg_cancel_backend(pid) 查杀语句,原因和排查方式可参考上述pg_terminate_backend【场景二】执行sql时直接 ctrl C 中止语句【场景三】statement_timeout超时查杀排查方式:1.如上图所示,发送查杀信号的是线程本身,是线程触发定时器后中止的自己;2.通过日志记录,或者topsql查询报错作业,看执行时间是否为statement_timeout;3.show statement_timeout;查看全局超时参数,如果对不上,可以通过以下方式查看是否设置了用户级别的超时参数SELECT oid, rolname FROM pg_roles;select * from pg_db_role_setting;
  • [其他] DWS管控面之OC告警数据库操作异常(浮动IP掉)
    【问题现象】管控面OC告警数据库操作异常【常见版本】HCS810 DWS812【解决方案】1、让用户进后台查看controller日志,发现报数据库连接超时;2、让用户登数据库节点Get_db_status.py查mysql状态,发现主备都有问题,浮动IP也掉了(如下);10.xx.xx.1 status: Offline,Unkown,Unkown,its no slave node. 10.xx.xx.2 status: Online,Read-Only.Master Node.no slave role,its no slave node.Can not find VIP 10.xx.xx.3/xx both on the 10.xx.xx.2 , 10.xx.xx.1注:正常10.xx.xx.1为主,10.xx.xx.2为备3、让二线建关联单给cloudDB,帮忙指导修复数据库;4、切换主备,挂上浮动IP,重建备库后数据库恢复正常;          4.1 连上备节点MySQL数据库:mysql -uroot -p{root密码} -S /data/mysql/tmp/mysql.sock                  mysql -udbadmin -p{dbadmin密码} -S/data/mysql/tmp/mysql.sock         4.2 将该备节点只读设为0,改为主:set global read_only=0/OFF ;                  show variables like 'read_only';                  set global read_only=OFF;          4.3 再次Get_db_status.py查看备节点是否正常并变为主,是的话就挂载浮动IP到新的主节点;         4.4 挂载浮动IP:sudo /usr/sbin/ifconfig eth0:1 xx.xx.xx.xx/xx (浮动ip/掩码);                  ifconfig eth0:1 xx.xx.xx.xx/xx         4.5 Get_db_status.py查看浮动IP是否挂上,并且主库是否正常,如果主节点一切正常,再登录备节点重建备库,如果主库没起来,可以Start_mysql.sh手动启动;                  python /usr/local/bin/MHA_RebuildSlave.py {master_ip}    (master_ip为对应主节点对应的ip)         注:重建备库如果提示:/tmp/CloudDB_MySOL_KA2WAMHAVIP.1og 权限问题,修改该文件权限属主属组为mysql,然后重试;                  chown mysql:mysql /tmp/CloudDB_MySOL_KA2WAMHAVIP.1og 5、让用户登运维容器连接rms数据库,能正常进入,告警恢复也不再重复上报;
  • [其他] ECF软件包分发之ECF管理节点安装moicagent工步失败
    【问题版本】820->821【问题描述】单独升级ecf,ECF软件包分发的ECF管理节点安装moicagent工步失败,报错:get dmk info for apigw failed【定位思路】1、查看工步详细日志信息,报错的是DMK的apigw的配置信息:get dmk info for apigw failed;2、登录Turnkey工具后台节点查看ecf_install_moicagent.py脚本配置的不是apigw账号密码,改了正确的账号密码,后台重启容器hcci_exec_70;1)vi /opt/cloud/src/HCCI/projects/70/plugins/ECF_hcsu_plugin/upgrade/ecf/scripts/ecf_install_moicagent.py2)找到def update_dmk_info(self):模块下DMK账户密码更改为:dmk_user_name = "apigw"dmk_pwd = "xxxxxxxx"3)在后台执行重启容器命令:docker restart hcci_exec_703、在前台Turnkey重试工步还是失败报密码错误;4、登DMK界面sysadmin账户重置apigw密码后,再次重试该工程工步,执行成功;
  • [热门活动] 【数据仓库专题直播有奖提问】DTSE Tech Talk 技术直播 NO.41:看直播提问题赢华为云定制U型按摩枕、华为云定制POLO衫等好礼!
    中奖结果公示感谢各位小伙伴参与本次活动,本次活动获奖名单如下:请各位获奖的伙伴在9月2日之前点击此处填写收货地址,如逾期未填写视为弃奖。再次感谢各位小伙伴参与本次活动,欢迎关注华为云DTSE Tech Talk 技术直播更多活动~直播简介【直播主题】数仓专家手把手教您资源管控与运维实战【直播时间】2023年8月29日 16:30-18:00【直播专家】吕鹏博 华为云EI DTSE技术布道师【直播简介】GaussDB(DWS)的CPU、内存、磁盘IO等资源管控对保证数据库性能稳定至关重要,本次直播将通过实战案例,介绍如何定位和优化资源使用情况,包括:CPU 使用率分析、内存参数优化、排队问题定位等。通过本次直播,您将学会如何科学合理地分配和管理数据库的核心资源,从而确保数据库性能的稳定。这将是一场非常实用的GaussDB(DWS)资源管控优化指南,帮助您更好地管理数据库资源,提升数据库性能。直播报名:cid:link_1活动介绍【互动方式】直播前您可以在本帖留下您疑惑的问题,专家会在直播时为您解答。直播后您可以继续在本帖留言,与专家互动交流。我们会在全部活动结束后对参与互动的用户进行评选。【活动时间】即日起—2023年8月30日【奖励说明】评奖规则:活动1:直播期间在直播间提出与直播内容相关的问题,对专家评选为优质问题的开发者进行奖励。奖品:华为云定制U型按摩枕活动2:在本帖提出与直播内容相关的问题,由专家在所有互动贴中选出最优问题贴的开发者进行奖励。奖品:华为云定制POLO衫更多直播活动直播互动有礼:官网直播间发口令“华为云 DTSE”华为云定制鼠标垫、填写问卷抽华为云定制长袖卫衣等好礼分享问卷有礼 :邀请5位朋友以上完成问卷即可获得华为云定制雨伞。老观众专属福利:连续报名并观看DTT直播3期以上抽送华为云DTT定制T恤。【注意事项】1、所有参与活动的问题,如发现为复用他人内容,则取消获奖资格。2、为保证您顺利领取活动奖品,请您在活动公示奖项后2个工作日内私信提前填写奖品收货信息,如您没有填写,视为自动放弃奖励。3、活动奖项公示时间截止2023年8月31日,如未反馈邮寄信息视为弃奖。本次活动奖品将于奖项公示后30个工作日内统一发出,请您耐心等待。4、活动期间同类子活动每个ID(同一姓名/电话/收货地址)只能获奖一次,若重复则中奖资格顺延至下一位合格开发者,仅一次顺延。5、如活动奖品出现没有库存的情况,华为云工作人员将会替换等价值的奖品,获奖者不同意此规则视为放弃奖品。6、其他事宜请参考【华为云社区常规活动规则】。
  • [其他] 【业务报错】硬件RAID故障导致节点OS Hung,CN被剔除
    【问题现象】SQL执行报错,故障一段时间后故障节点上CN被剔除【问题定位】1)2023-08-16 10:13:54,故障节点所有DWS相关进程异常卡住,日志停止打印。​各进程最后打印日志的时间点分别如下: cm_agent:2023-08-16 10:13:54 cn_5003:2023-08-16 10:13:53 dn_6009:2023-08-16 10:13:53 2)2023-08-16 10:13 cms日志并未出现断连告警,说明cma与cms之间连接并未断开,但故障节点日志无法打印​3)2023-08-16 10:20:00 cma和cms之间的心跳超时断连​4)2023-08-16 10:29:38 超时10分钟后,故障CN被自动剔除​5)在2023-08-16 10:13:54~10:31:02期间,业务有影响,CN被自动剔除后业务恢复正常6)查看OS message日志,对应时间点OS日志有断档​【问题根因】上层业务DWS定位结论:OS 半hang死(表现为网络正常,日志等IO操作卡住)导致业务被阻塞,一段时间后OS panic重启服务器,CN剔除,业务继续正常执行。需要麒麟OS定位系统hung的直接原因麒麟OS的定位结论:硬件RAID卡问题,需要更换硬件和升级驱动。【解决方案】根据麒麟OS定位结论:更换硬件和升级驱动。
总条数:2746 到第
上滑加载中