• [其他] 【变更】扩容,添加节点后,在fi界面刷新无法显示新添加的节点
    1、问题现象添加节点后,登录FI界面,多次刷新发现新加的节点偶现不显示2、排查方法(1)使用老节点ping新节点发现丢包率较大,多次执行依旧有严重的丢包(2)排查bond配置有异常,网卡配置文件中BOOTPROTO=DHCP,建议改成NONE或者STATIC
  • [应用案例] max_prepared_transactions参数修改
    max_prepared_transactions参数的修改和其他参数不同,这个参数是写在Pg_control里的,在重启时,需要按这个值创建数组,并把两阶段的事务Load进来改大没有问题,但当将max_prepared_transactions改小时,修改方法错误可能导致集群无法启动1.修改guc参数gs_guc reload -Z coordinator -Z datanode -N all -I all -c "max_prepared_transactions=XXX"注意:参数的值不能小于max_connections2.执行checkpointgsql postgresql://:8000/postgres?application_name='OM' -ar -c "checkpoint"3.停止集群cm_ctl stop注意:此命令不能加-mi,必须等待集群正常关闭,加上-mi就可能导致由于max_prepared_transactions改小,部分实例无法启动的问题4.启动集群cm_ctl start -t 600其余重启注意事项参考重启标准方案【运维变更】【标准变更方案】【HC/HCS/HCSO】重启集群_数仓GaussDB(DWS)_大数据_华为云论坛 (huaweicloud.com)【运维变更】【标准变更方案】【纯软】重启集群_数仓GaussDB(DWS)_大数据_华为云论坛 (huaweicloud.com)备用方案当出现个别实例由于max_prepared_transactions改小无法启动的情况时,现象为实例一直不断重启,日志内有明显max_prepared_transactions相关logFATAL:  hot standby is not possible because max_prepared_transactions = 800 is a lower setting than on the master server (its value was 850)如果其对端为Primary Normal,那对问题实例进行一次增量build,可将问题实例拉起。
  • [其他] 【升级】--【升级时提交失败】升级完成后,提交时失败
    【问题现象】升级完成后,提交时失败【日志现象】ERROR:The database cannot be created during the database upgrade【解决措施】检查upgrade_mode的值,如果为2,则将其修改为0,重新提交即可gs_guc reload -Z datanode -Z coordinator -N all -I all -c 'upgrade_mode=0'然后提交重试
  • [热点问题专区] 【汇总版】智能客服使用实践战
    一、小D实践文章汇总(持续更新中....):🔴第一弹:《索引篇》小D机器人《使用实践战第一弹--索引篇》来咯!欢迎收藏、转发给有需要的友友~🟣第二弹:《磁盘篇》小D机器人《使用实践战第二弹--磁盘篇》来咯!磁盘问题一网打尽,数据倾斜专题调优,一篇覆盖99%的使用场景!欢迎收藏、转发给有需要的友友~🔵第三弹:《审计日志篇》小D机器人《使用实践战第三弹--审计日志篇》来咯!合理管理审计日志,问题回溯有迹可循!一文掌握审计日志管理全流程~欢迎收藏、转发给有需要的友友~🟠第四弹:《分区表篇》小D机器人《使用实践战第四弹--分区表篇》来咯!从创建到自动管理,关于分区表的一切都整理在这里啦欢迎收藏、转发给有需要的友友~🟢第五弹:《资源负载&ccn排队篇》小D机器人《使用实践战第五弹--资源负载&ccn排队篇》来咯!全面了解CPU管控,让你的SQL跑得高效!欢迎收藏、转发给有需要的友友~🟡第六弹:《表信息篇》小D机器人《使用实践战第六弹--表信息篇》来咯!覆盖建表、查表、改表全场景,哪里不会点哪里!欢迎收藏、转发给有需要的友友~二、唤醒方法:PC端使用1. 提问入口:cid:link_02. 选择大数据—数据仓库服务,即可开启提问。
  • [其他] 【扩容】-【重分布】jsonb中小于1的小数没有0,导致插入报错
    问题现象:jsonb中小于1的小数没有0,导致报错ERROR: XXX invalid input syntax for type jsonDETAIL: Token "." is invalid解决方案:behavior_compat_options参数中增加'display_leading_zero'具体措施:1.查看参数值 behavior_compat_options:show behavior_compat_options2.增加值 display_leading_zero 设置后全局生效:gs_guc reload -Z coordinator -Z datanode -N all -I all -c "behavior_compat_options= 'xx,display_leading_zero'"--xx 表示系统初始配置配置参数,display_leading_zero是新增配置项,追加到最后整改后影响:小数点前为0的,比如0.001,以前select语句的输出是.001,修改后为0.001
  • [其他] 扩容-重分布-存在reindex失败的问题,主键冲突报错
    现象:存在reindex失败的问题,主键冲突报错   规避方法:1、查询表定义(\d+ $table),找到索引列对应的字段2、用找到的字段查询(如:id)$table=lts.lts_task_t groupselect id::text ,count(1) as num from lts.lts_task_t group by 1 having num >1;3、随意再找另一个非空字段(如:tsk_group_id)排查SELECT xc_node_id,tsk_group_id,xmin FROM lts.lts_task_t WHERE id::text::bigint = 44727;4、起事务执行(tsk_group_id以及xmin均为第3步查出的结果)start transaction;select tsk_group_id from lts.lts_task_t where tsk_group_id=1118 and xmin=9247872954;---查出唯一1条记录时在进行删除delete job_id from lts.lts_job_running_log_t where job_id=15 and xmin=9247873466;如果xmin一样,则建议删除时间早的记录commit;
  • [环境搭建] CN数量规划
     GaussDB(DWS)集群中至少保留1个正常的Coordinator。  整个集群部署的CN数量必须小于等于10。  产品文档有关描述:CN个数配置的两种场景建议值: •点查场景    并发50以下:建议配置2~4个。     并发50以上:建议配置6~10个。 •分析场景:建议配置为2~4个。 CN的数量和业务并发数有关,在分析场景下,集群规模超过100节点也保持2~4个CN么?在集群既承载分析也承载即席查询这种混合场景下,CN数量怎么规划呢?
  • [其他] 【变更】包周期降配注意事项
    1、以前CBC功能开放仅需配置一下leader审批就可以了。​CBC功能开放仅需配置一下leader审批就可以了。​2、现在包周期特性不能云服务自己下发创建变更等命令,需要CBC下发这些命令​3、注意事项在包周期降配变更前需提前通知,联系华为工程师开启CBC开启规格降配开关。​若云服务自己下发包周期降配,此时CBC无法打开规格降配的开关,会导致客户没办法变更。​(非功能问题,只是流程不对)
  • 节点GDS访问报错,路由不通
    问题现象:GDS批量业务报错,节点网络不通,路由丢失规避方案:1.对节点进行隔离 xx为对应节点编号cm_ctl stop -n xx    2.及时添加路由 route add -net {bondip}/24 dev ${bondname}sh /etc/init.d/addRoute
  • [数据库变更] GaussDB(DWS) HCS管控面升级案例合集
    DWS HCS管控面升级:HCS820之前升级用HCSU,HCS820开始升级和部署都用HCC Turnkey、checklist、FusionCare工具巡检;升级前要走RFC评审:cid:link_20(checklist也在链接下载)【升级前准备】ECF参数校验:ECF服务得某个节点报错脚本异常,请查看日志cid:link_3DWS参数校验:EI-RegionLB-LVS的浮动IP不通cid:link_4软件包分发:dws bms 业务镜像注册失败cid:link_5参数上传:ECF失败cid:link_6参数上传:ECF-CM01登录失败cid:link_7参数上传:DWS-Region_Node 连接失败cid:link_8【软件包分发】ECF软件包分发之ECF管理节点安装moicagent工步失败:cid:link_9【升级前检查】升级前检查:DWS检查失败cid:link_10【升级】许多组件升级失败:dms-collection、dwscontroller、dbsevent、dbsinsight等组件升级失败cid:link_11cid:link_0DWS-upgrade-dms-dbm-job升级:升级dms组件,执行sql失败cid:link_12instance-package-register失败:注册dws实例失败cid:link_13cid:link_19 ECF.decrease-replication失败:升级dwsmaintain失败cid:link_14upgrade-cluster-manager-dbm-job任务失败:升级cluster-manager-dbm失败cid:link_15dws db升级和dws dms db升级报错:cid:link_16cid:link_17ECF秘钥挂载至CDK/DWS秘钥挂载至CDK失败:cid:link_18cid:link_1【升级后】管控面升级后console纳管集群信息不显示:cid:link_2
  • [其他] GaussDB(DWS)管控面升级后console纳管集群信息不显示
    【问题版本】 管控面820-->821 【问题描述】 管控面升级后集群界面纳管集群不显示 【问题影响】 对集群业务无影响 【问题根因】 console不会获取纳管集群的endpoints值,后台也不会传 【规避措施】修改前台脚本规避 【定位过程】  1、F12检查接口状态正常有返回值 。2、根据页面console报错,定位到js代码调用点,根据报错逻辑确认是缺少endpoints值。 3、检查clusters接口返回值,确认endpoints为空。 { "clusters": [ { "id": "cbc6dff6-43d4-4182-990f-3d2a1ff090d9", "name": "KTY-DWS", "order_id": null, "enterprise_project_id": null, "status": "AVAILABLE", "is_frozen": null, "frozen_time": null, "datastore_type": null, "version": "8.1.1", "created": "2021-04-16 15:44:59.0", "updated": null, "user_name": "omm", "recent_event": null, "logical_cluster_mode": false, "use_logical_cluster": false, "has_logical_cluster_action": null, "is_possible_to_shrink": false, "sub_status": null, "number_of_free_node": 0, "number_of_node": 5, "availability_zone": null, "vpc_id": null, "subnet_id": null, "security_group_id": null, "port": 25308, "guest_agent_version": null, "public_ip": null, "endpoints": null, "public_endpoints": null, "node_type": "dws.physical2.24xlarge5", "spec_version": null, "task_status": null, "action_progress": null, "failed_reasons": null, "error": null, "plugins": null, "flavor_resize_num": null, "network_type": null } ], "count": 1 } 5、版本梳理代码后确认为该版本问题,不会获取纳管集群的endpoints值,需要修改前台js文件规避。 6、建议用户升级到20230430后的830版本,该版本不会有问题; 修改前端静态脚本规避: 1)登录两个console-static节点,serviceOM里面搜节点IP 2)进到/opt/cloud/static/private/dws/目录下备份app.2083d144.js文件 3)vim app.2083d144.js搜cluster.endpoints      在cluster.endpoints后添加一个英文问号?      在cluster.endpoints.map(e=.e.connect_info)后添加英文符号||[] 4)清浏览器缓存后刷新后集群信息显示出来了;
  • [其他] ECF秘钥挂载至CDK失败/DWS秘钥挂载至CDK失败(CDK集群状态异常)
    【问题版本】 管控面811->820 【问题描述】 DWS秘钥挂载至CDK失败/ECF秘钥挂载至CDK失败 【问题影响】 无 【问题根因】 CDK集群异常,kube-apiserver容器没起来 【规避措施】 把kube-apiserver容器拉起来 【定位过程】  1、挂载秘钥失败,查日志详情发现集群状态NotReady; 2、拉CDK的人排查,去CDK界面查询集群处于非健康状态; 3、登后台CDKmaster节点,发现kube-apiserver容器没起来;     docker ps     docker images     cd /var/pass/sys/log/kubernetes/     ll 4、发现kube-apiserver.manifest文件跑到了 上层目录,mv到原来目录manifests后集群状态恢复;重试工步成功;     cd /var/pass/sys/log/kubernetes/manifests     mv ../kube-apiserver.manifest ./     watch docker ps查看kube-apiserver容器已经拉起 
  • [数据库变更] GaussDB(DWS) db升级工步失败(数据库root默认密码被改)
    【问题版本】 管控面820-821 【问题描述】 管控面升级DWS db升级工步失败 【问题影响】无 【问题根因】 数据库root默认密码被更改 【规避措施】先在备库断开同步链接,把备库密码改了,然后主备倒换,重建原来主库 【定位过程】  1、DWS db升级工步失败日志报超时,在设定时间120秒内未获取到期待的返回值; 2、检查DWS-DB01/02节点数据库主备状态正常,磁盘正常,前后台重试工步还是一样的错; 3、在数据库节点直接连接数据库,发现root连接不上,怀疑授权问题,建单给cloudDB的处理; 4、发现数据库root的密码被改了,非默认的,DB的人尝试改回去,发现改不回去,讨论不影响业务方案,需要重启MySQL;     select user,host from mysql.user; 5、最后方案是:先在备库断开同步链接,把备库密码改了,然后主备倒换,重建原来主库;    5.1由于老库属于非标,切时间比较长,需要先找到my.cnf文件,执行find / -name 'my.cnf',找到配置文件。    5.2找到后修改my.cnf文件,在[mysqld]下加上skip-grant-tables,保存退出    5.3重启数据库后,mysql -uroot -p登录(当前状态不用输入密码)    5.4执行mysql> USE mysql ;        mysql> show slave status \G        mysql> update mysql.user set authentication_string=password('新密码') where user='root';        mysql> flush privileges;     5.5退出数据库,将my.cnf文件中的配置修改回原样,删除skip-grant-tables,保存退出。     5.6重启数据库后,以新的root密码登录,可以成功登录 6、主备倒换后数据库就可以用root正常连接,让先跑升级,重试工步成功,然后重建原主;    停库:python /usr/local/bin/Stop_mysql_force.py    启库:python /usr/local/bin/StartMHACluster.py    主备倒换:python /usr/local/bin/MHA_SwitchOverManual.py    重建备库:python /usr/local/bin/MHA_RebuildSlave.py ip //ip为对应主节点对应的ip
  • [问题求助] GaussDB DWS cn发生下盘,导致集群只读。想问下什么是cn下盘?下盘一定是内存问题吗?
    GaussDB DWS cn发生下盘,导致集群只读。想问下什么是cn下盘?下盘一定是内存问题吗?
  • [其他] DWS管控面之License许可文件导入报错
    【问题现象】 MO页面-》许可管理-》许可软件列表-》产品DWS服务许可异常,导入时报错:      License文件已失效。[ESE:DWS,R EE. jx-zWy-1[URL :https://dws-lb. jx-zwy-1.jx-gcloud. com. cn: 31416/rds/insight/v2/mo/license/files [HttpCode:400]【常见版本】821.1之前版本【解决方案】1、该问题属于版本之间的差异,申请的License不应该包含动态脱敏,8.2.1.1前不支持DWS-动态脱敏-许可。2、dwscontroller日志中找到license is inValid, please check license item:HCSEIBDDWSDD报错信息。3、打开查看申请的license文件,CapacityKey name是否包含HCSEIBDDWSDD;4、包含则重新申请不包含动态脱敏的license许可,重新导入license即可。
总条数:2746 到第
上滑加载中