-
【问题现象】集群DN实例主备切换,日志报错Resource temporarily unavailable,could not fork new process for connection…【问题分析】此类报错问题基本为两方面,一为当时硬件故障或者OS配置问题,导致资源受限,可优先排查服务器是否存在大量僵尸进程;二,应用业务导致map使用过多。又从未来再次发现类似问题角度考虑,推出此类问题的分析步骤如下:1、查看线程数是否受限系统最大pid :cat /proc/sys/kernel/pid_max系统最大线程数:cat /proc/sys/kernel/threads-max系统限制某用户下最多可以运行多少进程或线程:max_user_process(ulimit -u)上述三者一般取下限,当前线程数超过上面任意一个配置都是不允许的。当前系统的线程数量:pstree -p | wc -l以下为某一具体案例。可供参考:某集群执行pstree -p打印后台发现大量java程序,进一步执行ps -ef|grep java发现有大量java加密程序,路径为/rds/dms-agent/workplace/util/CryptTool.jar进一步分析加密程序卡死原因为信号量冲突,hung住后占用大量系统资源【解决方法】删除dms-agent下scc.conf中semKey配置以永久规避,规避措施无其他影响
-
【问题现象】业务报错[HeapTupleSatisfiedVacuum set HEAP_XMIN_INVALID xid don't abort] tuplexid = xxx !【处理方法】1、kill报错对应DN2、在DN执行select * from pg_get_variable_info(); 查看startupMaxXid字段的值,如果startupMaxXid的值大于报错的tuplexid的值,则可以恢复。3、若kill DN后查看startupMaxXid的值小于报错的tuplexid的值,连续执行select txid_current()来推进事务号,然后再kill DN查看startupMaxXid值。
-
问题:DI工具抽取DWS任务报错连接失败(下图),重试几次后成功问题根因:该局点之前刚做了iam扩容,增加了新节点;新节点被防火墙限制了。解决方法:开通新增DI节点到DWS 的防火墙策略即可。
-
dws/ecf微服务的数据库审计日志总是占满目录的规避问题版本:all问题现象:dws/ecf微服务审计日志总是占满目录规避方法:1.进入审计日志目录,清理审计日志文件(DWS-DB-01/02、ECF-COMMON-DB01/02、ECF-CM-DB01/02共六个节点都需要做)。 cd /data/ ; du -sh audit.log //查看对应的审计日志大小 cat /dev/null > {需要清空的文件名}2.以root用户回到DWS-DB01节点,切到mysql用户,登录本地数据库。su - mysqlmysql --defaults-file=/data/mysql/etc/my.cnf -uroot -hlocalhost -P7306 -pxxxxxxx 3.执行set global audit_log_rotations=50; set global audit_log_rotate_on_size=20971520; 4.退出数据库,修改配置文件,保证重启也生效vim /data/mysql/etc/my.cnf增加审计日志轮转参数audit_log_rotations=50 audit_log_rotate_on_size=20971520保存退出。 5.观察审计日志是否开始轮转。 6.该参数是单节点生效,需要在每个节点执行。 7.(选做)如果不需要审计功能,可以登录库后设置关闭set globalaudit_log_policy=none; 每个节点都需要执行,该步骤请谨慎选择。
-
问题背景业务表数据量很少,但是占用空间很大问题原因1.脏数据多 2.列存表膨胀 3.使用大量varchar(不合理长度)排查过程1.查看脏页率(查之前先执行analyze 表名,如果脏页率很高,需要对表进行vacuum full analyze,如果脏页比较低看第二步) select c.oid AS relid, n.nspname AS schemaname, c.relname, pg_stat_get_tuples_inserted(c.oid) AS n_tup_ins, pg_stat_get_tuples_updated(c.oid) AS n_tup_upd, pg_stat_get_tuples_deleted(c.oid) AS n_tup_del, pg_stat_get_live_tuples(c.oid) AS n_live_tup, pg_stat_get_dead_tuples(c.oid) AS n_dead_tup, cast( (n_dead_tup / (n_live_tup + n_dead_tup + 0.0001) * 100) AS numeric(5,2)) AS dirty_page_rate from pg_class c LEFT JOIN pg_namespace n ON n.oid = c.relnamespace where c.oid = (select 'public.t4'::regclass::oid); /* public为模式名,t4为表名 */ 2.小CU多只有列存表涉及 参考如下链接排查,如果嫌排查麻烦,建议直接执行vacuum full analyze进行CU整合再次查询表大小。 https://bbs.huaweicloud.com/forum/thread-96965-1-1.html 3.使用大量character(不合理长度),相同数据量可以看到测试结果,使用character(8000)表占2667 MB使用text表占60 MB postgres=# \d+ yyb.test_row Table "yyb.test_row" Column | Type | Modifiers | Storage | Stats target | Description --------+---------+-----------+----------+--------------+------------- id | integer | | plain | | name | text | | extended | | name1 | text | | extended | | name2 | text | | extended | | name3 | text | | extended | | name4 | text | | extended | | name5 | text | | extended | | Has OIDs: no Distribute By: ROUND ROBIN Location Nodes: ALL DATANODES Options: orientation=row, compression=no postgres=# \dt+ yyb.test_row List of relations Schema | Name | Type | Owner | Size | Storage | Description --------+----------+-------+-------+-------+----------------------------------+------------- yyb | test_row | table | yyb | 60 MB | {orientation=row,compression=no} | (1 row) postgres=# \d+ yyb.character_test_row Table "yyb.character_test_row" Column | Type | Modifiers | Storage | Stats target | Description --------+-----------------+-----------+----------+--------------+------------- id | integer | | plain | | name | character(8000) | | extended | | name1 | character(8000) | | extended | | name2 | character(8000) | | extended | | name3 | character(8000) | | extended | | name4 | character(8000) | | extended | | name5 | character(8000) | | extended | | Has OIDs: no Distribute By: ROUND ROBIN Location Nodes: ALL DATANODES Options: orientation=row, compression=no postgres=# \dt+ yyb.character_test_row List of relations Schema | Name | Type | Owner | Size | Storage | Description --------+--------------------+-------+-------+---------+----------------------------------+------------- yyb | character_test_row | table | yyb | 2667 MB | {orientation=row,compression=no} | (1 row)解决方案1.脏数据和cu膨胀均可通过vacuum full analyze 表名进行解决。 2.character建议定长数据使用,不确定数据长度的场景下建议使用text或character varying代替。
-
单看产品文档的压缩比介绍,感觉在数据压缩比这块不占优势,能简单解释下吗?
-
问题版本:8.1.15问题现象:导入dws的license失败,前台报错:上传产品license失败排查步骤:1.检查license文件是否正确;正确2.排查manageone日志:cid:link_0发现报错:get cert config info from database failed3.登录dwscontroller容器查看ossre-dws.log 日志:发现有执行sql错误:锁等待超时 Lock wait timeout4.登录rms数据库所在节点;df -h 检查磁盘发现data目录100%进入data目录du -sh * 找到最大的文件进去查看最终发现audit.log太大了:审计日志将磁盘占满了清空审计日志:cat /dev/null > filename5.检查数据库状态:数据库节点su - root su - mysql Get_db_status.py发现备库挂了问题根因:审计日志满了导致数据库执行license相关的sql失败;解决方法:清空审计日志,做一下规避防止审计日志再次占满cat /dev/null > {需要清空的文件名}1.进入审计日志目录,清理审计日志文件(DWS-DB-01和DWS-DB-02)。 cd /data/ ; du -sh audit.log //查看对应的审计日志大小 cat /dev/null > {需要清空的文件名}2.以root用户回到DWS-DB01节点,切到mysql用户,登录本地数据库。su - mysqlmysql --defaults-file=/data/mysql/etc/my.cnf -uroot -hlocalhost -P7306 -pxxxxxxx 3.执行set global audit_log_rotations=50; set global audit_log_rotate_on_size=20971520; 4.退出数据库,修改配置文件,保证重启也生效vim /data/mysql/etc/my.cnf增加审计日志轮转参数audit_log_rotations=50 audit_log_rotate_on_size=20971520保存退出。 5.观察审计日志是否开始轮转。 6.该参数是单节点生效,需要在每个节点执行。 7.(选做)如果不需要审计功能,可以登录库后设置关闭set globalaudit_log_policy=none; 每个节点都需要执行,该步骤请谨慎选择。如果备库挂了需要拉起备库1.查看另一个节点是否为主节点,ip a,浮动ip在该节点则说明其是主节点2.登录备节点,切换到mysql用户,使用pathon脚本进行重建python /usr/local/bin/MHA_RebuildSlave.py ip //ip为对应主节点对应的ip3.等待build完成,查看备节点mysql进程是否正常 ps -ef|grep mysql 有mysqld则正常
-
一、版本信息:线下811二、定位过程1.主备OMS节点okerberos状态均异常2.查看oms-krb5kdc.log,报错 Cannot bind to LDAP Server;Unable to read Realm3.执行ldapsearch -H ldaps://节点ip:端口 用户名 密码 有时能连,有时不能连,不能连,报错 Can't contact LDAP server [-1]3.查看ldap进程,发现进程存在4.查看ldap得运行和启动日志,均正常5.手动启动 okerberos服务,krb_server.sh,仍然异常6.对比du -sh /srv/BigData/ldapData/oldap和du -sh /srv/BigData/ldapData/ldapserver,发现oldap比ldapserver小很多7.怀疑oldap数据有缺少68停止主备oms7.将ldapserver的数据目录/srv/BigData/ldapData/ldapserver拷贝给oldapserver的/srv/BigData/ldapData/oldap目录8.启动oms,状态恢复
-
一、版本信息:线下813二、定位过程1.安装集群到第7步配置集群失败2.查看postinstall.log,报错 mppdb-install-config.xml解析错误3.查看该文件显示内容为空,在主oms节点没有该文件4.查看preinstall.ini,g_hostname_conf字段的ip显示有误,应该是管理ip-业务ip-主机名,现场是业务ip-管理ip-主机名5.hostname -i 显示的是管理ip,正常应该是业务ip6.现场在LLD规划工具填写ip是管理ip和业务ip顺序写反,改过来后,重新生成preinstall.ini,重装成功备注:您所上传的图片不在允许的白名单范围内,请通知管理员添加白名单或者下载后通过本地上传的方式进行上传。
-
一、问题版本:811二、问题现象:oc 许可管理 dws服务许可状态连接异常三、问题排查:1.查看异常旁的?提示:请求4002.检查是否导入license文件;通过一线得知之前是导入了license文件但是hcs升级后licanse文件就没有了四、规避方法:重新导入license文件
-
问题现象: 创建集群在执行到RdsInitInstanceTask时失败问题版本: HCS 8.2.0 DWS 8.2.0问题分析: 1.登录cdk修改参数needDeleteCluster参数为false 2.发放集群,并登录节点,查看网卡情况,有bond,enp集中式,分布式网卡标识同时存在,且只有一个bond0绑定了ip 3.查看规格对应的底层规格 select c.* from rds_cluster_spec a ,rds_cluster_instance_resspec b,rds_resSpecAttr c where a.id=b.cluster_spec_id and b.instance_spec_id=c.specId and a.`code`='console界面显示的规格名'; 查询结果networkType 的值为sdi 4.确定客户网卡为集中式网卡问题根因: 在serviceOM 数据仓库服务 自定义规格时网关选择错误,应该选择集中式网卡解决方法: 删除失败的集群,删除有问题的规格,重建正确的规格,选择集中式网关,重建集群成功
-
一、版本信息:纯软800二、定位过程1.页面有ntp服务器异常告警2.查看oms状态,所有组件均正常3.检查主oms 节点防火墙,关闭状态4.ntp调试:ntpdate -d 外部始终源IP,能连通5.执行ntpq -np检查时间同步状态,外部始终源的refid状态为.INIT.6.查看ntpChecker.log、ntp.log、ha_ntp.log、ntpMonitor.log,未发现有用报错信息7.检查配置文件 /etc/ntp.conf,未发现错误8.切换主备oms,新的主oms检查时间同步状态正常;新的备oms也同步正常9.再次切换主备oms,检查主备oms节点的ntp同步情况,均正常
-
一、版本信息:HC DWS810.100二、定位过程1.一个磁盘得使用率相比其他盘高出10%,约150G2.通过du -sh *,一层层进入该盘下,找到占用磁盘高得目录为base3.进入base目录下,找到占用空间大的库目录4.分别进入正常磁盘和异常磁盘下得base下得该目录,ll *.10,个数相等,应该不是表倾斜场景5.lsof -n $data目录 |grep deleted,有许多记录,应该是文件句柄未释放导致盘使用率高6.执行clean connection to all for database xxx,一段时间后,空间下降备注:贴上图片,发布不了,将图片去掉就能发布
-
例如不小心将GBK的“场景”插入到UTF8数据中select '鍦烘櫙' as a,convert_from(convert_to(a,'GBK'),'UTF8'); a | convert_from --------+-------------- 鍦烘櫙 | 场景(1 row)convert,convert_from,convert_to函数利用好,字符集轻松转换到正确的字符集。
-
获奖名单:cid:link_7数据库是计算机软件领域的冠上明珠,它可以向下发挥硬件算力,向上支撑各类应用, 在软硬件栈中起到了承上启下的作用。自从1964年数据库概念被提出,经过 60年来的蓬勃发展,数据库已经被广泛应用到各行各业,成为了 IT 领域不可或缺的基础软件。随着云基础设施的逐渐成熟以及企业用户的需求(软硬件维护成本降低)推动,云数据库近十年也不断崛起,华为云顺应趋势,也推出了基于华为云架构的数据库系列产品GaussDB。而其中的华为云数据仓库产品GaussDB(DWS)自发布以来广受关注,该产品现已应用于全球60多个国家和地区,服务于全球1700+客户,包括工行/招行/国网/一汽/梦饷/兴盛优选等,覆盖全行业场景。为了让广大的开发者朋友们可以近距离地体验、交流华为云数仓产品GaussDB(DWS),我们特举办本次“玩转PB级数仓GaussDB(DWS)”征文活动,邀请大家分享自己在学习、使用DWS产品过程中的心得与体验,你所了解的DWS技术架构、调优妙招、维护宝典、周边工具使用经验、反馈建议等等,都可以与我们分享。同时我们准备了免费沙箱实验室,提供环境与实验指导手册,我们也期待你与我们分享产品使用心得。☞如何参与?第一步:点击下方链接,选择“免费沙箱实验”或“0.99元试用云数仓”进行体验。>>>免费沙箱实验:如何实现GaussDB(DWS)性能调优>>>0.99元试用云数仓GaussDB(DWS)试用指南见文末附件处PDF文件:第二步:在本社区发布博文,分享你的技术经验和体验心得。>>>点我发表博文注意:1、标题必须以【玩转PB级数仓GaussDB(DWS)】结尾。2、文章末尾需加上下面两句话:【一起来玩转PB级数仓GaussDB(DWS),分享你的技术经验与体验心得,赢开发者大礼包!】第19期有奖征文火热进行中!此外,在云声平台提出您的宝贵建议,标题以【云驻计划-定向征文】开头,还有机会获得额外惊喜。3、文章跟华为云产品相关,所以需要同时加上【DWS】和【云端实践】标签。· 以上奖品均为实体奖品。☞我们需要哪些主题的稿件?写与GaussDB(DWS)数据库有关的一切皆可,包括产品体验、沙箱/试用体验。如果你还不知道该怎么写,参考下面3篇往期征文内容,可以让你更快上手:GaussDB(DWS)的CPU资源隔离管控能力【这次高斯不是数学家】GaussDB(DWS)功能及配套工具丨【这次高斯不是数学家】华为云原生之数据仓库服务GaussDB(DWS)的深度使用与应用实践【这次高斯不是数学家】☞你将获得什么?我们会把收到的优质内容汇编成册,并注明原作者,积累行业口碑,开放给圈内开发者下载查阅,提供实践参考。对于贡献优质内容的作者,我们还将送出各项大礼!同时,在华为云站内外10+个技术社区进行推荐,给与百万级流量资源。优质作者更可获得长期约稿和更多内容合作机会。☞评奖规则说明华为云开发者社区、EI团队将联合评审此次征文。专家评分依据 :文章篇幅、技术含金量、排版美观度、阅读量、点赞、收藏等指标综合评分。其他说明:1、一二三等奖不能叠加。2、一二三等奖可与创作小能手奖叠加。3、征文投稿数量不计入月度激励活动文章数量。如果大家在征文中遇到有关华为云产品体验方面的问题建议,请到【云声平台】提出您的宝贵建议,标题以【云驻计划-定向征文】开头,还有机会赢取额外奖励。☞有哪些需要注意的1、文章内容需体现技术看点,图文并茂,建议字数在500字以上;2、文章要求为投稿人原创,凡转载或抄袭一经发现将取消参赛资格;3、文章须在华为云社区为首发,如华为云平台已有文章内容则视为稿件无效;4、稿件投稿后,华为云拥有该稿件的使用权、修改权等;5、因库存等原因,奖品可能会替换为等值礼品。☞问题咨询如果有任何问题,可扫描下方二维码咨询。添加微信时请备注:有奖征文+华为云博客昵称!更多GaussDB(DWS)技术干货、实践经验,点击了解详情为了更好地解决开发者遇到的问题,我们提供智能客服小D,24小时即时答疑,点击了解详情华为云GaussDB(DWS)推出了开发者认证课程,帮助开发者全面掌握数据库相关知识,点击了解详情
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第五期2026/09/04 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;蒋春阳-华为云AI开发者案例开发专家
本期直播内容: AI工具体验营 · 第5-8课连讲。Agent-Team 多智能体协作完成毕业设计实践
回顾中 -
华为云开发者AI素养ClassRoom·第六期2026/09/08 周二 19:00-20:00
樊渊-2026华为软件挑战赛冠军
高手来了:看软挑高手解析二维排样问题—从工业难题到算法突破
回顾中
热门标签