• [技术干货] DWS转义符反斜杠测试
    经过测试发现:反斜杠已经变成了普通字符,如果需要使用反斜杠转义可以在需要转义的字符串前面加上E(E就是Escape)(1)测试发现反斜杠是普通字符(2)字符串前面加上E,反斜杠变成了转义符,会转义后面的字符(3)参数 :standard_conforming_strings 说明参数说明:控制普通字符串文本('...')中是否按照SQL标准把反斜扛当普通文本。应用程序通过检查这个参数可以判断字符串文本的处理方式。建议明确使用转义字符串语法(E'...')来转义字符。参数类型:USERSET取值范围:布尔型on表示打开控制功能。off表示关闭控制功能。默认值:on总论:建议使用在需要转义的字符串前面加E的方式来明确使用转义!
  • [技术干货] DWS gsql发现的新宝藏
     在测试中发现,gsql登录时加上参数‘E’之后,执行gsql的元命令就会打印后台的实际SQL。这个很好,可以帮助理解DWS的系统视图。 gsql -d postgres -p 15108 -arE (1)查询角色及权限postgres=# \du ********* QUERY ********** SELECT r.rolname, r.rolsuper, r.rolinherit,   r.rolcreaterole, r.rolcreatedb, r.rolcanlogin,   r.rolconnlimit, r.rolvalidbegin, r.rolvaliduntil,   ARRAY(SELECT b.rolname         FROM pg_catalog.pg_auth_members m         JOIN pg_catalog.pg_roles b ON (m.roleid = b.oid)         WHERE m.member = r.oid) as memberof , r.rolreplication , r.rolauditadmin , r.rolsystemadmin , r.roluseft FROM pg_catalog.pg_roles r WHERE r.rolname !~ '^gs_role_' ORDER BY 1; (2)查询当前schema下的表postgres=# \d ********* QUERY ********** SELECT n.nspname as "Schema",   c.relname as "Name",   CASE c.relkind WHEN 'r' THEN 'table' WHEN 'v' THEN 'view' WHEN 'i' THEN 'index' WHEN 'S' THEN 'sequence' WHEN 's' THEN 'special' WHEN 'f' THEN 'foreign table' END as "Type",   pg_catalog.pg_get_userbyid(c.relowner) as "Owner",   c.reloptions as "Storage" FROM pg_catalog.pg_class c      LEFT JOIN pg_catalog.pg_namespace n ON n.oid = c.relnamespace WHERE c.relkind IN ('r','v','S','f','')       AND n.nspname <> 'pg_catalog'       AND n.nspname <> 'information_schema'       AND n.nspname !~ '^pg_toast'   AND pg_catalog.pg_table_is_visible(c.oid) ORDER BY 1,2; (3)查询当前库下所有schemapostgres=# \dn ********* QUERY ********** SELECT n.nspname AS "Name",   pg_catalog.pg_get_userbyid(n.nspowner) AS "Owner" FROM pg_catalog.pg_namespace n WHERE n.nspname !~ '^pg_' AND n.nspname <> 'information_schema' ORDER BY 1;
  • [维护宝典] GaussDB(DWS)维护日常运维常用名词&缩略语解析
    简写全称概要详解LMTLifecycle Management Team生命周期管理团队 DTRBdelivery technical review B DTRB是对DTRA从项目技术可交付性的细化,主要包含技术可行性、交付可行性和专业服务经营分析,对于影响项目规格说明书比如项目技术计划、预算和物流的都要带入DRBESNElectronic Serial Number电子序列号 SNSSW Subscription and Support软件订阅与保障年费永久license包 + 软件订阅 + 软件支持GAGeneral Availability 一般可获得性(通用可获得性)指产品包可以大批量交付给客户的时间.通常是GA 后,进入生命期的维护阶段。GA以后,转入维护部,开发和测试阶段就算完全结束了。EOMEnd of Marketing停止销售该日起停止接受订单(新建订单和扩容订单),但备件可以采购,EOM以收到LMT(lifecycle management team)停止销售确认书为准。EOPEnd of Production停止生产日供应链完成所有产品及备件最后一次生产,正式停产的日期,在该日之后,供应链将不再生产,该产品相关生产资源将释放。EOSEnd of Service and Support停止服务和支持该日起停止所有服务,客户将不能获得该软件版本的任何服务,包括服务热线电话等SLAService-Level Agreement服务等级协议 ITRIssue To Resolution问题到解决面向所有客户服务请求的端到端流程。ITR与IPD、LTC一样,是支持公司高效运营的公司级流程之一RFCRequest for Change,简称RFC变更请求包括变更准备、制定方案、方案评审、授权、变更实施等TACTechnical Assistance Center技术支持中心TAC is a department within a company that's primary purpose is networking, or an ISPGTACGlobal Technical Assistance Center全球技术支持中心 TDTechnical Director技术总负责 TLTechnical Leader技术负责人 FSEField Service Engineer现场服务工程师 RDEResearch and Develop Engineer研发工程师 RPMMResearch and Develop problem Management Manager研发问题管理经理 PSEProduct  Service Engineer产品服务工程师 CSECustomer Service Engineer客户服务工程师 ASPauthorized service partner授权服务伙伴是指通过华为CEG和渠道服务支持部联合认证的服务供应商,接受华为的外包服务订单并交付华为品牌服务给最终用户。CSPCertified Service Partner认证服务渠道伙伴是指通过华为渠道服务支持部认证的服务伙伴,可以销售并交付联合品牌的服务产品给最终用户,同时向华为购买背靠背支持服务。ISVIndependent Software Vendor独立软件提供商指提供自主产权,基于华为平台开放能力构建或运行的可复制独立软件应用产品的伙伴。DSVDelivery Service Vendor交付服务提供商指基于华为平台提供集成交付与项目型的客户化适配开发服务的伙伴。WOWork Order工作任务单主要包括客户信息、工作内容、时间要求等。IRInitial Requirement初始需求需求经理将用户需求(User Story)转换成客户能够接受的初始需求,即站在用户的角度使用精确的描述用户需求,包括需求背景、需求功能等。SRSystem Requirement系统需求有了原始需求IR后,SE根据系统整体架构,将IR拆分成SR。将IR拆分成SR的含义是,为了满足用户原始需求,系统需要具有哪些大的功能点。SR也是测试验收的粒度ARAllocation Requirement分配需求有了IR和SR分解后,针对每条SR还需要进一步做分解,以明确为了实现SR对应的功能,系统的哪些组件在什么场景下需要做哪些事,即分解成一条或多条AR。AR分解时需要充分考虑系统架构和功能场景。
  • [维护宝典] dn主备切换分析
    集群运行过程中,经常会出现dn切换得场景,对应FI界面会有集群平衡状态异常和dn主备不同步告警一般来说,原因大概以下3种一:内存不足 out of memory1.var/log/messages日志在切换时间点是否有kill关键字,若存在则说明由于max_process_memory参数设置过大,将参数修改为适当值进行观察,该参数计算方式详细见产品文档。2.dn日志关键信息 是否有 out of memory二:被cma kill         cm_agent日志($GAUSSLOG/cm/cm_agent/cm_agent-xxx.log)在实例重启时间点是否有kill关键字和phony dead等关键日志,若有,则说明dn hang或者cm_agent与cm_server连接异常,若该问题偶尔出现一次可不需做处理,若出现较为频繁联系华为工程师处理。三:进程产生core         如果已经配置操作系统core,则用对应工具解析core,查看core原因;若未配置则先配置core之后继续观察。
  • [维护宝典] CN异常重启
    问题现场:CN5001异常重启集群版本:HCS802问题分析:查看cn 5001得cma日志,发现7点11分时,cma检测cn hung时,检测5次失败,上报给cms,cms决策,kill掉该cn从cn 5001上看日志有空闲连接被杀掉的场景    3.此时cma日志中查询hang时报错interrupted system call。问题原因:本次问题由于800版本概率触发轻量级死锁,触发terminate,导致cn hang住。该问题在以下场景会低概率触发:1.大量空闲连接时间达到session_timeout的设置时长后断开会话连接2.频繁使用pg_terminate_backend或pg_cancel_backend操作终止作业解决:调大session_timeout参数值,建议调整为1个小时,降低问题触发概率
  • [维护宝典] CN异常重启
    问题现场:CN5001异常重启集群版本:HCS802问题分析:查看cn 5001得cma日志,发现7点11分时,cma检测cn hung时,检测5次失败,上报给cms,cms决策,kill掉该cn从cn 5001上看日志有空闲连接被杀掉的场景    3.此时cma日志中查询hang时报错interrupted system call。​​​​​​​问题原因:本次问题由于800版本概率触发轻量级死锁,触发terminate,导致cn hang住。该问题在以下场景会低概率触发:1.大量空闲连接时间达到session_timeout的设置时长后断开会话连接2.频繁使用pg_terminate_backend或pg_cancel_backend操作终止作业解决:调大session_timeout参数值,建议调整为1个小时,降低问题触发概率
  • [维护宝典] nodeagent未启动
    问题现象:多个节点得nodeagent未启动集群版本:线下6518问题分析:1.查看nodeagent进程,没有该进程2.手动拉起nodeagent:sh /opt/huawei/Bigdata/om-agent/nodeagent/bin/start-agent.sh;报错controllerIP is empty3.查看nodeagent运行日志,agent.log,发现日志停留在几个月前4.FI页面看到几个月前,集群有7个节点上报节点故障告警 5.查看nodeagent的配置文件:nodeagent.properties,发现该文件为空;其他6个节点查nodeagent进程均未启动,并且nodeagent.properties均为空6.从其他正常节点拷贝一个nodeagent.properties配置文件到故障节点,更改里面的IP和主机名未故障节点的7.再次启动nodeagent成功
  • [维护宝典] DN实例主备切换
    问题现象:FIM界面出现告警:集群平衡状态异常和dn主备不同步集群版本:线下80011问题分析:查看16节点的cma日志,发现dn hung住,dn实例被cma杀掉​​​​​​​查看主DN日志,主DN实际上当时未hung,日志中所有线程都收到了cancel信号​​​​​​​而cm的短连接失败错误码为Interrupted system call,怀疑是cm短连接也收到了cancel信号退出导致建连失败,从而误判了dn hung​​​​​​​产品内部不会对cm_agent hung检测线程发送cancel信号,怀疑是cm_agent hung检测线程复用了其他线程ID,而其他线程在收到cancel信号之前就已经退出,导致cm_agent hung检测线程复用线程ID后在启动阶段响应cancel信号退出。现有信息无法分析cancel信号的来源​​​​​​​​​​​问题原因:1.数据库中收到SIGINT模拟信号,cm_agent hung检测线程复用了线程ID,在启动阶段收到Cancel信号导致退出。        2.hung检测线程连续5次退出导致hung检测失败,cma将dn重启,此问题极低概率出现。
  • [维护宝典] 用户表的大小的总和 与 通过 pg_total_user_resource_info 查used_space 数据相差过大
    问题现象:用户表的大小的总和 与 通过 pg_total_user_resource_info 查used_space 数据相差过大版本信息:HCS803问题分析:统计该用户下所有表的大小,包含表空间和索引SELECT sum(pg_total_relation_size(schemaname || '.' || tablename)) from pg_tables where tableowner=’dws_adm’ ;结果为52T2.执行校准用户的空间统计函数select * from gs_wlm_readjust_user_space(0);     3.再次统计所有表的大小,结果仍为52T     4.使用pg_table_size函数统计该用户下所有表大小,结果仍为52TSELECT sum(pg_table_size(schemaname || '.' || tablename)) from pg_tables where tableowner='dws_adm' and schemaname not in ('pg_toast','cstore');     5.按照校准函数的流程,遍历pg_class,报锁冲突错误     6.怀疑第2步的校准用户的空间统计函数也是由于锁冲突导致校准失败。     7.再次执行校准用户的空间统计函数select * from gs_wlm_readjust_user_space(0);     8.使用pg_total_user_resource_info再次查询,结果为54T     9.查询该用户下所有表的表大小,减去pg_total_user_resource_info视图统计的大小,相差在17G左右,误差在正常范围内SELECT sum(pg_total_relation_size(schemaname || '.' || tablename)) from pg_tables where tableowner='dws_adm';问题原因:空间校准函数定时去校准空间统计的时候,扫描pg_class获取表信息的时候遇到了锁冲突,导致空间校准失败(虽然显示成功),多次手动的调用空间校准函数之后空间统计正常。
  • [问题求助] DWS是否支持dblink?
    DWS目前的版本是8.1.1,请问是否支持DBLINK?有哪个新版本支持吗?
  • [维护宝典] FI界面重装主机清除节点报错,安装节点提示环境未清理干净
    现象根因Manager 新版本安装整改 卸载组件脚本用户修改为omm 用户 之前版本是是root用户 组件适配里面 用了su - omm 切换用户 导致新版本卸载脚本会卡住直至超时 需要在执行重装主机前规避修改方案: 以omm用户修改 ${BIGDATA_HOME}/FusionInsight_MPPDB_*/install/FusionInsight-MPPDB-8.1.3/adapter/setup/nodeagent/uninstall_adapter.sh,删除 su - omm -c
  • [技术干货] 祝贺!国内首个大规模金融云数仓全面上线
    近日招商银行正式完成向华为云GaussDB(DWS)的全部迁移,成功建立了国内首个大规模金融云数仓,有效支撑了“人人用数”大数据发展战略落地。在此次迁移中招商银行实现了数据仓库云化升级,同时全面提升数据仓库平台容量和处理能力,为充分释放数据资产价值、扎实赋能业务打下坚实的基础,进一步夯实数字化转型底座。招商银行数据仓库平台主要应用于批量数据加工处理、数据实验室探索及交互式自助分析等场景。随着招商银行数字化转型的快速推进,数据采集处理规模大幅增长,逐步呈现“人人用数,人人都是数据分析师”的数据应用模式,对数据平台容量、算力、稳定性及可用性等提出更高要求。传统数据仓库一体机技术方案存在诸多问题,已不能满足快速、平滑的扩容需求。在此背景下,招商银行经过多轮测试和考量,最终采用华为云GaussDB(DWS)统一架构,并同华为成立联合创新实验室,共同构建具有招商银行特色的数据仓库平台。招商银行数据仓库的数据量规模达到PB级别,单一平台进行如此巨大规模的数据和程序迁移,在金融行业非常少见。项目组充分论证迁移方案,制定了基础数据模型先迁,分批次迁移应用集市的总体策略,最终圆满完成云数仓迁移工作。迁移完成后,招商银行业务用户享受到了更轻盈的用数体验: 查询速度快人一步批量数据处理完成进度整体提前2小时以上,业务用户查询时长缩短75%,数据仓库服务效能显著提升。  用数不间断,人人都是VIP集群扩容停机时长由12-24小时降至2-4小时,停机追批时长由1-2天降至业务零感知,平台运维能力大幅提升,用户随时取数用数,不再受维护和跑批的影响。  数据丝滑迁移,替换无感  在新旧数仓替换过程中的并行期,实现1分钟内完成重要数据在新旧平台中的数据核对,让用户对替换过程无感知。  强大的平台性能 是数字化转型不断深入的底气。为此,突破封闭技术路线,引入灵活扩展架构,是新一代数据仓库提升平台性能的必然选择。  依托云原生特性,扩展灵活从容 从技术选型出发,华为云GaussDB(DWS)打破原有一体机架构封闭的技术路线,基于华为云Stack底座构建开放型技术架构,支持资源弹性管理和按需扩展。 在线扩容的重分布速度由20TB/h提速至65TB/小时,在线备份速度由37TB/h提速至150TB/小时,缩短平台操作时间窗口,业务快速享用平台扩展后的更高算力。  分布式优化技术,增强系统性能 充分利用多核计算资源,采用多层级、全并行的分布式架构,运用查询重写、计划生成、倾斜处理等多项核心技术,全面提升集群处理性能,实现高并发交互式查询秒级响应,并支撑业务上千并发联机查询。  分析与计算集群分离,降低负载冲突 根据业务发展需要,项目组将原计算集群拓展为零售集群和批发中后台集群,并为业务用数建设专属分析集群,在扩展算力的同时实现业务分析与计算分离。  华为云GaussDB(DWS)为分析师提供7×24小时随需随用的数据服务,无需等待批量处理负载降低,延长数据服务时长。招商银行云数仓全面上线标志着其数据仓库平台能力上升到一个新台阶,同时也为金融行业数据仓库迁移提供了实践借鉴。面向未来,华为云GaussDB(DWS)将继续探索金融应用场景,全面推广数据工具平台,持续优化平台性能和体验,为打通企业数字化转型最后一公里提供坚实的平台保障。
  • [技术干货] 华为助力交通银行荣膺《亚洲银行家》最佳大数据应用奖
    【中国,北京,2022年8月25日】今日,国际权威财经杂志《亚洲银行家》在2022中国未来金融峰会上揭晓了“2022年度金融技术创新奖”评选结果。交通银行基于华为云FusionInsight智能数据湖建设的“湖仓一体的数据中台实践”荣获“最佳大数据应用”奖。近年来,随着交通银行业务体量的快速增长,业务品种的不断丰富,业务流程日趋多元化、便捷化和智能化,数据的产生和应用无论在体量还是复杂度方面都超过以往任何时期。交通银行数据中台选用华为云FusionInsight MRS云原生数据湖和华为云GaussDB(DWS)数据仓库,建设湖仓一体的智能数据湖。基于GaussDB(DWS)分布式数据仓库,交通银行全面提升数据访问能力,减少用数成本,提高用数效率,提升用数质量,建立全行更高质量标准的统一信息视图,打造全面完整的数据分析体系,为业务的经营决策提供全面的支持,最大化地实现数据价值。基于FusionInsight MRS的实时数据湖能力,交通银行拓展了实时采集、实时计算、批流融合等新的技术能力,构筑了从采集、计算、分析、再到消费的实时数据流,全面支撑各类实时和准实时业务场景。交通银行智能数据湖建设完成后,在各个领域实现了质的飞跃:营销场景基于用户交易交互行为建立用户画像,客户转化率较之前大幅提升164%。风控场景通过实时分析用户行为特征,实时识别欺诈行为,风险案件降低52%。运营场景实现了银行业务实时报表查询和分析,快速支撑业务决策。客户关系管理场景建立客户流失预警模型,对流失客户及时跟踪和维护。交通银行携手华为重构大数据基础平台,以立而不破的理念,提升海量数据服务的时效性,在营销、风险、监管、运营等多个领域提供数据服务,同时实现数据治理监控集中化、管理流程化、数据资产全景视图化,逐步推进“业务数字化,数据业务化”,加速建设数字化新交行。截至目前,华为已服务于全球60多个国家和地区的2000多个金融客户,包括全球Top100银行中的49家。华为云FusionInsight广泛应用于银行、证券、保险等金融用户的核心数据分析平台,与金融用户共同探索和推进数智融合平台建设。面向未来,华为将持续创新,为客户提供高价值数据分析能力,让金融科技创新驱动数据价值最大化。
  • [其他] 【管控面】HCS 802 是通过底层绑定的ELB,现升级到810。有界面可以绑定,但是以前绑定的ELB在页面看不到
    【问题现象】 HCS 802 是通过底层绑定的ELB,现在升级到810。有界面可以绑定,但是以前绑定的ELB在页面看不到【问题根因】 升级前手动绑的,升级后查不到,说明是有的表没有数据【规避措施】通过sql在mysql库把绑定ELB插入,具体语句就是:insert into express_resource (id, clusterId, elbName, elbId, elbVersion, listenerName, listenerId, poolName, poolId, healthName, healthId, elb_vip_port_id, expUser, expUserPwd, silent) values ('bac44636-f9bd-4a42-a00e-c2e0151d8cce', '1','1','1','1','1','1','1','1','1','1','1','1','1',1); insert into rds_port_relation (id, instanceId, vip, portType, sgId) values ('7365d78f-a717-4969-9ce9-4cda2deb0eac', '', '', 'elb', '');【定位过程】         1.从升级前的方案可知,在配ELB时,未存表           2.现通过sql在mysql库把绑定ELB插入
  • [维护宝典] GDS 报错connection timed out
    【问题现象】业务侧在测试gds高并发的性能的时候,有作业报错,报connection timed out,业务都是gaussdb数据库中往gds服务迁移数据【问题分析】1、咨询相关业务情况得知,客户在测试环境测试gds的并发性能情况,使用了三台gds服务器,70并发的去执行作业,从gaussdb数据库往gds服务器迁移数据。作业执行初       期有大量的业务报网络断连的报错,之后在并发作业还剩到27个作业的时候,开始有作业成功,之后的作业也都成功。2、查看相关gds的案例 cid:link_13、排查相关的gds服务器的网络参数设置之后,都设置成推荐的值4、之后在使用gsar.sh脚本排查网络重传情况时,发现gds服务器和gaussdb的网络的重传非常的高。     所以初步分析是网络重传导致的网络断连5、初步做了个实验,将tcp的参数net.ipv4.tcp_retries2由之前的12,变成了120,查看修改前后,作业的执行成功个数情况。     该参数的介绍可查看此链接 cid:link_0该参数是增加tcp发生重传的时候,重传多少次之后断连,理论上增加tcp断连之前的重传次数会减少tcp断连的几率,增加作业执行成功的概率。也同时会造成网络的拥堵,导致重传率会进一步增加。通过对比实验发现,修改前,gds的服务能支持27并发跑作业不报错,修改之后变成了54,成功的作业数量增加。gsar.sh脚本监控的重传率也由之前的个数的百分比,变成了40%多,重传非常的高。这个时候的网络速率峰值在170MB/s 左右。该实验也初步证实了作业的网络断连是由于网络重传高导致的。查看两端服务器的网卡都是万兆的网卡。我们又做了个实验,在不跑业务的情况下,gds服务器和gaussdb服务器之间传输一个1G大小的文件,想查看这两个服务器之间的传输速度。基本最大就到了170MB/s, 实际速度没有达到万兆网络。【问题根因】1、根据实验对比情况,基本确定是因为网络重传高导致的tcp网络断连,网络断连导致的任务执行失败。2、gds的实践指南里边有网络的要求,最好是万兆的网络,不然会造成网络的断连,目前现场看虽然都是万兆的网卡,但是实际的传输速度没有达到万兆网络的要求,有可能gds服务器和gaussdb服务器不在一个网段造成的,需要网络侧排查网络情况。【解决方案】gaussdb软件这块定位是网络原因造成的,解决方案就是解决重传高的问题,重传高的问题解决了,任务执行失败自然就没有了。
总条数:2746 到第 页
上滑加载中