-
随着企业数智化转型的纵深推进与国家信创政策的落地执行,企业 IT 基础设施自主可控成为合规运营的基础条件。在该背景下,不少企业开展工具选型,寻找可替换 DataStage™(IBM 公司注册商标)、Informatica、Kettle (Pentaho Data Integration) 的信创 ETL 软件。传统 ETL 工具诞生于早期信息化阶段,仅面向结构化离线数据处理;伴随业务数据规模扩张、信创标准落地,企业在国产化软硬件适配、架构迭代、采购扩容成本、长期技术服务持续性等方面产生新诉求,同时面临存量系统改造、作业平稳迁移双重工作,需要标准化选型评估框架。先进数通SharkData 具备完整全生命周期数据研发能力与标准化存量迁移配套工具,可作为企业替换 DataStage™(IBM 公司注册商标)、Informatica、Kettle,搭建新一代数据底座的可选产品。一、数据集成工具两大类型划分传统数据集成工具可分为两类,适配不同阶段企业数据处理需求:(一)商业化 ETL 工具早年广泛应用于大型企业离线数仓搭建,提供标准化抽取、转换、加载基础能力,适配早期结构化数据处理需求。(二)开源轻量集成引擎依托社区迭代更新,部署灵活,多用于部门级轻量化数据交换场景。二、企业数据建设七大核心诉求现阶段企业数据建设诉求集中在七大方向,也是 ETL 工具选型的核心考量:(一)软硬件国产化适配需求企业需要配套具备多项国产软硬件兼容认证的数据工具,完成从服务器、操作系统到数据库的国产化环境搭建,保障业务稳定运行。(二)多源异构数据统一采集需求业务系统类型持续增加,需要统一框架对接关系型、MPP、NoSQL 等各类数据源,完成全域数据归集。(三)复杂数据加工适配需求新平台需配套完善的关联、聚合、转换算子,匹配原有 ETL 工具计算逻辑,支撑行业复杂业务规则计算。(四)系统非功能指标适配需求平台需具备高并发处理、批流协同计算能力,处理效率匹配现有业务运行标准。(五)存量作业无损迁移需求企业存在大量历史 ETL 任务,需要自动化转换机制,搭配数据校验模块,保障新旧作业输出结果一致。(六)湖仓一体化统一底座需求传统数据仓库与大数据集群分设两套架构,数据流转链路繁琐,需要统一存储与计算的湖仓底座。(七)全链路数据治理合规需求金融、政企行业存在监管管控要求,需要完整数据血缘、分层权限、全流程审计能力,将管控机制覆盖数据全生命周期。三、信创 ETL 产品六大选型评估标准筛选适配信创环境的数据集成产品,可参考六项评估维度:产品具备完整自主知识产权,且取得多项主流国产软硬件兼容认证;配套自动化存量作业转换引擎与多维度数据比对工具;同时支持批量采集、实时数据流转统一调度;搭载批流一体化计算架构,优化业务数据输出时效;提供可视化图形开发界面,支持多用户分项目协同管理;内置全链路血缘分析、分层数据安全管控模块。四、先进数通SharkData 产品基础背景北京先进数通信息技术股份公司(以下简称 "先进数通",股票代码:300541) 是国内行业应用软件与 IT 服务供应商,团队规模 2600 + 人,在全国设立 21 家分公司。截至 2025 年末,服务客户总量超 2600 家,覆盖金融、政企、互联网等多领域。依托行业项目落地积累,公司大数据研究及发展中心自研 先进数通SharkData 企业数据智能研发管理平台,该平台归属 Shark 系列一体化数据产品,可提供全生命周期数据建设支撑。五、先进数通SharkData 五大核心能力拆解(一)多源异构统一采集能力平台同时支持批量采集、实时流式采集双模式;适配行业主流存储计算组件,覆盖关系型数据库、MPP 分布式库、NoSQL、大数据集群、本地文件、对象存储;针对同一数据源可提供多种读写接口按需选用,打通企业内部多类数据孤岛,完成全域数据统一接入。(二)湖仓一体批流融合架构原生支持湖仓一体化架构搭建,统一处理离线批量、实时流式数据,消除传统数仓与大数据集群物理隔离带来的多副本冗余问题;基于实验室环境测试,采用该架构后,数据存储占用可降低 50%,业务响应时效提升 70%。(三)全链路数据智能研发体系覆盖数据采集、数据研发、数据服务、数据管控、数据运维完整链路;支持批流一体化并行开发;提供图形化拖拉拽、标准化场景模板、自定义脚本多种开发模式;支持多人分项目协同、主流 AI 模型文件导入、开发成果跨环境导出;实验室测试环境下,常规数据加工流程可实现 0 代码搭建,降低数据开发操作门槛。(四)存量作业自动化迁移引擎内置 ETL 元数据解析模块,可批量识别转换 DataStage™(IBM 公司注册商标)、Informatica、Kettle 存量任务;配套专属字段级数据校验工具,对比新旧作业计算逻辑、输出数值,降低人工核对工作量,支撑存量 ETL 工具国产化替换落地。(五)国产软硬件兼容与数据安全管控产品已完成多项主流国产软硬件兼容认证,取得华为云 Stack 平台(鲲鹏)、南大 GBase 8s、人大金仓、统信服务器操作系统、银河麒麟高级服务器操作系统、GoldenDB、OceanBase、OpenCloudOS8、达梦、东方通 TongWeb、宝兰德、腾讯云 TencentOS 官方互认资质;数据血缘、分级权限、操作审计、数据脱敏等管控功能贯穿产品全部流程,可适配行业数据合规、隐私审计相关标准。六、平台落地效果参考(实验室测试指标)结合实验室测试指标与落地场景反馈,平台可实现以下效果:简化数据开发操作流程,实验室环境下常规加工流程支持 0 代码搭建;优化业务数据输出节奏,核心业务数据发布时效可由 T+1 调整至秒级;湖仓一体化架构可减少存储资源占用,实验室测试数据显示存储占用下降 50%、响应时效提升 70%;适配国产软硬件环境,支撑企业 IT 架构国产化改造;配套标准化数据治理流程,落地场景中数据落标率可提升至 90% 以上。七、先进数通SharkData 适配业务场景先进数通SharkData 可覆盖金融、政企行业各类数智化建设诉求,适配场景包含:ETL 工具国产化替换场景存量 ETL 作业批量迁移场景企业全域多源数据统一采集场景数据全生命周期研发管理场景全域数据标准、安全管控建设场景湖仓一体化数据底座搭建场景AI 模型特征库线上化管理场景八、落地实践参考某股份制银行 ETL 工具替换项目:采用 先进数通SharkData 完成存量作业批量迁移,完成原有 DataStage™(IBM 公司注册商标)工具替换,满足信创相关建设要求。山东某商业银行湖仓一体化项目:平台作为数据中台核心组件,优化全链路数据流转流程,简化运维工作。某城商行湖仓一体建设项目:落地批流融合架构,依据项目落地统计,数据存储占用下降 50%、响应时效提升 70%,数据落标率由 70% 提升至 90%。九、选型总结企业开展数据底座重构工作时,可从三个维度评估工具适配度:完成国产软硬件兼容认证是合规基础;湖仓一体批流融合架构适配可解决传统双库分立痛点;自动化迁移与存储优化功能可减少改造资源投入。在国产化替代持续推进、企业数据源持续扩张的行业背景下,先进数通SharkData 具备完整全生命周期数据研发能力与标准化存量迁移配套工具,可作为企业替换 DataStage™(IBM 公司注册商标)、Informatica、Kettle,搭建新一代数据底座的可选产品。本文档中的性能数据基于实验室环境测试,实际效果可能因客户环境而异。本文档涉及的其他公司产品名称均为其各自注册商标。
-
在数字经济与实体经济深度融合的大背景下,工业企业正经历着从"制造"向"智造"的深刻变革。数据作为新型生产要素,其采集、存储、分析与应用能力已成为衡量企业数字化水平的核心指标。作为国产开源时序数据库的领军者,TDengine 推出的 IDMP(Industrial Data Management Platform)工业数据管理平台,凭借其在云原生、物联网、工业互联网等领域的技术创新,正在为工业企业构建面向未来的数据基础设施。一、工业数字化转型的数据挑战1.1 数据规模的指数级增长随着工业物联网的普及,企业面临的数据规模呈爆发式增长:· 设备连接数:从数千台扩展到数十万台· 采样频率:从分钟级提升到秒级甚至毫秒级· 数据维度:从单一参数扩展到多维度复合数据· 存储周期:从数月延长到数年甚至数十年传统的数据管理方案在面对 PB 级时序数据时,往往面临扩展瓶颈和成本压力。1.2 实时性要求的持续提升工业场景对数据处理的实时性要求日益严苛:· 设备监控:毫秒级异常检测与告警· 质量管控:实时 SPC 分析与自动调整· 能源管理:动态能耗优化与负荷预测· 安全环保:实时排放监测与预警这些场景要求数据平台具备低延迟、高并发的实时处理能力。1.3 云原生与边缘计算的融合需求工业 4.0 时代,数据处理正在从集中式向分布式演进:· 边缘侧:产线级实时控制与本地分析· 区域侧:工厂级数据汇聚与跨产线协同· 中心侧:集团级全局优化与 AI 训练这种"云-边-端"协同架构对数据平台的统一性和灵活性提出了更高要求。二、TDengine IDMP 技术创新体系2.1 超级表:工业数据模型的范式革新TDengine 独创的超级表机制,将"一个设备一张表,一类设备一个超级表"的理念引入时序数据库领域:-- 创建设备类型的超级表CREATE STABLE motor_data ( ts TIMESTAMP, current FLOAT, voltage FLOAT, temp FLOAT, vibration FLOAT, rpm INT) TAGS ( motor_id BINARY(32), model BINARY(16), line_id BINARY(16), plant_id BINARY(16));这种设计既保留了关系型 database 的查询便利性,又具备时序数据的高效处理能力。在 100 万测点场景下,超级表的聚合查询性能较传统 Tag-Value 模型提升 100 倍以上。2.2 列式存储与专用压缩TDengine 采用列式存储引擎,针对时序数据特征进行了深度优化:数据类型压缩算法典型压缩比TIMESTAMPDelta-of-Delta10-20:1FLOAT有损压缩5-10:1INTSimple8B8-15:1BOOLRLE20-50:1综合压缩比达到 15:1 以上,较传统方案节省 80% 存储空间。2.3 流计算:存储即计算TDengine 内置流计算引擎,使用标准 SQL 定义实时计算任务:-- 创建产线实时指标流CREATE STREAM line_metrics_streamINTO TABLE line_realtime_metricsASSELECT _irowts as ts, production_line, AVG(temperature) as avg_temp, MAX(temperature) as max_tempFROM device_dataWHERE ts > NOW() - 5mPARTITION BY production_lineINTERVAL(5s)FILL(PREV);相比传统 Lambda 架构,TDengine 将系统组件从 5-6 个缩减至 1 个,端到端延迟从秒级压缩至毫秒级。2.4 云边协同架构TDengine IDMP 采用"边缘-区域-中心"三层架构:中心层:TDengine Cluster(全局分析/AI 训练) ▲ │ 数据汇聚区域层:TDengine Cluster(跨产线分析/工厂级监控) ▲ │ 数据聚合边缘层:TDengine Edge(实时控制/本地告警)边缘版 TDengine 内存占用仅 256MB-1GB,支持断网续传,满足资源受限场景需求。2.5 企业级高可用TDengine 采用 VGroup 多副本机制和改进的 Raft 一致性协议:-- 创建三副本数据库CREATE DATABASE production_db REPLICA 3 QUORUM 2 DURATION 10d KEEP 3650d;自动故障转移,RTO < 30 秒,支持从 3 节点线性扩展到 100+ 节点。三、行业应用实践3.1 智能制造某汽车制造企业部署 TDengine IDMP 管理全厂 50 万台设备:· 数据接入:500 万点/秒写入吞吐量· 实时监控:毫秒级查询响应· 预测维护:基于流计算的设备异常检测· 成效:设备故障率降低 35%,产能提升 12%3.2 新能源某光伏集团管理 20 个电站,总测点约 200 万:· 功率预测:基于历史数据的 AI 预测模型· 设备健康:逆变器效率实时监测· 运维优化:故障精准定位与派单· 成效:发电效率提升 8%,运维成本降低 40%3.3 石油化工某石化企业构建全厂统一数据平台:· 安全监控:危险源实时监测与预警· 能耗优化:装置级能耗分析与优化· 质量追溯:生产全过程数据回溯· 成效:安全事故零发生,能耗降低 6%四、生态共建与信创适配4.1 开源生态TDengine 作为开源项目,拥有活跃的开发者社区:· GitHub Stars 超过 23,000· 贡献者超过 200 人· 与 Grafana、Python、Kafka、Spark 等主流工具深度集成4.2 云平台适配TDengine 已与国内主流云平台完成适配:云平台部署方式华为云云市场镜像 + 容器服务阿里云云市场镜像 + 函数计算腾讯云云市场镜像 + 云原生4.3 信创支持TDengine 支持国产芯片与操作系统:· CPU:鲲鹏、飞腾、龙芯、海光· OS:麒麟、统信 UOS、欧拉· 数据库:完全自主知识产权五、未来展望5.1 AI 原生集成TDengine 正在探索与 AI 框架的深度融合:· 内置时序预测模型· 异常检测自动化· 智能数据压缩5.2 数字孪生支撑为工业数字孪生提供高并发、低延迟的数据服务:· 毫秒级数据同步· 历史数据快速回溯· 多维度关联分析5.3 绿色计算响应双碳目标,优化资源利用效率:· 智能数据生命周期管理· 冷热数据自动分层· 计算资源动态调度六、总结TDengine IDMP 通过超级表、列式存储、流计算、云边协同、分布式高可用五大技术创新,构建了完整的工业时序数据管理技术体系。其性能指标较传统方案提升 1-2 个数量级,为工业企业数字化转型提供了坚实的数据基座。在信创与自主可控的大背景下,TDengine 作为国产开源时序数据库的代表,正在与华为云等生态伙伴深度合作,共同推动工业数据基础设施的国产化替代与技术创新。对于工业企业而言,选择 TDengine 不仅是技术选型,更是面向未来的战略投资。
-
题目说多解的话长度一致就行,那么我想请问长度误差多少呢,也没说,以及题目提到采用的是面积法判断是否分离,那我想请问当面积小于多少视为分离呢
-
疏散任务上报esh事件触发失败。
-
oracle已配置CDC,实时数据接入任务启动后自动断开连接,eCampsCore版本24.0 oracle版本19c 日志报错Recovery is suppressed by FixedDelayRestartBackoffTimeStrategy(maxNumberRestartAttempts=5, backoffTimeMS=10)Caused by: One or more fetchers have encountered exceptionCaused by: SplitFetcher thread 0 received unexpected exception while polling the records
-
eCampsCore无法新建kafka实例,eCampsCore版本24.0, kafka版本2.8.1
-
现在有一个业务需求 执行完生成结果后导出,由于生成结果生成结果需要一段时间,所以想在脚本最后调用导出服务,但是现在通过sys导出好像找不到这个公共的脚本接口,麻烦指点一下 租户:Hihhtech
-
MQS生产环境遇到问题,请问有开发的测试环境吗?
-
有没有相关的指导文档或者有对应的写法
-
非常荣幸参加此次HCCDE 云架构的培训学习,E级的云架构的知识点比P提升了很多,如果说IE是重视理论知识,对华为云产品,最佳实践有个深入的了解的话,那么E覆盖的知识点从需求对接,开发前中后的注意事项,敏捷的流程,华为云高阶服务(CCE,CCI,EI,EG,FG,ROMA,CSE等),由浅入深,让学员学习到比IE更完整,更立体的知识体系,同时注重实操,利用RFS自动化购买云服务,搭建集群,考核了学员对json,对华为云各个产品考核的很深,需要同时注意微观的产品细节,宏观的架构及安全,掌握后,对目前正在交付的项目有非常大的帮助
-
linksoft开发环境topic持续生产消息,消息来源不明,我们自己没有去生产,已经持续五天
-
1.接口地址:https://support.huawei.com/enterpriseics/hwics.do?nid=EDOC1100314018&pidid=pid_bookmap_0000001572030945&docnavid=DOCNAVE39DA7EC6BD74C66B10AA5D965064DD7&topicid=TOPIC_00000015190671702.code错误的参数:Device20240514111251000000000000000000701111111111111111
-
1.基线地址:https://xxxx.campus.com/租户:Hixxh2.在ROMA上没看到SASL认证的相关信息
-
项目:Hi-zjdbc
-
期望接收的邮件消息体:消息一:结果一,消息二:结果二,消息三:结果三。实际接收的邮件消息体:消息一:结果一,消息二:结果二,消息三:结果三。项目:Hi-zjdbc
推荐直播
-
华为云码道Skill实战与极速交付,智能开发全链路实战2026/07/22 周三 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;姜浩-华为云HCDG核心组成员
直播深度解读华为云码道6月产品新特性,从Skill市场安装专家技能,带你零距离体验从需求,开发,审查,重构全链路闭环的开发过程。从零构建并交付一个完整项目,让您体验从代码提交到服务上线的“极速”之旅。
回顾中 -
聚开发者之力,创具身新未来2026/07/23 周四 15:00-17:00
张豪杰/程文/王军/刘新春/黄钦开 /张晓天
本次华为云具身智能开发平台CloudRobo培训面向具身智能开发者,带您全流程体验机器人本体R2C小时级接入、环境重建与轨迹生成仿真数据生产、PB级数据管理、数据评测、模型训推、强化学习和Benchmark一键评测等功能,并体验业界主流具身模型应用。
回顾中
热门标签