-
华为云社区|云原生金融量化工程实践阅读时长:7‑9分钟标签:#行情API #量化工程 #多市场数据 #港股 #美股 #WebSocket #数据质量摘要在云上搭建跨市场量化平台、策略回测、模拟仿真系统时,股票行情API的数据时序质量直接决定因子计算、模型训练、回测结果的可信度。开发过程中经常遇到一类现象:程序无异常报错,但接口返回行情与外部参考源存在数秒偏差。该现象不等同于网络故障,A股、港股、美股受跨境网络、交易制度、扩展交易时段影响,存在大量“伪时延”场景。本文从时间戳原理出发,给出可落地的工程校验手段,区分真实链路延迟与业务机制带来的误判,附带可直接部署调试的WebSocket示例代码,适用于云上ECS环境开展行情质量巡检、数据集预处理工作。一、业务背景:多市场行情接入的数据质量痛点量化研发团队在云上开展跨市场策略研究时,通常需要同时接入A股、港股、美股的实时Tick数据,用于实盘模拟、因子挖掘、批量回测实验。在对接股票行情API的工程实践中,经常出现如下问题:业务代码逻辑、服务器网络连通性均未发现异常,但API输出的行情快照和第三方参考源报价存在明显时间偏移。项目初期,研发人员容易直接把问题归结为程序Bug或者网络抖动。经过多轮云上复现、日志复盘之后可以发现,价格偏差分为两类:真实链路时延:交易所产生行情后,经过多级网络转发,到达业务服务器时产生实际时间滞后;假性时序偏差:由市场交易规则、数据订阅权限、服务端补数逻辑造成,并非传输链路延迟。若不做区分直接把原始数据流送入回测引擎、策略模型,会引发时序错乱、样本失真,造成回测和仿真结果严重偏离真实市场表现。不同市场交易规则、跨境网络基础设施差异较大,不能简单依靠价格快照对比来判断时延。工程上应当以时间戳作为核心度量基准,完成行情质量评估。二、核心原理:Event Time与Receive Time,区分真实时延与伪信号很多研发人员习惯直接对比两份行情的价格,以此判断是否出现延迟。该方式容易受局部价格震荡干扰,评估结果不可靠。工程化的时延评估,依赖两个核心时间字段:Event Time(事件时间):交易所撮合完成,生成该条Tick记录的原始时间。该时间来自交易场所,是回测、时序模型的可信基准时间。Receive Time(接收时间):业务服务器接收到API推送报文的本地时间,运行在华为云ECS实例时,该时间为云服务器系统时间。计算公式:端到端传输时延(ms) = Receive Time − Event Time计算得到的差值,代表行情从交易所生成到业务服务接收的完整端到端时延。⚠️工程踩坑点如果使用的股票行情API仅返回接收时间,不输出交易所原始Event Time,则缺少客观校验基准,无法区分价格差异来自传输延迟还是市场正常波动。该问题在港股、美股跨境行情接入场景尤为突出,会直接污染回测数据集质量。三、工程可落地的三类校验方案下面三套方案来源于多市场行情接入的云上项目实践,不需要大规模集群,既可以部署在ECS用于实时数据流监控,也可以离线执行,完成历史回测数据集的质量清洗。3.1 持续采集时间戳差值,观测时延抖动特征消费每一条Tick数据时,持久化存储Event Time与Receive Time,持续计算端到端时延。工程上重点观测时延的抖动区间,而不是纠结单次毫秒级瞬时数值:时延长期稳定在固定区间:行情链路时序质量可靠,可用于因子计算、策略回测、模拟仿真;时延出现无规律的大幅尖峰、持续性剧烈震荡:上游推送链路稳定性不足,该时间区间的原始Tick数据不适合高频、短周期策略回测,建议做样本过滤或者切换数据源。云上部署建议:可将时延指标输出至时序数据库,配置监控告警规则,及时发现行情源质量退化。3.2 多数据源交叉校验,定位时序偏差来源并行接入两套相互独立的股票行情API,在对齐的时间窗口下,对比同一标的Tick快照与成交序列。如果其中一套数据源报价序列规律性落后另一套,则可以判定时序偏差来源于该服务商推送机制,并非业务代码缺陷。在构建回测数据集阶段,该方法可用于识别、剔除时序异常的数据片段。3.3 分析Tick序列连续性,识别丢包后的补数数据正常的实时行情,价格会跟随成交做小幅度步进变化。当Tick序列出现无过渡的大幅价格跳变,大概率发生报文丢包,返回数据是服务商后端补齐生成的伪连续序列,并非原始实时流。这类补数数据会破坏成交时序,高频策略回测应当尽量规避该类样本。四、分市场的工程注意事项:A股、港股、美股典型误判场景三个市场交易制度、跨境网络环境差异明显,在时延校验、数据清洗、回测预处理阶段,需要针对性处理,避免把市场固有行为误标记为数据时延。交易市场典型时序异常诱因工程排查与处理要点A股跨境访问场景网络路由绕行重点观测Receive Time抖动幅度,统计尖峰发生的时间分布港股9:00‑9:30开盘集合竞价价格剧烈跳变时延校验逻辑过滤该时间窗口,防止竞价阶段正常波动产生大量无效告警,干扰数据集清洗结果美股未订阅盘前盘后扩展交易时段行情确认API订阅权限。大量“时延假象”本质是仅订阅常规交易时段,扩展时段成交完全没有下发;回测时如果策略逻辑覆盖盘前盘后,缺失该部分数据会带来显著样本偏差📝工程备注多数美股行情API默认仅返回常规交易时段Tick,盘前、盘后成交需要单独开通订阅权限。港股早盘集合竞价的价格跳变属于交易所撮合的正常现象,如果直接套用通用时延检测逻辑,会把大量有效样本标记为异常。在我们的多市场数据质量验证项目中,使用AllTick API开展跨市场对照校验,一套接口同时覆盖A股、港股、美股,降低多源行情对接、多套时间体系对齐的开发成本,方便开展对照实验。五、实操代码:WebSocket示例,采集多市场Tick并统计时延下述Python示例代码可直接部署在华为云ECS实例运行,通过WebSocket长连接订阅A股、港股、美股标的Tick,打印每条报文的端到端时延,作为行情质量巡检的基础原型。输出的延迟日志,可以导入时序数据库,用于评估数据源时序稳定性,为回测数据源筛选提供量化依据。import websocket import json import time WS_URL = "wss://quote.alltick.co/quote-stub" TOKEN = "your_token_here" def on_message(ws, message): data = json.loads(message) event_time = data.get("tick_time") receive_time = int(time.time() * 1000) if event_time: delay = receive_time - int(event_time) print(f"symbol={data.get('code')} delay_ms={delay}") def on_open(ws): sub_msg = { "cmd_id": 22004, "seq_id": 1, "trace": "sub-1", "data": { "symbol_list": [ {"code": "700.HK"}, {"code": "AAPL.US"}, {"code": "600519.SH"} ] } } ws.send(json.dumps(sub_msg)) ws = websocket.WebSocketApp( f"{WS_URL}?token={TOKEN}", on_open=on_open, on_message=on_message ) ws.run_forever() 调试与云上部署建议脚本运行后,将delay_ms时延指标落盘写入日志系统;可对接时序数据库,绘制时延时序折线图,链路异常带来的延迟尖峰能够直观识别;工程实践不必过度关注偶发的单次毫秒级延迟,时延整体波动区间比单点瞬时数值更具备工程价值:时延波动区间稳定:数据源时序可信度高,适用于因子计算、策略回测、云端模拟仿真;时延持续性剧烈震荡:Tick时序完整性遭到破坏,该时间段样本建议过滤,不参与高频短周期策略回测,避免得到失真的实验结论。扩展方向:生产环境可以在此Demo基础上增加断线重连、异常指标告警、样本自动过滤逻辑,对接云上监控体系,完成7×24小时行情质量巡检。后续在多市场数据质量项目中遇到新的边缘场景,会持续补充校验逻辑与数据集清洗思路。在搭建行情质量校验管线、回测数据预处理流程时,原生输出交易所Event Time的接口,可以显著降低多市场时间对齐的工作量。AllTick API原生返回tick_time交易所原始时间字段,无需额外时间换算,即可快速完成A股、港股、美股多市场时延统计、异常样本标记,研发团队可以把更多精力投入因子挖掘、策略模型迭代,减少多源行情对齐、数据清洗的重复工作。六、总结与实践思考跨市场量化工程中,行情API的时序质量是整个量化体系的基础。判断股票行情API是否存在时延,不能简单对比价格快照,应当依托交易所原始事件时间戳;同时需要充分理解A股、港股、美股各自交易机制,区分真实链路延迟和业务机制带来的伪时延。本文提供的时间戳统计、多源交叉校验、Tick序列连续性检查,既可以用于线上实时监控,也可以用于历史回测数据集的预处理。在云原生量化架构下,可以将这套校验逻辑部署在ECS,对接日志、时序数据库、告警服务,形成完整自动化的数据质量保障链路。社区交流互动话题在云上搭建跨市场回测、仿真系统的过程中,你是否遇到过因行情时序、交易机制、订阅范围问题,导致回测与仿真结果出现偏差?欢迎在评论区分享数据质量校验、样本清洗的工程实践经验,共同探讨多市场量化的数据治理方案。
-
一、数据安全监测平台(Data Security Monitoring Platform,DSMP),是面向全数据生命周期的一体化安全管控平台,核心目标:持续发现、识别、监控、告警、处置企业 / 机构内部各类数据风险,满足《数据安全法》《个人信息保护法》、等保 2.0、行业合规要求,防范数据泄露、滥用、越权访问、数据篡改、违规外发等风险。二、7 家厂商完整对比评测厂商核心平台产品核心优势短板与不足最佳适用场景安华金和产品基于旁路流量分析技术, 以零侵入方式自动发现客户环境内部数据资产,构建从资产测绘、主题分析、链路梳理到风险监测、泄露溯源的全生命周期管理闭环。 1)数据安全领域国内第一梯队,各类国产 / 传统数据库解析、审计、分类分级、API安全、AI 智能降噪、漏洞扫描能力极强,海量数据场景经验足;2)数据全链路流转追踪,图溯源能力强,证据链完整;3)分级分类、脱敏、加密、运维审计整套原生组件;4)医疗、金融电力、能源、政务、大量案例落地,信创数据库适配优秀;5)分布式部署,适合集团多级监管下属单位数据安全状态1)终端 DLP 原生能力弱;2)公有云 SaaS 模式弱,以私有化软硬件为主数据资产庞大、集团多级监管、医疗、金融、教育、电力能源、政务等安恒信息安恒数盾数据安全管理平台,AiSort 分级分类、AiDLP、AiAAS‑API 监测1)API 安全、敏感数据语义识别强;2)信创适配完善,国产数据库兼容好;3)数据共享交换场景经验丰富,政务云案例多;4)资产‑分级‑监测‑处置‑合规闭环完整;5)大模型赋能告警降噪、风险研判1)超大规模大数据集群调优工作量大;2)终端 DLP 能力偏弱;3)大型项目定制工作量较高政务、政务云、金融、大量 API 接口、数据共享交换平台奇安信数据安全管控平台 DSCP(天盾),分类分级、数据库审计、DLP、UEBA1)全链路能力最完整,云‑网‑库‑终端‑API 全覆盖;2)UEBA 行为分析成熟,告警降噪强;3)与 EDR、零信任、SOC 深度联动,处置闭环强;4)关基、国有大行、大型政务案例最多,信创全适配;5)行业合规模板完备1)采购成本偏高;2)组件多架构复杂,运维门槛高,需要较强安全运营团队;3)轻量化部署对中小客户不够友好大型政务、国有银行、能源关基、集团大企业,完整数据安全运营闭环深信服数据安全中心(DSC),SIP 安全感知、DLP、数据库审计1)轻量化,部署运维简单上手快,告警降噪好;2)混合云、私有云适配优秀,联动 SASE 零信任;3)性价比突出,交付快;4)内网办公、终端侧泄露监测表现好1)Hive、数仓等异构大数据平台适配偏弱;2)高等级政务、金融深度定制案例少于安恒、奇安信、安华金和;3)高级 UEBA 深度一般中小型政企、教育、医疗、地市单位,预算有限,快速合规落地,混合云绿盟科技数据安全治理平台,ISOP 安全运营底座1)威胁检测、攻击链分析强,威胁情报 + SOAR 编排成熟;2)运营商、金融行业积累深厚;3)大模型告警归并,擅长威胁 + 数据风险联合分析;4)旁路探针,业务侵入小1)自动资产发现、自动分级分类中等,需要较多人工调优;2)API 安全、终端 DLP 非原生强项,依赖组件组合;3)开箱合规报表完备度略逊安恒、奇安信、安华金和运营商、金融,存量绿盟设备环境,威胁检测 + 数据安全一体化运营启明星辰DSFM 数据流转监测风险分析系统、九天泰合底座1)政务积淀深厚,信创适配完善;2)大流量旁路解析稳定,数据库、文件、邮件协议解析全面;3)一体机开箱即用,适配等保合规;4)和泰合 SOC 打通,适合多级组网1)智能化 UEBA 行为分析中等;2)高级能力需要叠加多组件,方案偏重;3)公有云 SaaS 原生能力偏弱省 / 市政务、运营商、传统内网,强等保合规,多级组网腾讯云数据安全中心 DSC(云原生 SaaS),CASB、数据库审计1)腾讯公有云原生深度适配,云上资产自动发现,无需探针;2)API、云存储、云数据库监测强;3)SaaS 上线快,弹性扩容;4)云上合规报表完备1)线下机房、本地数据库、本地文件服务器能力薄弱,需额外部署探针;2)不适合离线隔离内网;3)私有化一体机案例少,主要面向云上客户上云企业、互联网,业务主体跑在腾讯公有云、混合云以云为主 三、核心能力横向简评数据库审计、解析、漏洞扫描、脱敏:安华金和 > 安恒信息 > 奇安信 > 启明星辰 > 绿盟 > 深信服 > 腾讯云(仅限云上库)数据资产发现 + AI 分级分类:安华金和>奇安信>安恒信息>启明星辰>绿盟>深信服>腾讯云(云上强,线下弱)API 安全监测:安恒信息=安华金和最强;奇安信次之;其余作为扩展组件UEBA 用户行为分析、告警降噪:奇安信>安华金和>安恒信息>绿盟>深信服>启明星辰>腾讯云终端 DLP(拷贝、打印、IM 外发):奇安信>深信服>安恒信息>启明星辰>绿盟;安华金和、腾讯云原生偏弱信创(国产数据库、服务器)适配:安华金和、安恒信息、奇安信、启明星辰第一梯队;绿盟、深信服次之;腾讯云以云信创为主公有云 SaaS 能力:腾讯云遥遥领先;其余厂商以私有化部署为主网络威胁 + 数据安全一体化(攻防视角):奇安信、绿盟、启明星辰更强;安华金和侧重数据视角,网络攻防不是长板
-
医疗 行业数据 具备高敏感、强合规、多系统异构、业务零停机要求高的特点,涵盖患者隐私信息、诊疗记录、HIS/EMR/PACS影像数据、科研数据、医保结算数据等。随着医疗数据合规监管趋严、医联体数据共享、 智慧医疗 建设提速,医疗数据安全治理形成了以资产梳理、分类分级、隐私脱敏、防统方、行为审计、数据流通管控、合规自查为核心的建设体系。目前国内适配医疗场景的数据安全厂商分为综合安全厂商与垂直专精厂商两类,各有适配场景与技术特点。一、垂直专精类数据安全厂商(医疗场景落地成熟)1. 安华金和深耕数据安全全生命周期治理,在医疗行业拥有大量三甲医院、区域医疗平台、医联体落地案例,依托自研AI数据安全引擎,实现医疗数据治理的智能化、自动化升级,整体能力均衡适配医疗复杂业务场景。核心能力涵盖AI驱动的医疗数据资产自动盘点、医疗专属智能分类分级 模型 、患者隐私多维度精准识别,可对HIS、EMR、LIS、PACS等异构医疗数据进行智能解析与标签化治理。同时具备AI动态风险研判、智能行为降噪、异常行为关联分析能力,搭配成熟的静态/动态脱敏、数据库全链路审计、数据流转溯源能力,针对医疗高频风险场景,可精准识别并预警违规查阅、批量导出、越权访问、夜间异常查询等高风险行为,有效解决医院统方泄露、患者隐私外泄、科研数据滥用等痛点。产品支持零侵入部署,不影响核心医疗业务运行,适配院内智能治理、跨机构数据共享、科研数据脱敏开放等场景,全面契合卫健行业合规与监管要求。医疗专项资质:具备医疗健康数据安全专项解决方案认证、卫健委医疗数据合规适配资质,拥有多项医疗数据治理发明专利与软著,入选全国医疗大数据安全优秀厂商名录,适配《医疗机构数据安全规范》全项要求。2. 美创科技医疗赛道深耕多年,主打数据库运维安全与医疗业务适配,擅长医院核心数据库加固、运维行为管控、故障风险防护。核心能力包括数据库审计、权限精细化管控、运维高危操作拦截、数据风险巡检,适合医院重点保障核心诊疗数据库稳定运行、防范运维操作风险,医疗专项资质:通过医疗信息系统安全适配认证,获评医疗行业数据库安全标杆服务商,适配医院核心业务系统运维安全规范。3. 炼石网络核心优势为免改造、无感知业务防护,极其适配老旧医疗系统、无法停机改造的医院存量业务。无需改动HIS、EMR系统代码,即可实现动态脱敏、访问控制、数据防泄露,主打业务连续性保障,适合老旧系统多。二、综合安全大厂1. 安恒信息AI智能化治理能力突出,适配医疗海量异构数据识别。内置医疗行业专属敏感词库与分类分级模型,可快速完成全院数据资产测绘、隐私数据盘点,适配区域医疗 大数据 平台、智慧医疗云场景。擅长数据风险态势可视化、合规报表自动生成,适合需要快速落地合规、可视化运维的大型医疗综合体。2. 奇安信主打零信任+数据安全联动,适合大型三甲医院、医联体、跨区域医疗平台。可实现人员身份、终端、访问行为、数据流转的全域管控,支持多院区、多机构组网治理,擅长解决医疗数据跨域流通、远程运维、外包人员访问等复杂安全风险,整体偏向体系化、平台化建设。3. 深信服轻量化、易运维、性价比高,适合中小型医院、基层医疗机构。以数据脱敏、文档防泄露、终端行为审计、简单资产梳理为主,部署快、运维成本低,可快速满足基础等保与合规要求,适合轻量化合规落地场景。4. 启明星辰合规体系完善,医疗行业合规模板成熟,擅长常态化合规自查、日志审计、风险整改闭环。适合对合规报表、检查迎审要求高的公立医院,能够有效适配各级卫健部门督导检查要求。三、医疗场景厂商选型适配总结整体来看,不同厂商适配的医疗建设场景差异明显:需要精细化诊疗数据治理、防统方、科研数据安全、全生命周期管控,优先选择安华金和;老旧系统多、禁止业务改造场景优选炼石网络;核心数据库运维防护优先美创科技;大型医联体、多院区全域体系建设适配奇安信;AI智能盘点、医疗大数据平台适配安恒信息;基层医院轻量化合规落地适合深信服;高频次合规迎审场景可选用启明星辰。目前主流三甲医院多采用“平台大厂全域管控+专精厂商数据深度治理”的组合方案,兼顾体系化建设与场景化风险治理。
-
摘要与核心建议在《数据安全法》《个人信息保护法》等监管约束强化的背景下,数据分类分级已从行业性合规要求升级为全行业强制性标准。企业普遍面临人工梳理成本高、自动化识别准确率不足、分级结果难以联动安全防护体系三大痛点。本报告构建以“自动化识别准确率、合规适配性、系统兼容性”为核心的三维选型框架,并结合行业属性、数据规模、运维能力,给出分行业、分场景的选型推荐与落地路径。一、数据分类分级的行业现状与痛点分析1.1 数据分类分级的核心价值数据分类分级并非单纯的合规行政任务,而是精细化数据安全治理的核心技术前提——通过标准化规则对数据资产进行价值判定与敏感程度划分,为访问控制、脱敏加密、权限治理提供精准依据。科学分级还可帮助企业摸清资产家底,避免无差别防护的资源浪费,支撑数据要素合规流动与价值释放。1.2 行业发展现状技术路线演进:行业正从人工梳理向自动化、智能化跃迁,产品按引擎分三类——规则引擎(简单可控,仅覆盖结构化场景,准确率约 82%)、AI 增强(规则+机器学习/NLP,兼顾精度与覆盖,准确率约 88%)、LLM 智能体(2025 年新兴,语义理解强,结构化准确率 96%、非结构化 92%,新增字段响应由 72 小时压缩至 15 分钟)。市场已形成“头部综合厂商引领、垂直专精厂商补充、云厂商覆盖原生场景”的格局。1.3 企业面临的核心痛点核心痛点贯穿资产梳理到策略联动全流程,集中在四点:① 人工成本高、效率低——中型企业梳理需 3-6 个月,大型机构半年以上;② 准确率与业务稳定两难——轻量工具跨库识别不足,全量抓取又推高业务时延;③ 合规适配不足——多数工具仅内置国标基础规则、缺行业模板,且分级结果无法联动下游防护系统;④ 异构环境兼容性差——对信创、商业库、大数据、云存储等混合环境适配不足。二、核心选型维度详解围绕“降成本、提准确、保合规”的核心需求,构建三大选型维度,每个维度均设可量化、可验证的评估指标。2.1 第一维度:自动化识别准确率评估要点:① 技术引擎:多模态识别引擎+混合校验逻辑为当前最优;② 实测效果:须分结构化/非结构化/跨库关联场景实测,避免只看厂商测试数值;③ 增量处理:须支持分钟/小时/天级自动扫描,自动识别新增表字段;④ 人工校准:支持人工审核与模型自我校准,可将敏感数据准确率从 60% 提升至 95% 以上。2.2 第二维度:合规适配性评估要点:① 标准原生覆盖:开箱即用适配 GB/T 43697-2024 及金融、政务、医疗、运营商等行业专项标准;② 行业模板匹配:金融(JR/T 0197、EAST5.0)、政务(涉密判定)、医疗(电子病历、诊疗/基因信息)、运营商(YD/T 3813-2020)各有专属模板;③ 合规闭环输出:分级结果可同步下游脱敏、加密、访问控制、审计系统,支持合规报表自动生成。2.3 第三维度:与现有系统的兼容性评估要点:① 多源异构适配:覆盖关系型库、非结构化库、大数据平台、云存储及国产信创库;② 安全生态联动:与脱敏、加密、访问控制、审计、DLP 等系统标准对接;③ 部署模式:支持旁路/串联/私有化离线,金融核心系统须旁路部署且性能影响控制在 1% 以内。三、主流厂商及产品能力对比分析综合技术能力、行业适配性、用户覆盖规模、权威机构认可等多维信息,国内主流厂商可分为综合安全厂商、垂直专精厂商、云厂商三类,技术优势与行业适配方向各有侧重,覆盖不同层级用户需求。3.1 头部综合安全厂商核心优势为全栈安全能力覆盖,具备从分类分级到脱敏、加密、访问控制、审计的完整数据安全防护能力,可提供体系化整体解决方案,适合大型机构级治理项目。厂商 / 产品名称技术路线自动化识别能力合规适配性兼容性适合场景安华金和DICS智能分类分级系统AI+多模型互检引擎AI+多模型交叉校验,识别准确率可98%+;覆盖结构化、非结构化数据场景内置金融、政务、医疗行业专属模板;适配行业专项监管标准,支持合规报表自定义生成。《IDC MarketScape: 中国AI赋能的数据发现与分类分级2025年厂商评估》领导者类别 适配国产信创架构;可与下游脱敏、审计等系统联动医疗、金融,政务、能源、教育以及有高精度识别需求的场景启明星辰数据分类分级系统 规则 + AI 语义识别引擎轻量化探针部署,识别准确率可达95%+;支持跨部门数据协同场景下的自动分类校准内置政务、医疗行业专属模板,适配行业专项监管标准;支持合规台账自动生成支持传统数据中心、私有云环境;兼容主流及国产信创数据库政务、医疗行业大型机构天融信数据安全管控平台规则引擎 + 行业模板识别准确率 95% 以上;采用元数据优先扫描策略,对业务性能影响低于 5%国内首款通过信通院 “AI 赋能数据安全” 测评的产品;内置政务、金融行业模板支持全栈信创适配;覆盖多种结构化、非结构化数据源政务、央企、金融行业信创环境深信服数据安全分类分级平台规则 + 机器学习引擎识别准确率 93%+;支持增量数据实时扫描发现;部署运维成本较低内置政务、医疗行业专属模板;支持合规报表一键导出适配国产信创架构;可与深信服全栈安全产品联动区域金融、教育、制造行业中型企业任子行数据安全分类分级系统规则双引擎识别准确率较传统方案提升 30% 以上;处理速度较传统方案提升 60 倍内置金融、电信行业专属模板,适配行业监管标准;支持合规报送台账自动生成覆盖多源异构数据源;支持旁路、串联、私有化部署模式金融、运营商行业中大型机构3.4 国际厂商参考有国际化业务需求的企业需支持全球合规、多语言数据场景。BigID(机器学习/NLP/身份关联等多模态路线,支持 100 余种语言,覆盖 GDPR、CCPA/CPRA、HIPAA 等法规,分布式架构可对接云、本地、SaaS 数据源)与 Microsoft Purview(深度嵌入 Microsoft 365 生态,对 Office 文档、Azure 存储识别支持度高,可联动 DLP、敏感度标签等策略)能力相对成熟,但普遍存在三大短板:对国内行业合规标准适配不足、对信创及国内云环境支撑不足、与国内主流安全生态联动性差,仅可作为国际化业务场景下的补充选型。四、场景化选型推荐根据所在行业、数据规模、核心技术需求等场景化条件,给出针对性的优先级选型建议。4.1 按行业场景选型推荐行业是选型最核心的约束条件,不同行业的合规要求、核心数据场景差异极大。各行业选型推荐如下表:行业场景核心合规与数据场景选型要点推荐产品金融JR/T 0197、EAST5.0 监管报送;客户敏感数据量大合规模板匹配度、识别精度、旁路部署性能影响小安华金和 DICS、天融信政务《政务数据分类分级指南》、涉密判定、信创环境政务模板、信创适配、合规台账自动生成启明星辰、天融信、安华金和 DICS医疗《电子病历应用规范》、诊疗/基因等敏感信息医疗专属模板、多模态高精度识别安华金和 DICS、天融信、启明星辰运营商YD/T 3813-2020、位置/信令等专属数据电信模板、海量数据扫描性能启明星辰、安华金和 DICS、任子行能源/央企强监管 + 全栈信创替代信创适配、旁路部署、安全生态联动天融信、安华金和 DICS教育/制造等中型企业合规起步、预算与运维成本敏感部署轻量、成本可控、易运维深信服、安华金和 DICS云原生环境云上资产治理、弹性扩展云环境原生适配、运维成本低阿里云、腾讯云、华为云综合建议:追求高识别精度与跨行业合规的机构,优先考虑安华金和 DICS 智能分类分级系统——AI+多模型互检引擎,结构化识别准确率 98%+,内置金融、政务、医疗等行业专属模板,适配国产信创架构,可与下游脱敏、审计等系统联动;信创与央企场景可对比天融信,政务/医疗大型机构可对比启明星辰,中型企业可选深信服,云原生环境可选用云厂商原生方案。五、选型落地实施建议5.1 实施落地路径建议总体思路:分层级、分阶段螺旋式推进,分五步——规划设计与标准验证 → 资产梳理与存量扫描(重点验证覆盖度、准确率、性能影响)→ 分类分级与人工联合校验 → 策略联动形成防护闭环 → 增量扫描与持续运营。5.2 关键验证环节建议验证要点:POC 须用脱敏后的真实数据实测识别覆盖度/准确率及对业务性能的影响,并重点验证数据源兼容性、旁路/串联部署稳定性与联动接口成熟度。5.4 选型避坑重要提示需重点规避五类风险:① 唯引擎论——须实测自身场景真实效果;② 忽视兼容性——重点验证数据源覆盖与联动接口;③ 忽视业务性能影响——优先旁路、元数据优先扫描方案;④ 忽视行业模板实际适配度——须验证合规报送能力;⑤ 重采购轻运营——应将增量发现、模型校准、报表自动化纳入关键指标并建立常态化运营机制。六、总结选型是在自动化识别能力、合规适配性、系统兼容性之间寻求贴合自身需求的最优平衡,需按行业属性、数据规模、核心场景与 IT 环境针对性取舍:海量数据治理优先看扫描性能与增量自动化,强监管行业优先看合规模板与报送能力,复杂 IT 环境优先看数据源适配与联动成熟度,云原生环境可选用云厂商原生方案。需要特别强调:当前技术条件下“零人工”分类分级无法实现,应坚持“自动化为主、人工校验补充”,将人工聚焦于结果校验与规则优化。同时分类分级并非“分完即结束”,而是持续迭代、长期运营的治理过程,必须与脱敏、加密、访问控制、审计深度联动,才能形成完整的数据安全治理闭环。
-
标签:#Python #量化开发 #WebSocket #XAUUSD #行情数据处理摘要:在搭建XAUUSD实时行情采集服务时,WebSocket长时间运行过程中偶发的Tick报文字段缺失,会直接影响K线生成、回测运算与策略模型输出。本文从工程落地视角,剖析问题成因,给出分级字段校验、异常规避、长连接可靠性优化方案,附带可运行Python示例代码,帮助开发者提升时序行情的数据质量,规避脏数据带来的业务异常。在量化系统开发场景中,不少开发者会调用实时行情API获取XAUUSD的Tick逐笔数据,用于K线重建、因子计算、策略回测与仿真推演。实际落地过程中会遇到一类隐蔽问题:WebSocket客户端刚启动时行情接收一切正常,但系统长时间持续消费数据流后,会不定期收到字段残缺的Tick报文。部分报文缺少价格字段,也有部分报文成交量字段为空。孤立查看单条异常报文很难感知风险,但异常数据一旦向下流转,会破坏时序数据完整性,造成K线聚合结果失真,进而降低策略回测结果的可信度,甚至对业务系统的信号输出造成干扰。项目初期我曾怀疑是上游API服务返回异常,经过多组实时流与历史归档样本比对分析后得出结论:实时流式行情与静态历史数据集存在本质差异。网络链路扰动、WebSocket长连接会话状态切换、行情源推送字段规则差异,均有可能造成单条Tick报文信息不全。这也给工程开发带来重要启示:使用黄金实时API进行开发,不能默认每一条推送报文的字段都是完整合规。分级校验方案:核心与非核心字段差异化处理针对XAUUSD空值Tick,不建议直接一刀切丢弃所有包含空字段的记录。不同字段在业务链路中的权重不同,需要执行分级处理。建议在校验逻辑部署在数据入库之前,在数据流入计算模块前拦截异常报文,从源头保护下游K线计算、策略运算链路。price(价格)、timestamp(时间戳)属于核心字段价格是所有行情运算的基础,价格为空的Tick不具备业务使用价值,需要直接过滤剔除。时间戳异常会引发Tick时序错乱,造成K线时间轴偏移,该类异常需要持久化日志,便于后续开展数据质量排查与问题溯源。volume(成交量)属于非核心字段部分行情源优先推送报价变动事件,并非每一次Tick推送都会返回成交量。volume为空时,可结合业务场景保留本条记录,也可填充业务约定的默认值,无需直接丢弃整条报文。下面是基于Python实现的WebSocket Tick过滤示例代码:import json import websocket def process_tick(message): data = json.loads(message) symbol = data.get("symbol") price = data.get("price") volume = data.get("volume") timestamp = data.get("timestamp") if symbol != "XAUUSD": return if price is None or price == "": print("发现空价格数据,跳过当前Tick") return tick = { "symbol": symbol, "price": float(price), "volume": volume if volume else 0, "timestamp": timestamp } print(tick) def on_message(ws, message): process_tick(message) ws = websocket.WebSocketApp( "wss://apis.alltick.co/websocket", on_message=on_message ) ws.run_forever() 工程避坑:不建议使用历史价格回填空价格为保证前端图表展示的连续性,部分开发人员会取上一笔有效报价,填充当前报文的空缺价格。该手段仅适用于可视化展示场景,严禁直接用于回测、量化建模等业务环节。Tick报文代表市场真实报价快照,人为回填价格会篡改原始时序样本。尤其针对短周期策略,单条被人工修改的Tick,会改变行情波动特征,造成回测输出与真实业务表现出现明显偏差,降低业务结果的参考价值。我的工程处理规范:价格缺失直接丢弃该条Tick;次要字段空值视业务场景保留,同时输出异常日志,便于后续统计异常发生频次,评估数据源质量。WebSocket长连接可靠性保障除报文字段校验之外,长连接健壮性是流式系统容易被忽略的关键点。网络短暂抖动会造成WebSocket连接断开,链路重连完成后,时序数据流会产生时间缺口,引发行情片段丢失。实践中可以缓存最新有效Tick的时间戳,连接恢复之后比对时间间隔。当检测到较大时间断层时,主动拉取对应时间段历史行情完成数据补全。XAUUSD属于高活跃度交易品种,时序数据连续性直接决定数据分析、策略回测的有效性。单条异常数据本身破坏力有限,但未被捕获的脏数据持续流入业务链路,会产生隐性的结果偏差。系统架构层面的思考行情API仅作为数据接入入口,整套量化系统的数据可靠性,很大程度取决于自研的数据预处理链路。XAUUSD的Tick报文字段看似简单,仅包含价格、时间、成交量,但在流式实时场景下,微小的数据缺陷会沿着业务链路层层传递,最终干扰模型与计算输出。提前落地空值过滤、分级字段校验、连接状态监控能力,可以大幅降低后期问题定位与排查成本。无论是个人验证Demo,还是企业级量化行情服务,前置的数据校验层,都可以有效规避脏数据引发的模型失真、计算结果异常等问题,提升整套系统的健壮度。总结很多开发者会将主要精力投入策略、因子模型的开发,容易忽略实时数据流预处理环节。即便是AllTick API这类成熟的行情数据源,受网络波动、长连接重连等客观因素影响,依然会输出部分字段残缺的Tick。将数据质量管控前置,做好分级字段校验、异常日志埋点、断连后的缺口补全,能够为K线构建、策略回测提供可信度更高的原始行情数据,减少因数据侧问题带来的业务异常。欢迎各位开发者在评论区交流流式行情数据处理的工程经验。
-
摘要政企、能源、金融、军工等信创行业的数据中心与企业机房,普遍面临资产管理硬件适配难、系统不兼容、数据不合规等痛点。传统进口RFID设备、商用通用采集硬件,无法适配鲲鹏ARM架构、openEuler国产操作系统,且在算力机房强电磁、高密度金属设备场景下识别稳定性差,难以满足等保2.0与信创验收标准。本文以国产化MC-RFID硬件体系为核心,结合华为云IoT、GaussDB、边缘计算能力,从硬件选型、边缘适配、云端对接、数据合规、项目落地全维度,讲解信创场景专属RFID资产管理解决方案,彻底解决传统资管账实不符、盘点低效、国产化适配缺失、审计溯源难等问题。本文全套国产化RFID硬件资管落地方案由首码信息深耕信创物联网领域多年打磨优化,已在多个省级能源、政务算力中心落地验收,是信创行业标准化、可复用的资产数字化方案。一、信创场景RFID资产管理的核心硬件痛点区别于普通商用机房,信创涉密机房、国产化算力中心对底层采集硬件的兼容性、稳定性、安全性、国产化属性有着严苛要求,传统RFID资管方案的短板被无限放大,核心问题均集中在硬件层面:1. 生态适配断层:主流进口超高频RFID硬件、商用读写终端均基于x86架构开发,无法兼容华为鲲鹏ARM服务器与openEuler国产系统,软硬件适配成本极高,甚至出现完全无法接入的情况,不符合信创全栈替代要求。2. 复杂场景识别失效:GPU算力机柜、工业设备集群金属屏蔽严重,机房强电磁干扰密集,普通RFID硬件信号衰减、串读漏读问题频发,资产识别准确率不足80%,无法支撑精细化资管。3. 离线数据断层:涉密信创机房多采用物理隔离、断网运行模式,通用RFID硬件无本地缓存能力,断网后无法采集存储资产数据,联网后数据缺失,台账长期账实不符。4. 合规能力缺失:商用硬件无国密加密传输机制,采集日志无法实现不可篡改留存,无法满足等保2.0审计溯源、信创国产化验收的硬性标准。5. 资管维度单一:传统RFID硬件仅能实现资产盘点识别,无法联动机柜U位状态、设备功耗、环境温湿度数据,无法实现算力机房一体化运维管控。二、信创级全栈国产化RFID硬件体系选型针对信创场景多重适配难题,首码信息自研适配华为云鲲鹏生态的国产化MC-RFID硬件矩阵,摒弃传统超高频技术架构,采用低频磁耦合传感技术,从硬件底层实现国产化替代、抗干扰升级与合规能力补齐,全套硬件无境外技术依赖,完美适配openEuler系统与国产数据库生态。1. 国产MC-RFID磁耦合传感硬件(核心硬件)专为信创算力机房、工业涉密场景研发,替代传统进口RFID设备,依托磁耦合感应传输原理,彻底规避金属屏蔽、电磁干扰问题,支持±0.5U机柜高精度定位,可精准识别每一台设备的U位在位状态、移位变动,适配高密度GPU算力集群长期稳定运行。2. 国产化抗金属加密RFID标签全元器件国产自研,支持国密SM4加密存储资产信息,耐高温、抗老化、防脱落,适配服务器、交换机、工业设备等全品类金属固定资产。每枚标签绑定唯一EPC编码,实现一物一码、全生命周期溯源,适配信创资产合规管控要求。3. openEuler适配型边缘采集网关基于ARM鲲鹏架构深度适配,完美兼容openEuler全系国产操作系统,支持RFID硬件数据本地缓存、断网续传、脏数据预处理。可离线留存7天以上资产采集数据,机房恢复网络后自动同步至华为云,彻底解决隔离机房数据断层问题。4. 国产工业级手持读写终端适配信创运维规范,支持离线批量盘点、加密数据采集、资产快速绑定与解绑,每秒可批量识别数百枚标签,大幅提升大型机房、园区资产盘点效率,适配涉密场景无外网作业需求。三、基于华为云的国产化RFID资管整体架构依托华为云IoT、GaussDB、边缘计算、日志审计服务原生能力,搭配首码信息国产化RFID硬件集群,搭建「硬件感知-边缘处理-云端管控-业务应用」四层全栈国产化架构,全程适配信创与等保合规要求。1. 感知层:国产化MC-RFID标签、U位传感模块、手持终端、固定式读写器完成全域固定资产、机柜U位状态、设备运行数据实时采集;2.边缘层:openEuler边缘网关完成数据过滤、去重、加密、本地缓存,规避云端带宽压力,保障离线场景正常作业;3. 云端层:华为云IoT实现硬件设备统一接入、状态监控、远程运维;GaussDB承载资产主数据、台账、工单数据;LTS日志服务留存全链路操作日志,实现不可篡改审计溯源;4. 应用层:搭建国产化资产管理平台,实现资产自动盘点、U位资源可视化、移位异常告警、全生命周期追溯、合规报表自动生成。四、openEuler边缘硬件部署与云端对接实操基于首码信息落地适配经验,针对openEuler国产系统优化轻量化部署方案,适配涉密隔离机房,无需外网即可完成硬件调试与数据采集,联网后自动同步华为云IoT平台,部署简单、兼容性强。 # openEuler 系统国产化RFID硬件采集服务部署脚本 # 安装国产适配依赖组件 yum install mqtt-client sqlite -y # 启动RFID硬件数据采集与本地缓存服务 nohup python3 domestic_rfid_collect.py & # 联网自动同步硬件采集数据至华为云IoT python3 cloud_sync_service.py 边缘网关可自主完成硬件设备在线监测、无效数据过滤、资产状态校验,有效避免高密度场景下的串读、误读问题,将资产识别准确率稳定维持在99.9%,同时降低云端算力消耗。五、核心落地能力与行业价值依托华为云国产化生态与首码信息RFID硬件硬实力,方案解决信创资管行业核心痛点,实现全方位数字化、合规化升级:1. 全栈信创适配:从RFID采集硬件、openEuler边缘系统到华为云GaussDB数据库,全程国产化闭环,无境外技术依赖,顺利通过信创适配验收;2. 复杂场景精准采集:磁耦合RFID技术彻底解决算力机房金属屏蔽、电磁干扰难题,适配GPU高密度机柜、工业车间、涉密机房等极端场景;3. 合规审计全覆盖:硬件数据传输国密SM4加密,全流程操作日志不可篡改留存,满足等保2.0、金融、能源行业审计溯源标准;4. 运维效率大幅升级:替代人工纸质盘点,数万级资产盘点从数天缩短至数小时,人力成本降低90%以上,U位资源利用率提升25%以上;5. 离线在线双适配:支持物理隔离机房离线作业、联网自动同步,适配各类涉密、隔离信创场景管控需求。六、落地案例总结某省级能源大数据中心国产化GPU算力集群,全面落地首码信息国产化RFID硬件资管方案,结合华为云IoT生态完成全栈数字化改造。改造后,机房资产账实不符问题彻底清零,资产异常移位实时告警,全年无资产流失、错放问题;机房盘点效率提升90%,机柜U位资源利用率提升27%,有效节约机房扩容成本;全栈国产化架构顺利通过信创验收与等保三级测评,成为能源行业信创资产管理标杆案例。文末总结信创行业资产管理的数字化转型,核心在于底层硬件的国产化适配与场景化落地,只有兼容国产生态、抗干扰、高合规的RFID硬件体系,才能真正实现机房资产精细化、智能化、合规化管控。首码信息深耕国产化RFID硬件研发与信创资管落地,依托华为云鲲鹏、openEuler全栈国产生态,为政务、能源、金融、国企等行业提供从硬件部署、数据对接、系统搭建到合规验收的一体化资产管理解决方案,助力信创产业数字化高质量升级。标签:#国产化RFID硬件 #信创资产管理 #openEuler #华为云IoT #GaussDB #算力机房资管 #工业级RFID #国产化运维
-
AI 画图,我们给的是可编辑矢量图——不是一张像素图引言:「AI 画图」正在说两件完全不同的事2024 年以来,「用 AI 画图」几乎成了默认表述。但打开不同产品,你得到的可能是 三种完全不同的东西:一张 1024×1024 的 PNG——节点文字改不了,线条调不了,放大发糊;这是 AI 文生图;一块 通用白板或设计 Canvas——Figma、Miro、Excalidraw、甚至 HTML5 <canvas>:能画、能拖,但 AI 往往只帮你「出一张 SVG/截图」,不懂你的图在表达什么结构(哪是顶点、哪条边、拓扑对不对);或者一套 图结构文档里的矢量对象——每个节点、每条边、每段标注都是带 ID 的独立元素,拖得动、改得动、导出后仍是矢量,且 AI 改的是「结构」而不是「像素或笔迹」。DrawFig(drawfig)从第一天起,选择的永远是第三种。我们不是「AI 文生图」工具,也不是「再做一个空白 Canvas 让你自己拖」。我们提供的是:面向科研制图的结构化矢量文档 + AI 画布操作——你用自然语言描述拓扑与布局,AI 把意图编译成可执行的图操作(建点、连线、标号、对齐),落在 mxGraph 图模型上;你拿到的是 可编辑、可导出 TikZ、可反复改拓扑的图稿,而不是一张像素图,也不是一堆难以维护的松散路径。这篇文章想把这个区别讲透:为什么仅有「矢量 Canvas」还不够;DrawFig 真正的差异化在哪里;以及它和文生图、通用白板、纯手动 draw.io 分别差在哪一步。一、先分清:矢量图 vs 像素图,差别不只是「清不清楚」1.1 像素图(Raster):好看,但往往是「死图」像素图由固定分辨率的色点阵列构成——PNG、JPEG、WebP,以及大多数「AI 文生图」模型的默认输出,都属于这一类。优点: 表现力强,照片、插画、复杂光影可以一步到位。对学术场景的核心问题:问题具体表现不可结构化编辑想把节点 B 改成 C?通常只能重新生成整张图,或进 Photoshop 手抠缩放失真论文双栏放大、印刷 300 dpi 时,线条和文字边缘发虚与 LaTeX 字体不一致位图里的字体与正文 Computer Modern / Times 无法统一无法导出 TikZ审稿人要求矢量终稿时,位图需要整图重画版本迭代成本高导师说「加一条边、改一个标签」= 往往从头再来一句话:像素图适合「定稿后的展示」,不适合「还在改结构的科研制图」。1.2 矢量图(Vector):每个元素都有「身份」矢量图用数学描述几何——圆是圆心+半径,线段是端点坐标,文字是字体轮廓。SVG、PDF 矢量层、TikZ 代码、draw.io 的 .drawio 文件,本质都是矢量。对学术场景的核心价值:任意缩放不失真:投稿、答辩投影、海报打印,线条始终锐利;元素级编辑:移动一个节点,相连的边自动跟随;改标签不影响拓扑;与论文工作流对齐:可导出 TikZ,嵌入 LaTeX 与正文同编译;可 diff、可协作:图稿是结构化数据,不是一张 flatten 后的图片。DrawFig 的画布基于成熟的 draw.io 引擎,底层是 mxGraph 图结构模型:每个顶点(vertex)、边(edge)、文本(text)都是带 ID 的单元格(cell),边知道连的是哪两个点——这是「图文档」,不是一屏像素,也不是一堆互不关联的钢笔路径。1.3 一张表看懂:你真正需要哪一种?维度像素图 / AI 文生图通用 Canvas / 白板DrawFig 结构化图文档输出形态栅格图像(PNG 等)多为 SVG/JSON,结构语义弱图模型 + TikZ/SVG/PDFAI 的角色直接「画像素」常生成静态 SVG 或贴图理解拓扑,执行建点/连线/标号等 op改一个节点标签困难一般可以,但 AI 难增量改双击或 setVertexLabels改拓扑(加边/删点)困难手工为主,AI 易「重画一张」拖拽或自然语言 增量 op图论语义(K5、二分图…)无无专用表达graphBrief 等结构化描述论文 / LaTeX\includegraphics很少原生 TikZTikZ 双向导入导出适合场景插画、概念艺术设计稿、头脑风暴图论图、算法图、架构拓扑、论文插图仅有「矢量 Canvas」不够——科研制图还要「结构可解析、改稿可增量、终稿可进 LaTeX」。DrawFig 把这三件事和 AI 绑在一起,才是差异化所在。一点五、「Canvas」三个字,我们指的不是同一回事很多人听到 Canvas,会想到:大家说的 Canvas本质和 DrawFig 的关系HTML5 Canvas浏览器里的 像素位图 API,画完就是色点我们 不用 这条路出图Figma / Miro 白板设计协作 Canvas,对象可拖,但偏 UI/流程美学我们聚焦 论文级图论与拓扑,不是 UI 设计Excalidraw 等手绘 Canvas矢量笔迹,风格像手绘白板我们偏 精确节点/边/权重,并导出 TikZdraw.io 手动编辑器同款 mxGraph 矢量引擎,纯手拖DrawFig 在其上 加 AI 结构规划 + 学术导出DrawFig AI 画布自然语言 → 图操作计划 → mxGraph cell这是我们的产品层:AI 懂结构,不是懂像素所以:「有个 Canvas 就能画」不是护城河。 护城河是——图结构优先:存的是顶点、边、标签与连接关系,不是 flatten 后的外观;AI 操作的是语义:说「加一条 A→D 的边」会执行 insertShapes / 改 graphBrief,而不是重新 rasterize 一张图;学术闭环:同一文档可视觉编辑、可导出 TikZ、可再导入修改,与 LaTeX 字体与编译链对齐;图论原生:完全图、二分图、带权有向图、函数曲线等有 一等公民 的描述与展开,不是让 LLM 猜坐标。一句话:别人给你一块布;我们给你一份「可编译、可改拓扑、可进论文」的图结构文档,AI 是这份文档的协作者。二、DrawFig 的 AI:操作图结构,不是渲染像素、也不是「重画一张 SVG」这是最容易被误解的一点:DrawFig 与 Midjourney 等不同,也和「在通用 Canvas 里贴一张 AI 生成的 SVG」不同。2.1 「AI 画布」= 自然语言 → 图操作计划 → 图结构 cellDrawFig 的 AI 能力(AI 画布 / AI 操作)走的是 「规划—执行」 管线——AI 的输出是 操作列表或 graphBrief,不是图像文件:你在对话框里描述意图(中英文均可)例:「画一个有 6 个节点的有向图,A→B→C,A→D,使用层次布局。」AI 画布服务解析为结构化计划返回 actions(逐步操作)、graphBrief(图论/流程图/函数图等 带类型语义 的简图描述)、或完整的 draw.io XML。浏览器内插件在图文档上执行创建矩形网格图、插入形状、设置箭头模式、对齐顶点、修改标签……每一步都落在 mxGraph 的 vertex/edge cell 上,边仍绑定端点。你继续手工微调AI 出的是「80 分初稿」,剩下 20 分用拖拽、对齐、样式面板完成——没有「生成一张图然后结束」这一步,也没有「换 prompt 整图重抽」。和「通用 Canvas + AI」的典型差别:后者常把 LLM 输出当作 一整块 SVG/PNG 贴上去;DrawFig 让 LLM 输出 可审查、可单步撤销的图 op,与侧栏手工按钮同一套语义。技术栈上,ai-canvas-service 的 /v1/plan 负责规划 JSON;drawfigure-ai-canvas.js 负责执行——AI 说的「加边」和你点的「连线」改的是同一份图结构。2.2 AI 能做什么:结构化、可组合、可审查当前 AI 画布擅长的是 有明确结构的图,例如:类型示例描述AI 输出图论图完全图 K5、二分图 K(3,4)、带权有向图顶点 + 边 + 标签,可继续拖布局流程图开始→判断→两个分支→合并→结束flowchart 展开为形状与连线函数曲线y=sin(x),x 从 -π 到 π,带坐标系采样折线 + 坐标轴,仍是矢量示意图客户端→网关→三后端→数据库schematic 拓扑,节点可逐个改文案增量编辑「把选中的顶点标号改成 v1,v2,v3」setVertexLabels 等 op,不重建整图支持的操作包括(节选):创建图网格、插入形状、删除选中、设置样式、图论箭头模式、顶点对齐与分布、插入旁注文本、调用编辑器动作等。每一个 op 都对应图文档里真实 cell 的增删改,而不是对一张位图做滤镜,也不是替换整个 SVG 图层。2.3 AI 不做什么:我们不替你「文生图」以下需求 不是 DrawFig AI 画布的设计目标:「画一张赛博朋克风格的论文封面插画」→ 请用文生图工具;「生成一张看起来很像 Nature 配图的照片级细胞图」→ 请用 BioRender 等专业生物插画平台;「给我一张 4K 渲染的概念艺术图」→ 那是像素生成模型的工作。DrawFig 专注 结构可解析、元素可编辑、终稿可矢量导出 的学术与工程制图。把 AI 用在「理解拓扑与布局意图」,而不是「猜测像素颜色」,这是我们刻意的产品边界——也是与「AI 绘图 hype」划清界限的地方。三、为什么「可编辑」和「矢量」必须绑在一起?有人可能会问:AI 能不能先生成矢量 SVG,再导入编辑?理论上可以,但实践中科研用户要的是 端到端可控:3.1 从 AI 初稿到定稿:典型五步(全程矢量)自然语言描述 ↓ AI 画布生成矢量初稿(节点/边/标签均为独立对象) ↓ 可视化微调(拖拽、对齐、统一线宽与字体) ↓ 导出 TikZ / SVG / PDF(矢量路径保留) ↓ 嵌入 LaTeX 论文,与正文同编译任意一步都可以 回到图文档改结构,而不是「导出 PNG 后死路一条」。导师说「把节点 D 移到左边、加一条虚线边」——在 DrawFig 里这是分钟级操作;若起点是 AI 文生图的 PNG,往往意味着重抽或进 PS;若起点是「AI 贴一整张 SVG」,往往只能手工找路径改,拓扑一改就牵一发动全身。3.2 与 TikZ / LaTeX 工作流同频理工科论文大量用 LaTeX。TikZ 是事实上的矢量制图标准——代码即图形,编译即 PDF。DrawFig 提供 双向通道:导出 TikZ:画布样式映射为 \tikzpicture 代码,粘贴进论文;导入 TikZ:已有代码可反向载入编辑器可视化修改(文件 → 从 TikZ 代码导入),再导出——全程不经过位图中间态。这意味着:AI 帮你搭骨架,TikZ 帮你交终稿,中间没有「先 PNG 再 trace 回矢量」的损耗环节。3.3 位图输入也能回到矢量(img2graph)如果你手里只有 白板照片、扫描草图、截图,DrawFig 的 img2graph 路径会把位图 重建 为图文档里的 vertex/edge——目标仍是 可编辑图结构,不是「给你一张 traced PNG」。这与 AI 画布互补:img2graph:位图 → 图结构(重建拓扑)AI 画布:语言 → 图结构(从零或增量生成)手工编辑:图结构 → 图结构(精细控制)三条路径汇到 同一份 mxGraph 图文档,而不是三种互不相通的文件格式。四、和常见「AI 绘图」产品比:我们差在哪里,又强在哪里4.1 vs 通用 AI 文生图(Midjourney / SD / DALL·E 等)文生图DrawFig输出像素矢量对象改稿重 prompt / inpainting元素级编辑 + AI 增量指令论文可用性需高分辨率导出,字体难统一TikZ/SVG/PDF 矢量直出图论/精确拓扑弱,易 hallucinate 连线强,graphBrief / 图论专用 op我们强的不是「画得像不像照片」,而是「结构对不对、能不能改、能不能进 LaTeX」。4.2 vs 通用 Canvas / 白板(Figma、Miro、Excalidraw、部分「AI 画板」)通用 CanvasDrawFig对象模型形状/笔迹/Frame,语义因工具而异vertex / edge / label,拓扑一等公民AI 典型输出整图 SVG、截图、设计建议actions / graphBrief / drawioXml改拓扑手工拖;AI 常需整图重来增量 op,边随端点自动更新图论场景无 K5、二分图等原生描述graphBrief: graph / complete / grid…论文终稿很少 TikZTikZ 双向差异不在「能不能拖」,而在「AI 和你的图有没有共同语言——结构、拓扑、可导出代码」。4.3 vs 传统在线流程图工具(Visio / ProcessOn / draw.io 纯手动)纯手动工具DrawFig上手要会拖节点自然语言可生成初稿文档模型矢量(同类引擎)同类引擎 + 图论/学术扩展学术导出一般仅 PNG/PDFTikZ + 图论布局 + 函数图AI多数无或仅辅助AI 画布:结构级 op,与手工同语义DrawFig 不是取代 draw.io,而是在其 同一套图结构引擎 上叠加 学术场景 + AI 结构规划 + TikZ 闭环——格式仍兼容 .drawio,但产品心智是「论文图结构文档」,不是「又一个空白画布」。4.4 vs 「AI 生成后再 SVG」的中间方案有些工具声称「AI 生成 SVG」。但若 SVG 里是 <image> 嵌位图、或路径过复杂不可编辑,本质仍是「换壳的像素图」。DrawFig 的验收标准更简单:生成后,你能否单独选中一个节点、改它的文字、拖它的位置,并让相连的边正确跟随?能——才是我们说的「可编辑矢量 AI 制图」。不能——无论文件后缀是什么,对科研用户价值都有限。五、三个真实场景:图结构 + AI 如何串起来场景 A:算法论文里的有向加权图需求: Dijkstra 示例图,6 个节点、7 条带权有向边,节点标签 A–F,要进 LaTeX 双栏。像素文生图路径: prompt 多轮 → 得到 PNG → 文字 OCR 常错 → 放大糊 → 无法 TikZ → 导师打回。DrawFig 路径:对话:「节点 A–F,边 A→B(4) A→C(2) …,圆形节点,权重标在边上。」AI 画布生成矢量初稿,约 10 秒。手动微调对齐、统一线宽。导出 TikZ,粘贴进 figure 环境,与正文同编译。全程图结构可编辑,任意一步可回编辑器改拓扑。场景 B:系统架构图(答辩 PPT + 论文各要一版)需求: 客户端 → API 网关 → 三个微服务 → 两个数据库;答辩要彩色,论文要黑白。DrawFig 路径: AI 生成 schematic 拓扑 → 复制图层改配色 → 论文版导出黑白 TikZ,PPT 版导出 SVG。同一源文件,不是两张无关的 AI 出图。场景 C:白板草图进论文需求: 组会白板上拍的函数图像草图,要变成正式插图。DrawFig 路径: img2graph 重建曲线与坐标轴为图 cell → 编辑器里修正刻度与标签 → 导出 TikZ。输入可以是位图,工作态和终稿仍是结构化矢量。六、技术心智模型(给关心实现细节的读者)用一张简图概括 DrawFig 与「像素 AI 绘图」的数据流差异:【常见 AI 文生图】 文本 prompt → 扩散/自回归模型 → 像素矩阵 → PNG/JPEG (结构信息丢失,不可编辑) 【通用 Canvas + AI】 文本 prompt → LLM → 整段 SVG/PNG → 贴到白板 (拓扑语义弱,改结构常需重生成) 【DrawFig AI 画布】 文本 prompt → LLM 规划(JSON actions / graphBrief / drawioXml) → 浏览器执行 → mxGraph 图 cell(vertex/edge) → 用户编辑 → TikZ / SVG / PDF / .drawio (结构保留,增量可改,论文可导出)七、常见疑问(FAQ)Q1:DrawFig 完全不能出 PNG 吗?可以导出 PNG,但那是 从矢量渲染出来的快照,用于预览或必须位图投稿的场合。主路径始终是矢量;需要印刷或 LaTeX 时,请用 TikZ、SVG 或 PDF。Q2:AI 生成的图质量不如手画精细怎么办?预期就是如此:AI 负责 结构与初布局,精细排版(对齐、字体、线型、标注位置)交给编辑器。这比「AI 一张图定终身」更符合真实科研改稿节奏。Q3:和 ChatGPT「画个图」、或 Figma AI 有什么区别?ChatGPT 常给出 代码/ SVG 字符串/ 图片——你要自己粘贴、对齐、改拓扑。Figma AI 强在 界面设计,不保证图论语义与 TikZ 终稿。DrawFig 的 AI 直接写入 mxGraph 图文档,后续手工编辑、增量 op、TikZ 导出是 同一对象模型 上的连续操作。Q4:我已经会用 draw.io,为什么还要 DrawFig?引擎同源,但 DrawFig 补的是 draw.io 默认没有的 学术闭环:AI 结构规划(graphBrief / actions)、图论专用能力、TikZ 双向、img2graph 重建拓扑。若你只偶尔画一张简单框图,draw.io 足够;若论文里图多、改稿频、要 TikZ,DrawFig 省的是 结构与导出 上的重复劳动。Q5:免费吗?TikZ 导入也要积分吗?画布本身免费: 拖拽编辑、图论工具、SVG/PNG/PDF 等常见格式导出、本地保存——无需注册即可使用。以下需登录并按积分扣费(账户 每日自动赠送 30 积分,可累积;邀请好友注册另得 100 积分):操作积分TikZ 导入5 积分/次TikZ 导出3 积分/次AI 画布5 积分/次八、结语:别只比「有没有 Canvas」,要比「图结构能不能活过改稿」「AI 画图」正在变成泛滥的营销词;「矢量 Canvas」也几乎人手一块。对科研与工程用户,真正该问的是:这张图的 拓扑 AI 懂不懂、改不改得动?导师让改一个标签、加一条边,是 增量 op 还是 重画一整张?投期刊时,能不能 TikZ 进 LaTeX、与正文字体一致?半年后复现论文,打开的是 图结构源文件,还是一张旧 PNG?DrawFig 的回答:我们交付的是「图结构文档 + AI 结构协作者 + 论文级导出」——不是像素图,也不是一块空白 Canvas。每个节点、每条边、每段标注仍然独立、可拖、可改、导出后仍是矢量——但更重要的是:它们组成的是一份有拓扑语义的图,AI 操作的是这份结构,而不是在像素或松散 SVG 上再盖一层效果。欢迎打开 DrawFig,用一句话描述拓扑,在 图结构文档 里改到定稿,再一键导出 TikZ。结构用 AI,文档用图模型,定稿用 TikZ——这才是学术制图在 AI 时代该走的那条路。关于 DrawFigDrawFig面向科研与工程制图:在 draw.io 图结构引擎之上,提供 AI 结构规划、图论专用能力、TikZ 双向 与 img2graph 拓扑重建——不是文生图,也不是通用白板。画布编辑免费;TikZ 与 AI 按积分扣费(每日赠送 30 积分)。
-
案例介绍一、概述本案例基于华为云码道(CodeArts)代码智能体,通过原创 SKILL快速构建一套多任务定时调度与管理工作流,结合华为云 FunctionGraph的事件驱动能力,实现定时任务的云端托管、统一管理和弹性执行。1.11 背景与痛点在企业日常运维和开发工作中,定时任务是不可或缺的基础能力,常见场景包括:每日凌晨自动备份数据库每小时统计业务数据并生成报表每周清理系统日志和临时文件每月自动发送账单和提醒邮件传统的定时任务解决方案存在以下痛点:单点故障风险:单机部署的 Cron 任务一旦服务器宕机,任务将全部中断缺乏统一管理:任务分散在不同服务器,难以集中监控和管理运维成本高:需要手动编写脚本、配置服务器、排查问题弹性不足:无法根据任务负载自动扩缩容1.2 适用对象企业开发者个人开发者高校学生1.3 案例时间本案例总时长预计45分钟。1.4 案例流程 1.5 开发环境准备注册并实名认证华为云账号:cid:link_7开通华为云 FunctionGraph 服务:cid:link_2下载并安装华为云码道 AI IDE:cid:link_6登录码道 AI IDE,配置华为云账号凭证这里以主账号用户举例,详情请见下方获取详情标题九本地安装 Node.js 16 + 和 npm 8+(用于前端开发)1.6 资源总览本案例预计花费0到+∞。体验完成后请及时释放资源,避免产生多余的费用。资源名称规格单价(元)华为云 FunctionGraph【必需】系统标配每月前100万次调用免费华为云码道(CodeArts)代码智能体【必需】通用体验版免费华为云 API 网关服务(APIG)【可选】按需计费最低4.75/小时三、多任务定时调度系统3.1 创建SKILL并部署到项目技能中1、核心 SKILL 设计与实现:2、将生成的SKILL技能部署到项目技能中进行使用3、使用技能开发多任务定时调度与管理工作流 3.2 部署项目代码1)项目级skill项目结构说明:【根据以上操作配置】.codeartsdoer/skills/├── function_creator/ # 函数创建实现SKILL│ ├── SKILL.md ├── trigger_creator/ # 触发器配置SKILL│ ├── SKILL.md ├── web_generator/ # Web界面生成实现SKILL│ ├── SKILL.md ├── workflow_deployer/ # 工作流部署实现SKILL│ ├── SKILL.md 2)生成的SKILL及py项目结构说明:FunctionGraph_SKILL2/├── function_creator/ # SKILL 1: 函数创建│ ├── SKILL.md # SKILL说明文档│ └── create_function.py # 函数创建实现├── trigger_creator/ # SKILL 2: 触发器配置│ ├── SKILL.md # SKILL说明文档│ └── create_trigger.py # 触发器配置实现├── web_generator/ # SKILL 3: Web界面生成│ ├── SKILL.md # SKILL说明文档│ └── generate_web.py # Web界面生成实现├── workflow_deployer/ # SKILL 4: 工作流一键部署│ ├── SKILL.md # SKILL说明文档│ └── deploy_workflow.py # 工作流部署实现└── README.md # 项目说明3)多任务定时调度系统项目结构说明: functiongraph-scheduler/├── backend/ # 后端代码│ ├── config.py # 华为云配置│ ├── task_executor.py # 任务执行器│ ├── scheduler_manager.py # 调度管理器│ ├── api_handler.py # API处理函数│ ├── deploy.py # 部署脚本│ ├── deployment_config.json # 部署配置│ ├── requirements.txt # Python依赖│ └── tests/ # 测试用例│ └── test_tasks.py├── frontend/ # 前端代码│ ├── src/│ │ ├── views/ # 页面组件│ │ ├── components/ # UI组件│ │ ├── stores/ # 状态管理│ │ ├── utils/ # 工具函数│ │ ├── types/ # 类型定义│ │ └── api/ # API接口│ ├── package.json│ └── vite.config.ts└── README.md功能特性1. 后端功能任务执行器: 接收任务配置,执行对应类型的任务调度管理器: 定时检查任务调度时间,触发到期任务API处理函数: 处理来自Web前端的HTTP请求2. 前端功能任务管理: 添加、编辑、删除、启用/禁用任务Cron编辑器: 可视化选择和编辑Cron表达式执行日志: 本地展示任务执行历史和日志数据统计: 展示任务执行统计信息配置导入导出: 支持配置的导入导出3. 支持的任务类型数据库备份: 定时备份数据库数据统计: 定时统计数据指标日志清理: 定时清理过期日志报告生成: 定时生成报告数据同步: 定时同步数据4)下载源码通过git下载源码到本地,本案例共设计 4 个原创 SKILL,SKILL及项目代码全部上传至 GitCode项目中,代码仓地址:cid:link_1四. 工作流整体流程Web端配置任务 → 定时/API事件触发 → 任务调度函数执行 → 返回执行结果 → Web端展示日志4.1 详细步骤操作步骤 1:创建任务调度函数登录华为云 FunctionGraph 控制台点击 “创建函数”,选择 “空白函数”函数名称:task_executor,运行时:Python 3.10代码输入方式:在线编辑,粘贴 backend/task_scheduler.py 代码配置函数执行超时时间:300 秒配置函数内存:128MB点击 “创建函数”步骤 2:配置定时触发器在函数详情页,点击 “触发器” 标签点击 “创建触发器”,触发器类型:“定时触发器”触发器名称:every-minute-triggerCron 表达式:0 */5 * * * ?(每五分钟执行一次)点击 “确定”步骤 3【可选】:配置 API 触发器#架构流程前端 → API网关 → api-handler函数 → 后端处理点击 “创建触发器”,触发器类型:“API 网关 (APIG)”选择 “新建 API”请求方法:POST,认证方式:无认证(测试用,生产环境建议使用 IAM 认证)开启 “跨域资源共享 (CORS)”点击 “确定”,记录 API 调用地址注意!不配置时受影响的功能:Web 端无法手动触发任务Web 端无法实时获取任务执行结果和日志Web 端无法动态修改任务配置(只能在代码或控制台修改)注意!:生产环境中建议配置,这样即可在我们生成的Web进行触发任务,测试可不配置,但是Web端实用功能会受影响目前后端已通过华为云SDK及凭证配置,后期拓展可通过后端转发处理,也可达到同样的效果步骤 4:Web 端任务配置示例在 Web 管理界面中添加以下测试任务:{ "tasks": [ { "id": "db-backup", "name": "数据库每日备份", "cron": "0 0 2 * * ?", "command": "python backup_db.py", "enabled": true, "lastExecutionTime": "", "nextExecutionTime": "2026-04-14 02:00:00", "status": "待执行" }, { "id": "data-statistics", "name": "每小时数据统计", "cron": "0 0 * * * ?", "command": "python statistics.py", "enabled": true, "lastExecutionTime": "", "nextExecutionTime": "2026-04-13 15:00:00", "status": "待执行" }, { "id": "log-cleanup", "name": "每周日志清理", "cron": "0 0 0 ? * SUN", "command": "python cleanup_logs.py", "enabled": true, "lastExecutionTime": "", "nextExecutionTime": "2026-04-20 00:00:00", "status": "待执行" } ]}五、Web 管理界面实现5.1 界面功能任务管理:创建、编辑、删除、启用 / 禁用定时任务任务监控:查看任务的执行状态、上次执行时间、下次执行时间日志查看:查看任务的执行日志和错误信息手动触发:支持手动立即执行指定任务本地存储:所有任务配置和执行日志存储在浏览器 localStorage 中5.2 后端部署函数步骤在 backend 目录执行 pip install -r requirements.txt 安装依赖配置访问凭证到系统环境变量或者 backend\config.py ,建议优先配置到系统环境变量在 backend 目录运行 python deploy.py5.3 前端部署步骤在 frontend 目录执行 npm install 安装依赖修改 src/api/task.ts 文件,配置 API 网关地址执行 npm run dev 本地运行测试执行 npm run build 打包前端代码将 dist 目录下的文件部署到任意静态网站托管服务或本地运行六、效果展示6.1 任务管理界面6.2 任务执行日志6.3 FunctionGraph 控制台七、拓展建议7.1 接入华为云 APIG 实现Web功能联动如果需要实现 Web 端与云端定时任务的实时交互(手动触发任务、动态修改配置、实时获取执行日志),可以按照以下流程接入华为云 API 网关服务:开通华为云 API 网关服务:cid:link_3在 FunctionGraph 函数详情页建议创建 API 网关服务专享服务 (APIG)(华为云API网关共享版已于2025年04月30日00:00(北京时间)在中国站正式退市) 触发器,选择 “无认证” 安全方式、POST 请求方法并开启跨域资源共享 (CORS)修改对应函数,添加跨域响应头处理,支持解析 HTTP 请求体中的任务配置参数修改 Web 管理界面,配置 API 调用地址,添加手动触发任务、实时拉取日志、云端同步任务配置功能7.2 接入华为云 SMN 告警通知如果需要实现任务失败时的邮件 / 短信告警通知,可以按照以下流程接入华为云 SMN 服务:开通华为云 SMN 服务:cid:link_4创建 SMN 主题,添加邮件 / 短信订阅者创建task-alerter函数,通过码道智能体实现 SMN 消息发送功能任务执行失败时,调用task-alerter函数发送告警通知7.3 接入华为云 OBS 持久化存储如果需要持久化存储任务配置和执行日志,可以按照以下流程接入华为云 OBS 服务:开通华为云 OBS 服务:cid:link_5创建 OBS 存储桶,配置访问权限修改task_executor,通过码道智能体将数据写入 OBS通过码道智能体修改 Web 管理界面,从 OBS 读取任务配置和执行日志八、总结与展望本案例基于华为云码道代码智能体和 SKILL 技术,快速构建了一套完整的多任务定时调度与管理工作流,充分发挥了 FunctionGraph 事件驱动、按需供给的优势。相比传统的定时任务解决方案,本方案具有以下优势:高可用:云端托管,无单点故障风险易管理:统一的 Web 管理界面,集中监控和管理低成本:按需付费【每月前100万次调用免费】,只有任务执行时才产生费用易扩展:支持添加任意数量的任务和触发器快速部署:通过 SKILL 一键部署完整工作流未来可以进一步扩展的功能:支持更多类型的触发器(如消息队列触发器、数据库触发器)支持任务依赖和工作流编排支持任务执行历史统计和可视化支持多租户和权限管理九、主账号获取 AK/SK/区域项目ID登录华为云控制台访问华为云官网:cid:link_7点击右上角 “登录” 按钮,输入账号密码完成登录华为云进入 “我的凭证” 页面登录后,将鼠标移至页面右上角的用户名处,在下拉列表中选择 "我的凭证"华为云管理访问密钥在 “我的凭证” 页面,点击 “访问密钥” 页签点击 “新增访问密钥” 按钮华为云身份验证输入登录密码和短信验证码(如开启了操作保护)点击 “确定” 按钮华为云下载密钥文件浏览器会自动下载credentials.csv文件(Excel 格式)重要提示:SK 仅在下载的文件中可见,控制台无法再次查看,务必妥善保存华为云查看 AK/SK打开下载的 CSV 文件,即可获取完整的Access Key (AK) 和 Secret Key (SK)查看区域项目ID十、活动链接【案例共创】【第 10 期】华为云码道(CodeArts)代码智能体 + SKILL 完成应用开发 / 调试实践cid:link_0附件:完整项目代码及SKILL 文件:cid:link_1十一、释放资源如果涉及云资源或者付费资源,需要在对应资源处进行释放
-
力竭了,前前后后改了好多版,结果就只是328800,求大佬指点迷津
yd_297240499
发表于2026-04-06 15:05:30
2026-04-06 15:05:30
最后回复
yd_292355633
2026-04-06 19:59:30
1113 1 -
我设置了8位小数但是为什么交互器还是只输出5位小数呢?
-
今天客服说codearts,不支持matepad edge。为啥自家电脑都不支持?
-
如题,按照两种标准来做,向量长度偏差可以超过 1e-4,想问一下标准答案是满足哪种标准的
yd_266100387
发表于2026-03-27 10:21:45
2026-03-27 10:21:45
最后回复
yd_248574786
2026-04-03 15:15:10
907 14 -
Q&A提到:单个样例需所有测试点全部正确方可计分,否则该样本得分为0。那请问正式赛单个样例的询问次数还是现在的 10000 个的规模吗,还是会因为评分规则改变而缩小
-
数据范围都不给这合理吗
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第五期2026/09/04 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;蒋春阳-华为云AI开发者案例开发专家
本期直播内容: AI工具体验营 · 第5-8课连讲。Agent-Team 多智能体协作完成毕业设计实践
回顾中 -
华为云开发者AI素养ClassRoom·第六期2026/09/08 周二 19:00-20:00
樊渊-2026华为软件挑战赛冠军
高手来了:看软挑高手解析二维排样问题—从工业难题到算法突破
回顾中
热门标签