-
描述Aster(文字识别/PyTorch)1. 概述此模型是基于ASTER: Attentional Scene Text Recognizer with Flexible Rectification的Pytorch实现版本,该算法需要使用SynthText和MJSynth数据集进行训练,IIIT5k的test数据进行验证。我们提供了训练代码和打包好的合成训练数据集和验证数据,如果有需要用户也可以加入真实数据集进行微调,具体参见ModelArts AI Gallery算法Aster使用指南。训练后生成的模型可直接在ModelArts平台部署成在线服务。对于英文识别任务,一般采用Accuracy作为评价指标:对于网络预测的字符串以及对应的gt,需要先进行归一化(去掉除字母和数字以外的字符,并统一大小写)。如果二者一致,则判定预测正确。Accuracy = 正确的数量 / 总数本算法的其他信息如下表所示:项目说明参考论文ASTER: Attentional Scene Text Recognizer with Flexible Rectification使用框架Pytorch-1.4.0训练集SynthText,MJSynth训练总epoch数7训练batch_size使用1卡训练,每张卡batch_size = 1024训练硬件及耗时1*v100,29小时左右测试集IIIT5K中的测试集推理硬件及速度CPU: 120~130ms/pic GPU: 20~30ms/pic (1*V100, batch_size=1024)输入图像尺寸64*256*3原论文准确率Accuracy (without Lexicon) = 93.4%本算法准确率Accuracy (without Lexicon) = 93.7%2、训练2.1. 算法基本信息任务类型文字识别支持的框架引擎PyTorch-1.4.0-python3.6算法输入存储在OBS上的数据集,必须将训练打包成lmdb格式进行存储,详情请查看下文第4节案例指导算法输出用于Pytorch推理的pth模型代码结构|-- lib| |-- datasets| |-- evaluation_metrics| |-- loss| |-- models| |-- tools| |-- utils| |-- evaluators.py| |-- trainers.py| |-- init.py|-- lib_infer_only| |-- datasets| |-- evaluation_metrics| |-- models| |-- utils|-- trained_model| |-- model| | |-- best_model.pth|-- train.py|-- evaluation.py|-- config.py|-- customize_service.py|-- config.json`-- pip-requirements.txt~~~2.2. 参数说明名称默认值类型是否必填是否可修改描述batch_size1024int是是batch size的大小workers8int是是workers的数量height64int是是网络输入图片的高度width256int是是网络输入图片的宽度voc_typeALLCASES_SYMBOLSString是否表示识别的类别包括大小写字母数字以及标点符号archResNet_ASTERString是否网络backbonecudaTrueString否是是否使用GPU训练evalFalseString是是是否进行模型评估,默认为False,如果设为True,则必须设定load_weight参数,加载指定的pth模型,在创建训练作业时指定的数据存储位置验证集上进行预测,所有预测结果results及模型评估结果eval_result.txt将保存到创建训练作业时指定的训练输出位置train_url上epoch7int是是总训练轮数,建议设置为7。load_weight./trained_model/model/best_model.pthString否是pth模型文件路径,支持加载OBS上保存的模型进行断点续训;不设置时直接进行训练. 默认使用已经预训练的模型,当删除该参数时则train from scratch.training_dataset/home/work/modelarts/inputs/Synth/String是否训练数据集在modelarts上的本地路径training_dataset_subfoldCVPR2016:NIPS2014String是否使用的训练数据集文件夹名。支持多个数据集同时训练,用:分隔多个数据集。testing_dataset/home/work/modelarts/inputs/Synth/benchmark_lmdbs_new/IIIT5K_3000/String是是验证集IIIT5K在modelarts上的本地路径,当eval=False时(训练过程),使用默认参数(对应imdb格式数据集)。当eval=True时,需要将其设置为/home/work/modelarts/inputs/Synth/IIIT5K/test/(对应png格式数据集)或者其他png格式的数据集。gt_path/home/work/modelarts/inputs/Synth/IIIT5K/testdata.matString否是如果eval时未设置gt_path参数,则不会输出统计指标,只保存推理结果。test_freq1000int是是训练过程中,每test_freq次迭代进行一次测试,并保存最优模型。print_freq100int是是训练过程中,每print_freq次迭代,输出一次loss。注1: 当eval设置成True时,只进行模型推理过程。如需对IIIT5K数据集进行推理,需要调整对应的testing_dataset = home/work/modelarts/inputs/Synth/IIIT5K/test/(对应png格式数据集);如需对自己提供的图片进行推理,请将数据集在obs中放置路径与该路径对应。注2: 当eval=True时,推理的结果results文件夹将会保存到train_url指定的obs路径。如果同时设置了gt_path的路径,还会将eval_result.txt保存到train_url路径。注3: 当使用自己提供的数据集进行训练时,需要根据数据集的大小来调整epoch以及test_freq,注意数据集需要放置在Synth目录下,并且将数据集的文件夹名称添加到training_dataset_subfold中,例如CVPR2016:NIPS2014。2.3. 模型输出训练输出的文件结构如下:|-- model | |-- lib_infer_only | | |-- datasets | | |-- evaluation_metrics | | |-- models | | |-- utils | |-- config.json | |-- config.py | |-- customize_service.py | |-- aster_Final.pth `-- logs |-- checkpoint.pth (last model) |-- model_best.pth |-- log.txt `-- cfg.txt设置eval = True,并对IIIT5K数据集进行推理,输出的文件结构如下:|-- results | |-- 1043_1_result.txt | |-- *** `-- eval_result.txt(当设置了gt_path之后输出评价结果)3. GPU/CPU推理利用本算法部署服务进行推理的详细步骤请查看ModelArts AI Gallery算法Aster使用指南4. 案例指导本算法的详细使用方法,请查看ModelArts AI Gallery算法Aster使用指南交付交付方式华为云ModelArts交付区域华北-北京一、华北-北京四、华东-上海一、华南-广州、亚太-**
-
Sequence-to-Sequence Contrastive Learning for Text Recognition本次工作提出一个对比性学习方法:SeqCLR,用于文本识别。将每个特征图看作是一系列的独立实例,得到 sub-word 级上的对比学习,例如每个图像提取几个正面的配对和多个负面的例子。另外,为获得有效的文本识别视觉表征,进一步提出新的增强启发式方法、不同的编码器架构和自定义投影头。在手写文本和场景文本上的实验表明,当用学到的表征训练文本解码器时,所提出方法优于非序列对比法。此外,当监督量减少时,与监督训练相比,SeqCLR 明显提高了性能,而当用 100% 的标签进行微调时,SeqCLR 在标准手写文本识别基准上取得了最先进的结果。作者 | Aviad Aberdam, Ron Litman, Shahar Tsiper, Oron Anschel, Ron Slossberg, Shai Mazor, R. Manmatha, Pietro Perona单位 | 以色列理工学院;亚马逊等论文 | https://arxiv.org/abs/2012.10873
-
Implicit Feature Alignment: Learn to Convert Text Recognizer to Text Spotter本次工作提出一个简单而有效新范式:IFA,将 text recognizer 转变为 detection-free text spotter,利用神经网络的可学习对齐特性,可以很容易地集成到当前主流的文本识别器中。得到一种全新的推理机制:IFAinference。使普通的文本识别器能够处理多行文本。具体来说,作者将 IFA 整合到两个最流行的文本识别流中(基于注意力和基于CTC),分别得到两种新的方法:ADP 和 ExCTC。此外,还提出基于Wasserstein 的 Hollow Aggregation Cross-Entropy(WH-ACE)来抑制负面噪音,以帮助训练 ADP 和 ExCTC。实验结果表明 IFA 在端到端文档识别任务中取得了最先进的性能,同时保持了最快的速度,而 ADP 和 ExCTC 在不同应用场景的角度上相互补充。作者 | Tianwei Wang, Yuanzhi Zhu, Lianwen Jin, Dezhi Peng, Zhe Li, Mengchao He, Yongpan Wang, Canjie Luo单位 | 华南理工大学;阿里等论文 | https://arxiv.org/abs/2106.05920
-
Dictionary-guided Scene Text Recognition本次研究,作者提出一种新的语言感知方法来解决场景文本识别中的视觉模糊性问题。该方法在训练和推理阶段都可以利用字典的力量,可以解决许多条件下的模糊性。另外,创建一个用于越南场景文本识别的新数据集:VinText,它在从多个类似字符中辨别一个字符方面带来了新的挑战。在 TotalText、ICDAR13、ICDAR15 和新收集的 VinText 数据集上的实验结果证明了该字典整合方法的优点。作者 | Nguyen Nguyen, Thu Nguyen, Vinh Tran, Minh-Triet Tran, Thanh Duc Ngo, Thien Huu Nguyen, Minh Hoa单位 | VinAI研究等论文 | https://openaccess.thecvf.com/content/CVPR2021/papers/Nguyen_Dictionary-Guided_Scene_Text_Recognition_CVPR_2021_paper.pdf代码 | https://github.com/VinAIResearch/dict-guidedPrimitive Representation Learning for Scene Text Recognition与常用的基于 CTC 和基于注意力的方法不同,作者通过学习原始表征并形成可用于并行解码的视觉文本表征,提出一个新的场景文本识别框架。又提出一个 pooling aggregator 和一个 weighted aggregator,从 CNN 输出的特征图中学习原始表征,并使用 GCN 将原始表征转换为视觉文本表征。所提出的原始表征学习方法可以被整合到基于注意力的框架中。并在英文和中文场景文本识别任务的实验结果证明了所提出方法的有效性和高效率。作者 | Ruijie Yan, Liangrui Peng, Shanyu Xiao, Gang Yao单位 | 清华大学论文 | https://arxiv.org/abs/2105.04286
-
场景文本识别What If We Only Use Real Datasets for Scene Text Recognition? Toward Scene Text Recognition With Fewer Labels本次工作的研究目的是使用更少的标签来运用 STR(场景文本识别) 模型。作者用只占合成数据 1.7% 的真实数据来充分地训练 STR 模型。通过使用简单的数据增广和引入半监督和自监督的方法,利用数百万真实的无标签数据,进一步提高性能。作者称该工作是迈向更少标签的 STR 的垫脚石,并希望这项工作能促进未来关于这个主题的工作。作者 | Jeonghun Baek, Yusuke Matsui, Kiyoharu Aizawa单位 | 东京大学论文 | https://arxiv.org/abs/2103.04400代码 | https://github.com/ku21fan/STR-Fewer-Labels
-
用于任意形状文本检测TextOCR: Towards large-scale end-to-end reasoning for arbitrary-shaped scene text本文介绍一个在 TextVQA 图像上收集的大型任意场景文本识别数据集 TextOCR,以及一个端到端的模型 PixelM4C,该模型通过将文本识别模型作为一个模块,可以直接在图像上进行场景文本推理。TextOCR,大型且多样化,来自 TextVQA 的 28,134 幅自然图像,有 100 万个任意形状的单词标注(比现有的数据集大3倍),每张图片有 32 个单词。作为训练数据集,在多个数据集上提高了 OCR 算法的精度 ;作为测试数据集,为社区提供新的挑战。在TextOCR上进行训练,可以提供更好的文本识别模型,在大多数文本识别基准上超过最先进的水平。此外,在 PixelM4C 中使用 TextOCR 训练的文本识别模块,可以使用它的不同特征,甚至有可能提供反馈,这使得 PixelM4C超越了 TextVQA 的现有最先进方法。通过 TextOCR 数据集和 PixelM4C 模型,在连接 OCR 和基于 OCR 的下游应用方面迈出了一步,并从直接在 TextOCR 上训练的 TextVQA 结果中所看到的改进,希望该研究能够同时推动这两个领域的发展。作者 | Amanpreet Singh, Guan Pang, Mandy Toh, Jing Huang, Wojciech Galuba, Tal Hassner单位 | Facebook论文 | https://arxiv.org/abs/2105.05486主页 | https://textvqa.org/textocr
-
【EI-OCR中的“前置控件-华为云版”如何配置与使用】或者是【报错信息有“flag_token缺失,可能是因为前置组件未添加”字样】---> 都是需要添加与配置“inputAccountByToken”控件1. 进入 https://console.huaweicloud.com/iam/?region=cn-north-4#/iam/users, 在图1中点击创建用户,需要创建一个子用户,用于填入图2中的“华为云IAM用户名”和“华为云IAM密码”(保证华为云账号名与华为云IAM用户名不一样),过程中有个权限“admin”,需要将其右移(这个在操作的过程中会出现,很简单,看到相应的页面就会了)。图1图22. 点击上一点网页中的左上角的“三条线”按钮,再在输入框中输入“ocr”,之后点击“文字识别 OCR”,如图3图33. 在图4选择“北京四”(此地区包含的服务较多),并在图5中选择需要的产品,在对应的产品描述的后面中选择“开通服务”(有一定免费次数的调用,标号1是未开通的情况,标号2是开通的情况)图4图54. (仅针对华为内网用户) 需要在http、https代理处设置相应的值,http设置为http://W3账号:密码@proxy.huawei.com:8080/,https设置为https://W3账号:密码@proxy.huawei.com:8080/ 。且因为使用的是proxy代理,所以用EI-OCR控件,需要确保图片大小(最好小一些,不然会报错,proxy代理携带不了太大的图片的base值)
怪咖Creatorchf
发表于2021-11-22 16:57:49
2021-11-22 16:57:49
最后回复
怪咖Creatorchf
2021-11-22 16:57:49
1066 0 -
设计器里【Manas引擎】--【图像识别】以及【自然语言处理】下控件的使用,也可以用于钉钉以及微信的cv操作里。user ID: com.huawei.gts.rparobotToken:hC4Q2yZ8p11h186KcC8b6un6ZS2tcAtegOn89HCJy6CurddgTkCzmm7hXCH3mJJt设计器中如下控件可使用上面的信息用于测试使用。getpicinfo_online在下图的链接里,对于习惯于老版本里的识别率且不满足当前识别结果的开发者可以试试把这里的v3修改成v2。
This is WeAutomate
发表于2021-11-04 18:38:51
2021-11-04 18:38:51
最后回复
This is WeAutomate
2021-11-04 18:38:51
1970 0 -
体验通过DevStar服务的“智能OCR图像文字识别”模板一站式生成应用代码并部署到函数工作流FunctionGraph,实现识别指定图片中的文字信息并显示在页面上。您将学到什么您将学会如何通过DevStar实现一站式快速开发基于Serverless的智能识别图片文字信息应用,并在此基础上基于华为云EI产品开放能力进行对应用的自定义扩展,体验云上开发的乐趣您需要什么硬件要求PC电脑软件要求Chrome浏览器需要的知识点熟悉常规电脑操作常识具备基本的软件开发能力环境准备注册华为云账号、实名认证如果您已拥有华为账号且已通过实名认证,可直接体验。若您还没有通过实名认证的账号,请注册华为账号,然后完成实名认证(推荐使用“扫码认证”方式,即时完成)。参考如何实名认证和如何扫码认证。应用开发及部署使用Chrome浏览器,登录DevStar,在搜索栏输入“智能OCR图像文字识别”关键字进行搜索,在卡片上点击“开发应用”首次使用可以开通服务“同意授权”并继续创建应用在应用创建页面根据页面提示完成项目、应用名信息输入注:如果没有任何DevCloud项目,可点击“创建项目”新建一个项目注:在创建项目过程中如提示“该企业租户服务处于关闭状态 ”,请点击“立即开通”。然后在DevCloud服务购买页面,选择基础版进行购买操作(基础版5人及以下免费)。开通后,继续完成项目创建注:创建完项目后,点击所属项目选项列表旁的“刷新”图标,可显示新创建的项目,选中并完成页面其它信息输入,点击“立即创建”按钮,进入应用详情界面等待应用使用的代码仓等资源创建完成(约20s),点击左侧的“应用部署”菜单,查看依赖云服务的状态。若有云服务未开通,则点击“去开通”按钮完成服务开通。查看文字识别服务增值税发票识别的开通状态,如果未开通,点击“开通服务”。注意:增值税发票识别API按需付费模式每月0~1千次(含)调用免费,如果超出则会产生费用,计费详情可点击“参考价格”查看。函数工作流FunctionGraph若实际使用量每月调用不超过100万次且计量时间不超过400,000 GB-秒免费,如果超过则会产生费用,计费详情可点击“参考价格”查看。完成服务开通后,点击对应服务的刷新按钮,查看服务开通状态。依赖的云服务全部完成开通后,点击“部署”按钮,进行应用部署。待部署完成后,点击“看看”链接访问部署到函数工作流的云函数。在智能OCR识别页面,点击“选择文件”上传发票图片,体验使用OCR精准识别发票图片上的文字。注:上传的发票图片为JPG/JPEG/BMP/PNG格式,建议大小不超过5M(超出有可能会失败),推荐1M。进阶体验-使用Huawei Cloud Toolkit在本地进行快速开发Huawei Cloud Toolkit是华为云提供的IDE插件工具,支持VSCode平台和Intellij平台。支持查看华为云开放API的文档、SDK、错误码、示例代码、代码模板;基于代码模板快速创建本地工程;智能代码自动补全等场景,能极大提高开发者在本地开发基于华为云API的应用的开发效率。这里我们使用Huawei Cloud Toolkit辅助,给原来的代码快速扩展一个新的“通用文本识别”功能。在应用详情页面的代码仓库栏,点击右边的“克隆/下载”,复制弹出框中的https链接,然后在本地命令行中输入:git clone <仓库链接>,既可把代码仓克隆到本地。(克隆的时候会提示输入用户名和密码,用户名为<华为云账号名>/<华为云账号名形式>,具体可以在codehub的配置页面查找到https://devcloud.cn-north-4.huaweicloud.com/codehub/https)使用本地IDE(使用Intellij或者VSCode)打开刚克隆的代码,这里以Intellij为例。安装 Huawei Cloud Toolkit插件,Intellij点击 File -> Settings -> Plugins,在 Marketplace中搜索“HuaweiCloud Toolkit”,点击“install”进行安装。注:如果您使用VSCode,也可以在VSCode插件市场中搜索“HuaweiCloud”,选择安装“HuaweiCloud Extension Pack”这个插件。打开链接https://console.huaweicloud.com/iam/?region=#/mine/accessKey,点击“新增访问秘钥”添加一个您租户账号的AK/SK。在Intellij中,点击左侧的“Huawei Cloud Toolkit”标签,点击登录图标。将刚才生成的AK/SK(注意excel中的AK/SK后面有一个空格,需要去掉)填入配置中,点击“apply”和“ok”按钮,插件即可登录成功。登录成功后我们在右侧搜索栏搜索“OCR”。选择“云服务”标签下的“文字识别 OCR”,可以看到OCR服务出了支持身份证识别外,还支持很多的其他的文字识别功能。这里我们选择下方的“通用文字识别”,点击“查看文档”。接口文档包含的接口的说明,请求参数,返回参数的详细信息,这里看到这个接口的请求参数只需要一个图片的base64字符串即可。在对要实现的接口有了了解后,我们来改造一下原理的代码。在Intellij中打开代码中的“java”文件。为了方便扩展功能,我们已经在代码中预留好扩展的位置。找到代码的第50行,按注释提示添加一个识别类型:修改后:接着我们来实现调用接口的逻辑,找到代码中第101行的函数“recognizeGeneralText”:把注释删掉,输入我们刚才搜到的api名称“recognizeGeneral”,这是我们看到会有自动提示弹出,选择第一个提示选择后可以看到API调用的基础代码已经被插入:然后我们只需要简单的添加一下输出和输入即可实现API调用的功能,添加下图红框里面的两行代码:到这里我们的代码已经完成,为了使用“通用文本识别”功能,我们需要到OCR服务开通该服务,打开OCR页面:https://console.huaweicloud.com/ocr/#/ocr/overview,找到“通用文本识别”点击开通服务。(按需计费模式下,每个月的前1000次调用免费)将代码push到远端的git仓库,回到我们的应用部署页面,重新部署应用(请参考本文“应用开发及部署小节步骤6、7”),现在可以上传一张带有文字内容的图片,体验添加的通用文本识别功能,识别图片中的文本。到这里我们已经实现了一个新的识别功能的添加,您可以继续查看OCR服务的文档,添加更多的文本识别功能到项目中。恭喜您已完成体验,您还可以了解和体验DevStar AI识图作诗应用开发模板。
-
产品介绍文字识别(Optical Character Recognition,简称OCR)以开放API的方式提供给用户,用户使用Python、Java等编程语言调用OCR服务API将图片识别成文字,帮助用户自动文字识别(Optical Character Recognition,简称OCR)以开放API的方式提供给用户,用户使用Python、Java等编程语言调用OCR服务API将图片识别成文字,帮助用户自动采集关键数据,打造智能化业务系统,提升业务效率。采集关键数据,打造智能化业务系统,提升业务效率。视频资料点击链接即可播放,支持下载链接:学习资料:第1章 初识OCR技术第2章 华为云OCR服务介绍第3章 华为云OCR使用指南第4章 FAQ及随堂测试链接OCR资讯动态:链接
-
梳理常见的OCR问题,请参考1、如何选择OCR服务套餐包的区域?不同的地域之间资源包不互通,每个地域需分别购买,请根据您的实际需求慎重选择。各服务所部署区域请参见终端节点。请先确定使用的服务与区域之后再购买相应区域的套餐包。2、OCR服务识别结果可以转化为Word或者TXT吗?OCR提取之后返回的结果是JSON格式,需要用户通过编程,将结果保存为Word或者TXT格式。3、OCR服务提供哪些版本的SDK?目前OCR提供的SDK有Java、Python、iOS、Android、Node.js版本。如果想用其他编程语言调用OCR API服务,可以使用Token鉴权方式,参考接口说明文档实现接口调用。4、OCR服务可以识别文本格式文件吗?OCR服务是指对图像中的文字进行检测与识别,不能识别word、pdf、excel等文件。5、关于数据安全,隐私保护的有什么措施?OCR服务坚持“华为云始终把可信作为产品质量的第一要素”的理念,我们基于安全、合规、隐私、韧性、透明,为您提供有技术、有未来、值得信赖的云服务。具体请参见白皮书资源。
-
使用的是华为电脑管家里面的“Huawei Image Viewer", 看图的,但有个OCR的功能都对于印刷文字来说,中文识别率很高,可以说完美。英文识别一塌糊涂。有的就识别不出来。我想这除了是软件的问题之外,也有语言本身的问题吧。开始觉得IT里面,英文比较适合,比如写代码呀、打字啊,那都是要会英文24个字母的呀,用中文很麻烦呀但后来觉得不是那么简单~嘿嘿~
-
1 常见安装配置问题及解决方案查看2 常见studio错误提示及解决方案查看3 常见网页及应用程序自动化问题及解决方法 查看4 常见Excel自动化操作问题及解决方法查看5 常见控件使用问题及解决方案查看6 常见Email自动化操作问题及解决方案查看7 常见studio错误提示及解决方案(二)查看8 常见系统、文件和数据库操作问题及解决方案查看9 web操作中的常用js语句查看 华为RPA 经验分享合集 ————————————————————— [studio 2.16] Studio中很多时候都会用到Json与Dict类型的转化查看 [studio 2.16]获取当前时间(例如:前几年...几月...几日、几小时、几分钟、几秒...的时间)查看 常用studio内置变量查看 web操作中的常用js语句查看 如何在studio中用查找工具查找关键字,提高编写效率?查看 关于 SetActive控件 与 SelectWindow 控件的区别查看 关于Studio中Try-Catch中的Try属性当中的错误重试次数如何体现的?查看 如何在管理中心GDE或助手Assisant上执行项目?查看 如何获取邮件中的表格并将其写入excel?查看 关于getText控件获取内容失败的解决或者获取时间过长的解决方法查看 WeAutomate Studio 2.16 控件插件自动安装失败解决方案 查看 [studio 2.16] 关于发布脚本/工程到管理中心失败的解决方法查看 [studio 2.14及以后版本] 运行失败提示Excel.Application.ShowWindowsInTaskbar查看 [studio 2.16] openurl失败提示"以一种访问权限不允许的方式做了一种访问套接字的尝试"查看 [studio 2.16执行机助手]安装时显示乱码,安装失败的解决方法查看 共享一个图片转成base64的方法查看 使用开源硬件Arduino模拟USB键盘解决密码输入框中密码输入难题查看 文件交互插件(文件上传,另存为弹框)查看 [Windows系统]Windows系统自动登录到桌面的方法查看 [2.1x设计器操作数据库]SQL异常提示:a number is required, not str查看 [Studio2.14以前版本] 如何取消studio在机器人脚本发布时的io风险校验查看 [2.17studio]win32桌面应用操作type等提示has no attribute 'handle'查看 [2.1x设计器]共享一个图片URL保存为图片的方法查看 关于定位过程中写两个不同元素的xpath的应用查看 [2.1x设计器]请检查57889端口是否被占用类问题解决方法。查看 [2.16设计器]Server运行提示“DLL load failded while importing cv2:找不到指定模块查看 [设计器2.16及以后]脚本发布时关于第三方依赖包的导包问题查看 [Studio]script cannot references self/SubScript cannnot referenc查看 图片在线识别getpicinfo_online的另一个使用方式查看 [2.16执行器]python脚本提示“invalid character in identifier”查看 [2.16设计器]smtp.sendemail发送邮件注意事项/未命名的附件000.dat查看 [studio 2.16] 运行报错RobotKeyError exception details:'USERNAME'查看 [设计器]找不到发布按钮,怎么办?Studio E 与Studio切换/Studio切换Studio E模式/设计器模式切换查看 连接失败(Open Connector Failed)查看 [2.17设计器]调用子程序callScript的用法演示查看 汉字unicode转换工具,供大家转换时测试使用。查看 全局变量与全局参数有什么区别?WeAutomate支持哪些变量类型查看 csv和excel(xlsx,xlsm,xls,xlsb)互相转化查看 要保存的文件不能与已打开的文档重命。有一个打开的文档使用了当前指定的名称。查看【Studio 2.16版本】pandas has no attribute "plotting"查看 no validate rule 'server_address' what you need查看 根据excel某一列分类来分发不同表格数据到对应的邮箱——机器人查看 打开Excel提示“this Com can not automate the makepy process查看 [设计器2.17]设计器获取不到ESN,插件加载失败,提示设计器内部异常错误。查看 Studio2.17——关于“人工智能-Manas引擎-图像识别”系列控件的使用与返回结果的解析查看 关于长路径和长字符串的键入替代查看 The northbound interface supports only public assets查看 EI-OCR中的“前置控件-华为云版”如何配置与使用 ||报错信息“flag_token缺失,可能是因为前置组件未添加查看 SAP操作/SAP插件查看 防止电脑锁屏工具/虚拟移动鼠标/鼠标移动工具查看 设计器调用getVatInfoOcr增值税发票识别,报错attributeError("'str' has no attribu查看 应用场景分享——获取邮件正文中的表格到Excel_支持多对多或一对一查看 应用场景分享——跑不死的脚本如何开发查看 文件操作——【WinRAR命令行】加密压缩文件、解压加密文件、分卷压缩、解压分卷...查看 应用场景分享——RPA华为云EI-OCR服务控件的使用查看【应用场景分享】网页表格保存为Excel查看 自定义扩展插件——数据库sqlite3相关控件查看 应用场景分享——XPath中根据某个节点定位另一个节点查看 自定义扩展控件——OCR识别图片生成Excel文件、图片转Excel查看 自定义扩展控件——OCR识别图片或PDF文件,生成Word文件查看 WeAutomate Assistant 助手2.17版本以及后续版本点击启动无反应,检查日志报错提示SQLError查看 以管理员权限运行RPA,方法适用于所有windows应用程序查看 LAMP方式和LNMP方式创建数据库的区别查看 减轻超大Excel表格“数据处理中断”的时间损失查看 [EBS][Java1.8]windows找不到文件\Studio\jre\jre_86\bin\java.exe查看 Studio设计器界面操作卡顿或机器人长时间运行C盘内存占用过多查看print模块怎么使用查看如何将已有的Python脚本应用到weAutemate的流程中?查看利用华为weautomate,怎么获取网页里图片的链接查看 华为RPA 管理中心经验分享合集 ————————————————————— [管理中心]设计器调用管理中心2.0的服务报错:Check the openness level of the service查看 RPA管理中心2.0环境创建机机用户操作流程查看 [管理中心1.5.3]执行器助手2.14 执行器处于空闲状态,然而云管理中心中查看执行器状态一直处于运行状态原因分析及解决办法查看 [管理中心]北向接口开发文档1.5.x/2.0x/北向接口开发手册查看 [管理中心2.1]管理中心操作指导查看 [管理中心2.0]管理中心登录异常,提示无法进入编辑模式查看 [管理中心2.0]修改管理中心的登出时间/修改管理中心锁屏时间/延长管理中心注销时间查看【2.1管理中心安装】停止安装FusionStage查看【2.1】RPA管理中心,OP部署环境下进行备份操作查看【1.5.3】小程序迁移操作指导查看【管理中心】一体机场景,服务器下电操作指南查看【2.1管理中心安装】前台卸载数据面失败查看【2.1版】RPA管理中心安装小提示查看【2.1管理中心】增加备份服务器失败查看【2.1管理中心安装】虚拟机磁盘挂载大小与场景包中建议值不一致怎么办?如何修改场景包?如何在Gkit前台页面修改配置?查看【2.1管理中心安装】只安装一个管理中心,不安装其他服务(如:NLP服务),场景包需要做哪些修改?查看 管理中心虚机资源说明查看 管理中心、执行器、设计器安装环境要求查看【1.5.3管理中心】OP(本地)部署环境下创建租户指导查看【管理中心】本地部署环境下,1.5.3版管理中心升级为2.1版管理中心操作指南查看【2.1管理中心】OP(私有化部署)环境下,如何创建用户及用户管理角色介绍查看【2.1管理中心】OP(私有化部署)环境下,创建删除了的同名用户指导查看【2.1管理中心】OP(私有化部署)环境下,系统安装完毕后,建议修改用户密码策略,如延迟密码过期时间,增加密码重试次数查看【2.1管理中心】OP(私有化部署)环境下,数据面admin用户密码忘记,如何重置密码查看
-
云实验室近期将实验手册开放,并且提供了许多手册型实验,即没有提供沙箱环境,需要实验者自己找环境体验的实验,这种方式对新手相当友好,不仅可以按照实验步骤顺利完成实验,还可以继续保留实验环境,进一步深入学习。自己参考网上的帖子,容易发生软件已经升级了,自己还在使用过时的软件排查古老的bug的情况,而且网上的帖子有可能作者的实践环境以前已经做过配置而遗留一些依赖的操作步骤:昨天用了一整天的时间,好不容易把 OAI-cn的mme,hss,spgw调起来了,结果刚刚运行mme的时候报错:Initializing MSC logsInitializing MSC logs DoneFunction s6a_init (&mme_config) has failedreturning 22提示是linux内核版本不对,需要换版本,这就意味着整个部署过程需要推倒重来。软件部署本来就不是一件一蹴而就的事情,反复尝试之后许多原来的难题也都会随之而解。华为云沙箱实验室的实验就不存在上述问题:整个实验的环境依赖步骤完整,可以提供顺利跑通的实验手册,增加实验者的信心。使用ECS,体验了一下使用使用华为云鲲鹏弹性云服务器部署文字识别Tesseract实验:首先搭建实验环境,这里如果不清除实验用的操作系统是哪个,可以先用在线实验环境查一下,有了实验的经验也可以根据手册中的yum 推断使用的是centos。将ecs的操作系统更换为centos,版本选择了最新版本。系统安装好后,绑定EIP。使用secureCRT远程登录ECS。[root@ecs-b769 tesseract-4.0.0]# history 1 2021-04-29 09:58:48 root ls 2 2021-04-29 09:58:57 root yum install automake libtool gcc-c++ libjpeg-devel libpng-devel libtiff-devel -y 3 2021-04-29 09:59:49 root wget https://sandbox-experiment-resource.obs.cn-north-1.myhuaweicloud.com/kunpeng-tesseract/leptonica-1.78.0.tar.gz 4 2021-04-29 10:00:03 root tar -xvf leptonica-1.78.0.tar.gz 5 2021-04-29 10:00:13 root cd leptonica-1.78.0 6 2021-04-29 10:00:25 root ./configure --prefix=/usr/ && make -j4 && make install 7 2021-04-29 10:02:07 root vim /etc/profile 8 2021-04-29 10:02:56 root source /etc/profile && ldconfig 9 2021-04-29 10:03:06 root cd /usr/local/src 10 2021-04-29 10:03:16 root wget https://sandbox-experiment-resource.obs.cn-north-1.myhuaweicloud.com/kunpeng-tesseract/tesseract-4.0.0.tar.gz 11 2021-04-29 10:03:25 root tar -xvf tesseract-4.0.0.tar.gz 12 2021-04-29 10:03:36 root cd tesseract-4.0.0 13 2021-04-29 10:03:43 root ./autogen.sh && ./configure && make -j4 && make install 14 2021-04-29 10:08:55 root wget https://sandbox-experiment-resource.obs-website.cn-north-1.myhwclouds.com/kunpeng-tesseract/eng.traineddata 15 2021-04-29 10:09:05 root wget https://sandbox-experiment-resource.obs-website.cn-north-1.myhwclouds.com/kunpeng-tesseract/chi_sim.traineddata 16 2021-04-29 10:09:21 root cp eng.traineddata /usr/local/share/tessdata -r && cp chi_sim.traineddata /usr/local/share/tessdata -r 17 2021-04-29 10:09:31 root wget https://portal-www-software.obs.cn-north-1.myhuaweicloud.com:443/kunpeng_chi.bmp 18 2021-04-29 10:09:44 root tesseract -l chi_sim kunpeng_chi.bmp res_chi && cat res_chi.txt[root@ecs-b769 tesseract-4.0.0]# tesseract -l chi_sim kunpeng_chi.bmp res_chi && cat res_chi.txtTesseract Open Source OCR Engine v4.0.0 with Leptonica华 为 云 鲲 鹏 云 服 务 器就到这了?当然不是,自己修改一下图片来识别一下![root@ecs-b769 tesseract-4.0.0]# tesseract -l chi_sim kunpeng_chi.bmp res_chi && cat res_chi.txt Tesseract Open Source OCR Engine v4.0.0 with Leptonica测 试[root@ecs-b769 tesseract-4.0.0]# 测试两个字图像识别出来了,但是隔了空白之后的服务器三个字却没有识别出来。从网上下载一幅图片[root@ecs-b769 tesseract-4.0.0]# tesseract -l chi_sim 111.jpeg res_chi && cat res_chi.txt Tesseract Open Source OCR Engine v4.0.0 with Leptonica播 broadcast[root@ecs-b769 tesseract-4.0.0]#
-
在公司技术委员会副主席这个位置上干了有几个月了,期间,我一方面给研发团队整理各种文档资料,做技术沉淀;一方面给市场/运营帮了几次忙,用技术解决业务问题。上周又解决了一个业务难题,估计是考虑到升职加薪也不能太频繁,老板就奖励了我7天带薪假期,让我自己安排。(上集故事请查看:《破圈,用一个API代替10人内容团队》)程序员的工作时间不是996就是007,这突然有了假,干点啥去呢?疫情期间也不能出去浪,有日子没回老家了,回去看看吧。躺在老家院子里的摇椅上,我妈养的中华田园犬在身边绕来绕去,晃晃**地吃了睡睡了吃,日子虽然无聊,倒也难得清闲。叮~同样是做研发的高中同学发不脱同志给我打电话,约我晚上去学校旁边吃烧烤。说走就走,到了地方我看见这小子,紧了紧头上的帽子,赶紧坐下。几杯酒下肚,聊起大家的近况,发不脱表示出了对我的羡慕,“真羡慕你在北京工作,开发的都是些有意思的产品,不像我,待在老家,每天就是围绕销售的需求,让干啥就干啥,实在是没劲,一点成就感都没有。就比如最近销售提了个需求,让我给做一个自动识别名片的功能,你说这玩意能有啥用?”自动识别名片?现在谁还用名片,不都是微信联系了么,最多也是弄个小程序,一扫码就有自己的个人信息了,多方便。我说完,发不脱也说:“对啊,现在谁还用名片,所以这个需求销售那边一个月里提了三四次,都被我们给拒绝了,做了也没价值。”正说到这儿,我看着隔壁桌来了2个小伙子,俩人不太熟的样子,一见面又是握手又是寒暄,最后交换了名片才坐下。这名片难道还真有市场?看完这一幕,我突然有了点想法,跟发不脱说,还是帮销售实现这个需求吧,又不费事,几行代码就解决了,万一人家有用呢。没想到发不脱差点跟我急了:“几行代码?你闹呢?文字识别欸,我们又没有AI工程师,没那个技术能力!”这还不好解决么,说着我掏出手机,打开浏览器进入了华为云API Explorer,搜索“名片识别”,找到对应API,按照接口说明把调用方式发给了发不脱,可不就几行代码的事么。 过去了大概10来天,我已经回公司上班了,发不脱给我发信息:“哥们,谢谢你啊,这个名片识别的功能上线之后才发现,销售们每天能收回来一百多张名片,以前要手动录入CRM,现在扫完就能直接录入了,老板因为这个还给我涨工资了呢,大家还打听我什么时候学的AI,哈哈。” 通过这件事我也意识到,有些功能还真不能光凭自己的直觉和认识,来自一线的声音才是最真实的用户需求。如果你也需要名片识别这个功能,“名片识别API”调用方式如下,拿走不谢。步骤一:开通服务1. 进入文字识别OCR主页,单击“立即使用”,进入文字识别Console控制台。2. 选择服务所在的区域。系统默认显示“华北-北京四”,根据各服务的部署区域选择对应区域,开通与调用的服务必须在同一个区域。3. 在左侧服务列表中单击需要使用的服务,单击“开通服务”。 服务开通成功后,界面显示已开通的服务。步骤二:调试服务通过API Explorer可进行快速调试。在API Explorer点击文字识别。我们先看看调用这个API都需要点啥:看上去获取到名片图片的64位编码或者url就能调用了。举个栗子接下来我们就拿“诸葛亮”的名片调试一下。1、 获取名片图片的64位编码:把“诸葛亮”放进Chrome浏览器里,按F12,在弹出窗口点Sources,选中“诸葛亮”的名片文件,这样就能看到名片的64位编码了。2、 双击选中图片的base64编码信息,“Ctrl+C”复制,然后粘贴到 API Explorer里,点击“调试”,响应结果里就把“诸葛亮”的名片信息都识别出来了~(注意不可使用鼠标右键方式进行复制) 了解更多华为云API信息:“免费下载创新加速利器《华为云API精选手册》【拓展阅读】【API进阶之路】因为不会创建云服务器,我被实习生摆了一道【API进阶之路】前浪的绝地反击与自我证明【API进阶之路】甩锅大会上,我是如何绝地求生的【API进阶之路】一个技术预案,让老板当场喊出了“奥利给”【API进阶之路】万万没想到,一个技术方案帮实习生追到了运营妹子!【API进阶之路】一个技术盲点,差点让整个项目翻车【API进阶之路】老板给我涨薪30%!如何通过SDK接口搞定千万级流量直播【API进阶之路】半天搞定百万条手机号归属地查询,竟影响了公司战略方向!【API进阶之路】无法想象!大龄码农的硬盘里有这么多宝藏【API进阶之路】高考要考口语?一场10w+刷屏活动是如何用多模态评测API做出来的【API进阶之路】帮公司省下20万调研费!如何巧用情感分析API实现用户偏好调研【API进阶之路】逆袭!用关键词抽取API搞定用户需求洞察【API进阶之路】破圈,用一个API代替10人内容团队【API进阶之路】用API打造一条自动化内容生产流水线——活动推荐——华为云已经成为全球主要云服务供应商,在华为云上开放了2400+ API,包括计算、存储、网络、应用服务、软件开发服务、视频、数据库、EI智能等74+产品,如何利用这些丰富强大的API快速开发自己的应用和服务,成为大家关注的热点。华为云API学习赛,为入门初学者量身定制的学习平台,以赛带学,学以致用。无需代码,只需下载体验模板,按操作文档操作即可完成作品。参赛、邀请都有丰富奖品,还有机会拿P40 5G手机超级激励!!识别下图二维码即可报名参加。API入门学习赛·AI人脸识别报名地址奖项设置API入门学习赛·探险寻宝之旅报名地址奖项设置
上滑加载中
推荐直播
-
用码道,让你的AI作品三步上朋友圈2026/08/04 周二 19:00-20:00
林华鼎-华为云AI开发者运营负责人
从入门 · 到做AI应用 · 到企业级开发。不教编程,只教用AI · 零代码、有产出、能带走、可炫耀 · 每课人人动手实操
回顾中 -
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
基于华为云码道,构建你的定制化AI搭子2026/08/14 周五 09:00-11:30
明亮-华为云开发者发展与支持部部长
本期直播将向您全面介绍华为云码道产品,并基于码道手把手教你部署自己的定制化AI陪伴搭子。
回顾中
热门标签