-
前言图像修复可对图片进行智能修复,去除图片中不需要的物体,并使用背景内容进行填充,也可对破损图片进行修复。支持URL、Base64等图像上传途径,适配 JPG/PNG/BMP 等通用图片格式,处理完成返回图片URL及图片base64编码API介绍戳这里查看详情请求说明名称类型必须说明base64String否图像base64字符串urlString否图像url链接,url链接长度不超过1024字节,请注意关闭URL防盗链fileFile否图像文件rectangleString是遮挡物坐标,JSON格式字符串。每个元素包含left, top, width, height,int 类型。如: [{‘width’: 92, ‘top’: 25, ‘height’: 36, ‘left’: 543}] ,注意:上传宽高、位置坐标参数要比图片实际宽高小返回样例{ "code": 200,// 返回码,详见返回码说明 "msg": "成功",// 返回码对应描述 "taskNo": "122984078218931802948253",// 本次请求号 "data": { "base64": "" ,// 生成后图片的base64字符串,不带图片头。 "url": ""// 生成后的图片的url,长期有效。建议用户自行下载保存,避免丢失。 } }
-
前言图片缩放可将图图片在长宽方向放大或缩小,并保持图像质量无损。可用于图片修复、彩印照片美化、监控图片质量重建等场景。缩放尺寸可格局尺寸缩放和比率缩放。图片提供方式支持URL、Base64等图像上传途径,适配 JPG/PNG/BMP 等通用图片格式,处理完成返回图片URL及图片base64编码。API介绍戳这里查看详情请求说明名称类型必须说明base64String否原图base64串 原图url,file、base64三选一fileFile否原图文件 原图url,file、base64三选一urlString否原图url 原图url,file、base64三选一typeString是类型,type=size为尺寸缩放,type=rate为比率缩放widthInteger否缩放图宽度,单位px,正整数,type为size时必输heightInteger否缩放图高度,单位px,正整数,type为size时必输keepRateInteger否是否保持宽高比,1为保持,0为不保持,当type=size时有效,默认为1rateDouble否缩放比率,当type=rate时,此值才有效.其值为0到2之间,例如:0.5、1.2返回样例{ "code": 200,// 返回码,详见返回码说明 "msg": "成功", // 返回码对应描述 "taskNo": "596744245171443788745816",// 本次请求号 "data": { "imageUrl": "xxx.jpg",//图片URL,有效期30天。建议自行下载保存,避免丢失 "imageBase64": "xxxxxxx" //图片base64 } }
-
前言图片水印裁剪可对图片生成缩略图、图像裁剪和添加图片水印等。可同时处理,也可以分开处理。图片加水印可支持文字水印和图片水印,支持自定义文字大小、颜色、样式、旋转角度、透明度、位置等。图片缩放可根据尺寸缩放和比率缩放。图片提供方式可支持URL、Base64等图像上传途径,适配 JPG/PNG/BMP 等通用图片格式,处理完成返回图片URL。API介绍戳这里查看详情请求说明名称类型必须说明srcBase64String否底图文件base64串,底图url,file、base64三选一srcFileFile否底图文件, 底图url,file、base64三选一srcUrlString否底图文件url, 底图url,file、base64三选一logoBase64String否logo图base64串, logo图url,file、base64三选一。文字内容和水印logo图必须提供一个,优先级:文字内容 > logo图logoFileFile否logo图文件, logo图url,file、base64三选一。文字内容和水印logo图必须提供一个,优先级:文字内容 > logo图logoUrlString否logo图url, logo图url,file、base64三选一。文字内容和水印logo图必须提供一个,优先级:文字内容 > logo图positionString否水印在底图的位置。参数:NorthWest,North,NorthEast, West, Center, East, SouthWest, South, SouthEast,Lay(平铺)。默认值为SouthEast在右下角xInteger否x坐标, 水印左边缘距原始图片的位置yInteger否y坐标, 水印上边缘距原始图片的位置opacityFloat否水印透明度,0~1之间,默认为1contentString否水印的文字内容,文字内容和水印logo图必须提供一个,优先级:文字内容 > logo图fontSizeInteger否水印文字字体大小,默认:40fontColorString否水印文字颜色,16进制值,默认白色:#FFFFFF。其他常见颜色,红色:#FF0000,黑色:#000000,绿色:#00FF00,蓝色:#0000FFfontNameString否水印文字字体,直接传字体的中文名称。支持:宋体、黑体、微软雅黑。默认: 微软雅黑fontStyleInteger否水印文字字体样式。0:普通,1:粗体,2:斜体。默认: 2rotationInteger否水印旋转角度, 默认:0。图片水印或者文字水印平铺时支持旋转返回样例{ "code": 200,// 返回码,详见返回码说明 "msg": "成功", // 返回码对应描述 "taskNo": "596744245171443788745816",// 本次请求号 "data": { "imageUrl": "xxx.jpg",//图片URL ,有效期30天。建议自行下载保存,避免丢失 } }
-
前言在实际拍摄过程中,环境因素和设备操作往往会影响图像质量。例如,户外拍摄遇到浓雾天气时,空气中的水汽会降低光线传播效果,使照片出现灰蒙、低对比度、细节缺失等问题;而在图片编辑、传输或显示过程中,错误的拉伸操作又可能导致人物、建筑等内容比例失真,影响视觉效果。针对这些常见问题,本接口通过深度学习算法自动分析图像内容,实现智能去雾与图像比例修复,帮助用户快速恢复清晰、自然、真实的视觉效果。特性用户无需手动调整参数,只需要上传原始图片,系统即可自动完成:图像检测 → 问题分析 → 智能处理 → 高清输出API介绍戳这里查看详情请求说明名称类型必须说明base64String否图像base64字符串urlString否图像url链接,url链接长度不超过1024字节fileString否图像文件返回样例{ "code": 200,// 返回码,详见返回码说明 "msg": "成功",// 返回码对应描述 "taskNo": "466186169184611593557371",// 本次请求号 "data": { "base64": "" ,// 生成后图像的base64字符串,不带图像头。 "url": ""// 生成后的图像的url。建议用户自行下载保存,避免丢失。 } }
-
前言面对压缩模糊、色彩暗淡的图片素材,可通过本接口实现AI自动均衡亮度、饱和度、对比度,同步去除画面噪点、还原纹理细节,低成本完成图片美化,提升产品图片展示质感。支持 URL、Base64、文件三类图像上传途径,适配 JPG/PNG/BMP 等通用图片格式;处理完成同步产出图片直链与 Base64 编码素材,不用额外加工图片文件。核心能力智能调节图片的色彩饱和度、亮度、对比度,使得图片内容细节、色彩更加逼真,可用于提升网站图片、手机相册图片、视频封面图片的质量;对压缩后的模糊图像实现智能快速去噪,优化图像纹理细节,使画面更加自然清晰。API介绍戳这里查看详情请求说明名称类型必须说明base64String否图像base64字符串urlString否图像url链接,url链接长度不超过1024字节fileString否图像文件返回样例{ "code": 200,// 返回码,详见返回码说明 "msg": "成功",// 返回码对应描述 "taskNo": "122984078218931802948253",// 本次请求号 "data": { "base64": "" ,// 生成后图片的base64字符串,不带图片头。 "url": ""// 生成后的图片的url,长期有效。建议用户自行下载保存,避免丢失。 } }
-
前言道路运输证OCR识别,即利用图像识别技术,自动识别道路运输证照片上的信息:包括:业户名称、地址、车辆号牌、经营许可证、经济类型、车辆类型、吨座位、车辆规格、经营范围、初领日期、备注、发证日期。可支持识别横版及竖版两种道路运输证。道路运输证OCR识别被广泛用于货运平台运力准入、车队台账管理、营运资质审核。API介绍请求说明名称类型必须说明base64String否base64,url,pdfFile必须提供一个, 图像数据,base64编码后进行urlencode,要求base64编码和urlencode后大小不超过8M,最短边至少15px,最长边最大8192px,支持jpg/jpeg/png/bmp格式urlString否base64,url,pdfFile必须提供一个, 图片完整url,url长度不超过1024字节,url对应的图片base64编码后大小不超过8M,最短边至少15px,最长边最大8192px,支持jpg/jpeg/png/bmp格式pdfFileString否base64,url,pdfFile必须提供一个, PDF文件,base64编码后进行urlencode,要求base64编码和urlencode后大小不超过8M,最短边至少15px,最长边最大8192pxpdfFileNumString否需要识别的PDF文件的对应页码,当 pdf_file 参数有效时,识别传入页码的对应页面内容,若不传入,则默认识别第1页戳这里查看详情返回样例{ "code": 200, // 返回码,详见返回码说明 "msg": "成功", // 返回码对应描述 "taskNo": "65605503936940344488", // 本次请求号 "data": { "车辆号牌": "云F44481", "经济类型": "个体经营", "经营范围": "道路普通货物运输", "车辆类型": "解放CA5240XXYP1K2L7T", "吨座位": "11.8850", "备注": "落户日期:2009-11-18HT2985", "经营许可证": "530402013190", "车辆毫米_高": "3900", "车辆毫米_宽": "2499", "发证日期": "2016年12月26日", "地址": "玉溪市红塔区北城镇龙华苑3幢6号", "车辆毫米_长": "11993", "业户名称": "王金海", "初领日期": "" } }
-
前言户口本OCR识别,即通过图像识别技术自动识别户口本照片中的信息,包括:户号、姓名、与户主关系、性别、出生地、民族、出生日期、身份证号、本市县其他住址、曾用名、籍贯、宗教信仰、身高、血型、文化程度、婚姻状况、兵役状况、服务处所、职业、何时由何地迁往本市、何时由何地迁往本址、登记日期全部 22个信息。户口本OCR还可以识别户口本内户主页的5个信息,包括:户别、户主姓名、户号、住址、户主页时间。API介绍请求说明名称类型必须说明fileFile否户口本照片,file、base64、url 必须提供一个base64String否户口本照片base64字符串,file、base64、url 必须提供一个urlString否户口本照片 url,file、base64、url 必须提供一个householdSideString否户主或成员页,默认值subpage。subpage:常住人口登记卡 (成员),homepage:户主页戳这里查看详情返回样例{ "code": 200, // 详见code返回码说明 "msg": "成功", // code 对应的描述 "taskNo": "30853523396532582768", // 本次请求号 "data": { "birthAddress": "广东省英德市",//出生地址 "name": "梁小满",//名称 "relationship": "户主",//与户主关系 "cardNo": "4418221980080063171",//身份证号 "sex": "男",//性别 "nation": "汉族",//民族 "belief": "无宗教信仰",//宗教 "career": "农业",//职业 "maritalStatus": "未婚",//婚姻状态 "registerDate": "2009年6月30日",//登记日期 "birthday": "1980年08月03日",//出生日期 "education": "初中",//学历 "hometown": "广东省英德市",//籍贯 "whenWhereToCity": "1980年09月01日出生",//何时由何地迁来本市(县) "whenWhereToHere": "1980年09月01日出生",//何时由何地迁往本址 "householdNum": "",//户号 "formerName": "",//曾用名 "otherAddress": "",//本市(县)其他住址 "height": "",//身高 "bloodType": "",//血型 "veteranStatus": "",//兵役状况 "workAddress": ""//服务处所 } }
-
前言行驶证OCR识别,即利用图像识别技术,自动提取行驶证照片中的车辆信息,包括:所有人、品牌型号、住址、车牌号、发动机号码、车辆识别代号、注册日期、发证日期。可兼容多种图片格式,准确率可达99%以上。行驶证OCR识别可用于车辆信息快速登记、线上业务材料提交,广泛用于保险、货运平台、租车、车辆管理业务。API介绍请求说明名称类型必须说明fileFile否行驶证照片,file、base64、url 必须提供一个base64String否照片base64字符串,file、base64、url 必须提供一个urlString否照片 url,file、base64、url 必须提供一个sideString否front:正本 back:副本 默认: front正本戳这里查看详情返回样例{ "code": 200,//详见code返回码说明 "msg": "成功",//code对应的描述 "taskNo": "986901198151630094255882",//本次唯一请求号 "data": { "plate_no": "赣**81",//车牌号码 "vehicle_type": "小型轿车",//车辆类型 "owner": "罗*",//所有人 "address": "1西业******元分户",//住址 "model": "长城牌****Q602",//品牌型号 "vin": "LGW****034590",//车辆识别代号 "engine_no": "14***46",//发动机号码 "register_date": "20150104",//注册日期 "issue_date": "20150104",//发证日期 "use_character": "非营运",//使用性质 "issue_by": "北京****公安局",//发证单位 "chip_no": "xxxx",//证芯编号(电子行驶证) "valid_date": "2025年10月",//检验有效期(电子行驶证) "status": "正常",//状态(电子行驶证) "create_time": "2024年04月10日" //生成时间(电子行驶证) } }
-
前言营业执照OCR识别,是通过图像处理、模式识别等技术自动识别营业执照照片中信息,包括:企业名称、统一社会信用代码、法人、类型、注册地址、注册资本、营业期限、经营范围。可实现根据营业执照照片自动录入企业信息,大幅替代人工录入,提升处理效率,广泛用于商户入驻、招投标、企业资质备案等场景,是实现企业相关业务流程自动化的核心技术之一。API介绍请求说明名称类型必须说明fileFile否营业执照照片,file、base64、url 必须提供一个base64String否照片base64字符串,file、base64、url 必须提供一个urlString否照片 url,file、base64、url 必须提供一个戳这里查看详情返回样例{ "code": 200,//详见code返回码说明 "msg": "成功",//code对应的描述 "taskNo": "986901198151630094255882",//本次唯一请求号 "data": { "legal_person": "胡三",//法定代表人或经营者 "capital": "贰佰万元整",//注册资本 "valid_date": "20620802",//营业期限 "address": "浙江省杭州市西湖区文二路12号",//住所或经营场所 "reg_num": "91430102023653079C",//注册号或社会统一信用代码 "company": "杭州万源责任有限公司",//公司名称 "establish_date": "20120803",//注册日期 "business": "通讯产品研发;通讯设备及配套设备批发;移动电信业务代理服务;电子产品、计算机软件、计算机辅助设备的销售。(依法须经批准的项目,经相关部门批准后方可开展经营活动)",//经营范围 "type": "有限责任公司(自然人投资或控股)" //类型 } }
-
前言传统扫码硬件部署成本偏高,普通手机本地拍照解码极易受画面倾斜、反光、污渍、模糊等问题干扰,经常出现识别失败的情况。本接口兼容市面全部主流一维码、二维码格式解析,支持图片 URL、Base64 两种文件提交形式,依托图像增强修复算法大幅提升破损、畸变码图的识别成功率,精准高效解析条码内置明文数据,轻量化对接各类业务系统,轻松完成条码信息自动化解析提取工作。二维码条形码识别在以下场景中应用广泛:物流快递管理商超零售结算仓储库存盘点电子票券核销校验工业生产流程管控政务资料核验移动端系统集成单据档案电子化归档API介绍请求说明名称类型必须说明base64String否图片base64。base64、url、file 三选其一urlString否图片完整url。base64、url、file 三选其一fileFile否图片文件。base64、url、file 三选其一戳这里查看详情返回样例{ "code": 200, // 返回码,详见返回码说明 "msg": "成功", // 返回码对应描述 "taskNo": "55318992410294812098", // 本次请求号 "charge": true, // 计费标志 "data": [ { "text": ["SF1688255711970"],//二维码内容 "type": "CODE_128"//二维码类型 } ] }
-
前言传统人工录入图文资料存在效率低、出错率高、无法留存文字位置版式信息等问题。本通用文字识别 API 依托深度学习优化算法,识别精度最高可达 99.9%,支持图片、PDF、OFD 文件解析,同步返回文本坐标、轮廓点位、段落结构与置信度数据;可快速对接各类业务系统,完成图像文字结构化、版式还原等智能化处理。通用文字识别在以下场景中应用广泛:政务档案数字化财务单据自动处理资质证件信息采集固化电子文档解析日常图文文字提取工业资产信息采集版面还原与标注开发企业办公自动化API介绍请求说明名称类型必须说明imageString否图片base64pdfString否PDF文件的base64pdfNumString否需要识别的PDF文件的对应页码,不传默认识别第 1 页ofdString否OFD文件的base64ofdNumString否需要识别的OFD文件的对应页码,不传默认识别第 1 页fileFile否文件urlString否文件地址image、pdf、ofd、file、url 必须提供一个,优先级:image > pdf > ofd > file > url文件不超过4M,最短边至少15px,最长边最大4096px图片格式为 jpg、png、bmp、jpeg戳这里查看详情返回样例{ "msg": "成功",// code 对应的描述 "code": 200,// 详见code返回码说明 "taskNo": "316942821199035820008485",// 本次请求号 "charge": true, // 计费标志 "data": { "resultNum": 2,//识别结果数 "result": [//识别结果 { "words": "测试第一行",//识别结果字符串 "location": {//位置数组(坐标0点为左上角) "top": 72,//表示定位位置的长方形左上顶点的垂直坐标 "left": 89,//表示定位位置的长方形左上顶点的水平坐标 "width": 52,//表示定位位置的长方形的宽度 "height": 12//表示定位位置的长方形的高度 }, "probability": {//表示识别结果中每一行的置信度值 "average": 0.9956096411,//行置信度平均值 "min": 0.9842295051,//行置信度最小值 "variance": 0.00003516419747//行置信度方差 }, "vertexesLocation": [//识别结果中每一行的外包四边形点坐标 { "x": 90,//水平坐标(坐标0点为左上角) "y": 73//垂直坐标(坐标0点为左上角) }, { "x": 142, "y": 73 }, { "x": 142, "y": 85 }, { "x": 90, "y": 85 } ], "finegrainedVertexesLocation": [//识别结果中每一行的多边形轮廓点坐标 { "x": 89, "y": 72 }, { "x": 101, "y": 72 }, { "x": 113, "y": 72 }, { "x": 124, "y": 72 }, { "x": 136, "y": 72 }, { "x": 141, "y": 72 }, { "x": 141, "y": 78 }, { "x": 141, "y": 84 }, { "x": 130, "y": 84 }, { "x": 118, "y": 84 }, { "x": 106, "y": 84 }, { "x": 95, "y": 84 }, { "x": 89, "y": 84 }, { "x": 89, "y": 78 } ] }, ], "paragraphsResult": [//段落检测结果 { "wordsResultIdx": [//一个段落包含的行序号 0, 1 ], "finegrainedVertexesLocation": [//识别结果中每一行的多边形轮廓点坐标 { "x": 89, "y": 72 }, { "x": 101, "y": 72 }, { "x": 113, "y": 72 }, { "x": 124, "y": 72 }, { "x": 136, "y": 72 }, { "x": 141, "y": 72 }, { "x": 141, "y": 72 }, { "x": 141, "y": 84 }, { "x": 141, "y": 88 }, { "x": 141, "y": 100 }, { "x": 141, "y": 100 }, { "x": 129, "y": 100 }, { "x": 117, "y": 100 }, { "x": 104, "y": 99 }, { "x": 92, "y": 99 }, { "x": 89, "y": 99 }, { "x": 89, "y": 99 }, { "x": 89, "y": 87 }, { "x": 89, "y": 84 }, { "x": 89, "y": 72 } ] } ], "paragraphsResultNum": 1,//识别结果数,表示 paragraphsResult 的元素个数 "pdfFileSize": 1//传入PDF文件的总页数,当 pdfFile 参数有效时返回该字段 } }
-
前言在日常生活、工作中,往往需要从一张图片中自动识别出:图片中有什么,主要内容是什么。那么图片检测分类能帮你完成。图片检测分类可对图片中的文档、卡证、票据等含文字的主体进行检测、分类。可同时支持一张图片中多张主体的情况,返回每个主体的类别及位置信息。图片检测分类通常可以和卡证类识别、票据类识别结合使用,先用图片检测分类检测是什么,然后再用对应的卡证类、票据类识别来识别具体内容。API介绍请求参数名称类型必须说明base64String否图片base64字符串urlString否图片url戳这里可查看详细介绍返回样例{ "code": 200, //返回码,详见code返回码说明 "msg": "成功", //code对应的描述 "taskNo": "576437785202759366455607", //本次请求号 "data": { "list": [//检测和分类结果数组,如图片中无文字内容,则此数组为空 { "probablity": 0.9999736547,//分类置信度 "location": {//位置数组(左上角为坐标0点) "top": 570,//表示定位位置的长方形左上顶点的垂直坐标 "left": 11,//表示定位位置的长方形左上顶点的水平坐标 "width": 774,//表示定位位置的长方形的宽度 "height": 464 //表示定位位置的长方形的高度 }, "type": "卡证_身份证_副" //类别信息,当前可输出类别列表见:类别列表 } ] } }
-
最近刷到不少 “拍万物就能问 AI” 的工具,本来以为又是换皮的玩具功能,结果上手试了这款「看图识万物」API,直接被它的实用度惊到了。今天就以纯测评视角,聊聊这个接口到底是 “智商税” 还是 “宝藏工具”。先上结论:它到底是什么?一句话总结:这不是个只会打标签的普通图像识别 API,而是个「自带知识库的看图问答神器」。它基于视觉模型 + 多模态大模型,能识别图片里的主体,还能根据你的提问,整合百科和实时网络信息,直接给出完整答案。从动植物、名人到汽车、文物,几乎你能想到的常见品类,它都能 hold 住。先给大家划个测评重点:✅ 新用户免费送 5 次调用,零成本就能测效果✅ 支持图片 URL 和 Base64 两种上传方式,适配各种开发场景✅ 能识别 + 能问答 + 能联网,不是单纯的 “打标签工具”✅ 阶梯式定价,从个人开发者到企业级都能用戳这里上手实测:用起来到底有多简单?1、 我直接去看了官方的调试文档,整个调用流程对开发者来说非常友好,甚至新手也能快速上手:核心请求逻辑很清晰:请求地址:固定接口请求方式:标准 POST,格式用最通用的x-www-form-urlencoded,所有语言都能轻松对接必填参数:就 2 个:✨图片(image/url二选一):直接传公网图片 URL 或者 Base64 编码的图片就行✨你的问题(question):比如 “这是什么?”“这个演员最近有什么新作品?”可选拓展:还能通过searchResult和baikeResult控制要不要返回引用源和百科信息,细节拉满。我自己用免费额度测了下:传了一张路边拍的不知名小花,提问 “这是什么花?”,接口几秒内就返回了识别结果 + 详细百科介绍,连它的品种、花期、分布地区都给出来了,完全不用我再去手动搜资料。2、效果实测:识别准不准?问答够不够智能?我挑了几个大家关心的场景,做了个小测试:测试场景输入图片 + 问题接口输出结果动植物识别一张多肉照片,问 “这是什么品种?好养吗?”识别出具体品种,附带养护难度、浇水频率等百科信息名人影视问答一张明星剧照,问 “这是哪部剧?他最近的新电影是什么?”识别出演员 + 剧名,同时给出了该演员最新的影视作品信息汽车识别一张停在路边的车,问 “这是什么车?大概多少钱?”识别出车型和年份,附带参考价格和车型介绍文物 / 商品识别一张博物馆拍的瓷器照片,问 “这是什么年代的?有什么背景?”识别出文物名称和年代,整合了权威百科的历史信息整体下来,识别准确率比我预想的高很多,而且问答不是那种生硬的模板回答,而是根据问题给出了针对性的信息,连时效性的内容(比如新电影、新款车型)都能覆盖到,这点确实超出预期。谁适合用?这些场景用它直接 “开挂”很多人可能会说:“我自己用 AI 生成工具不也能实现?” 但这个 API 的优势,在于它能直接集成到你的产品里,解决真实业务场景的痛点:AI 助手 / 聊天机器人:给对话产品加上 “看图提问” 能力,用户不用再打字描述,直接发图就能问,体验直接拉满;儿童学习机 / 科普 APP:孩子指着绘本、标本问问题,设备就能直接给出带百科信息的回答,比干巴巴的讲解有趣多了;智能硬件 / 车载设备:集成到相机、智能眼镜里,实现 “指着万物就能问” 的功能,实用性拉满;内容社区工具:给图文平台加上智能识别,自动给图片打标签、补充话题和百科信息,帮创作者省超多事。价格 & 性价比:新用户直接免费玩,企业级也有方案很多人担心这种 API 的调用成本太高,我特意看了下它的定价方案,覆盖了从个人到企业的所有需求:新用户直接送5 次免费调用,不用花钱就能完整体验功能;低门槛套餐:2 元就能买 8 次调用,个人开发者小测试完全够用;企业级套餐:最高到 16000 元 / 10 万次调用,调用量越大单次成本越低,高并发场景也能 hold 住。对比市面上同类型的多模态识别 API,这个价格区间的性价比确实能打,尤其是它自带联网百科问答能力,不用自己额外对接知识库,开发成本直接省了一大截。总结:它不是 “玩具 API”,是真能解决问题的工具测下来,这款「看图识万物」API,给我的感觉是 “超出预期的实用”。它不是那种只能用来玩的 demo 级功能,而是能直接落地到真实业务里,帮开发者解决 “看图 + 问答 + 知识库” 的全链路问题。如果你正在做 AI 助手、智能硬件或者科普类产品,想要低成本快速实现 “万物识别 + 问答” 的能力,这个接口真的可以去试试,毕竟新用户免费额度摆在那,零成本就能上手。
-
简介图像内容理解,即采用图像理解视觉大模型,可多维度识别与理解图片内容,包括人、物、行为、场景、文字等,支持输出对图片内容的一句话描述,同时返回图片的分类标签、文字内容等信息。主要功能包括:图片理解与内容描述多维度理解图片内容,支持输出对图片内容的一句话描述,结合大语言模型,可应用于看图问答、视觉推理等场景。物体和场景全识别识别动物、植物、商品、建筑、风景、动漫、食材、公众人物等10万个常见物体及场景,支持拼接返回大类及细分类名称。图片文字全识别检测并识别图片内的全部文字信息,涵盖文档、证件等常见场景,支持输出文字内容及文字位置。API介绍图像内容理解服务涉及 2 个接口,分别为:图像内容理解-提交请求:支持传入图片、提问等参数,创建图像内容理解任务,该接口会返回任务ID。图像内容理解-获取结果:在任务成功创建后,支持传入任务ID,查看任务处理的状态、获取处理完成后返回的结果。详细请参考此处提交请求请求参数名称类型必须说明imageString否图片的base64urlString否图片完整 url,url 长度不超过 1024 字节questionString是提问信息,如“这张图片里有什么?”、“图中的人物是谁,并进行简单介绍”,限制 100 个字符之内image、url 必须提供一个,优先级:url > base64。大小不超过10M,最短边至少64px,最长边最大8192px,图片格式支持jpg/jpeg/png格式。超过4096px的图片,将被自动等比例压缩至4096px进行处理,压缩后会影响处理效果返回样例{ "code": 200,// 返回码,详见返回码说明 "msg": "成功",// 返回码对应描述 "taskNo": "043439882226367117195632",// 本次请求号 "data": { "taskId": "xxxx" //用于获取结果 } } 获取结果请求参数名称类型必须说明taskIdString是提交请求接口返回的taskId返回样例{ "code": 200,//返回码,详见返回码说明 "msg": "成功",//返回码对应描述 "taskNo": "571436032193067500962066",//本次请求号 "data": { "resultCode": "0",//任务状态,0:处理成功;1:处理中 "description": "这张图里面有:\n\n1. 一个人正在讲台上讲话, xxxxxx",//针对输入的 question 问题,对图片内容进行分析后输出的答案 "resultMsg": "处理成功" //任务状态描述 } }
-
解决方案: step1:感兴趣区域调节是为了摄像头只检测到车道线,首先观察图像中车道线是否在感兴趣区域(蓝色区域)内。如下图:图像偏低或者肉眼发现摄像头下垂,那么就调整摄像头的高度。 step2:若调节摄像头的高度后,车道线依旧不在感兴趣区域内,或者区域太大识别到其他部分,影响到舵机控制,则调整LKAS代码文件中region_of_interest函数的vertices = np.array([[(10, imshape[0]), (imshape[1] * 5 / 34, imshape[0] * 2 / 3), (imshape[1] * 29 / 34, imshape[0] * 2 / 3), (imshape[1] - 20, imshape[0])]], dtype=np.int32)感兴趣区域四个坐标,保证车道线在感兴趣区域内或者截取掉多余区域。 左下角:(10, imshape[0])左上角:(imshape[1] * 5 / 34, imshape[0] * 2 / 3)右上角:(imshape[1] * 29 / 34, imshape[0] * 2 / 3)右下角:(imshape[1] - 20, imshape[0])连接这些点,形成一个梯形的感兴趣区域,更改这些点,改变区域的大小和形状。
上滑加载中
推荐直播
-
用码道,让你的AI作品三步上朋友圈2026/08/04 周二 19:00-20:00
林华鼎-华为云AI开发者运营负责人
从入门 · 到做AI应用 · 到企业级开发。不教编程,只教用AI · 零代码、有产出、能带走、可炫耀 · 每课人人动手实操
回顾中 -
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
基于华为云码道,构建你的定制化AI搭子2026/08/14 周五 09:00-11:30
明亮-华为云开发者发展与支持部部长
本期直播将向您全面介绍华为云码道产品,并基于码道手把手教你部署自己的定制化AI陪伴搭子。
回顾中
热门标签