- 对电影评分数据进行分析,使用SQL编程,获取电影平均分Top10,要求电影的评分次数大于200 数据展示 代码 package org.example.SQL import org.apache.log4j.{Level, Logger}import org.apache.spark.sql.{DataF... 对电影评分数据进行分析,使用SQL编程,获取电影平均分Top10,要求电影的评分次数大于200 数据展示 代码 package org.example.SQL import org.apache.log4j.{Level, Logger}import org.apache.spark.sql.{DataF...
- 共享变量 广播变量(Broadcast Variables):广播变量用来把变量在所有节点的内存之间进行共享,在每个机器上缓存一个只读的变量,而不是为机器上的每个任务都生成一个副本,简单理解:减少内存,减小计算压力; 累加器(Accumulators):累加器支持在所有不同节点之间进行累加计算(比如计数或者求和); ... 共享变量 广播变量(Broadcast Variables):广播变量用来把变量在所有节点的内存之间进行共享,在每个机器上缓存一个只读的变量,而不是为机器上的每个任务都生成一个副本,简单理解:减少内存,减小计算压力; 累加器(Accumulators):累加器支持在所有不同节点之间进行累加计算(比如计数或者求和); ...
- 文章目录 一、pyspark.sql部分1.窗口函数2.更换列名:3.sql将一个字段根据某个字符拆分成多个字段显示4.pd和spark的dataframe进行转换:5.报错ValueError:... 文章目录 一、pyspark.sql部分1.窗口函数2.更换列名:3.sql将一个字段根据某个字符拆分成多个字段显示4.pd和spark的dataframe进行转换:5.报错ValueError:...
- 文章目录 零、本讲学习目标一、基本数据源(一)文件流1、读取文件流概述2、读取文件流演示 零、本讲学习目标 掌握Spark Streaming基本数据源掌握Spark Strea... 文章目录 零、本讲学习目标一、基本数据源(一)文件流1、读取文件流概述2、读取文件流演示 零、本讲学习目标 掌握Spark Streaming基本数据源掌握Spark Strea...
- 文章目录 零、本讲学习目标一、Spark Streaming概述(一)什么是Spark Streaming(二)Sparing Streaming的主要优点1、易于使用2、易于与Spark体系整合... 文章目录 零、本讲学习目标一、Spark Streaming概述(一)什么是Spark Streaming(二)Sparing Streaming的主要优点1、易于使用2、易于与Spark体系整合...
- 文章目录 零、本讲学习目标一、使用Spark SQL实现词频统计(一)数据源 - words.txt(二)创建Maven项目(三)添加依赖和构建插件(四)修改源目录名称(五)创建日志属性文件(六)... 文章目录 零、本讲学习目标一、使用Spark SQL实现词频统计(一)数据源 - words.txt(二)创建Maven项目(三)添加依赖和构建插件(四)修改源目录名称(五)创建日志属性文件(六)...
- 文章目录 零、本讲学习目标一、Spark SQL内置函数(一)内置函数概述1、10类内置函数2、两种使用方式 (二)内置函数演示1、通过编程方式使用内置函数upper()2、通过SQL语句的... 文章目录 零、本讲学习目标一、Spark SQL内置函数(一)内置函数概述1、10类内置函数2、两种使用方式 (二)内置函数演示1、通过编程方式使用内置函数upper()2、通过SQL语句的...
- 文章目录 零、本讲学习目标一、Spark SQL读取关系数据库二、Spark SQL JDBC连接属性三、创建数据库与表(一)创建数据库(二)创建学生表(二)创建成绩表 四、读取和写入数据库表... 文章目录 零、本讲学习目标一、Spark SQL读取关系数据库二、Spark SQL JDBC连接属性三、创建数据库与表(一)创建数据库(二)创建学生表(二)创建成绩表 四、读取和写入数据库表...
- 文章目录 零、本讲学习目标一、Spark SQL支持读写Hive二、Spark配置hive-site.xml三、准备工作(一)启动Hive的metastore(二)启动Spark Shell ... 文章目录 零、本讲学习目标一、Spark SQL支持读写Hive二、Spark配置hive-site.xml三、准备工作(一)启动Hive的metastore(二)启动Spark Shell ...
- 文章目录 零、本讲学习目标一、读取JSON文件概述二、读取JSON文件案例演示(一)创建JSON文件并上传到HDFS(二)读取JSON文件,创建临时表,进行关联查询1、读取user.json文件,... 文章目录 零、本讲学习目标一、读取JSON文件概述二、读取JSON文件案例演示(一)创建JSON文件并上传到HDFS(二)读取JSON文件,创建临时表,进行关联查询1、读取user.json文件,...
- 文章目录 一、任务描述 二、实现步骤 (一)引入包并构建训练数据集 (二)定义工作流阶段 (三)创建工作流,训练出模型 (四)构建测试... 文章目录 一、任务描述 二、实现步骤 (一)引入包并构建训练数据集 (二)定义工作流阶段 (三)创建工作流,训练出模型 (四)构建测试...
- 文章目录 零、本讲学习目标一、基本操作(一)默认数据源1、默认数据源Parquet2、案例演示读取Parquet文件(1)在Spark Shell中演示(2)通过Scala程序演示 ... 文章目录 零、本讲学习目标一、基本操作(一)默认数据源1、默认数据源Parquet2、案例演示读取Parquet文件(1)在Spark Shell中演示(2)通过Scala程序演示 ...
- 文章目录 一、索引分区映射概述 二、索引分区映射案例 (一)每个元素翻10倍,不显示分区索引 (二)每个元素翻10倍,要显示分区索引 ... 文章目录 一、索引分区映射概述 二、索引分区映射案例 (一)每个元素翻10倍,不显示分区索引 (二)每个元素翻10倍,要显示分区索引 ...
- 文章目录 零、回顾一、使用Spark SQL完成任务1里面的数据筛选二、使用Spark SQL完成任务2里面的统计(列可以不统计)三、使用Spark SQL完成任务3的分组统计 零、回顾 ... 文章目录 零、回顾一、使用Spark SQL完成任务1里面的数据筛选二、使用Spark SQL完成任务2里面的统计(列可以不统计)三、使用Spark SQL完成任务3的分组统计 零、回顾 ...
- 学习总结 文章目录 学习总结一、数据统计1.1 读取文件1.2 保存读取的信息1.3 分析每列的类型,取值个数1.4 分析每列是否包含缺失值 二、分组聚合2.1 学习groupby分组聚合的... 学习总结 文章目录 学习总结一、数据统计1.1 读取文件1.2 保存读取的信息1.3 分析每列的类型,取值个数1.4 分析每列是否包含缺失值 二、分组聚合2.1 学习groupby分组聚合的...
上滑加载中
推荐直播
-
昇腾AI算法挑战赛-核心算子如何优化?专家带你深度解析2025/11/17 周一 16:00-17:00
王老师 华为算子专家
昇腾AI算法挑战赛进阶赛战鼓催征!本期直播间,我们特邀华为算子专家王老师,为你深度剖析Matmul、wholereducesum等核心算子的底层原理与优化技巧,直击赛题核心。想提升代码效率、冲击更高排名?锁定直播,带你破局!
回顾中 -
AI编码实干派,“码”力全开2026/02/26 周四 15:00-16:30
谈宗玮/于邦旭/丁俊卿/陈云亮/王一男
【中国,深圳,2026年2月26日】,以“AI编码实干派,码力全开”为主题的华为云码道(CodeArts)代码智能体新春发布会在线上成功召开。华为云码道公测版正式发布,为开发者和企业提供具备工程化能力的智能编码解决方案。
回顾中 -
华为云码道-玩转OpenClaw,开启在线养虾模式2026/03/11 周三 19:00-20:00
刘昱,华为云高级工程师/谈心,华为云技术专家/李海仑,上海圭卓智能科技有限公司CEO
OpenClaw 火爆开发者圈,华为云码道最新推出 Skill ——开发者只需输入一句口令,即可部署一个功能完整的「小龙虾」智能体。直播带你玩转华为云码道,玩转OpenClaw
回顾中
热门标签