05-快速理解SparkSQL的DataSet_ZenDei技術網路在線

05-快速理解SparkSQL的DataSet

-Advertisement-

1 定義一個數據集是分散式的數據集合。Spark 1.6增加新介面Dataset，提供 RDD的優點：強類型、能夠使用強大lambda函數 Spark SQL優化執行引擎的優點可從JVM對象構造Dataset，然後函數式轉換（map、flatMap、filter等）操作。Dataset API在 ...

1 定義

一個數據集是分散式的數據集合。Spark 1.6增加新介面Dataset，提供

RDD的優點：強類型、能夠使用強大lambda函數
Spark SQL優化執行引擎的優點

可從JVM對象構造Dataset，然後函數式轉換（map、flatMap、filter等）操作。Dataset API在Scala和Java中可用。

Python不支持Dataset API，但由於Python動態性質，許多Dataset API優點已經能使用（可通過名稱自然訪問行的欄位row.columnName）。R的情況類似。

Python支持DataFrame API是因為DataFrame API是基於Python#Pandas庫構建，而Pandas庫提供強大易用的數據分析工具集。因此，Spark提供對Pandas DataFrame對象的支持，使Python使用DataFrame API非常方便。Python的Pandas也提供強類型保證，使Spark可在保持動態特性同時提供類型檢查和類型推斷。因此，雖Python不支持Spark的Dataset API，但它支持Spark的DataFrame API，這為Python用戶提供一種方便的數據處理方式。

2 案例

package com.javaedge.bigdata.cp04

import org.apache.spark.sql.{DataFrame, Dataset, SparkSession}

object DatasetApp {

  def main(args: Array[String]): Unit = {
    val projectRootPath = "/Users/javaedge/Downloads/soft/sparksql-train"
    val spark = SparkSession.builder()
      .master("local").appName("DatasetApp")
      .getOrCreate()
    import spark.implicits._

    // 創建一個包含一條記錄的Seq，這條記錄包含一個名為 "JavaEdge" 年齡為 18 的人員信息
    val ds: Dataset[Person] = Seq(Person("JavaEdge", "18"))
      // 將Seq轉換為一個Dataset[Person]類型數據集，該數據集只包含一條記錄
      .toDS()
    ds.show()

    val primitiveDS: Dataset[Int] = Seq(1, 2, 3).toDS()
    primitiveDS.map(x => x + 1).collect().foreach(println)

    val peopleDF: DataFrame = spark.read.json(projectRootPath + "/data/people.json")
    val peopleDS: Dataset[Person] = peopleDF.as[Person]
    peopleDS.show(false)
    peopleDF.select("name").show()
    peopleDS.map(x => x.name).show()

    spark.stop()
  }

  /**
   * 自定義的 case class，其中包含兩個屬性
   */
  private case class Person(name: String, age: String)

}

output：
+--------+---+
|    name|age|
+--------+---+
|JavaEdge| 18|
+--------+---+

2
3
4
+----+-------+
|age |name   |
+----+-------+
|null|Michael|
|30  |Andy   |
|19  |Justin |
+----+-------+

+-------+
|   name|
+-------+
|Michael|
|   Andy|
| Justin|
+-------+

+-------+
|  value|
+-------+
|Michael|
|   Andy|
| Justin|
+-------+

3 DataFrame V.S Dataset

val peopleDF: DataFrame = spark.read.json(projectRootPath + "/data/people.json")
val peopleDS: Dataset[Person] = peopleDF.as[Person]
peopleDS.show(false)

// 弱語言類型，運行時才報錯
peopleDF.select("nameEdge").show()

編譯期報錯：

關註我，緊跟本系列專欄文章，咱們下篇再續！

作者簡介：魔都技術專家兼架構，多家大廠後端一線研發經驗，各大技術社區頭部專家博主。具有豐富的引領團隊經驗，深厚業務架構和解決方案的積累。

負責：

中央/分銷預訂系統性能優化

活動&優惠券等營銷中台建設

交易平臺及數據中台等架構和開發設計

車聯網核心平臺-物聯網連接平臺、大數據平臺架構設計及優化

目前主攻降低軟體複雜性設計、構建高可用系統方向。

參考：

編程嚴選網

本文由博客一文多發平臺 OpenWrite 發佈！

您的分享是我們最大的動力!

-Advertisement-

更多相關文章

解放雙手！這個插件只要一張表就能生成CRUD代碼

EasyCode —— 基於 IntelliJ IDEA Ultimate 版開發的一個代碼生成插件，主要通過自定義模板（基於 velocity）來生成各種你想要的代碼。 ...
從靜態到動態化，Python數據可視化中的Matplotlib和Seaborn

本文詳細介紹瞭如何使用Python中的Matplotlib、Seaborn、Bokeh和Plotly等庫進行數據可視化，並深入探討了一系列主題，涵蓋了從基礎的靜態圖表到高級的交互性和動態可視化的方方面面。 ...
阿裡二面：Java中鎖的分類有哪些？你能說全嗎？

本文主要講述Java中各類鎖機制的特點，包括重入鎖、悲觀/樂觀鎖、偏向/輕量級/重量級鎖、分段鎖和自旋鎖，闡述其優缺點及一些適用場景。 ...
基於R語言的GD庫實現地理探測器並自動將連續變數轉為類別變數

本文介紹基於R語言中的GD包，依據柵格影像數據，實現自變數最優離散化方法選取與執行，併進行地理探測器（Geodetector）操作的方法~ ...
馬斯克開源的 grok-1 底層 Transformer 模型論文《Attention is All You Need》

拓展閱讀馬斯克開源的 grok-1 底層 Transformer 模型論文《Attention is All You Need》馬斯克開源的 grok-1 大模型底層 Transformer 模型到底是個啥？馬斯克開源的 grok-1 大模型硬核源碼第 1 彈馬斯克開源的 grok-1 大 ...
aardio封裝庫) sunny抓包工具的使用

前言還有個迭代器，基礎語法基本已經說完了，後面想到啥再補充，之後的教程會從以下方面來講：基礎庫的使用，比如string、table等基礎控制項的使用，比如listview、tab等 aardio和Python交互，比如給Python寫個界面自帶的範常式序我寫的一些小程式當然，我的理解也是很 ...
爬蟲實戰+數據分析：全國消費支出分析及未來預測

完美收官，本文是爬蟲實戰的最後一章了，所以儘管本文著重呈現爬蟲實戰，但其中有一大部分內容專註於數據分析。爬蟲只是整個過程的起點，其主要目的之一就是為後續數據分析等工作做好準備。通過對爬取的數據進行精確的清洗和分析，可以揭示其中隱藏的規律和趨勢，為決策提供有力支持。因此，爬蟲實戰並不僅僅是技術的展示，... ...
啪，還敢拋出異常

前言去年又重新刷了路遙的《平凡的世界》，最近也在朋友推薦下，來看了路遙的另一部成名作《人生》。故事中的主人公高加林，雖生在農村，面朝黃土背朝天，卻不甘心像父輩一樣或者，一心想著擺脫民語的束縛，追求他的理想生活。然而命運多舛，在他所想象的理想生活中，一次次跌倒，最終不得不承認自己的平凡，生活總得 ...