加入收藏 | 设为首页 | 会员中心 | 我要投稿 广元站长网 (https://www.0839zz.com/)- 科技、建站、经验、云计算、5G、大数据,站长网!
当前位置: 首页 > 站长资讯 > 外闻 > 正文

“5G+医疗”商用潜力凸显

发布时间:2021-02-21 15:56:52 所属栏目:外闻 来源:互联网
导读:parkMagic真正有用之处在于实现本地Notebook和远程群集之间无缝传递数据。数据科学家的日常挑战是在与临时集群合作以与其公司的数据湖进行交互的同时,创建并保持其Python环境。 在下例中,我们可以看到如何将seaborn导入为本地库,并使用它来绘制covid_data

parkMagic真正有用之处在于实现本地Notebook和远程群集之间无缝传递数据。数据科学家的日常挑战是在与临时集群合作以与其公司的数据湖进行交互的同时,创建并保持其Python环境。

在下例中,我们可以看到如何将seaborn导入为本地库,并使用它来绘制covid_data pandas数据框。

这些数据从何而来?它是由远程Spark集群创建并发送的。神奇的%%spark-o允许我们定义一个远程变量,以在单元执行时转移到本地笔记本上下文。我们的变量covid_data是一个远程集群上的SparkSQL Data Frame,和一个本地JupyterNotebook中的PandasDataFrame。


 

如图所示,SparkMagic自动启动了一个远程PySpark会话,并提供了一些有用的链接以连接到Spark UI和日志。

Notebook集成了2种环境:

  • %%local,可在笔记本电脑和jupyter docker映像提供的anaconda环境中本地执行单元
  • %%spark,通过远程Spark集群上的PySpark REPL,再通过Livy REST API远程执行单元

首先将以下code cell远程导入SparkSql数据类型;其次,它使用远程SparkSession将Enigma-JHU Covid-19数据集加载到我们的远程Spark集群中。可以在Notebook中看到remote .show()命令的输出:


 

SparkMagic能够:

  • 以多种语言运行Spark代码
  • 提供可视化的SQL查询
  • 轻松访问Spark应用程序日志和信息
  • 针对任何远程Spark集群自动创建带有SparkContext和HiveContext的SparkSession
  • 将Spark查询的输出捕获为本地Pandas数据框架,以轻松与其他Python库进行交互(例如matplotlib)
  • 发送本地文件或Pandas数据帧到远程集群(例如,将经过预训练的本地ML模型直接发送到Spark集群)

可以使用以下Dockerfile来构建具有SparkMagic支持的Jupyter Notebook:


 

很多数据科学家都在高规格笔记本电脑上进行本地工作,可以更加轻松地安装和持久保存Jupyter Notebook环境。那么这些数据科学家们如何将其本地开发环境与生产数据湖中的数据联系起来?通常,他们使用Spark实现了csv文件,并从云存储控制台下载了它们。

从云存储控制台手动下载csv文件既不高效,也没有特别强大的功能。如果能以终端用户友好且透明的方式无缝地将本地的Jupyter Notebook与远程集群连接起来,岂不是更好吗?

学好SparkMagic,打破数据科学二八法则的时间到了!

适用于Jupyter NoteBook的SparkMagic

Sparkmagic是一个通过Livy REST API与Jupyter Notebook中的远程Spark群集进行交互工作的项目。它提供了一组Jupyter Notebook单元魔术和内核,可将Jupyter变成用于远程集群的集成Spark环境。



(编辑:广元站长网)

【声明】本站内容均来自网络,其相关言论仅代表作者个人观点,不代表本站立场。若无意侵犯到您的权利,请及时与联系站长删除相关内容!

    热点阅读