首页 > 资讯 > 后端开发 > Python >pycharm利用pyspark远程连接spark集群的实现

288

分享到

pycharm利用pyspark远程连接spark集群的实现

2024-04-02 19:04:59 288人浏览薄情痞子

Python 官方文档：入门教程 => 点击学习

摘要

0 背景由于工作需要，利用spark完成机器学习。因此需要对spark集群进行操作。所以利用PyCharm和pyspark远程连接spark集群。这里记录下遇到的问题及方法。主要

0 背景

由于工作需要，利用spark完成机器学习。因此需要对spark集群进行操作。所以利用PyCharm和pyspark远程连接spark集群。这里记录下遇到的问题及方法。
主要是参照下面的文献完成相应的内容，但是具体问题要具体分析。

1 方法

1.1 软件配置
spark2.3.3, hadoop2.6, python3
1.2 spark配置
Spark集群的每个节点的python版本必须保持一致。在每个节点的$SPARK_HOME/conf/spark-env.sh中添加一行：具体看你的安装目录。


export PYSPARK_Python=/home/hadoop/anaconda2/bin/python3

此步骤就是将python添加到spark的配置中。
此时，在服务器命令行输入pyspark时，可以正常进入spark。
1.3本地配置
1.3.1 首先将spark2.3.3从服务器拷贝到本地。
注意： 由于我集群安装的是spark-2.3.3-bin-without-hadoop。但是拷贝到本地后，总是报错Java gateway process… 。同时我将hadoop2.6,的包也从服务器拷贝到本地加载到程序中，同样报错。
最后，直接从spark的官网中，下载了spark-2.3.3-bin-hadoop2.6，这回就可以了。
pyspark的版本与spark的版本最好对应。比如pyspark2.3.3，spark2.3.3


# os.environ['SPARK_HOME'] = r"F:\big_data\spark-2.3.3-bin-without-hadoop"(无用)
os.environ['SPARK_HOME'] = r"F:\big_data\spark-2.3.3-bin-hadoop2.6"（有用）
# os.environ["HADOOP_HOME"] = r"F:\big_data\hadoop-2.6.5"（无用）
# os.environ['JAVA_HOME'] = r"F:\Java\jdk1.8.0_144"（无用）

1.3.2
C:\windows\System32….\hosts(Windows机器)中加入Spark集群Master节点的IP与主机名的映射。需要管理员权限修改。

在这里插入图片描述

其中的spark_cluster就是对于Master的IP的映射名。（直接写IP一样可以，映射名是为了方便）
1.3.3
添加刚刚下载解压好的spark的python目录到pycharm的project structure

在这里插入图片描述

1.3.4
新建py文件，编辑Edit Configurations添加SPARK_HOME变量

在这里插入图片描述

注意： 在实际中，这个不添加好像也可以。只需要在程序中加载了spark_home.比如os.envion(…spark…)

2 测试


import os
from pyspark import SparkContext
from pyspark import SparkConf
# os.environ['SPARK_HOME'] = r"F:\big_data\spark-2.3.3-bin-without-hadoop"
os.environ['SPARK_HOME'] = r"F:\big_data\spark-2.3.3-bin-hadoop2.6"
# os.environ["HADOOP_HOME"] = r"F:\big_data\hadoop-2.6.5"
# os.environ['JAVA_HOME'] = r"F:\Java\jdk1.8.0_144"
print(0)
conf = SparkConf().setMaster("spark://spark_cluster:7077").setAppName("test")
sc = SparkContext(conf=conf)
print(1)
logData = sc.textFile("file:///opt/spark-2.3.3-bin-without-hadoop/README.md").cache()
print(2)
print("num of a",logData)
sc.stop()

在这里插入图片描述

3 参考

PyCharm+PySpark远程调试的环境配置的方法
Spark下：Java gateway process exited before sending the driver its port number等问题

估计每个人遇到的问题不一样，但是大同小异，具体问题具体分析。

到此这篇关于pycharm利用pyspark远程连接spark集群的实现的文章就介绍到这了,更多相关pyspark远程连接spark集群内容请搜索编程网以前的文章或继续浏览下面的相关文章希望大家以后多多支持编程网！

您可能感兴趣的文档:

--结束END--

本文标题: pycharm利用pyspark远程连接spark集群的实现

本文链接: https://lsjlt.com/news/126167.html(转载时请注明来源链接)

有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

回答

如何调试操作系统的错误？
操作系统

2023-11-15发布

回答

操作系统中的I/O系统是如何实现的？
操作系统

2023-11-15发布

回答

如何实现操作系统的内存管理？
操作系统

2023-11-15发布

回答

什么是虚拟内存，它对操作系统有什么影响？
操作系统

2023-11-15发布

回答

ASP中的MVC架构和WebForms架构有什么区别和使用场景？
ASP.NET

2023-11-15发布

回答

ASP中的数据验证和数据校验有什么不同？
ASP.NET

2023-11-15发布

回答

ASP中的ADO对象和DAO对象有什么区别和使用方法？
ASP.NET

2023-11-15发布

回答

Node.js中的包管理器NPM是什么？如何使用它进行依赖管理？
node.js

2023-11-15发布

回答

Vue.js中的动态组件是什么？如何使用它来动态渲染组件？
VUE

2023-11-15发布

回答

如何使用Vue.js实现懒加载和预加载？
VUE

2023-11-15发布

pycharm利用pyspark远程连接spark集群的实现

0 背景

1 方法

2 测试

3 参考

pycharm利用pyspark远程连接spark集群的实现

关于IDEA创建spark maven项目并连接远程spark集群问题

Pycharm远程连接服务器跑代码的实现

RedisLettuce连接redis集群实现过程详细讲解

利用PyCharm实现远程开发的实用指南

PyCharm利用pydevd-pycharm实现Python远程调试的详细过程

利用Pycharm连接服务器的全过程记录

RedisDesktopManager远程连接redis的实现

利用Intellij Idea连接远程服务器实现远程上传部署功能

如何实现mysql的远程连接

如何使用php实现远程连接

portainer连接远程docker的实现示例

Mariadb如何利用MariaDB Galera Cluster实现mariadb的集群环境

如何利用SSH通道来连接远程的Mysql

利用nginx实现动静分离的负载均衡集群实战

Docker远程连接设置的实现示例

AutoDL租用实例、配置环境、Pycharm中SSH、SFTP连接远程服务器、Pycharm访问远程服务器终端

scrapy框架中用ssh连接远程服务器的实现

CentOS7安装GUI界面及远程连接的实现

Redis远程连接Redis客户端的实现步骤

python分析数据的方法是什么

如何使用Python实现抽奖小程序

python copy函数的作用是什么

python ffmpeg模块怎么安装和使用

python进程池创建队列的方法是什么

python无法运行文件的原因有哪些

python can't open file报错怎么解决

python keyerror错误怎么解决

python字符串处理与应用的方法有哪些

python全局变量如何定义