首页 > 资讯 > 精选 >pyspark自定义UDAF函数调用报错如何解决

348

分享到

pyspark自定义UDAF函数调用报错如何解决

2023-07-02 07:07:49 348人浏览安东尼

摘要

这篇文章主要讲解了“pyspark自定义UDAF函数调用报错如何解决”，文中的讲解内容简单清晰，易于学习与理解，下面请大家跟着小编的思路慢慢深入，一起来研究和学习“pyspark自定义UDAF函数调用报错如何解决”吧！问题场景：在Spark

这篇文章主要讲解了“pyspark自定义UDAF函数调用报错如何解决”，文中的讲解内容简单清晰，易于学习与理解，下面请大家跟着小编的思路慢慢深入，一起来研究和学习“pyspark自定义UDAF函数调用报错如何解决”吧！

问题场景：

在Sparksql中，因为需要用到自定义的UDAF函数，所以用pyspark自定义了一个，但是遇到了一个问题，就是自定义的UDAF函数一直报

AttributeError: 'NoneType' object has no attribute '_JVM'

问题描述

在新建的py文件中，先自定义了一个UDAF函数，然后在 if __name__ == '__main__': 中调用，死活跑不起来，一遍又一遍的对源码，看起来自定义的函数也没错：过程如下:

import decimalimport osimport pandas as pdfrom pyspark.sql import SparkSessionfrom pyspark.sql import functions as Fos.environ['SPARK_HOME'] = '/export/server/spark'os.environ["PYSPARK_python"] = "/root/anaconda3/bin/Python"os.environ["PYSPARK_DRIVER_PYTHON"] = "/root/anaconda3/bin/python"@F.pandas_udf('decimal(17,12)')def udaf_lx(qx: pd.Series, lx: pd.Series) -> decimal:    # 初始值 也一定是decimal类型    tmp_qx = decimal.Decimal(0)    tmp_lx = decimal.Decimal(0)    for index in range(0, qx.size):        if index == 0:            tmp_qx = decimal.Decimal(qx[index])            tmp_lx = decimal.Decimal(lx[index])        else:            # 计算lx: 计算后，保证数据小数位为12位，与返回类型的设置小数位保持一致            tmp_lx = (tmp_lx * (1 - tmp_qx)).quantize(decimal.Decimal('0.000000000000'))            tmp_qx = decimal.Decimal(qx[index])    return tmp_lxif __name__ == '__main__':    # 1) 创建 SparkSession 对象，此对象连接 Hive    spark = SparkSession.builder.master('local[*]') \        .appName('insurance_main') \        .config('spark.sql.shuffle.partitions', 4) \        .config('spark.sql.warehouse.dir', 'hdfs://node1:8020/user/hive/warehouse') \        .config('hive.metastore.uris', 'thrift://node1:9083') \        .enableHiveSupport() \        .getOrCreate()    # 注册UDAF 支持在SQL中使用    spark.udf.reGISter('udaf_lx', udaf_lx)    # 2) 编写SQL 执行    excuteSQLFile(spark, '_04_insurance_dw_prem_std.sql')

然后跑起来就报了以下错误：

Traceback (most recent call last):  File "/root/anaconda3/lib/python3.8/site-packages/pyspark/sql/types.py", line 835, in _parse_datatype_string    return from_ddl_datatype(s)  File "/root/anaconda3/lib/python3.8/site-packages/pyspark/sql/types.py", line 827, in from_ddl_datatype    sc._jvm.org.apache.spark.sql.api.python.PythonSQLUtils.parseDataType(type_str).JSON())AttributeError: 'NoneType' object has no attribute '_jvm'During handling of the above exception, another exception occurred:Traceback (most recent call last):  File "/root/anaconda3/lib/python3.8/site-packages/pyspark/sql/types.py", line 839, in _parse_datatype_string    return from_ddl_datatype("struct<%s>" % s.strip())  File "/root/anaconda3/lib/python3.8/site-packages/pyspark/sql/types.py", line 827, in from_ddl_datatype    sc._jvm.org.apache.spark.sql.api.python.PythonSQLUtils.parseDataType(type_str).json())AttributeError: 'NoneType' object has no attribute '_jvm'During handling of the above exception, another exception occurred:Traceback (most recent call last):  File "/root/anaconda3/lib/python3.8/site-packages/pyspark/sql/types.py", line 841, in _parse_datatype_string    raise e  File "/root/anaconda3/lib/python3.8/site-packages/pyspark/sql/types.py", line 831, in _parse_datatype_string    return from_ddl_schema(s)  File "/root/anaconda3/lib/python3.8/site-packages/pyspark/sql/types.py", line 823, in from_ddl_schema    sc._jvm.org.apache.spark.sql.types.StructType.fromDDL(type_str).json())AttributeError: 'NoneType' object has no attribute '_jvm'

我左思右想，百思不得骑姐，嗐，跑去看 types.py里面的type类型，以为我的 udaf_lx 函数的装饰器里面的 ‘decimal(17,12)’ 类型错了，但是一看，好家伙，types.py 里面的774行

_FIXED_DECIMAL = re.compile(r"decimal\(\s*(\d+)\s*,\s*(-?\d+)\s*\)")

这是能匹配上的，没道理啊！

原因分析及解决方案：

然后再往回看报错的信息的最后一行：

AttributeError: 'NoneType' object has no attribute '_jvm'

竟然是空对象没有_jvm这个属性！

一拍脑瓜子，得了，pyspark的SQL 在执行的时候，需要用到 JVM ，而运行pyspark的时候，需要先要为spark提供环境，也就说，内存中要有SparkSession对象，而python在执行的时候，是从上往下，将方法加载到内存中，在加载自定义的UDAF函数时，由于有装饰器@F.pandas_udf的存在 , F 则是pyspark.sql.functions, 此时加载自定义的UDAF到内存中，需要有SparkSession的环境提供JVM，而此时的内存中尚未有SparkSession环境！因此，将自定义的UDAF 函数挪到 if __name__ == '__main__': 创建完SparkSession的后面，如下:

import decimalimport osimport pandas as pdfrom pyspark.sql import SparkSessionfrom pyspark.sql import functions as Fos.environ['SPARK_HOME'] = '/export/server/spark'os.environ["PYSPARK_PYTHON"] = "/root/anaconda3/bin/python"os.environ["PYSPARK_DRIVER_PYTHON"] = "/root/anaconda3/bin/python"if __name__ == '__main__':    # 1) 创建 SparkSession 对象，此对象连接 hive    spark = SparkSession.builder.master('local[*]') \        .appName('insurance_main') \        .config('spark.sql.shuffle.partitions', 4) \        .config('spark.sql.warehouse.dir', 'hdfs://node1:8020/user/hive/warehouse') \        .config('hive.metastore.uris', 'thrift://node1:9083') \        .enableHiveSupport() \        .getOrCreate()    @F.pandas_udf('decimal(17,12)')    def udaf_lx(qx: pd.Series, lx: pd.Series) -> decimal:        # 初始值 也一定是decimal类型        tmp_qx = decimal.Decimal(0)        tmp_lx = decimal.Decimal(0)        for index in range(0, qx.size):            if index == 0:                tmp_qx = decimal.Decimal(qx[index])                tmp_lx = decimal.Decimal(lx[index])            else:                # 计算lx: 计算后，保证数据小数位为12位，与返回类型的设置小数位保持一致                tmp_lx = (tmp_lx * (1 - tmp_qx)).quantize(decimal.Decimal('0.000000000000'))                tmp_qx = decimal.Decimal(qx[index])        return tmp_lx    # 注册UDAF 支持在SQL中使用    spark.udf.register('udaf_lx', udaf_lx)    # 2) 编写SQL 执行    excuteSQLFile(spark, '_04_insurance_dw_prem_std.sql')

运行结果如图：

pyspark自定义UDAF函数调用报错如何解决

感谢各位的阅读，以上就是“pyspark自定义UDAF函数调用报错如何解决”的内容了，经过本文的学习后，相信大家对pyspark自定义UDAF函数调用报错如何解决这一问题有了更深刻的体会，具体使用情况还需要大家实践验证。这里是编程网，小编将为大家推送更多相关知识点的文章，欢迎关注！

--结束END--

本文标题: pyspark自定义UDAF函数调用报错如何解决

本文链接: https://lsjlt.com/news/340512.html(转载时请注明来源链接)

有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

回答

如何调试操作系统的错误？
操作系统

2023-11-15发布

回答

操作系统中的I/O系统是如何实现的？
操作系统

2023-11-15发布

回答

如何实现操作系统的内存管理？
操作系统

2023-11-15发布

回答

什么是虚拟内存，它对操作系统有什么影响？
操作系统

2023-11-15发布

回答

ASP中的MVC架构和WebForms架构有什么区别和使用场景？
ASP.NET

2023-11-15发布

回答

ASP中的数据验证和数据校验有什么不同？
ASP.NET

2023-11-15发布

回答

ASP中的ADO对象和DAO对象有什么区别和使用方法？
ASP.NET

2023-11-15发布

回答

Node.js中的包管理器NPM是什么？如何使用它进行依赖管理？
node.js

2023-11-15发布

回答

Vue.js中的动态组件是什么？如何使用它来动态渲染组件？
VUE

2023-11-15发布

回答

如何使用Vue.js实现懒加载和预加载？
VUE

2023-11-15发布

pyspark自定义UDAF函数调用报错如何解决

问题场景：

问题描述

原因分析及解决方案：

pyspark自定义UDAF函数调用报错如何解决

pyspark自定义UDAF函数调用报错问题解决

python自定义函数报错未定义怎么解决

mysql自定义函数如何调用

python如何调用自定义函数

matlab如何自定义函数并调用

python中如何调用自定义函数

如何调试 PHP 自定义函数？

如何调试自定义 PHP 函数？

解决python3中自定义wsgi函数,make_server函数报错的问题

JS自定义函数如何声明和调用

如何通过函数指针调用自定义 PHP 函数？

shell自定义函数及参数调用解析

mysql怎么调用自定义函数

Python函数如何定义和调用

Python中定义函数时出现 return outside function报错如何解决

JavaScript如何自定义函数

Python如何自定义函数

hive3.0.0如何自定义函数

如何自定义 PHP 函数？

使用golang框架有哪些常见的问题？

golang框架与其他流行框架的比较？

如何使用 C++ STL 扩展 C++ 语言的功能？

PHP 框架安全指南：如何实现安全编码实践？

mysql拆分函数使用要注意哪些事项

C++ 思维导图：全面整理编程核心知识

基于社区支持最强大的PHP框架

如何在 C++ 中有效使用 STL 函数对象？

PHP 框架中的调试和故障排除技术

经验丰富的开发者的PHP框架评估指南