首页 > 资讯 > 精选 >Hadoop Combiner使用方法详解

953

分享到

Hadoop Combiner使用方法详解

hadoop combiner 用 2023-05-30 23:05:07 953人浏览安东尼

摘要

Hadoop Combiner使用方法详解Combiner函数是一个可选的中间函数，发生在Map阶段，Mapper执行完成后立即执行。使用Combiner有如下两个优势： Combiner可以用来减少发送到Reducer的数据量，从而提高

Hadoop Combiner使用方法详解

Combiner函数是一个可选的中间函数，发生在Map阶段，Mapper执行完成后立即执行。使用Combiner有如下两个优势：

Combiner可以用来减少发送到Reducer的数据量，从而提高网络效率。
Combiner可以用于减少发送到Reducer的数据量，这将提高Reduce端的效率，因为每个reduce函数将处理相对较少记录，相比于未使用Combiner之前。

Combiner与Reducer结构相同，因为Combiner和Reducer都对Mapper的输出进行处理。这给了我们一个复用Reducer作为Combiner的好机会。但问题是，复用Reducer作为Combiner总是是一个好主意吗？

特点：

Combiners是MapReduce中的一个优化，允许在shuffle和排序阶段之前在本地进行聚合。Combiners的首要目标是通过最小化键值对的数量来节省尽可能多的带宽

Reducer作为Combiner的适用场景

假设我们正在编写一个mapReduce程序来计算股票数据集中每个股票代码的最大收盘价。Mapper将数据集中每个股票记录的股票代码作为key和收盘价作为value。Reducer然后将循环遍历股票代码对应的所有收盘价，并从收盘价列表中计算最高收盘价。假设Mapper 1 处理股票代码为ABC 的3个记录，收盘价分别为50，60和111。让我们假设Mapper 2 处理股票代码为ABC的2个记录，收盘价分别为100和31。那么Reducer将收到股票代码ABC五个收盘价---50，60，111，100和31。Reducer的工作非常简单，它将简单地循环遍历所有收盘价，并将计算最高收盘价为111。

我们可以在每个Mapper之后使用相同的Reducer作为Combiner。Mapper 1 上的Combiner将处理3个收盘价格--50，60和111，并且仅输出111，因为它是3个收盘价的最大值。Mapper 2 上的Combiner将处理2个收盘价格--100和31，并且仅输出100，因为它是2个收盘价的最大值。现在使用Combiner之后，Reducer仅处理股票代码ABC的2个收盘价（原先需要处理5个收盘价），即来自Mapper 1 的111和来自Mapper 2 的100，并且将从这两个值中计算出最大收盘价格为111。

正如我们看到的，使用Combiner情况下Reducer输出与没有使用Combiner的输出结果是相同的，因此在这种情况下复用Reducer作为

Combiner是没有问题。

Reducer作为Combiner的不适用场景

假设我们正在编写一个MapReduce程序来计算股票数据集中每个股票代码的平均交易量（average volume for each symbol）。Mapper将数据集中每个股票记录的股票代码作为key和交易量（volume）作为value。Reducer然后将循环遍历股票代码对应的所有交易量，并从交易量列表中计算出平均交易量（average volume from the list of volumes for that symbol）。假设Mapper 1 处理股票代码为ABC 的3个记录，收盘价分别为50，60和111。让我们假设Mapper 2 处理股票代码为ABC的2个记录，收盘价分别为100和31。那么Reducer将收到股票代码ABC五个收盘价---50，60，111，100和31。Reducer的工作非常简单，它将简单地循环遍历所有交易量，并将计算出平均交易量为70.4。

50 + 60 + 111 + 100 + 31 / 5 = 352 / 5 = 70.4

--结束END--

本文标题: Hadoop Combiner使用方法详解

本文链接: https://lsjlt.com/news/222143.html(转载时请注明来源链接)

有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

回答

如何调试操作系统的错误？
操作系统

2023-11-15发布

回答

操作系统中的I/O系统是如何实现的？
操作系统

2023-11-15发布

回答

如何实现操作系统的内存管理？
操作系统

2023-11-15发布

回答

什么是虚拟内存，它对操作系统有什么影响？
操作系统

2023-11-15发布

回答

ASP中的MVC架构和WebForms架构有什么区别和使用场景？
ASP.NET

2023-11-15发布

回答

ASP中的数据验证和数据校验有什么不同？
ASP.NET

2023-11-15发布

回答

ASP中的ADO对象和DAO对象有什么区别和使用方法？
ASP.NET

2023-11-15发布

回答

Node.js中的包管理器NPM是什么？如何使用它进行依赖管理？
node.js

2023-11-15发布

回答

Vue.js中的动态组件是什么？如何使用它来动态渲染组件？
VUE

2023-11-15发布

回答

如何使用Vue.js实现懒加载和预加载？
VUE

2023-11-15发布

Hadoop Combiner使用方法详解

Hadoop Combiner使用方法详解

iperf3使用方法详解

PerformanceCounter详解,使用方法

PopupWindow使用方法详解

FragmentTabHost使用方法详解

ToolBar使用方法详解

JavaBigDecimal使用方法详解

Quartz.Net使用方法详解

KotlinFragment使用方法详解

KotlinWorkManager使用方法详解

详解datagrid使用方法

Optional 使用方法详解

hadoop集群使用的方法是什么

android TabLayout使用方法详解

android BitmapFactory.Options使用方法详解

Android Tabhost使用方法详解

详解go mod 使用方法

djangoredis的使用方法详解

Android HandlerThread使用方法详解

Android Notification 使用方法详解

使用golang框架有哪些常见的问题？

golang框架与其他流行框架的比较？

如何使用 C++ STL 扩展 C++ 语言的功能？

PHP 框架安全指南：如何实现安全编码实践？

mysql拆分函数使用要注意哪些事项

C++ 思维导图：全面整理编程核心知识

基于社区支持最强大的PHP框架

如何在 C++ 中有效使用 STL 函数对象？

PHP 框架中的调试和故障排除技术

经验丰富的开发者的PHP框架评估指南