大数据文本并行计算实现方式是什么-编程学习网

本篇文章为大家展示了大数据文本并行计算实现方式是什么，内容简明扼要并且容易理解，绝对能使你眼前一亮，通过这篇文章的详细介绍希望你能有所收获。

对于大数据文件的处理，可以充分利用现代计算机的多核CPU，实施多线程并行计算，从而达到提速的目的。然而，要在程序语言中编写多线程并行程序，并不是一件容易的事。

要并行处理就需要将源文件分段，每个线程处理其中一段。文本文件一般是每一行对应一条记录，每一行长度不一定相同。所以，不能按行数分段，因为每次都从头遍历，起不到提高性能的目标；若按字节分段则不需要遍历，但有可能分段点正好落在行的中间，造成一行被拆进两段，导致数据错误。有效的解决办法是采用自动去头补尾的字节分段机制，即分段开始点所在的行被舍弃，分段结束点所在的行会被补齐，这样将确保每一段都由完整的行构成，不会有数据错误。另外，还有线程的管理和控制等问题，如果管理不当，则会出现越界的情况。

如果有集算器SPL就简单多了，它对多线程并行计算进行了封装，代码写起来不仅更短而且更容易理解，这样在获得高性能的同时，让程序员把注意力更多地放在计算的整体逻辑上，而不必纠缠于为了提高性能而采用的并行细节。用集算器SPL写出并行计算代码：

	A	B	C
1	=file(“data.txt”)		/源文件
2	fork 4	=A1.cursor@t(amount;A2:4)	/分作4段并行，分别建立游标
3		=B2.groups(;sum(amount):am)	/遍历游标计算amount之和
4	=A2.conj().sum(am)		/汇总每个线程的结果

文本解析的时间经常比计算要长得多，有时候只要解析能够并行，计算本身是否并行并不重要。所以SPL对于读取数据提供了简单的内置并行选项，如果对数据读取次序不关心，比如分组、求和运算就不在乎次序，可以更简单地写出代码：

	A	B
1	=file("orders.txt").cursor@mt()	/@m选项将自动根据系统配置决定并行的线程数量
2	=A1.select(month(Date)==10)	/过滤
3	=A2.groups(ID;sum(COST*WEIGHT):VALUE)	/分组、汇总（串行）

上述内容就是大数据文本并行计算实现方式是什么，你们学到知识或技能了吗？如果还想学到更多技能或者丰富自己的知识储备，欢迎关注编程网行业资讯频道。

文章详情

大数据文本并行计算实现方式是什么

软考中级精品资料免费领

相关文章

猜你喜欢

大数据文本并行计算实现方式是什么

如何让Java实现大文本并行计算

Cassandra数据的分布式计算和并行处理怎么实现

Beam怎么实现数据的并行处理和分布式计算

大数据报表合计需求的实现方法是什么

php数据流中第K大元素的计算方法是什么

mongodb实现大数据处理的方法是什么

mongodb实现大数据处理的方法是什么

处理大数据打包，PHP编程算法的实现技巧是什么？

vue实现父子组件间数据交互的方式是什么

Python中的魔法函数与量子计算模拟实现的方法是什么

如何使用PHP连接和操作Redis数据库？（PHP连接Redis并进行数据读写的方式是什么？）

大数据中大屏报表组件间的联动交互效果实现方法是什么

MySQL对数据表已有表进行分区表的实现方法是什么

大数据同步神器：Python path 实现同步的最佳解决方案是什么？

Vue中计算属性、监听属性、数据的响应式更新和依赖收集基本原理是什么