利用python如何处理百万条数据(适用java新手)


Posted in Python onJune 06, 2018

1、前言

因为负责基础服务,经常需要处理一些数据,但是大多时候采用awk以及java程序即可,但是这次突然有百万级数据需要处理,通过awk无法进行匹配,然后我又采用java来处理,文件一分为8同时开启8个线程并发处理,但是依然处理很慢,处理时长起码在1天+所以无法忍受这样的处理速度就采用python来处理,结果速度有了质的提升,大约处理时间为1个小时多一点,这个时间可以接受,后续可能继续采用大数据思想来处理,相关的会在后续继续更新。

2、安装python 

第一步首先下载python软件,在官网可以根据自己情况合理下载,大家也可以通过三水点靠木进行下载其余就是下一步搞定,然后在开始里面找到python的exe,点击开然后输入1+1就可以看出是否安装成功了.如下图

利用python如何处理百万条数据(适用java新手) 

3、IEDA编辑器如何使用python

首先我们在idea中打开设置然后点击plugins,在里面有个输入框中输入python,根据提示找到如下的这个(idea版本不同可能影响python版本)

利用python如何处理百万条数据(适用java新手) 

然后开始创建idea工程

file->New->Project->python然后出现如下图情况(其他的下一步然后就会创建工程了)

利用python如何处理百万条数据(适用java新手)

4、开发前知识准备

文件的读取,python读取文件非常的简单,我现在直接贴代码提供给大家

def readData(fileName):
 result = ""
 count=0
 with open(fileName, 'r') as f:
 for line in f.readlines():
  result += line
  count += 1
  print count
 return result

"""写入文件"""

def writeData(fileName, data):
 with open(fileName, 'a+')as f:
 f.write(data)

其中def是函数的定义,如果我们写定义一个函数直接前面加上def,返回值可以获取后直接用return即可

python我们直接采用with open('文件路径',模式) as f的方式来打开文件

模式:

r 只读 文件不存在则出错
r+ 支持读写 文件不存在则出错,写入时,会覆盖源文件
w 只写 如果文件不存在则创建文件,会覆盖源文件,如果写入内容少则保留为覆盖的内容
w+ 支持读写 同上
a 只写 如果文件不存在则创建文件,会采用追加模式
a+ 读写 同上
b 二进制读写  

跨文件引用:

同一个层级python是采用import直接导入文件名的方式,看下一个代码

import IoUtils

fileName1 = 'D:\\works\\pythons\\files\\userids.txt'
userIds = IoUtils.readData(fileName1).split('\n')
fileName2 = 'D:\\works\\pythons\\files\\records.txt'
records = IoUtils.readData(fileName2).strip()
recordsArr = records.split('\n')
count=0;
for data in recordsArr:
 count+=1
 if data.split('\t')[2] in userIds:
 IoUtils.writeData('D:\\works\\pythons\\files\\20180604.txt', data + '\n')
 print count

其他说明:

其中split和java程序的split一样,strip是去掉空格换行符等,循环(for in)模式,判断某个元素是否在数组中存在则直接使用 元素 in 数组

5、总结

如果你有数据量级别在百分的时候我建议优先可以想到python处理真的特别方便,而且很简单学习成本也很低,但是却很实用,其实awk在数据处理中也发挥很大的作用,大家可以私下学习,如果有时间我会分享一些,关于数据我这里就不提供了大家可以按照我上述代码跑就可以,更细节的我推荐看廖雪峰的python教程。

好了,以上就是这篇文章的全部内容了,希望本文的内容对大家的学习或者工作具有一定的参考学习价值,如果有疑问大家可以留言交流,谢谢大家对三水点靠木的支持。

Python 相关文章推荐
零基础写python爬虫之HTTP异常处理
Nov 05 Python
Python创建xml的方法
Mar 10 Python
浅析Python中将单词首字母大写的capitalize()方法
May 18 Python
windows系统下Python环境搭建教程
Mar 28 Python
Python2和3字符编码的区别知识点整理
Aug 08 Python
Python Subprocess模块原理及实例
Aug 26 Python
Jupyter Notebook 文件默认目录的查看以及更改步骤
Apr 14 Python
Django之富文本(获取内容,设置内容方式)
May 21 Python
Python实现微信表情包炸群功能
Jan 28 Python
anaconda安装pytorch1.7.1和torchvision0.8.2的方法(亲测可用)
Feb 01 Python
Python中tkinter的用户登录管理的实现
Apr 22 Python
8g内存用python读取10文件_面试题-python 如何读取一个大于 10G 的txt文件?
May 28 Python
Python3实现的Mysql数据库操作封装类
Jun 06 #Python
python操作redis方法总结
Jun 06 #Python
目前最全的python的就业方向
Jun 05 #Python
python多进程提取处理大量文本的关键词方法
Jun 05 #Python
使用python进行文本预处理和提取特征的实例
Jun 05 #Python
python 用正则表达式筛选文本信息的实例
Jun 05 #Python
python和shell获取文本内容的方法
Jun 05 #Python
You might like
解决phpmyadmin中文乱码问题。。。
2007/01/18 PHP
解析用PHP读写音频文件信息的详解(支持WMA和MP3)
2013/05/10 PHP
探讨:如何使用PhpDocumentor生成文档
2013/06/25 PHP
CodeIgniter安全相关设置汇总
2014/07/03 PHP
php 利用array_slice函数获取随机数组或前几条数据
2015/09/30 PHP
php设计模式之状态模式实例分析【星际争霸游戏案例】
2020/03/26 PHP
javascript json2 使用方法
2010/03/16 Javascript
jQuery操作input type=radio的实现代码
2012/06/14 Javascript
JavaScript统计网站访问次数的实现代码
2015/11/18 Javascript
JavaScript数据结构与算法之链表
2016/01/29 Javascript
非常实用的js验证框架实现源码 附原理方法
2016/06/08 Javascript
JS封装的自动创建表格的实现代码
2016/06/15 Javascript
js检测离开或刷新页面时表单数据是否更改的方法
2016/08/02 Javascript
node.js连接MongoDB数据库的2种方法教程
2017/05/17 Javascript
vue 里面使用axios 和封装的示例代码
2017/09/01 Javascript
nodejs+mongodb aggregate级联查询操作示例
2018/03/17 NodeJs
js指定日期增加指定月份的实现方法
2018/12/19 Javascript
小程序实现人脸识别功能(百度ai)
2018/12/23 Javascript
微信小程序rich-text富文本用法实例分析
2019/05/20 Javascript
LayUI switch 开关监听 获取属性值、更改状态的方法
2019/09/21 Javascript
使用Python绘制图表大全总结
2017/02/11 Python
python机器学习之随机森林(七)
2018/03/26 Python
对python读取CT医学图像的实例详解
2019/01/24 Python
使用coverage统计python web项目代码覆盖率的方法详解
2019/08/05 Python
python实现计算图形面积
2021/02/22 Python
HTML5基于flash实现播放RTMP协议视频的示例代码
2020/12/04 HTML / CSS
美国巧克力喷泉品牌:Sephra
2019/05/05 全球购物
浙江文明网签名寄语
2014/01/18 职场文书
美发店5.1活动方案
2014/01/24 职场文书
售后服务经理岗位职责
2014/02/25 职场文书
土建专业大学生自荐信范文
2014/04/09 职场文书
新学期国旗下演讲稿
2014/05/08 职场文书
四年级学生期末评语
2014/12/26 职场文书
CSS3实现列表无限滚动/轮播效果
2021/06/23 HTML / CSS
使用feign服务调用添加Header参数
2021/06/23 Java/Android
Go语言怎么使用变长参数函数
2022/07/15 Golang