python 删除大文件中的某一行(最有效率的方法)


Posted in Python onAugust 19, 2017

用 python 处理一个文本时,想要删除其中中某一行,常规的思路是先把文件读入内存,在内存中修改后再写入源文件。

但如果要处理一个很大的文本,比如GB级别的文本时,这种方法不仅需要占用很大内存,而且一次性读入内存时耗费时间,还有可能导致内存溢出。

所以,需要用另外一个思路去处理。

我们可以使用 open() 方法把需要修改的文件打开为两个文件,然后逐行读入内存,找到需要删除的行时,用后面的行逐一覆盖。实现方式见以下代码。

with open('file.txt', 'r') as old_file:
  with open('file.txt', 'r+') as new_file:

    current_line = 0

    # 定位到需要删除的行
    while current_line < (del_line - 1):
      old_file.readline()
      current_line += 1

    # 当前光标在被删除行的行首,记录该位置
    seek_point = old_file.tell()

    # 设置光标位置
    new_file.seek(seek_point, 0)

    # 读需要删除的行,光标移到下一行行首
    old_file.readline()
    
    # 被删除行的下一行读给 next_line
    next_line = old_file.readline()

    # 连续覆盖剩余行,后面所有行上移一行
    while next_line:
      new_file.write(next_line)
      next_line = old_file.readline()

    # 写完最后一行后截断文件,因为删除操作,文件整体少了一行,原文件最后一行需要去掉
    new_file.truncate()

以上这篇python 删除大文件里的某一行(最有效率的方法)就是小编分享给大家的全部内容了,希望能给大家一个参考,也希望大家多多支持三水点靠木。

Python 相关文章推荐
python搭建简易服务器分析与实现
Dec 15 Python
python从ftp下载数据保存实例
Nov 20 Python
用python找出那些被“标记”的照片
Apr 20 Python
Python数据拟合与广义线性回归算法学习
Dec 22 Python
pandas全表查询定位某个值所在行列的方法
Apr 12 Python
python调用c++传递数组的实例
Feb 13 Python
pandas数据集的端到端处理
Feb 18 Python
Tensorflow 实现释放内存
Feb 03 Python
150行python代码实现贪吃蛇游戏
Apr 24 Python
python读取excel进行遍历/xlrd模块操作
Jul 12 Python
Opencv中cv2.floodFill算法的使用
Jun 18 Python
Python采集壁纸并实现炫轮播
Apr 30 Python
在java中如何定义一个抽象属性示例详解
Aug 18 #Python
python中将函数赋值给变量时需要注意的一些问题
Aug 18 #Python
python中子类调用父类函数的方法示例
Aug 18 #Python
Python设计实现的计算器功能完整实例
Aug 18 #Python
python中类和实例如何绑定属性与方法示例详解
Aug 18 #Python
Python实现基于多线程、多用户的FTP服务器与客户端功能完整实例
Aug 18 #Python
对python中return和print的一些理解
Aug 18 #Python
You might like
15种PHP Encoder的比较
2007/04/17 PHP
php之CodeIgniter学习笔记
2013/06/17 PHP
php连接与操作PostgreSQL数据库的方法
2014/12/25 PHP
php接口数据加密、解密、验证签名
2015/03/12 PHP
Zend Framework入门之环境配置及第一个Hello World示例(附demo源码下载)
2016/03/21 PHP
jQuery 性能优化手册 推荐
2010/02/23 Javascript
jquery下为Event handler传递动态参数的代码
2011/01/06 Javascript
提示$ is not defined错误分析及解决
2013/04/09 Javascript
onkeypress字符按键兼容所有浏览器使用介绍
2013/04/24 Javascript
用js闭包的方法实现多点标注冒泡示例
2014/05/29 Javascript
加随机数引入脚本不让浏览器读取缓存
2014/09/04 Javascript
在JavaScript的AngularJS库中进行单元测试的方法
2015/06/23 Javascript
JAVA四种基本排序方法实例总结
2015/07/24 Javascript
JavaScript如何实现对数字保留两位小数一位自动补零
2015/12/18 Javascript
JS实现上下左右对称的九九乘法表
2016/02/22 Javascript
JS中使用apply、bind实现为函数或者类传入动态个数的参数
2016/04/26 Javascript
JavaScript中的普通函数和箭头函数的区别和用法详解
2017/03/21 Javascript
js中位运算的运用实例分析
2018/12/11 Javascript
推荐几个不错的console调试技巧实现
2019/12/20 Javascript
[46:43]DOTA2上海特级锦标赛主赛事日 - 1 胜者组第一轮#2LGD VS MVP.Phx第二局
2016/03/02 DOTA
python使用append合并两个数组的方法
2015/04/28 Python
python算法表示概念扫盲教程
2017/04/13 Python
Python+Django搭建自己的blog网站
2018/03/13 Python
Python实现在某个数组中查找一个值的算法示例
2018/06/27 Python
Django 中使用流响应处理视频的方法
2018/07/20 Python
在双python下设置python3为默认的方法
2018/10/31 Python
pandas计数 value_counts()的使用
2019/06/24 Python
使用 Python ssh 远程登陆服务器的最佳方案
2020/03/06 Python
人事任命书范文
2014/06/04 职场文书
小学生环保标语
2014/06/13 职场文书
2014领导班子正风肃纪思想汇报
2014/09/18 职场文书
农村党支部书记司法四风问题对照检查材料
2014/09/26 职场文书
工作失误检讨书范文
2015/01/26 职场文书
赢在中国观后感
2015/06/02 职场文书
工作感言一句话
2015/08/01 职场文书
详解Java实现数据结构之并查集
2021/06/23 Java/Android