编程 Python

基于h5py的使用及数据封装代码

Posted in Python onDecember 26, 2019

1. h5py简单介绍

h5py文件是存放两类对象的容器，数据集(dataset)和组(group)，dataset类似数组类的数据集合，和numpy的数组差不多。group是像文件夹一样的容器，它好比python中的字典，有键(key)和值(value)。group中可以存放dataset或者其他的group。”键”就是组成员的名称，”值”就是组成员对象本身(组或者数据集)，下面来看下如何创建组和数据集。

1.1 创建一个h5py文件

import h5py
#要是读取文件的话，就把w换成r
f=h5py.File("myh5py.hdf5","w")

在当前目录下会生成一个myh5py.hdf5文件。

2. 创建dataset数据集

import h5py
f=h5py.File("myh5py.hdf5","w")
#deset1是数据集的name，（20,）代表数据集的shape，i代表的是数据集的元素类型
d1=f.create_dataset("dset1", (20,), 'i')
for key in f.keys():
 print(key)
 print(f[key].name)
 print(f[key].shape)
 print(f[key].value)

输出：

dset1
/dset1
(20,)
[0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0]
import h5py
import numpy as np
f=h5py.File("myh5py.hdf5","w")
a=np.arange(20)
d1=f.create_dataset("dset1",data=a)
for key in f.keys():
 print(f[key].name)
 print(f[key].value)

输出：

/dset1
[ 0 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19]
2. hpf5用于封装训练集和测试集
#============================================================
# This prepare the hdf5 datasets of the DRIVE database
#============================================================
 
import os
import h5py
import numpy as np
from PIL import Image
 
def write_hdf5(arr,outfile):
 with h5py.File(outfile,"w") as f:
 f.create_dataset("image", data=arr, dtype=arr.dtype)
 
#------------Path of the images --------------------------------------------------------------
#train
original_imgs_train = "./DRIVE/training/images/"
groundTruth_imgs_train = "./DRIVE/training/1st_manual/"
borderMasks_imgs_train = "./DRIVE/training/mask/"
#test
original_imgs_test = "./DRIVE/test/images/"
groundTruth_imgs_test = "./DRIVE/test/1st_manual/"
borderMasks_imgs_test = "./DRIVE/test/mask/"
#---------------------------------------------------------------------------------------------
 
Nimgs = 20
channels = 3
height = 584
width = 565
dataset_path = "./DRIVE_datasets_training_testing/"
 
def get_datasets(imgs_dir,groundTruth_dir,borderMasks_dir,train_test="null"):
 imgs = np.empty((Nimgs,height,width,channels))
 groundTruth = np.empty((Nimgs,height,width))
 border_masks = np.empty((Nimgs,height,width))
 for path, subdirs, files in os.walk(imgs_dir): #list all files, directories in the path
  for i in range(len(files)):
   #original
   print "original image: " +files[i]
   img = Image.open(imgs_dir+files[i])
   imgs[i] = np.asarray(img)
   #corresponding ground truth
   groundTruth_name = files[i][0:2] + "_manual1.gif"
   print "ground truth name: " + groundTruth_name
   g_truth = Image.open(groundTruth_dir + groundTruth_name)
   groundTruth[i] = np.asarray(g_truth)
   #corresponding border masks
   border_masks_name = ""
   if train_test=="train":
    border_masks_name = files[i][0:2] + "_training_mask.gif"
   elif train_test=="test":
    border_masks_name = files[i][0:2] + "_test_mask.gif"
   else:
    print "specify if train or test!!"
    exit()
   print "border masks name: " + border_masks_name
   b_mask = Image.open(borderMasks_dir + border_masks_name)
   border_masks[i] = np.asarray(b_mask)
 
 print "imgs max: " +str(np.max(imgs))
 print "imgs min: " +str(np.min(imgs))
 assert(np.max(groundTruth)==255 and np.max(border_masks)==255)
 assert(np.min(groundTruth)==0 and np.min(border_masks)==0)
 print "ground truth and border masks are correctly withih pixel value range 0-255 (black-white)"
 #reshaping for my standard tensors
 imgs = np.transpose(imgs,(0,3,1,2))
 assert(imgs.shape == (Nimgs,channels,height,width))
 groundTruth = np.reshape(groundTruth,(Nimgs,1,height,width))
 border_masks = np.reshape(border_masks,(Nimgs,1,height,width))
 assert(groundTruth.shape == (Nimgs,1,height,width))
 assert(border_masks.shape == (Nimgs,1,height,width))
 return imgs, groundTruth, border_masks
 
if not os.path.exists(dataset_path):
 os.makedirs(dataset_path)
#getting the training datasets
imgs_train, groundTruth_train, border_masks_train = get_datasets(original_imgs_train,groundTruth_imgs_train,borderMasks_imgs_train,"train")
print "saving train datasets"
write_hdf5(imgs_train, dataset_path + "DRIVE_dataset_imgs_train.hdf5")
write_hdf5(groundTruth_train, dataset_path + "DRIVE_dataset_groundTruth_train.hdf5")
write_hdf5(border_masks_train,dataset_path + "DRIVE_dataset_borderMasks_train.hdf5")
 
#getting the testing datasets
imgs_test, groundTruth_test, border_masks_test = get_datasets(original_imgs_test,groundTruth_imgs_test,borderMasks_imgs_test,"test")
print "saving test datasets"
write_hdf5(imgs_test,dataset_path + "DRIVE_dataset_imgs_test.hdf5")
write_hdf5(groundTruth_test, dataset_path + "DRIVE_dataset_groundTruth_test.hdf5")
write_hdf5(border_masks_test,dataset_path + "DRIVE_dataset_borderMasks_test.hdf5")

遍历文件夹下的所有文件 os.walk( dir )

for parent, dir_names, file_names in os.walk(parent_dir): 
 for i in file_names: 
  print file_name

parent: 父路径

dir_names: 子文件夹

file_names: 文件名

以上这篇基于h5py的使用及数据封装代码就是小编分享给大家的全部内容了，希望能给大家一个参考，也希望大家多多支持三水点靠木。

基于h5py的使用及数据封装代码

- Author -

沈子恒

声明：登载此文出于传递更多信息之目的，并不意味着赞同其观点或证实其描述。

Python 相关文章推荐

跟老齐学Python之编写类之一创建实例

Oct 11 Python

对Python新手编程过程中如何规避一些常见问题的建议

Apr 01 Python

python表格存取的方法

Mar 07 Python

tensorflow: 查看 tensor详细数值方法

Jun 13 Python

详解如何管理多个Python版本和虚拟环境

May 10 Python

python滑块验证码的破解实现

Nov 10 Python

Tensorflow 定义变量,函数,数值计算等名字的更新方式

Feb 10 Python

TensorFlow tf.nn.softmax_cross_entropy_with_logits的用法

Apr 19 Python

Python远程linux执行命令实现

Nov 11 Python

一劳永逸彻底解决pip install慢的办法

May 24 Python

Python 内置函数速查表一览

Jun 02 Python

使用scrapy实现增量式爬取方式

Jun 21 Python

python深copy和浅copy区别对比解析

Dec 26 #Python

详解python opencv、scikit-image和PIL图像处理库比较

Dec 26 #Python

torch 中各种图像格式转换的实现方法

Dec 26 #Python

python两个_多个字典合并相加的实例代码

Dec 26 #Python

Python时间差中seconds和total_seconds的区别详解

Dec 26 #Python

python requests模拟登陆github的实现方法

Dec 26 #Python

python 实现按对象传值

Dec 26 #Python

You might like

thinkPHP中验证码的简单实现方法

2016/12/05 PHP

DOM相关内容速查手册

2007/02/07 Javascript

对象无length属性时IE6/IE7中无法将其转换成伪数组(ArrayLike)

2011/07/31 Javascript

获取服务器传来的数据用JS去空格的正则表达式

2012/03/26 Javascript

jQuery获取iframe的document对象的方法

2014/10/10 Javascript

js改变Iframe中Src的方法

2015/05/05 Javascript

AngularJS基础 ng-keypress 指令简单示例

2016/08/02 Javascript

Bootstrap实现input控件失去焦点时验证

2016/08/04 Javascript

Easyui的组合框的取值与赋值

2016/10/28 Javascript

JavaScript实现简单精致的图片左右无缝滚动效果

2017/03/16 Javascript

Angular实现响应式表单

2017/08/04 Javascript

vue.js添加一些触摸事件以及安装fastclick的实例

2018/08/28 Javascript

解决axios post 后端无法接收数据的问题

2019/10/29 Javascript

用JS实现选项卡

2020/03/23 Javascript

Python Web框架Flask信号机制(signals)介绍

2015/01/01 Python

Python开发中爬虫使用代理proxy抓取网页的方法示例

2017/09/26 Python

Python代码实现KNN算法

2017/12/20 Python

python找出因数与质因数的方法

2019/07/25 Python

Python实现的微信红包提醒功能示例

2019/08/22 Python

python中加背景音乐如何操作

2020/07/19 Python

OpenCV Python实现图像指定区域裁剪

2021/03/12 Python

Python爬虫+tkinter界面实现历史天气查询的思路详解

2021/02/22 Python

最便宜促销价格订机票：Airpaz（总部设在印尼，支持中文）

2018/11/13 全球购物

荷兰度假屋租赁网站：Aan Zee

2020/02/28 全球购物

J2EE是技术还是平台还是框架

2016/08/14 面试题

十八大报告观后感

2014/01/28 职场文书

大学军训感言200字

2014/02/26 职场文书

材料员岗位职责

2014/03/13 职场文书

机关会计岗位职责

2014/04/08 职场文书

班主任与学生安全责任书

2014/07/25 职场文书

内科护士节演讲稿

2014/09/11 职场文书

无财产无子女离婚协议书范文

2014/09/14 职场文书

2014年幼儿园教师工作总结

2014/11/08 职场文书

市场部经理岗位职责

2015/02/02 职场文书

女性健康知识讲座通知

2015/04/23 职场文书

Python基础之元类详解

2021/04/29 Python