读HDF5格式的文件

这里写自定义目录标题

HDF格式简介

HDF(Hierarchical Data Format)指一种为存储和处理大容量科学数据设计的文件格式及相应库文件。其中Hierarchical层级结构的意思,也就是说,HDF的文件结构是分层的,像文件夹一样,上层文件夹套下层文件夹。

python读取HDF文件

现在比较常用的HDF文件的格式是HDF5,可以使用python的h5py库来读取。

下面提供的这个函数,可以输入文件名,读取HDF5文件,输出numpy的DataFrame格式的数据。

python 复制代码
import h5py
import numpy as np
import pandas as pd
def read_hdf(ff):
    f = h5py.File(ff,'r')
    print('f',type(f))
    df = pd.DataFrame()
    for group in f.keys():
        print(group)
        #根据一级组名获得其下面的组
        group_read = f[group]
#         print('group_read',type(group_read),isinstance(group_read,h5py._hl.group.Group))
        if isinstance(group_read,h5py._hl.group.Group):
            #遍历该一级组下面的子组
            for subgroup in group_read.keys():
    #             print(subgroup)     
                #根据一级组和二级组名获取其下面的dataset          
                dset_read = f[group+'/'+subgroup]                           
                #遍历该子组下所有的dataset
                for dset in dset_read.keys():
                    #获取dataset数据
                    dset1 = f[group+'/'+subgroup+'/'+dset]
#                     print('dset1',type(dset1))
    #                 print(dset1.name)
                    data = np.array(dset1)
        #             print(data,type(data),data.shape)
                    #添加到DataFrame中
                    df = pd.concat([df,pd.DataFrame({dset1.name:list(data)})],axis=1)
        elif isinstance(group_read,h5py._hl.dataset.Dataset):
            data = np.array(group_read)
            df = pd.concat([df,pd.DataFrame({group:list(data)})],axis=1)
#     print(df)
    return df
相关推荐
多米Domi0112 小时前
0x3f 第49天 面向实习的八股背诵第六天 过了一遍JVM的知识点,看了相关视频讲解JVM内存,垃圾清理,买了plus,稍微看了点确定一下方向
jvm·数据结构·python·算法·leetcode
人工智能训练7 小时前
【极速部署】Ubuntu24.04+CUDA13.0 玩转 VLLM 0.15.0:预编译 Wheel 包 GPU 版安装全攻略
运维·前端·人工智能·python·ai编程·cuda·vllm
yaoming1687 小时前
python性能优化方案研究
python·性能优化
码云数智-大飞8 小时前
使用 Python 高效提取 PDF 中的表格数据并导出为 TXT 或 Excel
python
biuyyyxxx10 小时前
Python自动化办公学习笔记(一) 工具安装&教程
笔记·python·学习·自动化
极客数模10 小时前
【2026美赛赛题初步翻译F题】2026_ICM_Problem_F
大数据·c语言·python·数学建模·matlab
小鸡吃米…11 小时前
机器学习中的代价函数
人工智能·python·机器学习
Li emily12 小时前
如何通过外汇API平台快速实现实时数据接入?
开发语言·python·api·fastapi·美股
m0_5613596712 小时前
掌握Python魔法方法(Magic Methods)
jvm·数据库·python
Ulyanov13 小时前
顶层设计——单脉冲雷达仿真器的灵魂蓝图
python·算法·pyside·仿真系统·单脉冲