如何使用pandas对超大csv文件进行快速拆分详解_Python

如何使用pandas对超大csv文件进行快速拆分详解

2022-07-04 22:37coder1479 Python

Pandas是Python语言的一个扩展程序库,提供高性能、易于使用的数据结构和数据分析工具,下面这篇文章主要给大家介绍了关于如何使用pandas对超大csv文件进行快速拆分的相关资料,需要的朋友可以参考下

前言
1. 操作步骤
- 1.1 安装pandas
- 1.2 拆分大文件
2. 再多了解一点儿
- 2.1 pandas读取csv文件后，返回的是什么类型？
- 2.2 如何从DataFrame中读取某一行呢？
- 2.3 如何从DataFrame读取多行呢?
- 2.4 如何从DataFrame中读取某一列呢？
- 2.5 如何用pandas读写CSV文件？
- 2.6 关于pandas
3. 小结

前言

本文介绍如何利用pandas对超大CSV文件进行快速拆分。

1. 操作步骤

1.1 安装pandas

				?

									pip install pandas

1.2 拆分大文件

				?

									import pandas as pd

									# 读取csv文件

									df = pd.read_csv("../super_big.csv")

									# 获取文件总行数

									row_num = len(df)

									# 确定每个小文件要包含的数据量

									step = 400

									for start in range(0, row_num, step):

									    stop = start + step

									    filename = "./small_{}-{}.csv".format(start, stop)

									    d = df[start: stop]

									    print("Saving file : " + filename + ", data size : " + str(len(d)))

									    d.to_csv(fname, index=None)

									# 输出如下

									# Saving file : ./small_0-500.csv, data size : 500

									# Saving file : ./small_500-1000.csv, data size : 500

代码就这么简单。

2. 再多了解一点儿

2.1 pandas读取csv文件后，返回的是什么类型？

				?

									import pandas

									df = pandas.read_csv('./super_big.csv')

									type(df)

									<class 'pandas.core.frame.DataFrame'>

2.2 如何从DataFrame中读取某一行呢？

				?

									# 返回第一行

									print(df.loc[0])

									# 返回第二行

									print(df.loc[1])

2.3 如何从DataFrame读取多行呢?

				?

									d = df[start: stop]

2.4 如何从DataFrame中读取某一列呢？

				?

									data = {

									    "name": ["peter", "rose", "joe"],

									    "career": ["teacher", "engineer", "doctor"]

									}

									df = pd.DataFrame(data)

									print(df["name"])

									#0    peter

									#1     rose

									#2      joe

									#Name: name, dtype: object

2.5 如何用pandas读写CSV文件？

				?

									df = pd.read_csv("YOUT_CSV_FILE.csv")

									df.to_csv(fname, index=None)

注意：index默认是True，意思是保存行索引，这时候需要一个例子。

				?

									data = {

									    "name": ["peter", "rose", "joe"],

									    "career": ["teacher", "engineer", "doctor"]

									}

									df = pd.DataFrame(data)

									df.to_csv("a.csv")

									# 文件内容如下，注意每行的开头自动添加了行索引，从0开始递增

									,name,career

									0,peter,teacher

									1,rose,engineer

									2,joe,doctor