python爬虫基础------文件的相关操作（第十天）

file = open('filename.txt', 'r')  # 打开文件用于读取
file = open('filename.txt', 'w')  # 打开文件用于写入，会覆盖文件中已有的内容
file = open('filename.txt', 'a')  # 打开文件用于追加，新写入的内容会被添加到文件末尾
file = open('filename.txt', 'r+') # 打开文件用于读写

第一个参数是文件名，第二个参数是打开文件的模式（读取、写入、追加等）。

文件路径

复制代码

  (1)绝对路径：指的是绝对位置，完整地描述了目标的所在地，所有目录层级关系是一目了然的。

例如： E:\python ，从电脑的盘符开始，表示的就是一个绝对路径。 (2)相对路径：是从当前文件所在的文件夹开始的路径。 test.txt ，是在当前文件夹查找 test.txt 文件 ./test.txt ，也是在当前文件夹里查找 test.txt 文件， ./ 表示的是当前文件夹。 ../test.txt ，从当前文件夹的上一级文件夹里查找 test.txt 文件。 ../ 表示的是上一级文件夹 demo/test.txt ，在当前文件夹里查找 demo 这个文件夹，并在这个文件夹里查找 test.txt 文件。

访问模式

| 访问

模式	说明
r	以只读方式打开文件。文件的指针将会放在文件的开头。如果文件不存在，则报错。这是默认模式。
w	打开一个文件只用于写入。如果该文件已存在则将其覆盖。如果该文件不存在，创建新文件。
a	打开一个文件用于追加。如果该文件已存在，文件指针将会放在文件的结尾。也就是说，新的内容将
会被写入到已有内容之后。如果该文件不存在，创建新文件进行写入。
r+	打开一个文件用于读写。文件指针将会放在文件的开头。
w+	打开一个文件用于读写。如果该文件已存在则将其覆盖。如果该文件不存在，创建新文件。
a+	打开一个文件用于读写。如果该文件已存在，文件指针将会放在文件的结尾。文件打开时会是追加模
式。如果该文件不存在，创建新文件用于读写。
rb	以二进制格式打开一个文件用于只读。文件指针将会放在文件的开头。
wb	以二进制格式打开一个文件只用于写入。如果该文件已存在则将其覆盖。如果该文件不存在，创建新
文件。
ab	以二进制格式打开一个文件用于追加。如果该文件已存在，文件指针将会放在文件的结尾。也就是
说，新的内容将会被写入到已有内容之后。如果该文件不存在，创建新文件进行写入。
rb+	以二进制格式打开一个文件用于读写。文件指针将会放在文件的开头。
wb+	以二进制格式打开一个文件用于读写。如果该文件已存在则将其覆盖。如果该文件不存在，创建新文
件。
ab+	以二进制格式打开一个文件用于读写。如果该文件已存在，文件指针将会放在文件的结尾。如果该文
件不存在，创建新文件用于读写。

关闭文件

使用完文件后，应该及时关闭文件以释放资源。可以使用文件对象的 close() 方法关闭文件：

复制代码

file.close()

自动关闭文件（推荐）

为了确保文件被正确关闭，通常使用 with 语句来打开文件，这样文件在退出 with 代码块时会自动关闭：

复制代码

with open('file.txt', 'r') as file:
    # 在这里进行文件操作
# 文件已经自动关闭，无需手动调用 file.close()

使用 with 语句可以确保文件被正确关闭，即使在处理文件过程中发生异常也会被正确处理。

二、文件的读写

写数据（write）

使用 write() 可以向文件写入数据。示例中展示了如何向文件中写入内容。如果文件不存在，则创建文件；如果文件已存在，则清空文件内容后写入数据。

复制代码

# 新建一个文件，文件名为:test.txt
f = open('test.txt', 'w')
# 关闭这个文件
f.close()
f = open('test.txt', 'w')
f.write('hello world, i am here!\\n' * 5)
f.close()

读取数据（read）

使用 read(num) 可以从文件中读取数据，num 表示要读取的数据的长度（单位是字节）。如果不指定 num，则表示读取文件中所有的数据。

复制代码

f = open('test.txt', 'r')
content = f.read(5)  # 最多读取5个字符
print(content)
print("-" * 30)  # 分割线，用来测试
content = f.read()  # 从上次读取的位置继续读取剩下的所有的数据
print(content)
f.close()  # 关闭文件

读取一行数据（readline）

readline() 用来读取一行数据。

复制代码

f = open('test.txt', 'r')
content = f.readline()
print("1:%s" % content)
content = f.readline()
print("2:%s" % content)
f.close()

读取多行数据（readlines）

readlines() 可以按行读取整个文件的内容，并返回一个列表，其中每一行是列表的一个元素。

复制代码

f = open('test.txt', 'r')
content = f.readlines()
print(type(content))
for temp in content:
    print(temp)

三、序列化和反序列化

序列化是将对象转换为字节序列的过程，而反序列化则是将字节序列转换回对象的过程。Python 中可以使用 JSON 模块进行序列化和反序列化操作。

序列化

使用 json.dumps() 方法将对象转换为 JSON 格式的字符串，或使用 json.dump() 方法将对象写入文件中。

复制代码

import json

# 将列表转换为 JSON 字符串
names = ['zhangsan', 'lisi', 'wangwu']
json_str = json.dumps(names)
print(json_str)

# 将 JSON 字符串写入文件
with open('names.json', 'w') as file:
    json.dump(names, file)

反序列化

使用 json.loads() 方法将 JSON 格式的字符串转换为对象，或使用 json.load() 方法从文件中加载 JSON 数据并转换为对象。

复制代码

import json

# 将 JSON 字符串转换为列表
json_str = '["zhangsan", "lisi", "wangwu"]'
names = json.loads(json_str)
print(names)

# 从文件中加载 JSON 数据并转换为对象
with open('names.json', 'r') as file:
    names = json.load(file)
    print(names)

JSON 格式非常适合在不同语言之间进行数据交换，因为它是一种通用的格式，并且易于阅读和解析。

四、文件异常处理

在文件操作过程中，可能会发生各种异常，如文件不存在、文件权限错误等。为了保证程序的健壮性，需要使用异常处理机制来捕获和处理这些异常。

try...except...finally 语句

复制代码

try:
    file = open('file.txt', 'r')
    # 文件操作
except FileNotFoundError as e:
    print("文件不存在：", e)
except IOError as e:
    print("IO错误：", e)
finally:
    if file:
        file.close()

with 语句（自动关闭文件）

使用 with 语句打开文件，可以在退出 with 代码块时自动关闭文件，不需要手动调用 close() 方法。

复制代码

with open('file.txt', 'r') as file:
    # 文件操作

完整示例

复制代码

try:
    with open('file.txt', 'r') as file:
        content = file.read()
        print(content)
except FileNotFoundError as e:
    print("文件不存在：", e)
except IOError as e:
    print("IO错误：", e)

以上是关于文件对象的属性和方法，以及异常处理的详细介绍。这些知识对于进行文件操作和处理文件操作中的异常非常重要。

好了小伙伴们，今天的学习就到这里了，再见喽！