深度学习-数据清单——把图片整理成训练可读的 txt

一、项目背景:20 类食物,怎么"喂"给模型?

目标是训练一个卷积神经网络(CNN),识别 20 类食物:八宝粥、哈密瓜、圣女果、巴旦木、板栗、汉堡、火龙果、炸鸡、瓜子、生肉、白萝卜、胡萝卜、草莓、菠萝、薯条、蛋、蛋挞、青菜、骨肉相连、鸡翅。

数据按"一个文件夹一个类别"的方式组织,这是图像分类数据集的标准结构:

数据集目录结构(food_dataset)

food_dataset/

├── train/ # 训练集

│ ├── 八宝粥/ # 文件夹名 = 类别名

│ ├── 哈密瓜/

│ └── ... # 共 20 个类别文件夹

└── test/ # 测试集,结构相同

关键约定:文件夹名就是类别名;数据已按 train(训练集)/test(测试集)分好。写网络之前的第一步,是把"图片路径 + 类别编号"整理成清单文件,让 PyTorch 按行读取------这就是数据处理.py 的任务。

二、核心函数:用 os.walk 遍历目录树

数据处理.py ------ 生成标签清单的核心函数

def train_test_file(root,dir):

file_txt = open(dir+'.txt','w',encoding='utf-8')

path = os.path.join(root,dir)

for roots,directories,files in os.walk(path):

if len(directories) !=0 :

dirs = directories

else:

now_dir = roots.split('\\')

for file in files:

path_1 = os.path.join(roots,file)

file_txt.write(path_1+' '+str(dirs.index(now_dir-1))+'\n')

file_txt.close()

函数作用:遍历给定目录,把每张图片写进 txt,格式为「图片路径 + 空格 + 类别编号」,一行一条:

.\food_dataset\train\八宝粥\img_八宝粥罐_22.jpeg 0

.\food_dataset\train\哈密瓜\img_哈密瓜_103.jpeg 1

os.path.join(root, dir) 拼出要扫描的目录(如 ./food_dataset/train);

os.walk 逐层遍历,每次返回三元组:roots(当前目录)、directories(子文件夹)、files(文件);

walk "先父后子":第一次进入 train 时 directories 就是全部 20 个类别文件夹,先存进 dirs 备用;

**•**走到叶子目录(不再有子文件夹)时,把里面每张图的路径和类别编号写入文件。

三、重点代码:文件夹名如何变成数字标签

标签映射 ------ 全函数最关键的两行

now_dir = roots.split('\\') # 按 \ 切开路径,取最后一段

file_txt.write(path_1+' '+str(dirs.index(now_dir-1))+'\n')

roots.split('\\') 把路径按反斜杠切开取最后一段------类别文件夹名(如"八宝粥");dirs.index(该名字) 返回它在 20 个类别列表中的下标 0~19,这个下标就是数字标签 。训练/测试两次调用文件夹顺序一致,标签能对齐;str(...) 把数字转成字符串,'\n' 换行。

四、必须强调的坑:中文乱码

open(dir+'.txt','w',encoding='utf-8') 里的 encoding='utf-8' 不能省 。Windows 中文系统默认用 GBK 编码写文件,而 PyTorch 读取 txt 按 UTF-8 解码------类别名是中文,读出来全是乱码,后续 Image.open 找不到文件直接报错。写、读两端统一 UTF-8 最省事(第 2 篇读文件同样要指定)。

五、铺垫:两个魔法方法

数据处理.py ------ 魔法方法演示

class use_getitem():

def init(self,text):

self.text = text

def getitem(self,index):

result = self.textindex.upper()

return result

def len(self):

return len(self.text)

p = use_getitem('pytorch')

print(p1) # Y

print(len(p)) # 7

实现 getitem 后,实例能像列表一样用 p1 下标访问;实现 len 后,len(p) 能返回长度。为什么要先演示?因为自定义 Dataset 的机制就建立在这两个方法上 ------DataLoader 内部正是靠 len(dataset) 和 dataseti 取数据的。

相关推荐
憨波个1 小时前
【ASR】Whisper:Robust Speech Recognition via Large-Scale Weak Supervision
人工智能·深度学习·语言模型·whisper·语音识别
MicrosoftReactor1 小时前
技术速递|如何在不牺牲任务质量的前提下,让 AI 编码更具成本效益
人工智能·ai·github·copilot
陕西企来客1 小时前
2026年9月企来客科技GEO优化实战指南与本地落地方法
人工智能·科技·企来客科技geo优化
手写码匠1 小时前
DeepSeek 函数调用实战:从零搭建一个会“动手“的 AI 助手
人工智能·深度学习·算法·aigc
百度Geek说1 小时前
都在开源 Harness,Codex 和 DeepSeek 到底有什么不一样?
人工智能
科研小牛马1 小时前
北航何静:AI时代,热门专业十年后怎么样了
人工智能
weixin_446260851 小时前
JarvisGUI:面向跨设备GUI智能体的动态任务组合评测基准
人工智能
Splashtop高性能远程控制软件2 小时前
AI 辅助端点运维先接手补丁分级、合规可视和同台处置
运维·网络·人工智能·自动化·远程工作·splashtop
Yanjun2i2 小时前
Agent学习记录四:多工具时如何处理
人工智能·python·学习·agent