DAY 31

一、Notebook 里在干什么

notebook 里的 .ipynb 文件通常承担 "草稿纸 + 说明书" 的角色,核心思路是:

  1. 快速实验

    • 数据读取、分布查看、缺失值检查
    • 尝试不同的特征工程、模型,看哪个有效
    • 可视化分析,理解业务与数据的关系(信贷场景如逾期率、收入分布)
  2. 沉淀分析逻辑

    • 把实验结论写成 markdown 说明,解释每一步的原因
    • 这些结论会指导后续工程代码的编写
  3. 最终并不是"可交付"的代码

    • 很多函数是零散的,变量名随意,没有模块化
    • 所以今天要学的就是:如何把 notebook 里的有效内容,提炼到规范的项目结构中,让它可复用、可维护、可上线。

二、项目文件夹的拆分方法(以信贷项目为例)

一个典型的机器学习项目拆分类似这样(很多大项目都是这个骨架):

复制代码
credit_project/
├── data/                # 原始数据 & 处理后的数据(只读/版本管理)
│   ├── raw/
│   └── processed/
├── notebooks/           # 探索性分析,文件名带编号和主题
│   └── 01_data_exploration.ipynb
├── src/                 # 核心代码包
│   ├── __init__.py
│   ├── preprocess.py    # 数据清洗、缺失值填补、编码
│   ├── features.py      # 特征构造、筛选
│   ├── train.py         # 模型训练与交叉验证
│   ├── evaluate.py      # 评估指标、AUC/KS、报告生成
│   └── utils.py         # 通用工具(日志、配置读取)
├── configs/             # 配置文件(yaml/json),参数集中管理
│   └── config.yaml
├── models/              # 保存训练好的模型文件
├── outputs/             # 输出结果(预测结果、图表)
├── tests/               # 单元测试
├── requirements.txt     # 依赖包版本
├── README.md            # 项目说明
└── main.py              # 主入口,串联所有流程(可选)

拆分原则

  • 数据与代码分离:原始数据只读,处理后的数据由代码生成,不手动修改。
  • 流程模块化 :每个 .py 只负责一个阶段(清洗、特征、训练),函数职责单一。
  • 可配置 :超参、路径、阈值全写在 configs/ 里,改动不碰代码。
  • 可复现:固定随机种子,记录依赖版本。

三、知识点回顾对照

1. 规范的文件命名

  • 模块名用小写 + 下划线:preprocess.pytrain_model.py
  • Notebook 用数字编号:01_xxx.ipynb,方便排序
  • 数据文件有明确版本或日期:application_20250101.csv
  • 避免中文、空格和特殊字符

2. 规范的文件夹管理

  • 按功能分层,不要所有文件平铺在根目录
  • src/ 就是你的"工具箱",notebooks/ 是"实验记录"
  • 第三方代码、原始数据、产出物各归其位

3. 机器学习项目的拆分

  • 对应上面的项目树,把 "notebook 思路" 转成 "工程代码":
    • 探索后,把数据清洗逻辑写成 preprocess.py 的函数
    • 把特征构造写成 features.py,并用 ColumnTransformerPipeline 封装
    • 训练逻辑独立,方便调参和切换模型
  • 这样可以一键运行,而不是手动一个 cell 一个 cell 点

4. 编码格式和类型注解

  • 文件头声明编码

    python 复制代码
    # -*- coding: utf-8 -*-

    确保中文注释、数据列名在不同系统不乱码。

  • 类型注解(Type Hints)

    python 复制代码
    def calc_ks(y_true: np.ndarray, y_pred: np.ndarray) -> float:
        ...

    好处:IDE 会有代码提示、错误检查,读代码的人也更容易理解函数的输入输出。

相关推荐
2601_9621005444 分钟前
python包和模块的内容整理
python·模块·导入·虚拟环境·
二进制漫游记1 小时前
FastAPI项目集成 Qdrant向量数据库+阿里云Embedding完整实战(工具封装+业务调用)
数据库·python·阿里云·embedding
-今昭-2 小时前
《V2V 迁移实战:将 VMware 虚拟机转为 OpenStack 可用 Glance qcow2 镜像》
开发语言·python
2601_962381582 小时前
【转】Python渗透测试工具:sqlmap
python·渗透测试·sql注入·sqlmap·数据库安全
用户3721574261353 小时前
如何使用 Python 从 Word 文档中提取图片
python
白山编程大哥4 小时前
Java 集合算法:从排序、查找到底层原理的实战指南
java·python·算法
昭昭日月明5 小时前
RAGFlow 入门,不用从零造轮子
python·ai编程
莓有烦恼吖6 小时前
Vibe Coding 的一些思考
python
小白学大数据6 小时前
超简单:用 Python 让 Excel 飞起来:用 openpyxl 把重复报表整理交给脚本
开发语言·数据库·python·excel
爱丶不疚6 小时前
写给前端工程师的现代 Python 工程化最佳实践:从 pnpm 到 uv,从 CommonJS 到 src-layout
javascript·python·typescript