这是一本给算法小白的算法模型实战手册。能够深入浅出的理解如何利用数据训练一个成熟的模型。
这本小册子想做的,就是把"从数据到能用的模型"这个过程,用一个贯穿始终的示例项目讲透。
谁适合读这本小册子
写给"想真正动手做一遍"的人:
- 你不用先修过机器学习课。书里该补的概念,会在用到的地方现讲,不假定你背过什么。
- 能理解一些编程的基本概念即可。深的东西(GBDT、校准、聚类)书里会带着走。
- 最好你手头正有个想用模型解决的小问题,带着问题读,比空读香得多。
如果你已经是熟手,你也能从中受益。
这本小册子怎么组织的
30 章,分成八个部分,难度是顺着爬的:
- 认知篇(1--3):先搞清"我们在解决什么问题""监督和无监督是啥""一次模型训练到底经历哪几步"。
- 准备篇(4--5):把环境搭起来,学会看懂你的数据。
- 特征与标签篇(6--8):这是地基。样本、特征、标签怎么造,以及最关键的,怎么防止数据泄露。
- 行为聚类篇(9--11):无监督那一套,把用户按行为风格分成群。
- 活跃度预测篇(12--18):全书的重心。用 GBDT 做有监督预测,从原理、样本准入、损失权重、训练实战、概率校准一路打到跑通。
- 评估篇(19--22):怎么判断一个模型"真的行",不只是看 AUC,还有稳定性、偏置、特征重要性。
- 双目标模型升级篇(23--27):当"回不回来"不够用时,怎么加第二个目标("回来了值不值得深耕"),用双头模型拼出综合评分。
- 上线篇(28--30):模型不是跑通就完了。异常软处理、监控与再训练、最后把全流程串一遍。
每一章的结构是固定的三块:小白一句话 (先告诉你这章在讲啥、解决啥)、原理 (把事说清楚)、动手(跟着脚本跑一遍,数字和书里对得上)。所以你随时能跳读,卡在哪章就翻哪章,不会因为前面落了一块就完全接不上。
环境和复现
整本手册只依赖 Python 加几个常用库(pandas、scikit-learn、numpy、scipy、matplotlib),清单在 附件/00_公共/requirements.txt。
bash
python -m pip install -r 附件/00_公共/requirements.txt
跑脚本的方式从头到尾都一样:在手册根目录,执行对应篇章的脚本,比如:
bash
python 附件/05_活跃度预测篇/activity_train_walkthrough.py
书里出现的每一个关键数字,都对应一个能直接跑的脚本。示例数据是一份固定随机种子生成的合成数据 (30 天、58 个用户、1643 条领取记录),任何人跑 附件/00_公共/generate_sample.py 都会得到一模一样的结果。所以你照着书里的数字复现,不会有"为什么我的数跟书里不一样"的困惑。
关于这份数据
要特意说一句:手册里所有数据都是脱敏的合成数据,不含任何真实业务或个人信息。它模拟的是一个"每日福利任务领取"的场景,五类任务(签到 / 看视频 / 分享好友 / 小游戏 / 填问卷)和奖励金额都是构造出来的。真实业务的数据量大得多、也脏得多,但建模的套路是一样的,这本小册子先把套路讲明白,真实数据那是你自己的战场。
读完你能带走什么
合上最后一章,你应该能独立做完这么一件事:拿到一份用户行为明细,造出特征和标签,训一个不容易泄露的预测模型,校准出能直接拿去排队的分数,用一套说得清的评估指标判断它靠不靠谱,再把它安全地放到日常流程里跑。中间踩过的坑(冷启动怎么路由、校准改了啥、双目标为什么不能各训各的),书里都摊开了讲。
祝你读得顺。哪里卡住了,就从那章的"小白一句话"重新开始。