Datawhale AI夏令营 机器学习2.1

主要优化点:

  1. 设备品牌分桶

    • 将低频设备品牌归类为"Other"

    • 解决长尾分布问题,减少噪声

  2. 重叠用户策略

    python 复制代码
    test_df['is_new_did'] = test_df['did'].apply( lambda x: user_label_dict[x] if x in user_label_dict else test_df.loc[test_df['did'] == x, 'pred_model'].values[0] )
    • 对于训练集中出现过的用户,直接使用已知标签

    • 充分利用数据特点(测试集93%用户出现在训练集中)

  3. 模型参数优化

    • 减小max_depth(8)和num_leaves(31)防止过拟合

    • 降低learning_rate(0.05)提高稳定性

    • 增加正则化项(lambda_l1, lambda_l2)

    • 增加num_boost_round(2000)配合早停

  4. 阈值搜索优化

    python 复制代码
    thresholds = np.arange(0.1, 0.5, 0.01) # 更精细的阈值搜索
    • 以0.01为步长搜索最佳阈值

    • 更精确地平衡精确率和召回率

分数结果:

相关推荐
政安晨1 小时前
政安晨【零基础玩转开源AI项目】- AutoGPT:全球首个自主AI Agent从入门到实战(致敬OpenClaw的小回顾)
人工智能·ai·autogpt·全球首个agent框架·致敬openclaw之作·参考价值·ai开源agent框架
Shawn_Shawn6 小时前
mcp学习笔记(一)-mcp核心概念梳理
人工智能·llm·mcp
33三 三like8 小时前
《基于知识图谱和智能推荐的养老志愿服务系统》开发日志
人工智能·知识图谱
芝士爱知识a8 小时前
【工具推荐】2026公考App横向评测:粉笔、华图与智蛙面试App功能对比
人工智能·软件推荐·ai教育·结构化面试·公考app·智蛙面试app·公考上岸
腾讯云开发者9 小时前
港科大熊辉|AI时代的职场新坐标——为什么你应该去“数据稀疏“的地方?
人工智能
工程师老罗9 小时前
YoloV1数据集格式转换,VOC XML→YOLOv1张量
xml·人工智能·yolo
Coder_Boy_9 小时前
技术让开发更轻松的底层矛盾
java·大数据·数据库·人工智能·深度学习
啊森要自信10 小时前
CANN ops-cv:面向计算机视觉的 AI 硬件端高效算子库核心架构与开发逻辑
人工智能·计算机视觉·架构·cann
2401_8362358610 小时前
中安未来SDK15:以AI之眼,解锁企业档案的数字化基因
人工智能·科技·深度学习·ocr·生活