从 Pandas 到 Polars 二十九:在Polars中进行机器学习预处理

Polars中的机器学习

在最近的时间里,我将探索在Polars中进行机器学习(ML)可以走到多远。

除了ML模型外,scikit-learn还提供了许多数据预处理功能。让我们看看在Polars中进行一些这样的预处理是否值得。

最小-最大缩放示例

简单示例:我们有一个包含100,000行和100列的数据框,并希望对每个列进行最小-最大缩放。

python 复制代码
import polars as pl
import numpy as np
from sklearn.preprocessing import MinMaxScaler

N = 100000
df = pl.DataFrame(np.random.standard_normal((N,100)))
arr = df.to_numpy()

# Using sklearn
minMax = MinMaxScaler()
minMax.fit_transform(arr)
Time: 90 ms

# Using Polars
df.select(
    (pl.all()-pl.all().min()) / (pl.all().max()-pl.all().min())
)
Time: 40 ms

所以在这个比较中,Polars的速度是原来的两倍。

这只是使用Polars进行机器学习的开始!例如,我们可以创建一个类来用scikit-learn的API包装Polars代码。然后,在转换为numpy以用于机器学习模型之前,我们可以尽可能长时间地保持在快速且内存高效的Polars和ApacheArrow组合中。

相关推荐
技术与健康3 小时前
LLM实践系列:利用LLM重构数据科学流程03- LLM驱动的数据探索与清洗
大数据·人工智能·重构
张小九994 小时前
Foldseek快速蛋白质结构比对
人工智能
云卓SKYDROID5 小时前
无人机延时模块技术难点解析
人工智能·无人机·高科技·云卓科技·延迟摄像
神齐的小马5 小时前
机器学习 [白板推导](十三)[条件随机场]
人工智能·机器学习
荼蘼5 小时前
CUDA安装,pytorch库安装
人工智能·pytorch·python
@Wufan6 小时前
【机器学习】7 Linear regression
人工智能·机器学习·线性回归
tainshuai6 小时前
从零开始理解 K 均值聚类:原理、实现与应用
机器学习·均值算法·聚类
cxr8286 小时前
自动化知识工作AI代理的工程与产品实现
运维·人工智能·自动化
whaosoft-1437 小时前
51c自动驾驶~合集18
人工智能
即兴小索奇7 小时前
2025年AI Agent规模化落地:企业级市场年增超60%,重构商业作业流程新路径
人工智能·ai·商业·ai商业洞察·即兴小索奇