机器学习 笔记

特征值提取

字典

from sklearn.extaction import DictVectorizer

m=DictVectorizer(sparse=False)#sparse是否转换成三元组形式

data=[], #传入字典数据

data1=model.fit_transform(data) #使用API

英文特征值提取

from sklearn.feature_extraction.text import CountVectorizer

data=[]

transfer=CountVectorizer(stop_words=])#创建词频提取对象

x=transfer.fit_transform(data)# 提取词频

中文特征值提取

from sklearn.feature_extraction.text import CountVectorizer,TfidfVectorizer

import jieba # 导入jieba用于断词中文字符串

import pandas as pd

def text_cut(text):

return "-".join(jieba.cut(text)) # 函数断词

data=[]

data1=(text_cut(i) for i in data) # 推导式

transfer=TfidfVectorizer(stop_words=[])

re=transfer.fit_transform(data1)

data2=pd.DataFrame(data=re.toarray(),columns=transfer.get_feature_names_out())

无量纲化-预处理

归一化

这里的 Xmin 和 Xmax 分别是每种特征中的最小值和最大值,而 ��是当前特征值,Xscaled 是归一化后的特征值。

标准化

相关推荐
用你的胜利博我一笑吧8 分钟前
opencv(自用)
人工智能·opencv·计算机视觉
pps-key12 分钟前
ai交易算力研究
大数据·jvm·人工智能·机器学习
2401_8414956413 分钟前
【机器学习】限制性玻尔兹曼机(RBM)
人工智能·python·深度学习·神经网络·机器学习·无监督学习·限制性玻尔兹曼机
最晚的py17 分钟前
cnn卷积层详解
人工智能·pytorch·cnn卷积层
彭军辉20 分钟前
生命体AI的本质是抽象主义人工智能
人工智能
老王熬夜敲代码21 分钟前
多路复用epoll
linux·网络·笔记
dajun18112345625 分钟前
智能体在复杂工作流中的角色分配
大数据·运维·人工智能
yesyesido35 分钟前
AI手办工坊:3D渲染级二次元写真生成、多风格角色定制与高清无损下载的一键创作平台
人工智能·3d
梦境虽美,却不长38 分钟前
简单项目,天问ASR离线语音+esp8266的红外语音助手2026-1-2
人工智能·语音识别·红外遥控·arduino编程·天问编程
AI Echoes39 分钟前
LangChain中的工具与工具包
人工智能·python·langchain·prompt·agent