机器学习 笔记

特征值提取

字典

from sklearn.extaction import DictVectorizer

m=DictVectorizer(sparse=False)#sparse是否转换成三元组形式

data=[], #传入字典数据

data1=model.fit_transform(data) #使用API

英文特征值提取

from sklearn.feature_extraction.text import CountVectorizer

data=[]

transfer=CountVectorizer(stop_words=])#创建词频提取对象

x=transfer.fit_transform(data)# 提取词频

中文特征值提取

from sklearn.feature_extraction.text import CountVectorizer,TfidfVectorizer

import jieba # 导入jieba用于断词中文字符串

import pandas as pd

def text_cut(text):

return "-".join(jieba.cut(text)) # 函数断词

data=[]

data1=(text_cut(i) for i in data) # 推导式

transfer=TfidfVectorizer(stop_words=[])

re=transfer.fit_transform(data1)

data2=pd.DataFrame(data=re.toarray(),columns=transfer.get_feature_names_out())

无量纲化-预处理

归一化

这里的 Xmin 和 Xmax 分别是每种特征中的最小值和最大值,而 ��是当前特征值,Xscaled 是归一化后的特征值。

标准化

相关推荐
Mintopia几秒前
🧠 AIGC技术人才缺口:Web行业的技能培养与技术传承
人工智能·aigc·trae
shayudiandian2 分钟前
用FastAPI部署深度学习模型
人工智能·深度学习·fastapi
Yan-英杰2 分钟前
openEuler 数据库性能深度评测:PostgreSQL 全方位压测
网络·人工智能·网络协议·tcp/ip·http
raoxiaoya4 分钟前
ADK-Go:Golang开发AI Agent
开发语言·人工智能·golang
_落纸6 分钟前
《传感器与检测技术》第 4 章 光电式传感器原理与应用
笔记·自动化
Jay20021117 分钟前
【机器学习】28-29 推荐系统 & 推荐系统实现
人工智能·python·机器学习
_oP_i8 分钟前
常见、主流、可靠的机器学习与深度学习训练集网站
人工智能·深度学习·机器学习
zery8 分钟前
Label Studio 切换到PostgreSQL 数据库
目标检测·机器学习
我很哇塞耶9 分钟前
Gemini手搓3D粒子特效,体验现实版钢铁侠
人工智能·ai·大模型
AI 搜索引擎技术10 分钟前
智能电网中的AI Agent负载均衡
运维·人工智能·ai·负载均衡