机器学习 笔记

特征值提取

字典

from sklearn.extaction import DictVectorizer

m=DictVectorizer(sparse=False)#sparse是否转换成三元组形式

data=\[\], #传入字典数据

data1=model.fit_transform(data) #使用API

英文特征值提取

from sklearn.feature_extraction.text import CountVectorizer

data=\[\]

transfer=CountVectorizer(stop_words=])#创建词频提取对象

x=transfer.fit_transform(data)# 提取词频

中文特征值提取

from sklearn.feature_extraction.text import CountVectorizer,TfidfVectorizer

import jieba # 导入jieba用于断词中文字符串

import pandas as pd

def text_cut(text):

return "-".join(jieba.cut(text)) # 函数断词

data=\[\]

data1=(text_cut(i) for i in data) # 推导式

transfer=TfidfVectorizer(stop_words=\[\])

re=transfer.fit_transform(data1)

data2=pd.DataFrame(data=re.toarray(),columns=transfer.get_feature_names_out())

无量纲化-预处理

归一化

这里的 Xmin 和 Xmax 分别是每种特征中的最小值和最大值,而 ��是当前特征值,Xscaled 是归一化后的特征值。

标准化

相关推荐
Veer Han几秒前
AI 开发真实案例完整复盘:给 App 增加宠物功能
人工智能·鸿蒙·宠物
2601_962300814 分钟前
用PyTorch Lightning简化空间分析:Python和机器学习的力量
python·深度学习·机器学习·空间分析·pytorchlightning
mpp0075 分钟前
AI 的“交通规则”也有保质期?
大数据·人工智能
June bug13 分钟前
【HCIA- AI(正课)】2.6.Transformer架构和Diffusion结构介绍
人工智能·深度学习·transformer
lovingsoft31 分钟前
AI测试中的对抗测试:从“找Bug”到“预演战争”
人工智能·bug
我想试一下名字可以取多长一点点再长一些33 分钟前
10|ARIMA 与 Prophet:两条「自动化」的路,和一盆冷水
机器学习
塔望品牌咨询37 分钟前
食品品牌战略验收的可验证框架:从文档交付到10项经营变化
大数据·人工智能
YHL41 分钟前
🧠 从零理解 Agent Memory 管理:内存记忆、文件持久化与上下文截断
人工智能
#卢松松#42 分钟前
网站备案已经注销了,以后不需要那么多网站了。
人工智能·创业创新
myaifas1 小时前
知识库搭建的五大关键步骤
大数据·人工智能