机器学习 笔记

特征值提取

字典

from sklearn.extaction import DictVectorizer

m=DictVectorizer(sparse=False)#sparse是否转换成三元组形式

data=\[\], #传入字典数据

data1=model.fit_transform(data) #使用API

英文特征值提取

from sklearn.feature_extraction.text import CountVectorizer

data=\[\]

transfer=CountVectorizer(stop_words=])#创建词频提取对象

x=transfer.fit_transform(data)# 提取词频

中文特征值提取

from sklearn.feature_extraction.text import CountVectorizer,TfidfVectorizer

import jieba # 导入jieba用于断词中文字符串

import pandas as pd

def text_cut(text):

return "-".join(jieba.cut(text)) # 函数断词

data=\[\]

data1=(text_cut(i) for i in data) # 推导式

transfer=TfidfVectorizer(stop_words=\[\])

re=transfer.fit_transform(data1)

data2=pd.DataFrame(data=re.toarray(),columns=transfer.get_feature_names_out())

无量纲化-预处理

归一化

这里的 Xmin 和 Xmax 分别是每种特征中的最小值和最大值,而 ��是当前特征值,Xscaled 是归一化后的特征值。

标准化

相关推荐
阿米亚波26 分钟前
【C++】流式数据输入处理(不完全整理)
开发语言·c++·笔记
IT_陈寒1 小时前
为什么我的JavaScript异步代码总是不按顺序执行?
前端·人工智能·后端
石头dhf2 小时前
Claude code执行过程
人工智能
小码哥哥2 小时前
云原生时代的企业AI知识库:从云生态融合到多云知识治理
人工智能·云原生
zhangrelay2 小时前
笔记本轻量高品质延寿工具完整分系统清单
运维·笔记·学习
熊猫钓鱼>_>2 小时前
Redis 突发缓存穿透:一次完整的定位复盘
数据库·人工智能·redis·缓存·ai·agent·智能
巴巴媛6662 小时前
STM32学习笔记【38.DHT11实验】
笔记·stm32·学习
Xzaveir2 小时前
不要用一个状态表示“号码已认证”:企业号码身份的四域模型
android·人工智能
To_OC2 小时前
搭 RAG 的第一个坎:网页检索答非所问?聊聊文档加载与分块的那些坑
人工智能·llm·agent
科技林总2 小时前
图像处理领域的技术发展
人工智能·深度学习·计算机视觉