机器学习 笔记

特征值提取

字典

from sklearn.extaction import DictVectorizer

m=DictVectorizer(sparse=False)#sparse是否转换成三元组形式

data=\[\], #传入字典数据

data1=model.fit_transform(data) #使用API

英文特征值提取

from sklearn.feature_extraction.text import CountVectorizer

data=\[\]

transfer=CountVectorizer(stop_words=])#创建词频提取对象

x=transfer.fit_transform(data)# 提取词频

中文特征值提取

from sklearn.feature_extraction.text import CountVectorizer,TfidfVectorizer

import jieba # 导入jieba用于断词中文字符串

import pandas as pd

def text_cut(text):

return "-".join(jieba.cut(text)) # 函数断词

data=\[\]

data1=(text_cut(i) for i in data) # 推导式

transfer=TfidfVectorizer(stop_words=\[\])

re=transfer.fit_transform(data1)

data2=pd.DataFrame(data=re.toarray(),columns=transfer.get_feature_names_out())

无量纲化-预处理

归一化

这里的 Xmin 和 Xmax 分别是每种特征中的最小值和最大值,而 ��是当前特征值,Xscaled 是归一化后的特征值。

标准化

相关推荐
June`2 分钟前
warp shuffle指令
c++·人工智能·算法·cuda
内蒙深海大鲨鱼6 分钟前
3.Introduction to PyTorch YouTube Series--Autograd
人工智能·pytorch·python
星核0penstarry10 分钟前
276B 总参 / 12B 激活,8 卡 B200 跑 648 tok/s:Inkling‑Small 技术解读**2
大数据·人工智能·ai
weixin_4462608513 分钟前
AtumAI:面向数据中心控制平面策略的规范化智能体生成框架
人工智能·平面
ZZHow102418 分钟前
PyTorch深度学习入门笔记(小土堆)P7-14
人工智能·pytorch·笔记·python·深度学习
Dr.kangder19 分钟前
AI4SE:AI赋能软件工程——从自动化到智能化的演进之路
人工智能·自动化·软件工程
GuWenyue22 分钟前
大模型幻觉无解?7步搭建Milvus+LangChain电子书RAG,私有小说精准问答零编造
人工智能·langchain·ai编程
是Dream呀26 分钟前
客户催着要数据,我用TRAE Work十分钟完成10万元项目
人工智能·架构·trae
IanSkunk28 分钟前
眼健康机构系统化运营:流程拆解与协同机制怎么建?
大数据·人工智能
40kuai30 分钟前
四款主流AI模型网关对比与选型指南
人工智能