机器学习 笔记

特征值提取

字典

from sklearn.extaction import DictVectorizer

m=DictVectorizer(sparse=False)#sparse是否转换成三元组形式

data=[], #传入字典数据

data1=model.fit_transform(data) #使用API

英文特征值提取

from sklearn.feature_extraction.text import CountVectorizer

data=[]

transfer=CountVectorizer(stop_words=])#创建词频提取对象

x=transfer.fit_transform(data)# 提取词频

中文特征值提取

from sklearn.feature_extraction.text import CountVectorizer,TfidfVectorizer

import jieba # 导入jieba用于断词中文字符串

import pandas as pd

def text_cut(text):

return "-".join(jieba.cut(text)) # 函数断词

data=[]

data1=(text_cut(i) for i in data) # 推导式

transfer=TfidfVectorizer(stop_words=[])

re=transfer.fit_transform(data1)

data2=pd.DataFrame(data=re.toarray(),columns=transfer.get_feature_names_out())

无量纲化-预处理

归一化

这里的 Xmin 和 Xmax 分别是每种特征中的最小值和最大值,而 ��是当前特征值,Xscaled 是归一化后的特征值。

标准化

相关推荐
货拉拉技术10 分钟前
货拉拉海豚平台-大模型推理加速工程化实践
人工智能·后端·架构
掘金安东尼17 分钟前
国内大模型真实格局:用户规模 vs API调用量(v2026.3.6)
人工智能
前端一课30 分钟前
OpenClaw 项目全面架构分析报告
前端·人工智能
小姐姐味道44 分钟前
1万美金的账单,烧麻了!bull这个skills让数据推理质量更好,更省!
人工智能
苍何1 小时前
再见 Openclaw,桌面端 Agent 起飞了!
人工智能
雮尘1 小时前
让 AI Agent 高效并行开发的命令-git worktree
人工智能·git·agent
Ray Liang2 小时前
AI基于Spec开发是巨坑?
人工智能·架构设计·mindx
哔哩哔哩技术2 小时前
游戏数据分析Agent的全栈架构演进
人工智能·agent
陆通3 小时前
10分钟Windows系统安装迷你版的OpenClaw ,小小龙虾Nanobot
人工智能
老张的码3 小时前
飞书 × OpenClaw 接入指南
人工智能·后端