机器学习 笔记

特征值提取

字典

from sklearn.extaction import DictVectorizer

m=DictVectorizer(sparse=False)#sparse是否转换成三元组形式

data=\[\], #传入字典数据

data1=model.fit_transform(data) #使用API

英文特征值提取

from sklearn.feature_extraction.text import CountVectorizer

data=\[\]

transfer=CountVectorizer(stop_words=])#创建词频提取对象

x=transfer.fit_transform(data)# 提取词频

中文特征值提取

from sklearn.feature_extraction.text import CountVectorizer,TfidfVectorizer

import jieba # 导入jieba用于断词中文字符串

import pandas as pd

def text_cut(text):

return "-".join(jieba.cut(text)) # 函数断词

data=\[\]

data1=(text_cut(i) for i in data) # 推导式

transfer=TfidfVectorizer(stop_words=\[\])

re=transfer.fit_transform(data1)

data2=pd.DataFrame(data=re.toarray(),columns=transfer.get_feature_names_out())

无量纲化-预处理

归一化

这里的 Xmin 和 Xmax 分别是每种特征中的最小值和最大值,而 ��是当前特征值,Xscaled 是归一化后的特征值。

标准化

相关推荐
土豆3591 分钟前
那个叫 fix bug 的提交,改了 140 万行
人工智能
随风@飘扬4 分钟前
CCS Theia中F28035 工程调试连接排障记录
人工智能
用户7275107796317 分钟前
程序员第一次控制工业步进电机:Python + Modbus RTU,从串口报文到自动定位(附可运行代码)
人工智能
AI袋鼠帝7 分钟前
WorkBuddy悄悄干了件大事,下一代Office真来了!
人工智能·agent
浮链序9 分钟前
用 Claude Haiku 5.5 做子智能体路由,把 Agent 成本砍掉六成
人工智能·python·llm
IT_陈寒9 分钟前
为什么你应该学习JavaScript?
前端·人工智能·后端
谁在黄金彼岸11 分钟前
Qwen-Image-2512-vs-2.1-实测对比
人工智能
ProbeX13 分钟前
Ollama到底是什么?能跑多大模型?
人工智能
梧桐AI14 分钟前
手写ReAct Agent:从mock循环到公网部署的完整记录
人工智能
吴佳浩23 分钟前
终章实战|300 行纯 Python 代码,手把手带你手搓一个生产级 Coding Agent
人工智能·agent