机器学习 笔记

特征值提取

字典

from sklearn.extaction import DictVectorizer

m=DictVectorizer(sparse=False)#sparse是否转换成三元组形式

data=\[\], #传入字典数据

data1=model.fit_transform(data) #使用API

英文特征值提取

from sklearn.feature_extraction.text import CountVectorizer

data=\[\]

transfer=CountVectorizer(stop_words=])#创建词频提取对象

x=transfer.fit_transform(data)# 提取词频

中文特征值提取

from sklearn.feature_extraction.text import CountVectorizer,TfidfVectorizer

import jieba # 导入jieba用于断词中文字符串

import pandas as pd

def text_cut(text):

return "-".join(jieba.cut(text)) # 函数断词

data=\[\]

data1=(text_cut(i) for i in data) # 推导式

transfer=TfidfVectorizer(stop_words=\[\])

re=transfer.fit_transform(data1)

data2=pd.DataFrame(data=re.toarray(),columns=transfer.get_feature_names_out())

无量纲化-预处理

归一化

这里的 Xmin 和 Xmax 分别是每种特征中的最小值和最大值,而 ��是当前特征值,Xscaled 是归一化后的特征值。

标准化

相关推荐
赟爸2 分钟前
直播切片素材杂乱不好复用,易元AI要怎么处理
大数据·人工智能·python
qpsj9 分钟前
让 LLM 操作 CAD:四条技术路线的取舍
人工智能·llm
东方小月9 分钟前
从零开发一个 Coding Agent(十):实现 CLI 参数解析与静态命令
前端·人工智能·开源
前端小白乘风16 分钟前
github Copilot 接入deepseek-v4-pro
人工智能
还不秃顶的计科生36 分钟前
具身智能论文学习1:PaLM: Scaling Language Modeling with Pathways
人工智能·语言模型·palm
qq_4542450339 分钟前
Agent数据价值分类存储原则
大数据·人工智能·分类
怪奇云呼军40 分钟前
从声音特征到 CRM 回流:闪电智能 Voice Agent 沟通策略自适应系统 v1 实战
android·人工智能·python·音视频·语音识别
Python私教41 分钟前
AI 并行编码的 Worktree 生命周期:创建、隔离与安全回收
人工智能·git
zhangrelay1 小时前
ROS 2 Lyrical 第4章 URDF机器人建模与Gazebo Garden仿真
linux·笔记·学习·ubuntu·机器人·ros2
ZhengEnCi1 小时前
什么是 SFT 监督微调:大模型从只会续写到会听话的关键一步
人工智能