机器学习 笔记

特征值提取

字典

from sklearn.extaction import DictVectorizer

m=DictVectorizer(sparse=False)#sparse是否转换成三元组形式

data=\[\], #传入字典数据

data1=model.fit_transform(data) #使用API

英文特征值提取

from sklearn.feature_extraction.text import CountVectorizer

data=\[\]

transfer=CountVectorizer(stop_words=])#创建词频提取对象

x=transfer.fit_transform(data)# 提取词频

中文特征值提取

from sklearn.feature_extraction.text import CountVectorizer,TfidfVectorizer

import jieba # 导入jieba用于断词中文字符串

import pandas as pd

def text_cut(text):

return "-".join(jieba.cut(text)) # 函数断词

data=\[\]

data1=(text_cut(i) for i in data) # 推导式

transfer=TfidfVectorizer(stop_words=\[\])

re=transfer.fit_transform(data1)

data2=pd.DataFrame(data=re.toarray(),columns=transfer.get_feature_names_out())

无量纲化-预处理

归一化

这里的 Xmin 和 Xmax 分别是每种特征中的最小值和最大值,而 ��是当前特征值,Xscaled 是归一化后的特征值。

标准化

相关推荐
超级架构师2 分钟前
【区块链技术】区块链101:比特币是什么?
人工智能·区块链·比特币
阿沐沐,5 分钟前
Claude Code 首次连接:官方登录与第三方网关配置
人工智能·ai
Claire_886 分钟前
AI 会议录音转写与纪要生成:3 款工具的功能记录与使用观察
人工智能
明志数科8 分钟前
机器人训练数据质量评估体系:核心维度与全流程质控方法
人工智能·深度学习·机器学习
点心的游戏开发世界11 分钟前
GDScript 入门笔记(十六):文件读写与数据持久化
开发语言·笔记·游戏引擎·godot
hhzz14 分钟前
【OpenCV 入门到精通 02】环境安装与第一个程序:5 分钟跑通 Hello OpenCV
人工智能·opencv·yolo·计算机视觉·开源
hddata@16 分钟前
让水印“追”着目标走——一种基于特定目标的视频水印嵌入方法
人工智能
阿里云大数据AI技术20 分钟前
EMR Serverless Spark:CPU + GPU 异构计算使用指南
人工智能·spark·gpu
海宇AI24 分钟前
零信任架构实战:基于海宇风控黑名单构建自动化企业信贷网关
运维·人工智能·架构·自动化
ByNotD0g33 分钟前
跨站脚本攻击- XSS
笔记·web安全