利用svm进行模型训练

一、步骤

1、将文本数据转换为特征向量 : tf-idf

2、使用这些特征向量训练SVM模型

二、代码

python 复制代码
from sklearn.model_selection import train_test_split
from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.svm import SVC
from sklearn.metrics import accuracy_score, classification_report

def preprocess_data(data):
    texts, labels = zip(*data)
    vectorizer = TfidfVectorizer()
    X = vectorizer.fit_transform(texts).todense()
    return X, labels, vectorizer

def print_sorted_feature_weights(X, vectorizer):
    feature_name = vectorizer.get_feature_names_out()
    for i, doc in enumerate(X):
        nonzero_idx = doc.nonzero()[1]
        dic = {idx: doc[0, idx] for idx in nonzero_idx}
        sorted_dic = dict(sorted(dic.items(), key=lambda x: x[1], reverse=True))
        data_ = {feature_name[k]: v for k, v in sorted_dic.items()}
        print(data_)

def train_and_evaluate_model(X_train, X_test, y_train, y_test):
    svm_classifier = SVC(kernel='linear', random_state=42)
    svm_classifier.fit(X_train, y_train)
    y_pred = svm_classifier.predict(X_test)
    return y_test, y_pred

def main():
    # 示例数据集
    data = [
        ("I love this product!", 1),
        ("This is terrible.", 0),
        ("The movie was fantastic.", 1),
        ("I dislike this feature.", 0),
        ("Amazing experience!", 1),
        ("Not recommended.", 0)
    ]

    # 数据预处理
    X, labels, vectorizer = preprocess_data(data)

    # 打印排序后的特征权重
    print_sorted_feature_weights(X, vectorizer)

    # 将数据集拆分为训练集和测试集
    X_train, X_test, y_train, y_test = train_test_split(X, labels, test_size=0.2, random_state=42)

    # 训练和评估模型
    y_true, y_pred = train_and_evaluate_model(X_train, X_test, y_train, y_test)

    # 测试集是哪些
    print_sorted_feature_weights(X_test,vectorizer)

    # 评估模型性能
    accuracy = accuracy_score(y_true, y_pred)
    report = classification_report(y_true, y_pred)

    # 打印模型性能指标
    print(f"Accuracy: {accuracy}")
    print("Classification Report:\n", report)

if __name__ == "__main__":
    main()

三、结果

​​​​​​​
对应着:test_data= [("I love this product!", 1),("This is terrible.", 0)]

​​​​​​​

相关推荐
CoovallyAIHub3 小时前
中科大DSAI Lab团队多篇论文入选ICCV 2025,推动三维视觉与泛化感知技术突破
深度学习·算法·计算机视觉
NAGNIP4 小时前
Serverless 架构下的大模型框架落地实践
算法·架构
moonlifesudo4 小时前
半开区间和开区间的两个二分模版
算法
moonlifesudo4 小时前
300:最长递增子序列
算法
CoovallyAIHub9 小时前
港大&字节重磅发布DanceGRPO:突破视觉生成RLHF瓶颈,多项任务性能提升超180%!
深度学习·算法·计算机视觉
CoovallyAIHub10 小时前
英伟达ViPE重磅发布!解决3D感知难题,SLAM+深度学习完美融合(附带数据集下载地址)
深度学习·算法·计算机视觉
聚客AI1 天前
🙋‍♀️Transformer训练与推理全流程:从输入处理到输出生成
人工智能·算法·llm
大怪v1 天前
前端:人工智能?我也会啊!来个花活,😎😎😎“自动驾驶”整起!
前端·javascript·算法
惯导马工1 天前
【论文导读】ORB-SLAM3:An Accurate Open-Source Library for Visual, Visual-Inertial and
深度学习·算法
骑自行车的码农1 天前
【React用到的一些算法】游标和栈
算法·react.js