OpenCV机器学习(3)期望最大化(Expectation-Maximization, EM)算法cv::ml::EM

  • 操作系统:ubuntu22.04
  • OpenCV版本:OpenCV4.9
  • IDE:Visual Studio Code
  • 编程语言:C++11

算法描述

cv::ml::EM 是 OpenCV 机器学习模块中的一部分,用于实现期望最大化(Expectation-Maximization, EM)算法。EM 算法是一种迭代方法,通常用于估计有限混合模型(如高斯混合模型,GMM)的参数。它在数据聚类、密度估计等领域有着广泛应用。

主要特点

  • 混合模型:支持高斯混合模型(Gaussian Mixture Model, GMM),可以用于数据点的概率分布建模。
  • 参数估计:通过 EM 算法自动估计模型参数(均值、协方差矩阵等)。
  • 分类功能:不仅可以用于聚类,还可以用于预测新样本属于哪个类别。
  • 自定义选项:允许用户指定组件数量、初始参数猜测、终止条件等。

常用成员函数

以下是一些常用的 cv::ml::EM 类成员函数:

创建和设置模型:

  • create():创建一个新的 EM 模型实例。
  • setClustersNumber(int val):设置混合模型中的成分(即高斯分布)的数量。
  • setTermCriteria(TermCriteria val):设置 EM 训练过程的终止标准(如最大迭代次数或最小对数似然改善量)。
  • setCovarianceMatrixType(int val):设置协方差矩阵的类型(如对角矩阵、球形等)。

训练模型:

  • trainE(const Ptr& data):使用期望步骤训练模型,并返回对数似然值。
  • trainM(const Mat& samples):使用最大化步骤训练模型(较少直接使用)。

预测:

  • predict2(InputArray sample, OutputArray probs):对新样本进行预测,并返回每个类别的概率分布。

保存与加载模型:

  • save(const String& filename):将模型保存到文件。
  • load(const String& filename):从文件加载模型。

使用步骤

  • 准备数据:准备好你的训练数据集,包括特征向量。
  • 初始化 EM 模型:使用 cv::ml::EM::create() 创建一个新的 EM 模型实例,并根据需要设置参数。
  • 训练模型:调用 trainE() 方法,传入你的训练数据来进行模型训练。
  • 评估模型:可以通过计算对数似然值来评估模型性能,或者在独立的测试集上评估模型性能。
  • 预测新数据:使用训练好的模型对新的未见过的数据进行预测,并获取其所属类别的概率分布。

代码示例

cpp 复制代码
#include <opencv2/opencv.hpp>
#include <opencv2/ml.hpp>
#include <iostream>

using namespace cv;
using namespace cv::ml;
using namespace std;

int main() {
    // 准备训练数据
    Mat samples = (Mat_<float>(4, 2) << 
        0.5, 1.0,
        1.0, 1.5,
        2.0, 0.5,
        1.5, 0.0);

    // 创建并配置 EM 模型
    Ptr<EM> em_model = EM::create();
    em_model->setClustersNumber(2); // 设置混合模型中的成分数量
    em_model->setCovarianceMatrixType(EM::COV_MAT_DIAGONAL); // 协方差矩阵类型
    em_model->setTermCriteria(TermCriteria(TermCriteria::COUNT + TermCriteria::EPS, 300, 0.1));

    // 使用 TrainData::create 将样本数据封装成 TrainData 对象
    Ptr<TrainData> tdata = TrainData::create(samples, ROW_SAMPLE, Mat());

    // 训练模型
    bool ok = em_model->train(tdata);
    if (ok) {
        // 保存模型
        em_model->save("em_model.yml");

        // 对新样本进行预测
        Mat sample = (Mat_<float>(1, 2) << 1.6, 0.7);
        Mat probs;
        int response = em_model->predict(sample, probs);

        cout << "The predicted response for the sample is: " << response << endl;
        cout << "Probabilities: " << probs << endl;
    } else {
        cerr << "Training failed!" << endl;
    }

    return 0;
}

运行结果

bash 复制代码
The predicted response for the sample is: 0
Probabilities: [0.9983411783982278, 0.001658821601772262]
相关推荐
88号技师38 分钟前
模糊斜率熵Fuzzy Slope entropy+状态分类识别!2024年11月新作登上IEEE Trans顶刊
人工智能·机器学习·分类·数据挖掘·信号处理·故障诊断·信息熵
死磕代码程序媛1 小时前
谷歌25年春季新课:15小时速成机器学习
人工智能·机器学习
liuluyang5301 小时前
C语言C11支持的结构体嵌套的用法
c语言·开发语言·算法·编译·c11
橙色小博2 小时前
Transformer模型解析与实例:搭建一个自己的预测语言模型
人工智能·深度学习·神经网络·机器学习·transformer
勤劳的进取家2 小时前
贪心算法之最小生成树问题
数据结构·python·算法·贪心算法·排序算法·动态规划
牛奶咖啡.8542 小时前
第十四届蓝桥杯大赛软件赛省赛C/C++ 大学 A 组真题
c语言·数据结构·c++·算法·蓝桥杯
亓才孓3 小时前
[leetcode]stack的基本操作的回顾
算法
小美爱刷题3 小时前
力扣DAY46-50 | 热100 | 二叉树:展开为链表、pre+inorder构建、路径总和、最近公共祖先、最大路径和
算法·leetcode·链表
Fanxt_Ja3 小时前
【数据结构】红黑树超详解 ---一篇通关红黑树原理(含源码解析+动态构建红黑树)
java·数据结构·算法·红黑树
永恒迷星.by3 小时前
全球变暖(蓝桥杯 2018 年第九届省赛)
算法