Day1 概率机器学习 信息论一种混乱程度。 具有较高的熵,认为具有较高的信息含量。K K K 个状态上分布为 p p p 的离散随机变量 X X X 的熵被定义为 H ( x ) ≜ − ∑ k = 1 K p ( X = k ) log 2 p ( X = k ) = − E X [ log p ( X ) ] \mathbb{H}(x)\triangleq-\sum_{k=1}^{K}p(X=k)\log_2p(X=k)=-\mathbb{E}_X\left[\log p(X)\right] H(x)≜−k=1∑Kp(X