截斷二進制編碼
截斷二進制編碼()是一種適用於擁有均勻分布特性的符號的熵編碼方式。當符號個數不為2的整數次方時,比起使用普通固定長度的二元編碼,採用截斷二進制編碼能縮短平均碼長。 編碼方式 令n個符號,s\in \left\{ {0,1,2,3...(n-1)}\right\},2^ \leq n\leq 2^ { },k=\lfloor {log_2 n} \rfloor 。 當n不為2的整數次方,以k+1個進行位元固定二元編碼時,會有m個未使用之碼…
共 12 篇文章
截斷二進制編碼()是一種適用於擁有均勻分布特性的符號的熵編碼方式。當符號個數不為2的整數次方時,比起使用普通固定長度的二元編碼,採用截斷二進制編碼能縮短平均碼長。 編碼方式 令n個符號,s\in \left\{ {0,1,2,3...(n-1)}\right\},2^ \leq n\leq 2^ { },k=\lfloor {log_2 n} \rfloor 。 當n不為2的整數次方,以k+1個進行位元固定二元編碼時,會有m個未使用之碼…
信息论中,困惑度代表概率分布或概率模型的预测结果与样本的契合程度,困惑度越低则契合越准确。该度量可以用于比较不同模型之优劣。 概率分布的困惑度 离散概率分布 p 的困惑度由下式给出 :2^{H(p)}=2^{-\sum_x p(x)\log_2 p(x)} 其中 H(p) 是该分布的熵,x 遍历事件空间。 随机变量 X 的复杂度由其所有可能的取值 x 定义。 概率模型的困惑度 词困惑度 参见
在概率论和信息论中,两个随机变量的互信息(mutual Information,MI)度量了两个变量之间相互依赖的程度。具体来说,对于两个随机变量,MI是一个随机变量由于已知另一个随机变量而减少的“信息量”(单位通常为比特)。互信息的概念与随机变量的熵紧密相关,熵是信息论中的基本概念,它量化的是随机变量中所包含的“信息量”。 MI不仅仅是度量实值随机变量和线性相关性(如相关系数),它更为通用。互信息决定了随机变量{\displaysty…
KL散度(,簡稱KLD),在訊息系统中称为相对熵(relative entropy),在连续时间序列中称为随机性(randomness),在统计模型推断中称为訊息增益(information gain)。也称訊息散度(information divergence)。 KL散度是两个機率分布P和Q差别的非对称性的度量。 KL散度是用来度量使用基于Q的分布来编码服从P的分布的样本所需的额外的平均比特数。典型情况下,P表示数据的真实分布,Q表…
物理學定律蘭道爾定律()理論上刻畫了至少須消耗多少能量,指出「任何對資訊邏輯上不可逆的操作,例如抹除位元,或兩路徑交匯,必增加資訊處理儀器——或其環境——不攜資訊自由度的熵。」 另一種表述是,如果觀測者喪失一物理系統的資訊,他亦無法使其做功。 計算過程若無資訊損耗,即所謂邏輯上可逆,則理論上可以不耗散熱能。這興起了可逆計算研究。確實,不可逆計算下,每耗散一焦耳能執行的計算次數是有上限的。若維持,則蘭道爾定律推導出的上限將於2050年左右…
在信息论中,熵(,又稱信息熵、信源熵、平均自信息量)是接收的每条消息中包含的信息的平均量。这里的“消息”代表来自分布或数据流中的事件、样本或特征。(熵最好理解为不确定性的量度而不是确定性的量度,因为越随机的信源的熵越大。)来自信源的另一个特征是样本的概率分布。这里的想法是,比较不可能发生的事情,当它发生了,会提供更多的信息。由于一些其他的原因,把信息(熵)定义为概率分布的对数的相反数是有道理的。事件的概率分布和每个事件的信息量构成了一个…
转移熵()是测量两个随机过程之间有向(时间不对称)信息转移量的一种非参数统计量。过程X到另一个过程Y的转移熵可定义为:在已知Y过去值的情况下,了解X的过去值所能减少Y未来值不确定性的程度。更具体地说,假定 X_t 和 Y_t ( t\in \mathbb{N} )表示两个随机过程,并用香农熵来度量信息量,则转移熵可定义为: : T_{X\rightarrow Y} = H\left( Y_t \mid Y_{t-1:t-L}\right…
在信息论中,基于相同事件测度的两个概率分布p和q的交叉熵()是指,当基于一个“非自然”(相对于“真实”分布p而言)的概率分布q进行编码时,在事件集合中唯一标识一个事件所需要的平均比特数(bit)。 给定两个概率分布p和q,p相对于q的交叉熵定义为: :H(p, q) = \operatorname{E}_p[-\log q] = H(p) + D_{\mathrm{KL}}(p \| q),\! 其中H(p)是p的熵,D_{\mathr…
在信息论中,自信息(),由克勞德·夏農提出。自信息指的是当我们接收到一个消息时所获得的信息量。具体来说,对于一个事件,其自信息的大小与该事件发生的概率有关, 它是与概率空间中的單一事件或离散随机变量的值相关的資訊量的量度。它用信息的單位表示,例如 bit、nat或是hart,使用哪个单位取决于在计算中使用的对数的底。自信息的期望值就是信息论中的熵,它反映了随机变量采样时的平均不确定程度。 定義 由定义,当信息被拥有它的实体传递给接收它的…
联合熵是一集变量之间不确定性的衡量手段。 定义 两个变量X 和 Y 的联合信息熵定义为: :\Eta(X,Y) = -\sum_{x} \sum_{y} P(x,y) \log_2[P(x,y)] \! 其中 x 和 y 是 X 和 Y的特定值, 相应地, P(x,y) 是这些值一起出现的联合概率, 若P(x,y)=0 ,则P(x,y) \log_2[P(x,y)] 定义为0。 对于两个以上的变量 X_1, ..., X_n ,该式的一…
在信息论中,条件熵描述了在已知第二个随机变量 X 的值的前提下,随机变量 Y 的信息熵还有多少。同其它的信息熵一样,条件熵也用Sh、nat、Hart等信息单位表示。基于 X 條件的 Y 的信息熵,用 \Eta(Y|X) 表示。 定义 如果 \Eta(Y|X=x) 爲變數 Y 在變數 X 取特定值 x 條件下的熵,那麼 \Eta(Y|X) 就是 \Eta(Y|X=x) 在 X 取遍所有可能的 x 後取平均的結果。 给定随机变量 X 与 Y…
熵編碼法是一种独立于介质的具体特征的进行无损数据压缩的方案。 一种主要类型的熵编码方式是对输入的每一个符号,创建并分配一个唯一的前缀码,然后,通过将每个固定长度的输入符号替换成相应的可变长度前缀无关(prefix-free)输出码字替换,从而达到压缩数据的目的。每个码字的长度近似与概率的负对数成比例。因此,最常见的符号使用最短的码。 根据香农的信源编码定理,一个符号的最佳码长是 −logbP,其中 b 是用来输出的码的数目,P 是输入符…