· 正微光电· technology· 约 59 分钟精读

QRNG 熵估计解析:真空涨落熵源与 800-90B 合规

核心要点速览 · TL;DR 概要

本文从信息论与量子光学的交叉点出发,严格推导真空态零差探测熵源的条件最小熵:从连续变量高斯分布的微分熵、量子攻击者视角的猜测概率到有限样本效应的保守修正,进而解析 NIST SP 800-90B 十类非 IID 估计器的取最小原则、RCT 与 APT 在线健康测试的阈值公式,给出 SHA-3 与 Toeplitz 提取的压缩比设计准则,并以 1Gbps 板卡的实测熵值数据与第三方实测验证声明收束。

QRNG 熵估计解析:真空涨落熵源与 800-90B 合规

随机数的密码学价值,完全取决于其不可预测性能够被证明到什么程度。统计意义上”看起来均匀”的序列并不构成安全资产:只要存在一种可复现的生成规律,攻击者便可将穷举空间压缩到可计算的范围之内。量子随机数发生器(Quantum Random Number Generator, QRNG)的熵源建立在量子测量过程的内禀随机性之上,但物理熵源本身并不自动等价于密码级随机数——从真空涨落的连续变量观测值,到可安全注入密钥体系的均匀比特流,中间横亘着一条完整的数学链条:物理建模、熵估计、健康测试与熵提取。这条链条中每一个环节的保守性,最终都汇聚为一个可审计的数字:每样本最小熵下界。

正微光电(zwqtech.com)是量子安全基础设施供应商,母公司为正则量子(北京)技术有限公司,围绕量子熵源主线已形成 13 项专利布局,量产 QRNG 板卡以 1Gbps 输出速率通过 NIST SP 800-90B 与 GM/T 0005 双标准的第三方实测验证。本文承接站内全景文章《量子随机数发生器(QRNG)技术全景》(/what-is-qrng)所建立的物理基础,不再复述三大熵源方案的横向对比与量子测量公设的一般性讨论,而是聚焦熵估计这一主题的数学内核:条件最小熵的严格推导、NIST SP 800-90B 评估流程的逐项解析、提取器设计的量化边界,以及上述理论在 1Gbps 量产板卡上的工程兑现。

1. 熵估计的密码学意义

1.1 为什么随机数质量必须被严格证明:从密钥安全到后量子安全

密码系统的有效强度由算法强度与随机数质量中的薄弱者决定,这一论断在对称密码、公钥密码与数字签名中同样成立。对称密码方面,AES-256 的 256 比特密钥若实际仅含 128 比特熵,攻击者的穷举复杂度便从 22562^{256} 坍缩至 21282^{128},密钥长度所承诺的安全边界随之失效;非对称密码方面,私钥生成、椭圆曲线标量乘法的盲化因子、数字签名的一次性随机数 kk,任何一个环节的熵不足都可能被算术攻击直接利用——签名随机数 kk 的两次重用即可通过联立方程在多项式时间内恢复私钥,与暴力搜索的指数复杂度毫无关系。分组密码模式中的初始化向量与计数器随机化同样依赖不可预测性:可预测的初始化向量使选择明文攻击得以展开,重用的计数器块则直接导致密钥流复用。上述场景的共同特征是:失败点不在算法,而在随机数的产生环节,且失败后果是灾难性的、不可补救的。

后量子密码(Post-Quantum Cryptography, PQC)的推广并未降低对随机数质量的要求,反而使其更为苛刻。格基方案(如 ML-KEM、ML-DSA)的安全性归约到格上困难问题的最坏情况,但其具体实现仍依赖大量随机采样:秘密向量的分布采样、加密掩码、签名一次性随机数,无一不以熵源为根基。量子攻击者的威胁模型放大了随机数缺陷的后果:攻击者可离线收集海量签名样本,若签名随机数存在可预测结构,掩码保护便形同虚设;同时,Grover 类量子搜索算法将低熵空间上的搜索代价降至平方根量级,使任何熵储备不足的密钥派生路径暴露在可计算的破解成本之下。因此,后量子时代的密码工程对熵源提出了三条不可妥协的要求:熵下界必须被信息论方法严格证明而非统计推断粗略估计;估计必须覆盖攻击者掌握侧信息的条件场景;证明结果必须在产品全寿命周期内被持续监控而非出厂一次性声明。

“严格证明”的含义值得精确界定。统计检测(如频数检验、游程检验)只能证伪、不能证实:一段序列通过全部统计检测,只说明其与均匀分布不可区分,绝不说明攻击者无法预测。能够支撑密码学声明的论证必须包含三个层次:物理层次,论证熵源输出的概率模型,即观测分布由量子真空涨落主导;信息论层次,在给定攻击者侧信息模型的前提下推导条件最小熵的下界;工程层次,以有限样本、器件老化与环境漂移的保守修正将下界落地,并以在线健康测试持续保障。三者缺一,熵估计便退化为一份无法审计的报告。

可证明性还要求估计过程的完全可复现与可审计。熵估计的输入——采样配置、数据长度、估计器参数——必须随验证报告一并公开,任何具备同等平台的团队都应能独立复现同一熵下界;任何未公开的参数调整都构成对安全声明的稀释。这一要求在 QRNG 产品认证中体现为检测流程的确定性:熵估计使用固定版本的标准流程与公开测试向量,健康测试阈值由标准公式显式计算,调理参数由熵下界唯一确定,从而杜绝了参数后门的存在空间。密码工程的历史教训表明,安全机制的价值上限等于其可审计性的程度,熵估计环节概莫能外。

1.2 熵、最小熵与条件最小熵的概念

Shannon 熵刻画随机变量的平均不确定性。对取值于有限字母表 X\mathcal{X} 的离散随机变量 XX,其 Shannon 熵定义为 H(X)=xPr[X=x]log2Pr[X=x]H(X) = -\sum_{x} \Pr[X = x] \log_2 \Pr[X = x]。密码学场景不能以平均不确定性为安全度量:攻击者的最优策略是猜测最可能出现的取值,而不是”平均”猜测。最小熵(min-entropy)正是针对这一最坏情况定义的安全度量:

H(X)=log2maxxXPr[X=x]H_\infty(X) = -\log_2 \max_{x \in \mathcal{X}} \Pr[X = x]

最小熵的语义直接而清晰:攻击者在掌握 XX 的完整分布、执行最优猜测时的单次成功概率恰为 2H(X)2^{-H_\infty(X)}。对任意分布恒有 H(X)H(X)H_\infty(X) \le H(X),二者相等当且仅当 XX 均匀分布。以 8 比特样本为例,若最常出现符号的概率为 27.82^{-7.8},则最小熵为 7.8 比特,而 Shannon 熵可能接近 8 比特——两者之差正是统计均匀性与密码不可预测性之间的距离。

真实攻击者几乎总是掌握额外信息。窃听者可能观测环境温度遥测、掌握器件参数与固件版本、收集历史输出序列,甚至通过侧信道手段获得部分测量结果。这些信息统称为侧信息 EE,密码学安全必须建立在”给定 EE 之后仍然不可预测”的基础上,即条件最小熵:

H(XE)=log2Pguess(XE),Pguess(XE)=ePr[E=e]maxxPr[X=xE=e]H_\infty(X \mid E) = -\log_2 P_{\mathrm{guess}}(X \mid E), \qquad P_{\mathrm{guess}}(X \mid E) = \sum_{e} \Pr[E = e] \cdot \max_{x} \Pr[X = x \mid E = e]

其中 Pguess(XE)P_{\mathrm{guess}}(X \mid E) 是窃听者在观测到 EE 后对 XX 的最优平均猜测概率。当侧信息为量子系统时,定义推广为对测量算符集合 {Mx}\{M_x\} 的优化:Pguess(XE)=max{Mx}xPr[X=x]Tr(MxρEx)P_{\mathrm{guess}}(X \mid E) = \max_{\{M_x\}} \sum_x \Pr[X = x] \operatorname{Tr}(M_x \rho_E^x),其中 ρEx\rho_E^x 为以 X=xX = x 为条件的窃听者量子态。对 QRNG 而言,熵源输出的安全性声明必须以 H(XE)H_\infty(X \mid E) 而非 H(X)H_\infty(X) 为基准:只有证明了攻击者在最优侧信息利用下仍无法有效猜测,输出才有资格进入密钥体系。这正是本文章节 3 以条件最小熵为核心展开推导的原因。

1.3 熵估计在 QRNG 产品认证中的地位

熵估计是随机数发生器标准化体系的枢纽环节。NIST SP 800-90B《熵源随机比特生成建议》为熵源验证规定了完整流程:数据收集阶段要求采集至少 10610^6 个连续样本;随后通过假设检验判定样本是否满足独立同分布(IID)假设;IID 与非 IID 两条轨道分别调用对应的估计器族,以估计器输出中的最小值作为每样本熵下界;在此之上叠加在线健康测试的持续保障,最终形成可声明的熵率。该标准同时规定了调理组件(conditioning component)的熵核算方法:对列入清单的通过认证的密码函数(含 FIPS 202 定义的 SHA-3 族),当输入最小熵达到输出长度的两倍以上时,输出可声明为全熵。这一”输入熵两倍于输出长度”的条款,是连接熵估计与产品输出速率声明的量化桥梁。

在中国商用密码标准体系中,熵估计的对应位置由两项标准共同占据:GM/T 0062-2018《密码产品随机数检测要求》规定熵源输出与熵估计的检测要求,GM/T 0005-2021《随机性检测规范》规定二元序列的统计检测指标与检测方法,二者与 NIST SP 800-90B 构成”熵源层面 + 统计层面”的对应关系。产品认证的实际含义是:熵估计结果决定产品可宣称的输出速率上限与安全等级,健康测试决定其持续可信度,统计检测决定其最终交付质量。正微光电量产 QRNG 板卡以 1Gbps 输出速率通过 NIST SP 800-90B 与 GM/T 0005 双标准的第三方实测验证,其核心依据正是本文所推导的熵下界与下述评估流程的完整落地。

2. 真空态零差探测熵源的物理建模

2.1 平衡零差探测的物理过程:本振光与真空态干涉

真空态零差探测(balanced homodyne detection)是连续变量量子光学最成熟的测量方案,其光路结构如下:一束强相干本振光(local oscillator, LO)注入 50:50 分束器的一个输入端口,真空态注入另一输入端口,两束光在分束器内干涉后,两个输出端口分别由一对配对的平衡光电二极管接收,差分电流即为正交分量的瞬时观测值。

真空态零差探测 · 量子涨落测量光路真空态 |0⟩量子涨落源本振光 |α⟩强相干参考50:50干涉分束光电二极管 A上路探测光电二极管 B下路探测差分电流跨阻放大16 位 ADC熵源输出平衡相减抵消经典噪声 · 残留涨落即真空量子噪声熵源

设本振光处于相干态 α|\alpha\rangle,其光子数足够大以致可视为经典幅度 α|\alpha|;信号端口输入真空态 0|0\rangle。经分束器后的两个输出场分别正比于 (a^+α)/2(\hat{a} + \alpha)/\sqrt{2}(a^α)/2(\hat{a} - \alpha)/\sqrt{2},其中 a^\hat{a} 为信号模式的湮灭算符。两路光电流之差构成差分电流算符:

I^2ηαX^φ,X^φ=a^eiφ+a^eiφ2\hat{I}_- \propto 2\sqrt{\eta}\,|\alpha|\, \hat{X}_{\varphi}, \qquad \hat{X}_{\varphi} = \frac{\hat{a} e^{-i\varphi} + \hat{a}^{\dagger} e^{i\varphi}}{2}

其中 η\eta 为探测器量子效率,φ\varphi 为本振光相位基准。本振光的经典强度涨落(相对强度噪声)在差分结构中被共模抑制:两臂共享同一本振源,其强度噪声在相减运算中近似抵消。当信号端口处于真空态时,X^φ\hat{X}_{\varphi} 的期望为零而方差非零,差分电流的涨落即真空零点涨落的直接投影。零差探测读取的不是”真空发出的光”,而是本振光作为测量基准对真空涨落的正交投影,本振光本身不携带随机性,随机性完全来自真空态的量子涨落。关于零差探测与单光子、放大自发辐射方案的横向对比,以及测量公设的一般性讨论,见站内全景文章《量子随机数发生器(QRNG)技术全景》(/what-is-qrng),本节不再展开。

2.2 正交分量 X、P 的量子涨落与海森堡不确定性原理

光场模式的正交分量算符由湮灭算符与产生算符定义:

X^=a^+a^2,P^=a^a^2i\hat{X} = \frac{\hat{a} + \hat{a}^{\dagger}}{2}, \qquad \hat{P} = \frac{\hat{a} - \hat{a}^{\dagger}}{2i}

[a^,a^]=1[\hat{a}, \hat{a}^{\dagger}] = 1 可导出对易关系 [X^,P^]=i/2[\hat{X}, \hat{P}] = i/2(取 =1\hbar = 1 的归一化单位)。在物理单位制下,位置与动量型共轭变量的对易关系为 [x^,p^]=i[\hat{x}, \hat{p}] = i\hbar,由此导出海森堡不确定性原理的严格形式:

ΔXΔP2\Delta X \cdot \Delta P \ge \frac{\hbar}{2}

=1\hbar = 1 的正交分量归一化下,相应的不确定关系为 ΔXΔP1/4\Delta X \cdot \Delta P \ge 1/4。真空态 0|0\rangle 是正交分量的最小不确定态:其期望值均为零,而方差恰取下界:

0X^20=14,0P^20=14\langle 0 | \hat{X}^2 | 0 \rangle = \frac{1}{4}, \qquad \langle 0 | \hat{P}^2 | 0 \rangle = \frac{1}{4}

平均场为零而方差非零,这是真空涨落(vacuum fluctuation)的精确含义。与经典热噪声不同,真空涨落不是对某个隐藏确定值的无知——按量子测量公设,单次测量结果在测量之前不存在确定值,其出现概率由 Born 规则给出,随机性是内禀属性。即:任何观测者、任何计算能力都无法预先确定下一次零差测量的结果,熵的下界由量子力学本身保证,而不依赖于对系统微观状态的建模精度。同时,真空态方差 1/41/4 是正交分量方差的下确界:任何经典噪声注入都只能增大方差,不可能减小之,这一单调性为后续的保守估计提供了物理锚点——窃听者即使完全掌握经典噪声,也无法压缩真空部分所贡献的不可预测性。

2.3 真空态的量子噪声主导判据与经典噪声抑制

熵源设计的核心工程目标是保证测量结果由真空量子噪声主导。设总观测方差为 σtot2=σq2+σc2\sigma_{\mathrm{tot}}^2 = \sigma_q^2 + \sigma_c^2,其中 σq2=1/4\sigma_q^2 = 1/4 为真空涨落贡献(散粒噪声单位),σc2\sigma_c^2 为经典噪声贡献(探测器暗电流、跨阻放大器热噪声、本振强度噪声残余等)。量子噪声主导判据为:

σq2σq2+σc21εc\frac{\sigma_q^2}{\sigma_q^2 + \sigma_c^2} \ge 1 - \varepsilon_c

工程上要求 εc102\varepsilon_c \le 10^{-2},即量子噪声贡献占总方差的比例不低于 99%。该判据同时给出量化约束:16 比特模数转换器的量化噪声方差 δ162/12\delta_{16}^2/12δ16\delta_{16} 为最低有效位电压)必须远小于 σq2\sigma_q^2 经增益折算后的值,否则量化本身将引入不可忽略的经典成分。平衡差分结构是本振强度噪声抑制的第一道防线:两臂光电二极管的共模抑制比(CMRR)决定相对强度噪声的残余水平,工程上要求 CMRR 不低于 30 dB;干涉相位由反馈环路锁定在正交分量的相位基准上,相位失锁将导致 XXPP 分量混叠,须由在线健康测试捕获;探测器暗电流与放大器热噪声随温度漂移,通过数字域增益校准与直流基线扣除予以补偿。

正微光电量产板卡的噪声预算如下表所示,其中经典噪声方差以散粒噪声单位为基准。在该预算下,真空涨落的标准差约为模数转换器满量程的 37%,16 比特量化噪声对总方差的比例低于 10510^{-5},量子噪声占比超过 99%,满足熵源物理建模的纯度要求。

噪声分量符号设计值说明
真空涨落方差σq2\sigma_q^20.25正交分量最小不确定态下界
经典噪声方差σc2\sigma_c^2103\le 10^{-3}暗电流、热噪声、强度噪声残余
总方差σtot2\sigma_{\mathrm{tot}}^20.251\approx 0.251量子占比 99.6%\ge 99.6\%
量化噪声占比δ162/12σtot2\delta_{16}^2/12\sigma_{\mathrm{tot}}^2<105< 10^{-5}16 比特量化可忽略
本振强度噪声抑制CMRR30\ge 30 dB平衡差分共模抑制
采样率fsf_s125 MS/s单采样链,板卡集成双链

3. 条件最小熵的严格推导

3.1 连续变量高斯分布的微分熵计算

零差探测单次测量输出连续实数值。在理想情形下,测量结果的概率密度为高斯分布:均值为零,方差为 σ2\sigma^2。连续变量随机变量 XX 的微分熵定义为 h(X)=+f(x)log2f(x)dxh(X) = -\int_{-\infty}^{+\infty} f(x) \log_2 f(x) \, dx,对均值为 μ\mu、方差为 σ2\sigma^2 的高斯分布,其微分熵为:

h(X)=+f(x)log2f(x)dx=12log2(2πeσ2)h(X) = -\int_{-\infty}^{+\infty} f(x) \log_2 f(x) \, dx = \frac{1}{2} \log_2 \left( 2 \pi e \sigma^2 \right)

推导要点如下:将概率密度 f(x)=(2πσ2)1/2exp ⁣((xμ)2/2σ2)f(x) = (2\pi\sigma^2)^{-1/2} \exp\!\big(-(x-\mu)^2 / 2\sigma^2\big) 代入微分熵定义,对数为两项之和——常数项 log22πσ2\log_2 \sqrt{2\pi\sigma^2} 直接提出,二次项 f(x)(xμ)2/(2σ2ln2)dx\int f(x) \cdot (x-\mu)^2 / (2\sigma^2 \ln 2) \, dx 恰为方差除以 2σ2ln22\sigma^2 \ln 2,即 1/(2ln2)1/(2\ln 2),合并后即得上式。微分熵可以取负值,不能直接等同于熵量;密码学关心的离散样本的熵,必须在量化(离散化)之后计算。

设采样链路以宽度 δ\delta 的量化单元(bin)将连续观测值离散化,并设 δ\delta 远小于标准差 σ\sigma。则中央量化单元(概率密度最大处)占据概率近似为 δf(0)=δ/(σ2π)\delta \cdot f(0) = \delta / (\sigma\sqrt{2\pi}),量化后离散分布的最小熵以该主项为近似:

H(X)log2(δσ2π)=log2(σ2πδ)H_\infty(X) \approx -\log_2\left( \frac{\delta}{\sigma \sqrt{2\pi}} \right) = \log_2\left( \frac{\sigma \sqrt{2\pi}}{\delta} \right)

该式是连续变量熵源熵估计的基本公式:量化最小熵等于”标准差相对量化步长之比”的对数尺度,加上高斯密度的形状因子。它直观地表明,提高熵输出的途径有二——增大测量标准差(即提升量子噪声占比),或细化量化(即提升模数转换精度)。在正微光电采样链路中,16 比特模数转换器经增益校准后,8 比特输出样本的量化间隔与真空标准差之比约为 δ/σ1/95\delta/\sigma \approx 1/95,代入上式得 Hlog2(952π)7.9H_\infty \approx \log_2(95\sqrt{2\pi}) \approx 7.9 比特,与实测结果吻合。

上述近似以中央量化单元的概率为主项,其成立条件除 δσ\delta \ll \sigma 外,还要求高斯分布的尾部单元概率衰减足够快:当量化范围覆盖 ±4σ\pm 4\sigma 以上时,尾部各单元的概率均远小于中央单元,全部尾部贡献之和不超过中央单元概率的百分之一,最小熵由中央单元单独决定。若量化范围过窄(覆盖不足 ±3σ\pm 3\sigma),边缘单元概率显著上升,最常出现符号可能转移到边缘,熵值随之下降,此时须以边缘单元的概率重新计算。工程上通过增益校准将真空涨落标准差稳定在满量程的 37% 附近,同时满足覆盖范围与量化细度两方面的要求,使上述最小熵近似公式在全部工作温度范围内成立。

3.2 量子攻击者视角:窃听者 E 对测量结果的猜测概率

条件最小熵的安全性语义必须放在明确的攻击者模型下讨论。对真空态零差探测熵源,窃听者 E 被假设掌握以下全部信息:光路结构与器件参数、本振光相位基准、放大器噪声的统计特性乃至逐样本实现、环境温度与供电遥测、历史输出序列及其与当前输出的统计关联。E 所不知道的仅有量子测量结果本身——真空涨落在单次测量中取何值,是量子力学保证的不可预测部分。

在此模型下,窃听者的最优策略是:先观测侧信息 E=eE = e,再输出使条件概率 Pr[X=xE=e]\Pr[X = x \mid E = e] 最大的取值 xx,其平均成功概率即上一节定义的猜测概率:

Pguess(XE)=ePr[E=e]maxxPr[X=xE=e]P_{\mathrm{guess}}(X \mid E) = \sum_{e} \Pr[E = e] \cdot \max_{x} \Pr[X = x \mid E = e]

将模型具体化:设经典噪声 NcN(0,σc2)N_c \sim \mathcal{N}(0, \sigma_c^2) 与真空涨落 NqN(0,σq2)N_q \sim \mathcal{N}(0, \sigma_q^2) 相互独立,测量值 X=Nq+NcX = N_q + N_c。在最保守的假设下,E 逐样本掌握经典噪声实现 NcN_c,则给定 EEXX 的剩余不确定性完全来自真空涨落,其条件方差为 σXE2=σq2=1/4\sigma_{X \mid E}^2 = \sigma_q^2 = 1/4。若采用更一般的量子侧信息描述,E 的量子记忆与测量结果构成经典-量子关联态,猜测概率需对测量算符集合优化,但本模型的经典结构使该优化退化为上式,条件方差仍然由真空部分决定。这一推导揭示了一个重要事实:只要量子噪声占比判据成立,经典噪声即使被窃听者完全掌握,其对条件熵的侵蚀也以 σc2\sigma_c^2 的相对大小衡量,即约 10310^{-3} 量级。

3.3 条件最小熵 H_inf(X|E) 的推导公式与数值估计

将 3.1 的量化最小熵公式中的标准差替换为条件标准差 σXE\sigma_{X \mid E},即得条件最小熵的估计式:

H(XE)=log2(δσXE2π)=log2(σXE2πδ)H_\infty(X \mid E) = -\log_2\left( \frac{\delta}{\sigma_{X \mid E} \sqrt{2\pi}} \right) = \log_2\left( \frac{\sigma_{X \mid E} \sqrt{2\pi}}{\delta} \right)

数值估计如下。无条件情形:σtot=0.2510.501\sigma_{\mathrm{tot}} = \sqrt{0.251} \approx 0.501,量化间隔 δ=σtot/95\delta = \sigma_{\mathrm{tot}}/95,得 H(X)log2(952π)7.90H_\infty(X) \approx \log_2(95 \sqrt{2\pi}) \approx 7.90 比特。条件情形:σXE=σq=0.5\sigma_{X \mid E} = \sigma_q = 0.5,得 H(XE)log2(952π0.5/0.501)7.89H_\infty(X \mid E) \approx \log_2\left(95 \sqrt{2\pi} \cdot 0.5/0.501\right) \approx 7.89 比特。两者之差不足 0.01 比特,在 8 比特样本的整数量化下完全可忽略。

参数符号数值
真空方差σq2\sigma_q^20.25
经典噪声方差σc2\sigma_c^210310^{-3}
总标准差σtot\sigma_{\mathrm{tot}}0.501
量化间隔与标准差之比δ/σtot\delta/\sigma_{\mathrm{tot}}1/95
无条件最小熵H(X)H_\infty(X)约 7.90 比特
条件最小熵H(XE)H_\infty(X \mid E)约 7.89 比特
熵损失差值小于 0.01 比特
保守设计下界修正后7.8 比特/样本

该结果的工程含义是决定性的:真空涨落熵源的熵下界不依赖对经典噪声的建模精度,条件最小熵与无条件最小熵几乎重合。这与经典热噪声熵源形成鲜明对比——后者的熵估计必须精确建模噪声带宽与温度,任何建模误差都直接侵蚀宣称的熵值。正微光电在第三方实测验证中,将 8 比特样本的条件最小熵下界保守取为 7.8 比特/样本,即为下文健康测试参数与压缩比设计的基准。

3.4 有限样本效应与熵下界的保守估计

上述推导给出的是理想化估计,工程上必须处理有限样本带来的统计偏差。频率估计的固有偏差是最主要的来源:以 NN 个样本估计最常出现符号的概率 pmaxp_{\max} 时,估计误差的标准差为 O(1/N)O(1/\sqrt{N}) 量级,且有限样本下最大频率估计系统性偏高——最常出现符号在有限样本中的观测频率几乎必然高于其真值,直接代入最小熵公式将高估熵值。NIST SP 800-90B 将熵估计数据集的下限定为 10610^6 个连续样本,正是为了将此类偏差压制到可保守处理的程度。

保守估计的工程程序分三步。第一步,取估计器族输出中的最小值(详见 4.1 节),消除单一估计器的系统性偏差方向;第二步,对估计值做向下取整与安全扣减,例如将实测条件最小熵 7.9 比特扣减至 7.8 比特,以覆盖 10610^6 样本之外的抽样涨落;第三步,叠加环境余量——在器件全工作温度范围内重复熵估计,以最差温度点的估计值为准,再扣除器件老化导致的增益漂移余量(如 0.1 比特)。健康测试不参与熵下界的计算,其作用是在器件运行期间持续验证”熵下界仍然成立”这一前提:一旦健康测试触发,熵源输出即被阻断,系统转入重启与诊断流程。

有限样本效应的另一个维度是块级最小熵。熵提取以固定长度块为输入,块的最小熵下界在独立样本假设下为 nhn \cdot hnn 为样本数,hh 为每样本下界);当样本间存在弱相关时,该乘积是保守近似——实际块熵不低于此值的前提是相关结构已被熵估计过程覆盖。工程上以健康测试的持续监控为这一前提背书,并将块长设计得足够大(如 512 个样本)以摊薄逐样本相关性残余。

4. NIST SP 800-90B 熵评估与健康测试

4.1 非 IID 估计器族(10 类估计器)与取最小原则

NIST SP 800-90B 的熵估计流程首先对噪声源输出执行 IID 假设检验:置换检验、卡方检验与最长游程检验用于判定样本序列是否可视为独立同分布。若 IID 假设成立,使用 4 类 IID 估计器(Shannon、最常值、碰撞、马尔可夫);若被拒绝——真空涨落经采样链路后存在微弱相关结构,通常落入此轨道——则使用非 IID 轨道下的 10 类估计器。这 10 类估计器从不同统计视角估计每样本熵,其原理与输出语义如下表:

估计器原理熵输出语义
最常值(MCV)最常出现符号的频率pmaxp_{\max} 直接给出最小熵
碰撞(Collision)序列中碰撞次数与碰撞概率由碰撞率反推熵率
马尔可夫(Markov)一阶转移概率矩阵最坏转移概率对应的条件熵
压缩(Compression)通用压缩后的长度比由压缩率估计熵率
t 元组(t-Tuple)长度为 t 的元组频数最常元组概率的对数
最长重复子串(LRS)最长重复子串长度由大偏差论反推熵率
窗口最常值(MultiMCW)滑动窗口内最常值频率多窗口最坏情形
滞后预测(Lag Prediction)以滞后 L 的历史预测当前值预测成功率的对数
多马尔可夫计数(MultiMMC)马尔可夫模型的多阶推广条件计数的最坏情形
LZ78YLZ78 字典编码压缩率由压缩率估计熵率

取最小原则是 SP 800-90B 熵评估的核心纪律:以全部估计器输出中的最小值作为每样本熵估计,且当采集多组数据集时跨数据集再取最小值。该原则的合理性在于:不同估计器对不同类型的相关结构敏感程度不同,攻击者只需利用其中未被某类估计器覆盖的结构即可获益,因此唯有全部估计器一致认可的下界才可安全声明。对真空涨落熵源,10 类估计器输出在 7.9 比特附近收敛,最小值由压缩类估计器给出,反映了采样链路中残存的微弱相关性。

各类估计器在真空涨落熵源上的行为特征具有明确的物理解释:碰撞与马尔可夫类估计器对样本间的弱线性相关敏感,其输出略低于单样本边际熵;压缩与 LZ78Y 类估计器对任意长度的重复结构敏感,在 10610^6 样本数据集上给出的估计值最低,成为最终下界的决定者;t 元组与窗口类估计器则对高阶矩的偏斜敏感。估计器族之间的这种互补性正是取最小原则的设计动机:没有单一估计器能够覆盖全部可能的缺陷模式,而估计器族的最小值给出的是对所有已建模缺陷模式的公共安全下界。该下界同时为健康测试参数提供输入——如 4.2 节所示,RCT 与 APT 的截止值均以该下界为唯一自变量,熵估计与健康测试由此构成闭环。

4.2 在线健康测试:重复计数测试(RCT)与自适应比例测试(APT)的阈值公式

在线健康测试与熵估计相互独立、持续运行,其目标不是测量熵,而是以极低误报率捕获熵源的灾难性失效。SP 800-90B 规定了两项强制性的连续健康测试,误报概率设计基准为 α=220\alpha = 2^{-20}

重复计数测试(Repetition Count Test, RCT)检测”输出卡死在某单一值”的灾难性故障。设熵源每样本最小熵下界为 HH,则连续 nn 个相同样本出现的概率至多为 2H(n1)2^{-H(n-1)},由此导出截止值公式:

CRCT=1+log2αH=1+20HC_{\mathrm{RCT}} = 1 + \left\lceil \frac{-\log_2 \alpha}{H} \right\rceil = 1 + \left\lceil \frac{20}{H} \right\rceil

测试逻辑为:维护当前连续重复样本的计数,一旦达到 CRCTC_{\mathrm{RCT}} 即触发失效。对 8 比特样本、H=7.8H = 7.8 比特的熵源,CRCT=1+20/7.8=4C_{\mathrm{RCT}} = 1 + \lceil 20/7.8 \rceil = 4,即连续出现 4 个相同样本即告警——高熵源对”卡死”信号的反应必须如此敏锐,因为正常序列中出现两个相同样本的概率已达 27.82^{-7.8} 量级。

自适应比例测试(Adaptive Proportion Test, APT)检测熵的缓慢流失,如放大器增益漂移、温度异常导致的分布偏斜。测试在窗口 WW 内统计最常出现样本值的计数,超过截止值 CAPTC_{\mathrm{APT}} 即触发失效。窗口长度按数据是否二元选取:二元数据 W=1024W = 1024,非二元数据 W=512W = 512。截止值由二项分布反解,要求误报概率不超过 α\alpha

CAPT=min{c:Pr[Bin(W,2H)>c]α}C_{\mathrm{APT}} = \min\left\{ c : \Pr\left[ \mathrm{Bin}(W, 2^{-H}) > c \right] \le \alpha \right\}

SP 800-90B 表 2 给出了典型截止值:二元数据在每样本熵 1.0 比特时 C=589C = 589;非二元数据在每样本熵 8 比特时 C=13C = 13、熵 4 比特时 C=62C = 62、熵 2 比特时 C=177C = 177。正微光电板卡按 H=7.8H = 7.8 比特取非二元配置 W=512W = 512C=13C = 13。两项健康测试在每次上电启动时执行启动测试,运行期间持续执行,任何触发均立即阻断熵输出并记录失效事件,供诊断与审计。

4.3 中国 GM/T 0005-2021 检测项目与 NIST 体系的对应

GM/T 0005-2021《随机性检测规范》规定了适用于二元序列的 15 项随机性检测指标与方法,其与 NIST 体系的对应关系如下表所示。该标准的检测项多数与 NIST SP 800-22 对应项同源(同为基于假设检验的统计检测),但在显著性水平、样本量与判据形式上存在差异:GM/T 0005 以显著性水平 0.01 判定单项是否通过,而 SP 800-22 以 P 值与显著性水平的比较给出结论,两者在工程上通常互为补充验证。

GM/T 0005-2021 检测项NIST SP 800-22 对应项
单比特频数检测频数(单比特)检测
块内频数检测块内频数检测
扑克检测无直接对应(多元频数类检验)
游程总数检测游程检测
游程分布检测无直接对应(游程长度分布检验)
块内最大游程检测块内最长 1 游程检测
二元推导检测无直接对应(序列派生检验)
自相关检测无直接对应(相关结构检验)
重叠子序列(模板匹配)检测重叠模板匹配检测
其余项(矩阵秩、谱类、通用统计、线性复杂度等)矩阵秩、离散傅里叶变换、通用统计、线性复杂度等

在熵源层面,GM/T 0062-2018《密码产品随机数检测要求》对熵源输出、熵估计与健康测试提出要求,与 NIST SP 800-90B 的熵估计与健康测试条款构成对应;GM/T 0005-2021 则对应统计检测层面。双轨合规的工程实践是:以 SP 800-90B 流程完成熵估计与健康测试设计(获得每样本熵下界),以 GM/T 0005-2021 的 15 项检测完成对调理输出二元序列的统计验收,两份报告共同构成产品认证的检测依据。正微光电的第三方实测验证即按此双轨执行:熵值按 SP 800-90B 第 6 章流程评估,统计检测按 GM/T 0005-2021 全部 15 项执行且全部通过。

5. 熵提取与调理:从原始量子噪声到密码级随机数

5.1 强提取器(Strong Extractor)与左散列引理(Leftover Hash Lemma)

熵估计的输出——每样本条件最小熵下界——是熵提取的输入条件。熵提取的目标是:将含偏置、相关与侧信息泄露的原始样本序列,变换为与均匀分布统计不可区分的输出序列。提取器(extractor)的形式化定义为函数 Ext:{0,1}n×{0,1}d{0,1}m\mathrm{Ext}: \{0,1\}^{n} \times \{0,1\}^{d} \to \{0,1\}^{m},输入 nn 比特弱随机串与 dd 比特均匀种子,输出 mm 比特;若输出与均匀分布 UmU_m 的统计距离不超过 ε\varepsilon,且种子 SS 对攻击者公开(即输出在 (Um,S)(U_m, S) 意义下仍接近均匀),则称为强提取器(strong extractor)。强提取器的安全性不依赖种子的保密性,这一性质使其成为 QRNG 调理的理想结构——种子可由器件自持或公开约定,攻击者知晓种子无济于事。

左散列引理(Leftover Hash Lemma, LHL)为通用散列族构造强提取器提供了量化保证。设 H\mathcal{H} 为将 {0,1}n\{0,1\}^n 映射到 {0,1}m\{0,1\}^m 的通用散列族(任意两个不同输入经随机选取的 hHh \in \mathcal{H} 碰撞的概率至多 2m2^{-m}),则对任意满足 H(X)kH_\infty(X) \ge k 的随机变量 XX,有:

Δ ⁣((H,H(X)), (H,Um))2km21\Delta\!\big( (H, H(X)),\ (H, U_m) \big) \le 2^{-\frac{k - m}{2} - 1}

其中 Δ\Delta 为统计距离,HH 为从 H\mathcal{H} 均匀随机选取的散列函数。该引理的证明思路是:输出碰撞概率 Pr[h(x)=h(x)]\Pr[h(x) = h(x')] 在通用散列族下被 2m2^{-m} 上界约束,结合输入的最小熵 kk 与双平方统计量(collision probability)分析,即可将统计距离压缩到上述指数界。其工程形式为参数选择准则:

mk2log21ε2m \le k - 2 \log_2 \frac{1}{\varepsilon} - 2

即输出长度 mm 不得超过输入最小熵 kk 减去两倍安全参数与常数项。当输入熵 3994 比特、要求统计距离 ε=264\varepsilon = 2^{-64} 时,输出上限为 39941282=38643994 - 128 - 2 = 3864 比特。NIST SP 800-90B 对通过认证的调理组件的熵核算(输出熵函数)本质上即 LHL 型界的标准化表述,二者的安全语义一致:输出的统计距离以输入最小熵为代价指数级收缩。

5.2 SHA-3 conditioning 与 Toeplitz 哈希的压缩比设计

SP 800-90B 3.1.5.1.1 节列出了一组通过认证的调理组件:密钥类(HMAC、CMAC、CBC-MAC)与非密钥类(FIPS 180/202 规定的全部哈希函数,含 SHA-2 与 SHA-3 族、Hash_df、Block_Cipher_df)。当输入最小熵不低于输出长度的两倍时,调理输出可声明为全熵。SHA-3(FIPS 202)作为非密钥哈希类调理组件,其熵核算直接适用该条款:以 SHA-512 为例,输入块取 2048 比特(256 个 8 比特样本,最小熵约 1997 比特,超过 2 倍输出长度 1024 比特),输出 512 比特全熵;单链等效输出速率为原始速率的四分之一。

Toeplitz 哈希是高速模式的提取结构。Toeplitz 矩阵 TT 的元素满足 Ti,j=tijT_{i,j} = t_{i-j},即矩阵由对角线方向的单一随机序列 tt 完全决定,独立随机比特数仅为 m+n1m + n - 1 而非 n×mn \times m。其通用散列性质来自逐行线性无关性;矩阵-向量乘法可利用 Toeplitz 结构嵌入循环矩阵后经快速傅里叶变换完成,复杂度为 O(nlogn)O(n \log n) 而非 O(nm)O(nm),在 125 MS/s 的实时吞吐下仍可由现场可编程逻辑阵列内的专用乘法器阵列支撑。Toeplitz 矩阵的构造与种子管理如下:以 m+n1m + n - 1 比特真随机种子生成矩阵首行与首列元素,其余元素沿对角线方向复制;种子由熵源直接供给、每块更新一次,保证不同数据块的提取矩阵相互独立。矩阵乘法经补零嵌入 m+n1m + n - 1 维循环矩阵后,以快速傅里叶变换在 O(nlogn)O(n \log n) 次运算内完成,相较通用矩阵乘法的 O(nm)O(nm) 次运算,在 4096 比特块长下节省约两个数量级的乘法器资源,这是 125 MS/s 实时提取能够以硬件实现的数学基础。压缩比设计遵循 5.1 节的参数准则,典型配置如下表:

提取方案输入块(比特)输入最小熵 k输出(比特)统计距离上界单链有效速率
Toeplitz 15/164096约 399438402782^{-78}约 937 Mbps
Toeplitz 95.3%4096约 399439042462^{-46}约 953 Mbps
SHA-3(SHA-512)2048约 1997512全熵(双倍条款)约 250 Mbps
SHA-3(SHA-256)1024约 998256全熵(双倍条款)约 250 Mbps

SHA-3 路径以经过认证的密码原语提供最保守的安全语义,适用于对算法审计要求最严格的模式;Toeplitz 路径以可证明的 LHL 界提供高速输出,两者在板卡中按应用场景切换。无论采用哪条路径,压缩比的设计基准都是保守熵下界 7.8 比特/样本,而非实测峰值 7.9 比特——安全边际是压缩比设计的常量约束,速率是它的因变量。

5.3 降采样策略:安全边际与输出速率平衡

降采样(压缩)在 QRNG 调理中的必要性来自四个层面:去偏置——原始样本分布存在微小的中央峰偏斜与直流残余,直接输出将泄露分布信息;去相关——采样链路带宽与模数转换的保持特性引入相邻样本弱相关,LZ78Y 与压缩类估计器捕获的正是这部分结构;压制侧信道——窃听者对经典噪声的掌握在条件最小熵中已被扣除,但提取器输出应进一步抹平任何未被建模的残余结构;保守边际——熵下界取 7.8 比特而实测为 7.9 比特,0.1 比特的差值即降采样为之付出的安全保费。

输出速率与安全边际的平衡由实时熵监控动态调节。板卡的熵监控模块以滑动窗口持续估计当前熵下界,当器件因温度漂移、老化导致熵值下降时,系统自动提高压缩比(降低输出速率)以维持统计距离上界不变;反之,在熵值处于高位时恢复高比率模式。这一”速率随熵自适应”的策略保证安全属性恒定,而将吞吐作为弹性资源。以单链为例:原始速率为 125 MS/s 乘 8 比特即 1000 Mbps,15/16 压缩比下有效输出约 937 Mbps,统计距离上界约 2782^{-78};若熵下界降至 7.5 比特,则压缩比调整为 7/8,有效输出降至约 875 Mbps,统计距离上界维持不变。速率损失是安全边际的显式价格,QRNG 工程的全部艺术在于让这一价格透明、可审计且可预测。

6. 工程实现与实测数据

6.1 1Gbps 板卡的熵估计流水线(硬件健康测试 + 实时熵监控)

正微光电量产 QRNG 板卡集成两条独立采样链,每链以 125 MS/s 采样,聚合调理后输出速率标称 1Gbps。熵估计与调理的完整流水线如下:

QRNG 熵估计流水线(NIST SP 800-90B)量子光学前端 · 1 Gbps采样链 A平衡探测 → 8 位样本采样链 B平衡探测 → 8 位样本16 位 ADC125 MS/s去直流 · 增益校准双链独立并行采样样本序列FPGA 熵估计与调理硬件健康测试RCT / APT 逐样本实时熵监控滑动窗口熵下界熵提取与调理Toeplitz / SHA-3调理输出PCIe → DRBG · 熵池全熵输出

各模块职责如下。硬件健康测试以组合逻辑实现 RCT 与 APT,逐样本执行、零中断开销,触发即硬件级阻断输出——该模块不依赖固件调度,保证失效响应时间在微秒量级;实时熵监控在滑动窗口(2202^{20} 个样本)上周期性地以轻量估计器跟踪熵下界,其输出驱动两件事:一是压缩比配置,二是面向管理面的熵值遥测;熵提取模块内置 Toeplitz 乘法阵列与 SHA-3 核心,按监控结果在两种路径间切换。上电启动时执行启动健康测试与基线校准,运行期间任一健康测试触发即进入失效-重启流程并记录事件日志。整条流水线的设计原则是:熵估计与健康测试的硬件化,保证安全机制不随固件复杂度增长而退化。

实时熵监控的工程参数为:滑动窗口长度 2202^{20} 个样本,每窗口输出一次熵下界估计,更新周期约 8 秒;监控结果同时上报管理面,形成熵值遥测曲线,供运维方在熵值出现趋势性下降时提前介入——健康测试捕获的是突变失效,熵监控捕获的是渐变退化,两者时间尺度互补。固件升级、温循试验与老化试验中的熵值曲线均纳入出厂测试报告,作为器件全寿命周期熵稳定性的基线档案。

6.2 实测熵值数据表与检测结果(第三方实测验证声明)

以下数据来自量产板卡的第三方实测验证过程。熵估计按 NIST SP 800-90B 第 6 章流程执行,数据量为每温度点 10610^6 个连续样本;统计检测按 GM/T 0005-2021 全部 15 项执行。

温度非 IID 估计器最小值(比特/样本)条件最小熵下界健康测试 24h 运行
-20 ℃7.907.80 次触发
25 ℃7.927.80 次触发
60 ℃7.887.80 次触发
健康测试项目配置参数实测最坏值阈值结论
重复计数测试(RCT)H=7.8H = 7.8, α=220\alpha = 2^{-20}最长连续重复 34通过
自适应比例测试(APT)W=512W = 512, H=7.8H = 7.8窗口内最常值计数 913通过
统计检测(GM/T 0005-2021)15 项,显著性水平 0.01最小 P 值 0.0190.01全部通过
板卡规格数值
原始采样2 链 × 125 MS/s × 16 比特
样本格式8 比特/样本
每样本最小熵下界7.8 比特(全温度范围)
输出速率1 Gbps(标称,经第三方实测验证)
调理路径Toeplitz / SHA-3 双路径
接口PCIe
工作温度-20 ℃ 至 60 ℃

第三方实测验证声明:本文全部熵值与检测数据均经独立第三方实测验证。验证方式为:由独立第三方测试机构依据公开的测试方法(熵估计按 NIST SP 800-90B 第 6 章流程,统计检测按 GM/T 0005-2021)在同等平台复测,熵值与送检报告偏差小于 0.05 比特/样本;测试脚本、固件版本、采样配置与复现步骤随验证报告一并公开,任何具备同等平台的团队均可复现。需要说明的测量约定包括:熵值以 8 比特样本为评估单元,健康测试以 24 小时连续运行为观测窗口;报告不包含任何未公开的参数或环境调整。正微光电承诺上述数据口径与公开报告完全一致,并欢迎独立复现与交叉验证。

6.3 在云密码机/KMS 高并发场景的熵池应用(简述)

云密码机与密钥管理服务(KMS)的高并发密钥生成、批量签名与一次性随机数供给,对熵源的速率与质量提出了持续性的根供给需求,QRNG 板卡经 PCIe 接入后作为根熵源注入密码机内部的三级熵池结构,再由各级 DRBG 以流式方式向外供给。该场景的核心价值在于:板卡提供的可证明熵下界消除了传统熵池”熵估计不可审计”的隐患,使得高并发场景下的熵枯竭风险——批量密钥生成瞬间耗尽熵池——从概率性担忧变为可量化、可监控的确定性保障;同时,1Gbps 量级的根熵供给速率足以支撑每秒数千次的密钥生成与签名操作,且每比特输出均可回溯至经第三方实测验证的熵下界。关于熵池与随机比特发生器级联的完整工程讨论不在本文范围,站内文章《后量子密码(PQC)迁移工程:时间线、算法选型与分阶段落地方案》与《量子随机数发生器(QRNG)技术全景》从系统角度给出了熵源供给与迁移路径的论述。

7. 参考文献与延伸阅读

7.1 参考文献

  1. NIST SP 800-90B, Recommendation for the Entropy Sources Used for Random Bit Generation, National Institute of Standards and Technology, January 2018.(https://csrc.nist.gov/pubs/sp/800/90/b/final)
  2. NIST SP 800-90C, Recommendation for Random Bit Generator (RBG) Constructions, National Institute of Standards and Technology, 2024.(https://csrc.nist.gov/pubs/sp/800/90/c/final)
  3. NIST SP 800-22 Rev. 1a, A Statistical Test Suite for Random and Pseudorandom Number Generators for Cryptographic Applications, National Institute of Standards and Technology, 2010.(https://csrc.nist.gov/pubs/sp/800/22/r1/upd1/final)
  4. GM/T 0005-2021《随机性检测规范》,国家密码管理局,2021.
  5. GM/T 0062-2018《密码产品随机数检测要求》,国家密码管理局,2018.
  6. C. Weedbrook, S. Pirandola, R. García-Patrón, N. J. Cerf, T. C. Ralph, J. H. Shapiro, S. Lloyd, Gaussian Quantum Information, Reviews of Modern Physics 84, 621 (2012).
  7. M. O. Scully, M. S. Zubairy, Quantum Optics, Cambridge University Press, 1997.
  8. R. Renner, Security of Quantum Key Distribution, PhD Thesis, ETH Zürich, 2005(条件最小熵与猜测概率的形式化定义).
  9. J. Håstad, R. Impagliazzo, L. A. Levin, M. Luby, A Pseudorandom Generator from any One-way Function, SIAM Journal on Computing 28(4), 1364 (1999)(左散列引理).
  10. C. Gabriel, C. Wittmann, D. Sych, R. Dong, W. Mauerer, U. L. Andersen, C. Marquardt, G. Leuchs, A Generator for Unique Quantum Random Numbers Based on Vacuum States, Nature Photonics 4, 711 (2010).
  11. S. Zhu, Y. Ma, T. Chen, J. Lin, J. Yang, Analysis and Improvement of Entropy Estimators in NIST SP 800-90B, IACR Transactions on Symmetric Cryptology, 2024.(https://csrc.nist.gov/pubs/sp/800/90/b/final)

7.2 站内延伸阅读

Share:
Back to Blog

Related Posts

View All Posts »
随机性测试:NIST SP 800-22 统计检验解析

随机性测试:NIST SP 800-22 统计检验解析

从零假设、P 值到十五项统计检验:完整解析 NIST SP 800-22 Rev.1a 随机性测试套件的原理、判定规则与工程实践,并对照 GM/T 0005 国密随机数检测规范,看统计检验如何为量子随机数(QRNG)与后量子密码(PQC)的随机源质量把关。

量子随机数发生器 QRNG 技术全景:从原理到密码工程

量子随机数发生器 QRNG 技术全景:从原理到密码工程

随机性是密码体系的根基性资源:密钥、nonce、初始化向量与盐值无一不依赖不可预测的熵。本文从密码学视角阐明真随机数的不可替代性,系统对比真空态零差探测、单光子到达时间与放大自发辐射三类主流量子熵源方案,基于量子力学测量公设与不确定性原理论证量子涨落的内禀随机性,梳理 NIST SP 800-90B 与 GM/T 0005 双轨认证下的熵评估与调理方法,并完整呈现从光电采样链路、噪声预算到 1Gbps PCIe 板卡的工程化路径及其在 PQC 生态中的应用。

后量子密码 AVX2 矢量优化实践

后量子密码 AVX2 矢量优化实践

深入解析后量子密码在 x86-64 AVX2 架构下的矢量化优化工程,涵盖 ML-DSA 模乘蝶形算子并行、Keccak 4路并行与内存对齐流水线设计。