基于离散多项分布偏置(Numeric Generation Bias)与指令覆写遵从度,通过向黑盒模型发送 $n_1$ 个标准随机探针并收集 $n_2$ 次回答,构建联合对数似然函数并计算 95% Bootstrap 置信区间。
✓ 5 组自回归离散探针
✓ Jelinek-Mercer 位置感知插值
✓ B=800 非参数 Bootstrap
✓ 严格零合成真实 API 底库
待测样本输入
(逐条记录探针与模型实际回答)
判定结果
胜出优势:
+0.0%
不确定性:
0.00 bit
各模型独立吻合度与 95% 置信区间
Bootstrap B=800
二维降维分布图
散点为各模型经验特征分布云团;★ 星标为当前测试样本的投影位置。
2D PCA
输入解析明细
提取的标准离散 Token 列表与合规性状态:
有效探针数: 0
总回答轮次: 0
METHODOLOGY & STATISTICAL FORMULATION
StatLLM: 基于离散阵列探针与贝叶斯似然的大语言模型黑盒指纹归因
深入阐述系统构建的核心数学模型:狄利克雷平滑多项分布、Jelinek-Mercer 位置插值模型、对数似然累加机制以及非参数 Bootstrap 95% 置信区间。
1. 物理机制:大模型为何存在离散数组生成偏置?
现代自回归大语言模型(Decoder-only Transformers)本质上并不具备真随机数发生器(TRNG)或物理熵源。模型输出离散序列(例如让其随机输出 5 个 1 到 100 之间的整数)遵循未归一化 logits 经 Softmax 温度缩放后的条件采样:
$$P(x_i \mid \text{context}) = \frac{\exp(z_i / T)}{\sum_{j=1}^{|V|} \exp(z_j / T)}$$
由于预训练语料分布的先验差异、分词器(Tokenizer)将数字切分为单 Token 还是多 Token 的机制不同,以及后训练阶段(SFT / RLHF)的安全对齐策略差异,不同大模型在生成离散序列时展现出高度稳健、不可抹除的固有偏置模式。
2. 狄利克雷平滑条件概率 (Dirichlet-Smoothed Categorical)
设候选模型为 $M \in \mathcal{M}$,探针题目为 $Q$,该题目的有限状态空间基数为 $K$(如 1~100 整数的 $K \approx 102$)。模型 $M$ 在该题目下累计观测到的总加权词频为 $W_M$,特定 Token $x$ 出现的经验频次为 $C_M(x)$。为避免未登录词导致似然计算出现崩溃,引入非信息 Jeffreys 先验平滑参数 $\alpha = 0.5$:
$$P_{\text{global}}(x \mid Q, M) = \frac{C_M(x) + \alpha}{W_M + \alpha \cdot K}$$
当样本充足时,经验频率占主导;当遇到测试输入的稀疏长尾数字时,概率优雅退化为保底惩罚项。
3. Jelinek-Mercer 位置插值模型 (Positional Lambda)
核心自回归建模
大语言模型是从左向右严格自回归生成的。首个数字是先验响应,而后续位置则强烈依赖于前面的生成历史。如果仅采用无序词袋,将无法识别恶意逆序攻击。为此,StatLLM 引入位置感知层级插值:
$$P(x_i \mid \text{pos}=i, Q, M) = (1 - \lambda) \cdot P_{\text{global}}(x_i \mid Q, M) + \lambda \cdot P_{\text{pos}}(x_i \mid \text{pos}=i, Q, M)$$
λ = 0.0 (纯词袋)
忽略元素排列顺序,仅统计集合内数字频次,容忍乱序。
λ = 0.5 (默认平衡)
50% 词袋抗稀疏 + 50% 位置自回归约束,最佳实践推荐。
λ = 1.0 (纯位置)
严格限制每个数字出现的具体槽位,对错位给予重度惩罚。
4. 联合对数似然与 Log-Sum-Exp 贝叶斯后验推断
用户提交的包含 $n_2$ 轮回答的数据集,在模型 $M$ 下的联合对数似然为所有回答中各 Token 条件似然的累加:
$$\mathcal{LL}(M) = \sum_{j=1}^{n_2} \sum_{i=1}^{L_j} \log P(x_{j,i} \mid \text{pos}=i, Q_j, M) + \sum \lambda_{\text{trait}} \log P(\tau \mid Q_j, M)$$
假定各模型无偏的先验概率,利用 Log-Sum-Exp 数值稳定化算法归一化后验概率:
$$P(M \mid \mathcal{D}) = \frac{\exp(\mathcal{LL}(M) - \mathcal{LL}_{\max})}{\sum_{M' \in \mathcal{M}} \exp(\mathcal{LL}(M') - \mathcal{LL}_{\max})}$$
5. 非参数 Bootstrap 95% 置信区间 (B=800)
为量化小样本波动对模型判定带来的不确定性,StatLLM 在客户端发起评测时,实时执行 $B=800$ 次有放回重抽样:
1. 对输入的 $n_2$ 条回答生成重采样索引矩阵;
2. 对每次抽样计算重采样似然和并归一化得到后验;
3. 收集各模型后验分布向量,取其经验分位数 $[q_{2.5\%}, q_{97.5\%}]$ 作为 95% 置信区间。
6. 实测目标大模型离散指纹对比 (arr_int5 实测数据)
| 特征维度 |
GPT-5.6-Luna |
Grok-4.7 |
DeepSeek-V4.1-Flash |
| 首词偏好 (Pos 0) |
17 (93.8%) |
37 (43.8%), 23 (31.3%) |
42 (31.3%), 37 (25.0%) |
| 高频数字模式 |
17, 64, 92, 8, 41 |
23, 37, 82, 14, 56, 91 |
41, 42, 37, 12, 65, 88 |
| 去重遵从率 |
100% |
100% |
局部重复 |
| 典型序列示例 |
[17, 64, 92, 8, 41] |
[37, 82, 14, 56, 91] |
[41, 51, 41, 26, 49] |
实测底库与 Token 消耗透明追踪
所有数据均来自各模型官方或中转 API 真实调用,严格零合成先验。
全量底库归档与热迁移 (ZIP Bundle)
支持一键导出自包含 ZIP 压缩包(包含 manifest 描述、JSONL 样本流与 SQLite 二进制快照),可直接在其他环境或新服务器上一键导入恢复。
分模型样本与 Token 消耗
| 模型 |
样本数 |
输入 Token |
生成 Token |
总 Token |