適応的融合の導出¶
翻訳について: 正本は英語版です。日本語版が古い場合は英語版を参照してください。
Status: derivation (導出)。明示した仮定の下でのものであって、挙動ではありません。ここに あるものは、何一つ実装されていません。
式は 2.6 設計ページの 適応的融合の節のために作られたもので、その 成功条件を変えるものではありません。コードとベンチマークファイルについて転記した事実は ツリーに対して抜き取り検査しましたが、式そのものはまだ独立には再導出されていません。 第 1 節の仮定はどれも、それを反証することになる観測を挙げており、第 9 節は実装に先立って 行わなければならない実測を列挙します。
1 段落での結果です。各アームをそのアーム自身の null に対する超過確率で融合することは 擁護できます。そしてそれらの確率の上に置く混合尤度比は、当てはめた重みを一切使わずに、 各アームの行ごとの影響度を閉じた形で与え、さらに現行の reciprocal rank fusion を厳密に 再現する識別可能な極限を持ちます。
数学が与えないのは、2 つの主張です。null の p 値が小さいことはそのアームが信頼できる ことを意味する、という主張。そして、自信のある dense アームがクエリ全体にわたって字面の 誤りを抑える、という主張です。前者は関連クラスについての仮定であり、後者は 混合則では成り立ちますが Fisher の則では成り立ちません。
1. 仮定と、それぞれの反証¶
- 損失を融合に帰属させる前に、測っているパイプラインを同定しなければなりません。
記録にあった 2 つの前提は、訂正を要しました。第 1 に、行は 3 票を受け取りません。
_recall_rrfはベクトルのリスト、エピソードの FTS リスト、メモリのキーワードリストを 融合しますが、メモリ行はベクトルとメモリキーワードのリストにしか現れず、エピソード行は ベクトルとエピソード FTS のリストにしか現れないので、各行に適用されるアームは 2 つです。 第 2 に、CPERSONA_FUSED_GATE_ENABLED=falseが無効にするのは較正済みのゲートだけで、do_recallは依然としてヒューリスティックな閾値で_apply_quality_gateを走らせます。 したがってベンチマークのレジームは、ゲート無しのランキング実験ではありません。 反証されるのは、候補を凍結した再生で、融合後のフィルタリング・重複の扱い・候補の 被覆が Track B − Track A の差の相当部分を説明すると示された時です。 - null のサンプルは、配備スコープにおける無関連なクエリ–文書スコアを代表します。 同じモデル、同じエンコーダの役割、同じコーパスのスナップショット、同じ行タイプ、同じ 分離スコープ、そして宣言されたクエリ母集団の下でのことです。ランダムな文書は無関連な 文書の近似であり、 ランダムなクエリ–文書ペアには正例が混じり得ます。反証されるのは、取り置いた無関連 ペアで小さい p の率が過剰に出る時、あるいは較正がクエリの言語・長さ・コーパス グループ・検索の適格性を通して大きく動く時です。
- 関連性はスコアの分布を、測れるだけ変えます。 妥当な null が同定するのは \(f_0\) であって \(f_1\) ではありません。Bayes 流の信頼性の言明には、対立分布か、その構造的な 代役が要ります。反証されるのは、gold / 非 gold の尤度比が融合統計量とともに増えない 時、あるいは極端に小さい字面の p 値が主に妨害文書を指す時です。
- Bayes のランキングは、固定された適格候補の全体集合の上で評価します。 期待 DCG に 対しては期待利得で順位付けし、二値の関連性であれば事後確率で足ります。期待正規化 DCG は別の量です。Track B の指標は、関連集合への二値の所属を使います。
- 候補集合からの独立性が必要で、クエリでの条件付けは許されます。 クエリ・行・ スナップショット・スコープが同一である限り、\(S(q,d;\mathcal C_1)=S(q,d;\mathcal C_2)\) です。参照分布は \(q\) に依存してよいですが、返された候補から推定したものであっては なりません。反証されるのは、検索の深さを変える・無関係な行を足す・別のリストを 有効にすることで、既存の行のスコアが変わる時です。
- 有限標本の保証は、独立な標本単位を使います。 文書サンプルの上での全ペアの内積は ベクトルを使い回しており、独立な観測ではありません。反証されるのは、不確実性の計算が ペア数を標本数として使っている時です。
- 過去のモデル間比較は仮説であって、統制された介入ではありません。 MiniLM の タスク別の差分は、jina と bge-m3 のものより古いパイプラインの下で測られました。 反証されるのは、両モデルが同一の候補・フラグ・コード・ラベルで走った時に、QASPER の 符号反転が消える場合です。
2. スコア、null、そして Bayes 最適な結合¶
適用される各アーム \(a\) について、値が大きいほど良いスコアを定義します: dense アームには
コサイン、字面アームには符号を反転した FTS5 の bm25 (SQLite は一致が良いほど小さい値を
返します)。短いクエリでの LIKE フォールバックは、欠けた bm25 の値ではなく、別個の離散的な
計測です。
\(F^0_a(t)\) をそのアームのスコアの null の法則とし、等号を含む超過確率を次で定義します。
大きさ \(m_a\) の有限な参照サンプルの下では、
足されている 1 は、裏付けのないゼロを防ぎます。それはドメインのずれや選択バイアスを直す ものではなく、有限標本での妥当性には、検定するスコアと参照スコアの交換可能性が必要です。
クラスの事前確率 \(\pi\) と、クラスごとの同時密度 \(f_1,f_0\) の下では、
であり、期待利得での並べ替えが期待 DCG に対して最適です。アームが両方のクラスで 条件付き独立なら、
これは尤度比の和であって、生スコアの和でも p 値の和でもありません。2 つの特別な場合が 古典的な則に名前を与えます。\(p_a\mid R=1\sim \operatorname{Beta}(\alpha_a,1)\) なら、
となり、これは \(\alpha_a\) が等しい時の Fisher の統計量です。\(z_a=\Phi^{-1}(1-p_a)\) が 共通の共分散 \(\Sigma\) を持つ Gauss 分布に従い、関連の下で \(\boldsymbol\delta\) だけ ずれるなら、
となり、これは重み付き Stouffer です。同時密度を \(f_y(\mathbf s)=D_y(\mathbf s)\prod_a f^y_a(s_a)\) と書けば、
周辺 null の較正は、最後の項について何も示しません。式 (5) はまた、契約上の衝突も示します。 \(\Sigma^{-1}\boldsymbol\delta\) は負の成分を持ち得るので、制約なしの最適解は「あるアームの スコアを上げて融合スコアが下がることはない」という要件に違反し得ます。
3. 候補となる規則: 混合尤度比¶
減少する、正規化された関数を定義します。
これにより、null の p 値が一様なら \(\mathbb E_0\,B(p_a)=1\) となります。関連クラスは、 事前確率 \(\pi_a\) を持つ 1 つの潜在アーム \(A\) によって説明されるとします:
\(A\) を周辺化すると、
その行タイプに適用されるアームにわたって \(\pi_a\) を等しく置くのは等しい prior であって、 学習された重みではありません。式 (8) は、null のアームどうしが相関することを許します。 対立仮説の下でも、説明役となる座標が与えられた時、他の座標は null の条件付き法則を保ち ます。検証されていない段は、単一座標の傾け (tilt) それ自体です。複数アームの一致が追加の 証拠を運ぶかもしれず、字面の妨害文書はそもそも傾けに従わないかもしれません。決めるのは gold で条件付けた同時分布です。
最初の実験的な選択は \(\kappa=0,\beta=\tfrac12\) です:
妥当性は依存性を生き延びます。 各 \(B(p_a)\) は e-value (減少し、積分が 1 になる量) であり、e-value の平均は e-value なので、アーム間の依存がどうであれ \(\mathbb E_0 E\le1\) が成り立ち、Markov の不等式から
これは保守的な null についての言明であって、関連性の事後確率ではありません。順位付けは \(S\) で行います。\(p_{\mathrm{comb}}\) を 1 で打ち切ると同値が生まれます。
創発する影響度。 \(u_a=-\log(\kappa+p_a)\) とおくと、
であり、この生成モデルの下では \(\omega_a=\Pr(A=a\mid\mathbf p,R=1)\) です。等しく 重み付けられた 2 つのアームでは
となるので、\(\kappa=0\) では \(p_v/p_l\to0\) につれて字面の影響度が消えます。3 つの限界: 影響度は行ごとであって、クエリ全体で共有される重みではないこと。自分自身の極端な p 値を 持つ字面の妨害文書は、依然として dense のヒットを上回ること。そして有限の参照が抑制に 上限を与えること — \(p_v\ge1/(m+1)\) かつ \(\beta=\tfrac12\) では \(\omega_v\le\sqrt{m+1}/(\sqrt{m+1}+1)\) です。
Fisher の則では \(\partial S_F/\partial(-\log p_a)=1\) です。dense アームはより多く 寄与できますが、字面の限界影響度は決して縮みません。「自信のある dense アームが字面の 票を黙らせる」は混合則の性質であって、p 値の結合一般の性質ではありません。
訂正 (2026 年 9 月)。 「黙らせる」は 1 行のスコアへの影響を述べたもので、融合後の順序を 述べたものではありません。この規則はアームについて対称です。lexical アームだけで極端な行は、 dense アームだけで極端な行より上位になります。 識別可能性ノート の計算例がそれを示します。\(\omega_a\) は行ごとの導関数として読み、それ以上のものとしては読まないでください。
4. 等重みの RRF が害する時¶
\(d\) がアーム \(a\) に現れるなら \(X_a(d)=1/(K+r_a(d))\)、そうでなければ \(0\) とします (実装されている票です)。関連する \(g\) と無関連な \(b\) について \(M_a=X_a(g)-X_a(b)\) と置くと、dense アームがこのペアを正しく並べている (\(M_v>0\)) 場合に、等重みの RRF がそれを逆転させるのは次と同値です。
等号の場合は同値の順序が決めます。混合則では、逆転の厳密な条件は
です。アームごとの分離度だけからは、無条件の定理は出てきません。平均・AUC・周辺の 分離度は、アームの誤りどうしの重なり方、上位付近のマージン、候補の打ち切り、切り捨て位置 との関係を決めないからです。分離度が同一の 2 つのシステムが、異なる融合結果になり得ます。 ペア単位の厳密な言明は \(\Pr(\sum_a M_a>0)<\Pr(M_v>0)\) (17) です。
票のマージンを Gauss 近似して \(\mathbf M\approx N(\boldsymbol\mu,\Sigma_M)\) とし、 マージンの分散が等しく、相関を \(\rho\)、\(\delta_a=\mu_a/\sigma_a\) とすると、2 アームの RRF がペア単位の精度を害するのは、ちょうど次の時です。
(等しい 3 アームなら \(\delta_l+\delta_k<(\sqrt{3+6\rho}-1)\delta_v\)、(19))。式 (18) は 実装の「行あたり 2 アーム」という構造に合致します。これは QASPER の符号が反転し得る 仕組み — 弱い dense アームに対しては字面の分離度が閾値を上回り、強い dense アームに 対しては下回る — と、Gorilla がどのモデルでも負け得ることを説明します。ただし、そうした 分離度が実際に起きたことを立てるものではなく、それができるのは凍結した再生だけです。
ペア単位の損失は NDCG@10 の損失ではありません。判定済みのクエリについては、次を厳密に 計算します。
5. 混合則の極限としての RRF¶
同じ \(N\) 件の文書の完全な順位付けについて、参照の裾を経験的な順位の裾 \(p_a=r_a/N\) と 同定し、(7) で \(\beta=1\)、\(\kappa=K/N\) と置きます。すると
となり、対数は増加関数なので、この極限で (10) は RRF とまったく同じ順序を生みます。 \(t\in[0,1]\) に対する経路 \(\beta(t)=1-t/2\)、\(\kappa(t)=(1-t)K/N\) は、RRF (\(t=0\)) と 本物の null の p 値に対する平方根の混合 (\(t=1\)) をつなぎます。これは解析的な橋であって、 ベンチマークの結果に合わせて回すつまみではありません。この同定は、打ち切られたリストや、 適格な全体集合が等しくない場合を覆いません。現行の RRF はリストに無い項目に 0 票を与え ますが、本物の非一致・適用されないアーム・打ち切られたスコアは、3 つの異なる観測です。
平坦な分布。 生スコアが同一なら p 値も同一になるので、この規則はアーム内に人為的な
分離を作りません。null の本体の内側にあるスコアには、例外的な証拠は与えられません。退化
した有限の参照は、満額の票ではなく \(p=1\) を与えます。これにより、クエリごとの min-max が
生む「平坦なリストや 1 件だけのリストの人為的な昇格」が無くなります (_minmax_norm は
全要素が等しいリストを 1 に写します)。ただし、誤って指定した null や、話題としての珍しさを
関連性と取り違える対立仮説に由来する汚染は、これでは直せません。
6. クエリ–文書の null と文書–文書の null¶
正規化したクエリベクトルと文書ベクトルが、平均 \(\mu_Q,\mu_D\)、共分散 \(\Sigma_Q,\Sigma_D\) を持つとします。無関連で独立なペアについては、
となります。Gauss 分布の仮定は要りません。位置–尺度の近似の下では、doc–doc の分位点は クエリ–doc の分位点へ次のように移されます。
したがって、純粋に乗法的な係数は、切片が無視できることを追加で仮定しています。現行の
RRF_THRESHOLD_FACTOR の 0.5 は、この種の粗い動作点の移送です。
較正ノートで実測された p95 の比は、タスクに
よって既に 0.64 から 0.86 まで動いているので、どの定数もすべてのタスクで正しくは
あり得ません。
コールドスタート。 \(G\) から引いた \(m\) 個の独立な参照スコアについて、確率 \(1-\delta\) 以上で
が成り立ちます。第 1 項は DKW–Massart の上界 (\(\delta=0.05\) では \(m=738\) で \(0.05\) になります)、第 2 項は参照と真の null のあいだの、避けられないずれです。
| 参照 | 推奨 | 何がそれを無効にするか |
|---|---|---|
| 保持した実クエリの埋め込み | 定常状態での推奨。スナップショットを凍結し、事前宣言した特徴でのみ層別する | クエリのドリフト、スコープの不一致、繰り返しのセッションを独立と数えること |
| クエリの役割でエンコードした文書断片 | それらの埋め込みが no-call 経路の外に既に存在する場合に限り、暫定的に | 断片からクエリへの未知のずれ、ほぼ重複による漏れ、誤ったプロンプト |
| 学習した変換を伴う doc–doc null | 取り置きデータでの分位点変換の検証を経た後にのみ | アフィンでないずれ、モデル/プロンプト/コーパスの変更 |
| 現在のクエリを固定の文書パネルに当てる | 新たなモデル呼び出しを要さないコールドスタートの推定量: クエリで条件付けたランダム文書の null | パネルが関連文書によって汚染される度合い \(\eta_q\) が、(25) に追加項として入る |
推奨は、定常状態では保持した実クエリ、コールドスタートではクエリを固定パネルに当てる 推定量です。小さなコーパス全体をパネルとして使うと、スコアは順位に潰れ、適応性の動機で あったクエリをまたぐ絶対的な分離が消えます。また、有限のパネルはその裾が飽和します。
7. 小さなコーパス、プロキシの退化、そして飢餓¶
null だけに基づく融合は、時間的な正例プロキシを必要としません。プロキシは p 値への変換の 外に置いてください。分離度の閾値を依然として使う場面では、大きさ \(m_0,m_1\) の独立な サンプルから \(J(t)=F_0(t)-F_1(t)\) を推定した時、2 つの DKW の上界と和集合上界から一様に \(|\widehat J(t)-J(t)|\le\epsilon_0+\epsilon_1\) が得られます (ここで \(\epsilon_y=\sqrt{\log(4/\delta)/(2m_y)}\))。擁護できる受理規則は次のものです。
ここで \(J_{\min}=0.2\) は宣言された方針であって、数学的な境界ではありません。 \(m_0=m_1=220\)、\(\delta=0.05\) では不確実性が約 \(0.2\) なので、\(J\ge0.2\) を保証するには 観測値 \(\widehat J\ge0.4\) が要ります。重なり合う数千のペアは、数千の観測ではありません。
飢餓。 固定 p の検定は、精度と「結果が空でないこと」を同時には保証できません。 \(n\) 個の独立な一様 p 値を持つ全 null のクエリの下では \(\Pr(\text{no admission})=(1-\alpha)^n\) です。方針 \(\alpha(n)=\max\{\alpha_0,1-\eta^{1/n}\}\) (27) は、その仮定の下でのみ、それを \(\eta\) で 抑えます。推奨するフォールバックは決定論的です。宣言した候補予算の内側で dense の上位 \(L_{\mathrm{reserve}}\) 行を保持し、p の基準を満たさない行はフォールバック候補として印を 付け、その較正済みスコアは保ち、候補として残すことを関連性の主張から切り離します。 \(L_{\mathrm{reserve}}\) は評価の前に選びます。少なくとも評価の深さぶんを保持すれば、 admission の規則が生の dense の上位 10 件を黙って取り除くことはなくなります。
8. 実装が守らなければならない不変条件¶
- 単調性。 (1) は生スコアについて非増加、(7) と (10) は \(p\) について非増加であり、 その合成は「大きいほど良い」生スコアのどれについても非減少です。
- ゼロの裾を作らない。 \(1/(m+1)\) で床を置きます。検証された裾のモデルなしに、 観測された裾の外へ外挿しません。
- 数値的に安定な算術。 (10) は \(\operatorname{LSE}_a[\log\pi_a-\beta\log(\kappa+p_a)-\log Z]\) として評価します。 有限でない生スコアは弾き、次元とノルムを検証します。
- 同値。 全順序は \((-S,\,-s_v,\ \text{row-type code},\ \text{row id})\) とし、 dense のスコアが無い場合には固定の番兵値を使います。生スコアが等しければ p 値も等しく なります。id が破るのは順位の同値であって、確率ではありません。
- アームの適用可否は固定 — 行タイプと設定から決めます。たまたま行を返したリストの 数で割ってはいけません。
- 欠測は非一致ではありません。 有界な和集合の各候補について、適用されるアームを すべて採点するか、その候補のスコアは不完全だと宣言します。上位 \(L\) のリストの外に ある行は、\(p=1\) ではなく打ち切られたスコアを持ちます。それを \(p=1\) として扱い、 後からそのスコアを知ることは、候補集合からの独立性を壊します。
- 参照は凍結する。 null のサンプルも、その層も、返された候補に依存してはいけません。
- 字面の原子。 字面の参照には非一致も含めます。返された FTS の一致だけで較正すると、
選択された条件付き法則を推定してしまいます。短いクエリの
LIKEフォールバックには 離散的な較正が必要です。FTS5 の trigram トークナイザは、3 文字未満の文字列に一致 しません。 - 仕事量を有界にする。 候補の和集合、参照パネル、相互採点、較正の保存量を、それぞれ
別々に有界にします。SQL の
LIMITが有界にするのは返る行数であって、索引の走査では ありません。FTS とLIKEの経路は、「宣言した上限を超えて走査しない」と言える前に、 明示的な仕事量予算の監査が要ります。 - 追加のモデル呼び出しをしない。 融合が消費するのは保存済みの埋め込みと字面の スコアです。疑似クエリの埋め込みは、あらかじめ供給されていなければなりません。
- 決定性の範囲。 シード、サンプリングした id、較正の版、dtype、リダクションの順序、 同値の方針を凍結します。プラットフォームをまたぐビット単位の一致は、別の要件です。
- 多重比較。 行ごとの \(\alpha\) が保証するのは、期待される誤受理の数が \(N_0\alpha\) を超えないことであって、\(\alpha\) を超えないことではありません。 ランキング品質、admission、汚染の制御は、3 つの別々の実測です。
9. 実装の前に何を、どの順で測るか¶
各段が次の段のゲートになります。
- 測っているパイプラインと候補母集団を同定する。 クエリごとに、適格なコーパスの id、保存されている行の id、admission の前後のベクトル候補、融合後の順序、ゲートを 生き延びたもの、最終順序、実効設定を記録します。QASPER の較正記録はコーパス行数を 65,300 と挙げる一方、null プローブが見た一意な id は 20,508 でした。それが突き合わ されるまで、2 つの計器は同じ母集団を採点していないかもしれません。ゲート: 段と 母集団が一致するまで、損失を融合だけに帰属させません。
- キャッシュの同一性、正規化、ペアの対応を検証する — 読み取り専用の接続を通して
行います。
_null_distributionは正規化せずに内積を計算しており、それがコサインで あるのは、保存された全ベクトルが単位ノルムである間だけです。ゲート: ノルムとペアの 対応が検証されるまで、コサイン分布についての推論をしません。 - admission、融合、下流の段を分離する — 凍結した埋め込みと字面スコアの上で、 dense のみ、admission 付きの dense、後処理前の RRF、各段の後の RRF を比べ、遷移ごとに (20) を計算します。ゲート: ヒューリスティックなゲートやコーパス母集団が「下がる族」を 説明するなら、融合の数学を選ぶ前に因果の問いを立て直します。
- クエリ–doc の null の較正を検定する — 取り置いたブロックで、事前宣言した水準 (0.01、0.05、0.1) にて、モデル・言語・クエリ長・コーパスグループ・行タイプで層別し、 字面の非一致も含めて行います。gold の棄却と裾の飽和を記録します。ゲート: null が 反保守的な場所、あるいは gold の棄却が受け入れられない場所では、固定 p の admission を 退けます。
- 関連性のモデルを検定する。 ラベル付きの同時 p 値分布、アームごとの条件付き誤り率、 \(S\) の関数としての経験的関連性を見ます。\(\beta\) が等しい Fisher、平方根の混合、 dense のみ、現行の RRF を、1 つの凍結された事前登録済みの実験として比較します。 ゲート: 稀な字面の妨害文書が混合を支配する、あるいは同時の中程度の証拠が訂正の 大部分を供給しているなら、単一の傾けという対立仮説を退けます。
- 創発する抑制を直接検定する — (13) と (16) を使い、dense が正しかった逆転を防げた 件数と、新たに持ち込んだ逆転の件数を数えます。ゲート: 抑制が数に入るのは、有害な 文書間の比較が減り、かつ有用な字面の訂正を壊さない場合だけです。
- Gauss 近似 (18) を検査する — 経験的な逆転確率と突き合わせます。上位付近の逆転を 外すなら、厳密な再生の式のほうを残します。
- コールドスタートの参照を評価する — 取り置いた実際のクエリ–doc スコアに対して、 ペア単位ではなくクエリのグループ単位で分割して行います。
- 事前に固定した成功条件を適用する: 両端点のモデルについて、同じ 22 タスクで \(\overline\Delta_m=\frac1{22}\sum_t(\mathrm{NDCG}^{\mathrm{new}}_{m,t}-\mathrm{NDCG}^{A}_{m,t})>0\) であること。ゲート: 明示的な重み層を検討するのは、宣言した p のみの実験がこれを 満たさなかった後だけです。
- 第 8 節の運用上の不変条件を、別途検証する。 ランキングで成功しても、それらが 守られていなければ配備は許されません。
10. どこに嵌まるか¶
以下の識別子はすべて提案であって、今日のコードが読む設定ではありません。
| 場所 | 組み込み方 |
|---|---|
_recall_rrf |
既存のモードは残す。有界な和集合を集め、適用されるアームを相互採点し、凍結した null の変換を適用して (10) を計算する兄弟経路を追加する。 |
_minmax_norm, _recall_rsf |
min-max は再利用しない。rsf は比較用のモードとして変えずに残す。 |
_autocut |
新しいスコアを明示的に認識する。その差はコサインの差ではない。 |
_apply_quality_gate |
別個のシグナル型を追加する。対数の証拠量や結合した p 値を、コサインの閾値と比較しては決していけない。ゲートの迂回を実験から観測できるようにする。 |
do_recall |
明示的なモードのディスパッチと trace のフィールド。融合が出力まで届いていると主張する前に、最後の confidence による再ソートを片付ける。 |
_null_distribution, do_calibrate_threshold |
有界なクエリ–doc と字面の較正成果物。1 つの閾値ではなく、経験的な参照分布を出所とともに保存する。既存の方法は残す。 |
_get_vector_threshold |
コサインの getter は残し、null 成果物を引く独立の参照を追加する。p の閾値を、コサインを値とするアクセサに差し替えることはできない。 |
config.py |
較正の方法と recall のモードの両方に値 (例えば null_p) を予約する。既定は off とし、両立する組み合わせを明示的に検証する。 |
| ベンチマークの runner | 実装が済んでから初めてモードを追加する。実効的なゲート、アームの被覆、参照の fingerprint、クエリごとの段の結果を、すべて記録する。 |
保存する成果物には、次を覆う fingerprint が要ります。モデルの同一性と版、次元、クエリ / 文書のプロンプト。正規化、チャンク分割、dtype、スコアリングの版。コーパス / 索引の世代と 分離スコープ。行タイプと near/far の適格性。FTS のトークナイザ、クエリビルダ、bm25 の 設定、フォールバックの方針。null の定義、参照母集団、層、サンプリングした id、シード、 実効的な標本単位。裾の規約、クリッピング、結合器のパラメータ、アームの適用可否、候補の 深さの契約。タイムスタンプとスキーマ版。既存の sidecar が検査するのは次元とスコアリングの 版で、次元だけでは同じ幅のモデルへの差し替えやプロンプトの差し替えを検出できません。
11. このノートがしないこと¶
- null の較正が関連性の確率を推定していると主張すること。
- dense の自信だけで Gorilla が回復すると約束すること: 文書をまたぐ字面の極値は、行ごとの 優位を打ち負かします。
- Fisher の則を、暗黙のアーム選択として扱うこと。
- 相関のある離散的なアームに、独立なカイ二乗や正規の参照を当てること。
- \(p=0.05\) で admission が解決したと宣言すること: それが制御するのは null の裾の事象で あって、gold の保持ではありません。
- i.i.d. の誤差上界にペア数を使うこと、あるいは最近傍の最大値を通常の正例サンプルとして 使うこと。
- \(\widehat J>0.2\) を十分条件として扱うこと。
- no-call 経路の内側で断片の埋め込みを生成すること。
- クエリごとの候補 min-max、返却リストでの正規化、上位の結果に依存する重みを使うこと: いずれもスコアの契約に違反します。
- 不在・適用外・失敗・打ち切りのアームを、1 つの値に潰すこと。
- SQL の出力上限から走査の上界を推論すること。
- 過去の符号の表を、構造的な因果の証明として読むこと。
- 宣言した p のみの実験が失敗する前に、明示的な重みを作ること。