コンテンツにスキップ

2 本のアーム、1 つの決定 — null 較正が識別できるもの、できないもの

Status: derivation (導出)。ハイブリッド経路の 凍結段リプレイ に対して書かれた。あのリプレイは、 ベンチマークの損失を融合段に特定し、その生じ方を記述した計測である。本ノートは、その損失を避ける ために融合則が何を知っていなければならないかを問う。最初の導出 を拡張し、その 1 文を訂正する (第 2 節)。ここにあるものは挙動ではない。すべての結果に derived (述べた前提から従う)、assumed (名指しした計測で反証されうるモデル化の選択)、 illustrative (式の形を示すために計算した数で、サーバの計測ではない) のいずれかの ラベルが付く。構成のあいだを決める計測は第 9 節に列挙する。

結果を 4 行で。

  1. 各アームのスコアと、そのアーム自身の null に対する超過確率だけを入力とする融合則 (最初の導出が提案した規則のクラス) は、lexical の証拠が dense の証拠を上書きすべき 時を決められない。 同一の null と同一の観測を持つ 2 つの世界が、逆の順序を要求する。 これは識別可能性の限界であって、ある公式の弱点ではない。
  2. 欠けているのは dense スコアで条件付けた lexical の証拠 \(J(v,l)=\log f_1(l\mid v)/f_0(l\mid v)\) である。null 較正は \(J\) の分母を定めるが、 分子については何も言わない。
  3. 重みを当てはめずにそれを供給する構成が 1 つある: 固定の参照母集団上のスコア対の 同時密度比 を同時 null で割ったもの \(S^\star=\log h_q(v,l)/f_{0q}(v,l)\)。lexical が 冗長なら dense の順序に退化し、lexical の証拠が有益なら訂正を保つ。相互順位融合は 依然として識別可能な極限である。5 つの前提は未検証。
  4. 計測された 3 つの損失機序のうち 2 つは適応性を全く必要としない。絶対的な admission floor は小さな候補宇宙を閉形式で与えられる確率で空にし、プールサイズの gate は プールが 30 行以下のときちょうど lexical のみの行をすべて削除する。どちらも 予約不変条件で取り除かれる。すなわち、適格な候補が存在する限り、どの段も \(\min(10,n)\) 行未満にしてはならない、という条件である。

1. 前提と、それぞれの反証条件

  1. 各行には適用されるアームが 2 本ある。 memory 行は dense アームと memory キーワード アームで、episode 行は dense アームと episode FTS アームで採点される。導出は そのような 1 対 \((v,l)\) について書かれる。反証: 出荷されている融合で 1 行が 独立な第 3 の票を受け取れる場合。
  2. 各アームの null は、配備スコープにおける無関連なクエリ–文書スコアを表す (同じモデル、エンコーダの役割、コーパスのスナップショット、行種別、分離スコープ、 宣言されたクエリ母集団)。反証: 保留した無関連ペアが小さい p の過剰を示す、または 較正がクエリ言語・長さ・コーパス群のあいだで大きく動く場合。
  3. 「行ローカルな規則」は 1 行について、2 つのスコア、2 つの null 超過確率、そして 望むなら null の下での 2 アームの同時法則を見る。 ラベルは見ず、そのクエリで返された 他の行も見ない。これが最初の導出が扱ったクラスであり、候補集合非依存のドクトリンが 許容するクラスである。
  4. ランキング品質は、固定された適格宇宙上の期待 DCG、二値関連度である。 関連件数を 固定すれば ideal DCG は定数で、期待 NDCG は期待 DCG に比例する。反証: 記録される 指標が変わる場合。
  5. アーム間の依存は両クラスで許容する。 以下のどこもアームの独立性を仮定しない。 独立性を要する式はそう述べる。

2. 混合則はアームについて対称である — 訂正

最初の導出は混合尤度比 \(E=\tfrac12\bigl(B(p_v)+B(p_l)\bigr)\)、\(B(p)=1/(2\sqrt p)\) を 提案し、各アームの行スコアへの影響度 \(\omega_a=B(p_a)/\sum_b B(p_b)\) が重みの当てはめ なしに現れることを観察した。dense アームで極端で lexical リストに無い関連行 \(g\) と、 dense アームでは中程度、lexical アームで極端な無関連行 \(b\) を考える:

\[ E_g=\frac{p_v^{-1/2}+p_l^{-1/2}}{4}\Big|_{(10^{-4},\,1)}=\frac{100+1}{4}=25.25, \qquad E_b=\frac{p_v^{-1/2}+p_l^{-1/2}}{4}\Big|_{(0.05,\,10^{-4})}=\frac{4.47+100}{4}=26.12 . \]

無関連行が勝つ。それぞれの自アームへの影響度は \(\omega_v(g)=0.990\)、 \(\omega_l(b)=0.957\) で、どちらの行も最良のアームに支配されているのに、行間の順序は なお誤っている。影響度 \(\omega_a\) は 1 行のスコアの 1 アームに関する導関数であり、 2 行のどちらが上位かについては何も言わない。 最初の導出にある「dense アームが確信して いるとき混合則は lexical の票を黙らせる」という文は、順序ではなく行のスコアについての 主張として読まねばならず、あちらで訂正される。あの構成の e 値保証は変わらず生きている: e 値の平均はどんな依存の下でも e 値なので \(\mathbb E_0 E\le1\) となる。これは null についての主張 であって、関連性についての主張ではない。

3. どの行ローカル規則もすべての世界で正しくはない

導出。 両アームの null 超過確率を一様、\(f_0(p_v,p_l)=1\) on \((0,1)^2\) とする。 null、クエリ、観測スコアを固定したまま、前提 2 のもとでそれぞれ許容される 2 つの 関連法則を考える:

\[ \mathcal W_D:\ f_1(p_v,p_l)=B(p_v), \qquad \mathcal W_L:\ f_1(p_v,p_l)=B(p_l). \]

\(\mathcal W_D\) では lexical アームは dense アームを超える情報を持たない (\(Y\perp P_l\mid P_v\))。尤度比は \(p_v\) だけについて減少で、Bayes 順序は dense の 順序、すなわち上の \(g\) を選ぶ。\(\mathcal W_L\) では役割が入れ替わり、Bayes 順序は \(b\) を選ぶ。\((p_v,p_l)\) だけを見る決定論的規則 (あるいは生スコア、あるいは両世界で 同じ独立一様である null の同時法則を見る規則) は、両世界で同一の入力を受け取り、同じ順序を 返さねばならない。したがってどちらかの世界で誤る。規則を確率化しても両方の決定を確実に はできない。対のうちちょうど 1 行が関連するという条件付けは何も変えない。

帰結は、与えられた有限ベンチマーク上ですべての固定非対称公式が失敗するということ ではない。それはリプレイの per-query 要約では決められない経験的な問いで、要約は対に なった行スコアを持たないからだ。帰結はそこではなく、行ローカルなクラスには分布自由な保証が存在 しないということである。このクラスの規則は関連法則への賭けであり、賭けは明示されるべき である。

4. 決定は実際には何に依存するか

導出。 関連尤度比を次のように分解する:

\[ \log\frac{f_1(v,l)}{f_0(v,l)} =\underbrace{\log\frac{f_{1v}(v)}{f_{0v}(v)}}_{A(v)} +\underbrace{\log\frac{f_1(l\mid v)}{f_0(l\mid v)}}_{J(v,l)} . \tag{1} \]

\(A\) は dense アーム自身の証拠である。\(J\) は dense スコアで条件付けた lexical の証拠で、 dense アームがすでに \(v\) と言った上で、この lexical スコアが null の下より関連の下で どれだけ起こりやすいか。\(Y\perp L\mid V\) なら \(J\equiv0\) で、\(A\) が単調なら融合順は ちょうど dense 順である。lexical の訂正は、2 行間の \(J\) の差が \(A\) の逆向きの差を 超えるときに起こる。null 較正は \(J\) の分母 \(f_0(l\mid v)\) を定めるが、分子は定め られない。アームの null 相関、null のコピュラ、コーパス上の最大 dense スコア、別々の周辺 証拠プロファイルのいずれも同様である: すべて第 3 節の 2 世界で同一な量の関数だからだ。

5. 重みを当てはめない十分な構成

本節末尾に列挙する前提の下での導出。 あるクエリの適格宇宙が、null と関連法則の 2 クラス混合である同時スコア密度

\[ h_q(v,l)=(1-\rho_q)\,f_{0q}(v,l)+\rho_q\,f_{1q}(v,l),\qquad \rho_q>0, \]

を持ち、\(h_q\) と \(f_{0q}\) がともに同定できると仮定する (\(h_q\) はスコア対の 母集団自体から、\(f_{0q}\) は null から同定する)。すると

\[ \boxed{S^\star(q,d)=\log\frac{h_q(v_d,l_d)}{f_{0q}(v_d,l_d)}} \tag{2} \]

は関連尤度比とちょうど同じ順に行を並べる。なぜなら

\[ \frac{h_q}{f_{0q}}=(1-\rho_q)+\rho_q\,\frac{f_{1q}}{f_{0q}} . \]

有関連率 \(\rho_q\) は未知だが当てはめる必要はない: 尤度比の正のアフィン写像であり、 順序もアーム間の均衡も変えない。これは 同時密度比 であってアーム重みベクトルでは ない。モデルごと・タスクごとの定数を含まないということである。条件付きの lexical 冗長性 \(h_q(l\mid v)=f_{0q}(l\mid v)\) の下では lexical の因子が消えて \(S^\star\) は dense 順に なり、lexical の証拠が有益なところでは因子が残る。相互順位融合は最初の導出で示した 識別可能な極限のままである (単一アームの等混合、\(\beta=1,\ \kappa=K/N,\ p_a=(r_a+1)/N\))。

仮定 — (2) を実装候補とする前に検証すべきもの:

  1. null がそのクエリとスコープで無関連行を表す (上の前提 2);
  2. 母集団が述べた 2 クラス混合である;
  3. 同時 プロファイルが尾まで含めて十分に推定できる — 関連行はペアのごく一部なので、 \(h_q/f_{0q}\) は \(f_{1q}\) が集中する尾以外ではほぼ 1 で、そこでの推定ノイズが 信号と競合する;
  4. 得られる比が座標ごとに単調である (最初の導出の単調性契約が拘束のままなら) — 制約のない尤度比は単調とは限らない;
  5. 期待 NDCG の主張は関連件数で条件付ける (前提 4)。

ドクトリン。 宣言された参照パネル (いかなる検索からも独立に選ばれた固定の クエリ集合と文書集合) から取ったプロファイルは、クエリとコーパスのスナップショットだけの 関数なので、それから作ったスコアは候補集合非依存である: 検索深度を変えても無関係な行を 足しても何も変わらない。返された 候補リストから推定したプロファイルはそうではなく、 除外される。コーパス全体のプロファイルには作業量予算の論証も別途要る。「モデル呼び出し なし」だけでは手頃な計算になるとは限らない。

6. 厳密な反転条件と、各規則が修復できるもの

行 \(d\) の実装上の票を \(V_d=\mathbf 1_v(d)/(K+r_v(d)+1)\)、 \(L_d=\mathbf 1_l(d)/(K+r_l(d)+1)\) と書く。\(K=60\)、順位は 0 始まり、無い票は 0。 dense アームが関連行 \(g\) を無関連行 \(b\) の上に並べる対について \(M_V=V_g-V_b>0\) と定める。

規則 \(b\) が \(g\) の上で終わるのはちょうど次のとき
等票の相互順位融合 \(L_b-L_g>M_V\) (3)
平方根混合、\(U=p_v^{-1/2},\ W=p_l^{-1/2}\) \(W_b-W_g>U_g-U_b\) (4)
条件付き証拠の規則 (1) または (2) \(J_b-J_g>A_g-A_b\) (5)

同点は宣言された全順序で解決する。リプレイは top-10 の会員変化を 4 種類記録して おり、それぞれが (3) と (4) を特殊化する:

事象 相互順位融合 平方根混合
lexical の票だけを持つ侵入者 (\(V_b=0\)) \(L_b>V_g+L_g\) \(W_b-W_g>U_g-U_b\)
すでに dense リストにいて lexical の票で持ち上げられた侵入者 \(L_b-L_g>V_g-V_b\) 同じ
押し出された関連行、lexical の票なし \(L_b>V_g-V_b\) 不在が真の不一致なら \(W_b-1>U_g-U_b\)
lexical の票があるのに押し出された関連行 \(L_b-L_g>V_g-V_b\) \(W_b-W_g>U_g-U_b\)

リプレイでの「lexical の票だけ」は admitted された dense の票が無い ことであって、 dense スコアが無い ことではない: admission floor の下の行にもコサインがあり、そこから 計算される p 値がある。その \(p_v\) を 1 に置くのは打ち切りと不在の混同である。

導出された修復の境界。

  • 等票の相互順位融合には (3) を修復する設定が無い。反転を生んだのがそれである。
  • 平方根混合は、較正されたスコアの間隔がたまたま (4) を反転させる場合にだけ反転を 修復する。4 類型の どれも 修復を保証しない。
  • dense 優先の方策 (lexical 重み 0、lexical 行は尾を埋める) は、admitted された dense 行の あいだのすべての厳密な反転を取り除き、admitted 行が 10 行ある限り lexical のみの侵入を 防ぐ。すべての lexical 訂正も取り除く。
  • 条件付き冗長性と単調な dense 証拠が検証された下では、規則 (2) は会員分類が数えない top-10 内の降格を含め、lexical 起因の反転をすべて取り除く。lexical の証拠が有益な下では (5) を通じて訂正を許す。Bayes 最適性は期待値についての主張であり、実現したすべての対に ついての保証ではない。

7. クエリ水準のセレクタ: 有意性は決定ではない

条件付き i.i.d. の無関連行の下での導出。 \(M_q\) をコーパスの \(N\) 行上の最大 dense スコア、\(F_{0q}\) をクエリ–文書 null とする。\(\Pr_0(M_q\le x)=F_{0q}(x)^N\) なので、 観測された最大値の有意性は

\[ p_{\max}(q)=1-F_{0q}(M_q)^N . \tag{6} \]

独立だが同一でない行では冪を積に置き換える。一般の依存の下では最大値の同時法則、 または保守的な Bonferroni 形 \(\min\bigl(1,\sum_i\Pr_0(S_{vi}\ge M_q)\bigr)\) を使う。 この量は候補集合非依存の下で許容される。コーパスのスナップショットとクエリに依存し、 何が返されたかには依存しないからである。ただし、行ごとのスコア導関数である \(\omega_a\) とは別の 対象である。

導出。 任意の許容されるクエリ記述子 \(Z_q\) について、dense 順と融合順のあいだの Bayes 選択は

\[ \text{融合する iff } \mathbb E[\,\Delta_q\mid Z_q\,]>0, \qquad \Delta_q=\mathrm{NDCG}_{\text{fused}}-\mathrm{NDCG}_{\text{dense}} . \tag{7} \]

最大値の null 法則を知っても、条件付きの利得も条件付きの害の確率も得られないので、 「有意な最大値 ⇒ dense のみ」は (6) が完全に較正されていても Bayes 整合ではない。1 つの 例外的な dense ヒットは、dense の top-10 が正しく並んでいることを示さない。最大コサインが どれほど予測しないかはリプレイが計測している: それに対する最適閾値は、良い方の定数方策に 対してせいぜい 1 点未満しか得ず、一方 per-query のオラクルは 3〜6 点上にある。

例示。 平均 \(\mu_0\)、p95 \(q_{.95}\) の Gaussian null は \(\sigma_0=(q_{.95}-\mu_0)/\Phi^{-1}(.95)\) と、最大値有意水準 \(\gamma\) での切替閾値 \(\tau_\gamma(N)=\mu_0+\sigma_0\Phi^{-1}\bigl((1-\gamma)^{1/N}\bigr)\) を与える。リプレイ ノートはこれが経験的最適に対してどこに落ちるかを報告する。負けているタスクのうち 3 つで 大きく外れ、これは pooled Gaussian のセレクタを棄却するのであって (6) を棄却するのでは ない。尾の分解能は別の制約である: \(m\) 個のクエリ条件付き null 標本による経験的参照では 表現できる最小の尾は \(1/(m+1)\) で、\(N=20{,}000\) 行に対する Bonferroni 水準 \(0.05\) を外挿なしに表現するには \(m\ge 4\times10^5\) が要る。

8. 小さな宇宙: 飢餓、全滅、予約

導出。 \(\alpha=\Pr_0(S_v\ge t)\) を admission floor の null 超過確率、 \(\beta=\Pr_1(S_v\ge t)\) を関連行の受理率とする。\(n\) 行のうち \(m\) 行が関連する 適格宇宙と、各クラス内で独立な admission を条件として、admitted 数は \(A=A_0+A_1\)、 \(A_0\sim\mathrm{Bin}(n-m,\alpha)\)、\(A_1\sim\mathrm{Bin}(m,\beta)\) で、

\[ \Pr(A<10)=\sum_{j=0}^{\min(m,9)}\binom mj\beta^j(1-\beta)^{m-j}\, F_{\mathrm{Bin}(n-m,\alpha)}(9-j) . \tag{8} \]

クエリ依存の率では、(8) を計算してからクエリ上で平均する。pooled の率を代入するのは 無効である。例示、全 null の宇宙、\(\alpha=0.05\):

\(n\) 19 45 196 200
\(\Pr(A<10)\) \(\approx1\) 0.9999 0.481 0.455

固定の小さい \(p\) による admission 規則は、小さく分離の弱い宇宙から 10 件を返すことを 同時には約束できない。リプレイは QASPER (適格宇宙の中央値が 45 行) のクエリの 31.8 % で admitted 行が 10 未満であることを計測しており、(8) の pooled Gaussian 版は それを過小予測し、EPBench の群では桁違いに外す。これは pooled 独立モデルを棄却するので あって、恒等式を棄却するのではない。

導出とコードに対する確認。 プールサイズ gate は lexical のみの行の融合スコア \(1/(K+r_l+1)\) を \(m(P)\cdot 3/(K+1)\) と比較する。\(P\) はプールサイズ、 \(m(P)=0.5-0.3\min\bigl(1,\log(P+1)/\log 500\bigr)\)。lexical のみの行が生き残るのは ちょうど

\[ r_l\le\frac{K+1}{3\,m(P)}-(K+1), \tag{9} \]

のときで、lexical のみの行が 1 行も生き残らないのは \(m(P)>\tfrac13\)、すなわち \(P\le30\) のとき、かつそのときに限る (\(500^{5/9}-1=30.58\)。出荷されている 小数 4 桁への丸めは整数境界を 30 に保つ)。\(P=196\) では切り捨ては lexical 順位 21、 \(P\ge500\) では順位 40。同じ gate のコサイン分岐は dense 行に \(m(P)\) を適用し、 小さなプールでは admission floor を上回って関連する dense 行も削除する。リプレイの 群別の数字は両方の効果を示している。

導出: 予約不変条件。 \(\mathcal U_q\) を必須フィルタ後の適格宇宙、 \(k_q=\min(10,|\mathcal U_q|)\) とする。admission の前に dense の上位 \(k_q\) を予約し、 予約を以降のすべての段から到達可能に保ち、最終選択で

\[ |O_q|\ge k_q \tag{10} \]

となるまで、適格な予約行を追加する。統計的に適格とはせず、フォールバックとして印を付けて 追加する。後段の gate が予約を削除できるなら初期の dense リストを守るだけでは不十分で ある。(10) は経路全体にわたる濃度の契約である。候補と較正されたスコアを保存するが、 関連性は約束せず、dense 行が融合で降格されることからも守らない。比較のため、全 null の 宇宙で \(\Pr(A<10)\le0.05\) を保証する純粋に確率的な admission は \(\alpha_{10}(n)=F^{-1}_{\mathrm{Beta}(10,\,n-9)}(0.95)\) の null 許容量を要し、 \(n=19\) で 0.68、\(n=45\) で 0.32、\(n=200\) で 0.08 — 決定論的フォールバックを証拠に 基づく admission から分けて保つべき理由を示すに足る大きさである。

9. これを作る前に計測しなければならないもの

各行は計算と、主張を反証する結果を名指しする。per-query のフィールドはリプレイの 出力のものである。

主張 計算 反証されるとき
行ローカル規則は分布自由ではありえない (第 3 節) なし — 定理。その関連性は経験的に反証される 行ローカル規則が両端モデルのすべてのタスクで dense 順に勝つ (そのとき第 3 節の世界は実際には起きていない)
支配的な損失機序は lexical 票で持ち上げられた dense 行 負けているタスクごとの侵入者中の intruder_dense_boosted の割合 負けていると主張するタスクで割合 \(\le50\,\%\)
会員変化が損失を説明する s2 < s1 かつ gold_out == 0 のクエリからの損失 「少なくとも半分」については既に反証: 2 タスクで損失の 55 % と 64 % が top-10 内の再順序化
混合則は有害な反転を修復する 行キー付きの \(p_v,p_l\)、生スコア、存否と打ち切り、ラベル、両順序; (4) を評価 \(10^{-12}\) の同点帯の外で (4) と食い違う厳密な対が 1 つでも
冗長性は (2) の下で dense 順を含意する \(f_1(l\mid v)=f_0(l\mid v)\) の宣言された合成法則; 厳密な密度で (2) を評価 不等な dense 比の厳密な反転が 1 つでも
融合が負ける場所でデータがその冗長性を持つ 行キー付きダンプからの \(J\) の保留推定 per-query 要約からは決められない; null のみの依存は不十分
最大値有意性セレクタは劣らない null 推定器、\(N\)、依存の扱い、\(\gamma\) を固定; その効用を計算 良い方の定数方策より 0.01 点超下回る
null の最大値は較正されている 保留した全 null クエリで \(\gamma\in\{.01,.05,.10\}\) における \(p_{\max}\le\gamma\) を数える クエリを単位として、片側 95 % 下界が \(\gamma\) を超える
lexical のみの全滅 iff \(P\le30\) 行ごとのアーム所属、大域 lexical 順位、gate 分岐と生存; (9) を評価 算術的等号の外で矛盾する適格行が 1 つでも
予約は飢餓を防ぐ 適格宇宙のサイズ、予約 id、各段の生存者 十分な適格予約行があるのに \(\min(10,n)\) 未満の出力が 1 つでも
候補集合非依存 同じクエリ、行、スナップショット、スコープ、参照; 返却深度とリスト構成を変える \(10^{-12}\) を超えるスコア差が 1 つでも
拘束力のある成功条件 弱いモデルと強いモデルそれぞれについて、\(\mathrm{NDCG}_{\text{new}}-\mathrm{NDCG}_{\text{dense}}\) の 22 タスク平均 どちらかのモデルで \(\le0\)

最後の行は設計ページが事前に固定した 条件である。dense のみの順序に対して述べられており、admitted リストや gate 後のリスト に対してではない。それらのどちらかに対する改善は成功ではない。