コンテンツにスキップ

適応的融合 — 設計

Status: 2.6 ラインの設計であり、挙動ではない。以下のすべてはモード切替の後ろに default-off で出荷される。出荷済みの融合は、本ドキュメントが事前登録する計測で 2.6 設計ページの成功条件が満たされるまで 触られない。

本設計が拠って立つ事実は、2 本の研究ノートにある。 凍結段リプレイ はベンチマークの損失を段ごとに 特定し、識別可能性ノート は、それを避ける ために融合則が何を知らねばならないかを述べる。本ページは決定する。再導出はしない。

0. 計測が変えたもの

このラインは「適応的較正」として枠づけられていた。各検索アームの信頼性を null 分布から 推定し、その推定を通じてアームを融合する、という枠である。いま判明している 3 点が、それを 組み替える。

  1. 損失には 3 つの原因があり、適応性を要するのはそのうち 1 つだけ。 純 ranking の タスクでは、Track B − Track A の損失の全量が融合段にある。lexical の票が、dense アームが すでに下位に並べていた行を、関連行の上へ持ち上げるためである。小さな候補宇宙では絶対的な admission floor が top-10 を空にし、小さなプールでは heuristic gate が lexical アームを 削除する。後の 2 つは、決定論的な修正を持つ構造的欠陥である。
  2. アームごとの null 較正は融合を決められない。 1 行のスコアとそのアーム別超過確率を 入力とするいかなる規則も、lexical アームが dense アームを上書きすべきかを判定できない。 同じ null と同じ観測を持つ 2 つの世界が、逆の順序を要求するからである。決めるのは、 dense スコアで条件付けた lexical の証拠である。
  3. 定数は 1 つのモデル階級では大部分を回収し、階級を跨ぐと何も回収しない。 lexical の 重みを 0.1 に下げると、中位と強いモデルでは純 ranking の損失の大部分が戻るが、最弱の モデルでは利得の大部分を失う。同じ凍結候補の上で、SciFact・TMD・ESGReports は最弱の モデルでは出荷済みの融合で勝ち、他の 2 モデルでは負ける。3 つすべてに効く定数は無い。

    適応層の標的はそのモデル依存性であり (このラインが存在する理由である)、その上に per-query オラクルとの 3〜6 点の差が乗る。

1. 決定

D1. 想起経路全体にわたる予約不変条件

必須の分離と候補フィルタの後で \(n\) 行の適格宇宙を持つクエリについて \(k=\min(10,n)\) とする。dense アームの上位 \(k\) 行を admission の前に予約し、以降の すべての段から到達可能に保ち、最終選択では出力が \(k\) 行以上になるまで、適格な予約行を 追加する。追加する行には、適格 (qualified) ではなくフォールバックとして印を付ける。

この不変条件は経路全体の濃度契約であり、どの段のスコアリングも変えない。候補と較正済み スコアを保存し、関連性を約束せず、dense 行が融合で降格されることからも守らない。

理由。 admission だけで QASPER のクエリの 31.8% (適格宇宙の中央値 45 行) で top-10 が 空になり、中位のモデルの Gorilla で 7.1 点、最弱のモデルで 18.2 点を失った。gate が、 lexical 行の埋め直した分を取り除いたためである。どちらも同じ誤り (小さすぎる宇宙への 絶対閾値の適用) であり、どんな融合則でも修復されない。

形。 追加した行への fallback: true マーカー (既存のメッセージ形状に対して additive) と、応答中のフォールバック行数。新しいツールは無い。

D2. プールサイズ gate は lexical アームへの順位カットであることをやめる

heuristic gate は、lexical のみの行の融合スコア \(1/(K+r+1)\) を \(3\,m(P)/(K+1)\) と 比較する。これはプールサイズ \(P\) に依存する lexical 順位でのカットになっている。 500 行超で順位 40、196 行で順位 21、30 行以下では 1 行も通らない。

これは品質判定ではない。順位融合スコアをコサイン尺度の閾値と比較したことの偶然の産物で あり、EPBench の損失の全量 (−10.2、その 99.6% が 19〜20 行の 4 群) を生んだ。

融合が生成した行に対する gate の順位分岐は取り除く。行の出力への受け入れは、融合モード 自身の証拠尺度 (D3) と D1 が決める。コサイン分岐は、dense のみの順序に対する役割を保つ。

ベンチマークのレジームを heuristic gate もバイパスするよう再定義するかは、別の決定である (公表済みの小コーパスの Track B の数字が動く)。下された時点でベンチマークのドキュメントに 記録する。本設計はそれに依存しない。

D3. 融合: いまはノブ 1 つ、後でモード 1 つ、当てはめた重みは永遠に無し

いま — 計測された定数。 CPERSONA_RRF_LEXICAL_WEIGHT (既定 1.0、バイト同一) が lexical アームの相互順位票をスケールする。モデルごと・タスクごとではない単一の大域定数で、 その既定値は第 2 節の計測の後、リリースの ladder を通じてしか動かない。

目的は 2 つある。その計測の非適応の対照アームになることと、適応モードが成功条件を 落とした場合に、強いモデルではなお損失の大部分を回収するフォールバックであることである。 すべてのモデルに同時には効かない。それがこのラインが置き換えようとしている固定重みの 妥協であり、これが答えではなく対照アームである理由である。

後で — 条件付き証拠の融合、default-off。 新しい融合モード (CPERSONA_RECALL_MODE=evidence、名前は暫定) は行を

\[ S^\star(q,d)=\log\frac{h_q(v_d,l_d)}{f_{0q}(v_d,l_d)}, \]

すなわち、宣言された参照母集団上の (dense, lexical) スコア対の同時密度を、同じ密度の 同時 null で割ったもので採点する。

これは識別可能性ノート第 5 節の構成である。述べた前提の下で関連尤度比と同じ順に行を並べ、 lexical アームが冗長なところでは dense 順に退化し、lexical が証拠を運ぶところでは訂正を 保ち、相互順位融合を識別可能な極限として含み、アームごとの重みを当てはめない。関連行の 未知の有関連率は、順序から消える。

「証拠」は何から推定するか。そしてこのモードを塞いでいる未解決問題。 両密度は、エージェントのスコープごとに宣言される参照パネル (検索と独立に選ばれた 固定の文書標本と固定のクエリ集合) から来るはずだった。

最初にここへ書いた標本の取り方は誤りであり、置き換わるまでこのモードは塞がっている。 そこには「同時 null はパネルのランダムなクエリ–文書ペア上のスコア対、同時母集団は全ペア 上のスコア対」と書いてあった。この 2 つは同じ分布である。Cartesian 積から一様にペアを 引いた法則は、その積を列挙した法則そのものなので、\(h/f_0\equiv1\)、すべてのスコアが 0 に なり、パネルを大きくしても直らない。

識別可能性ノートの構成は無傷である。あちらの \(h_q\) は query で条件付けられ、その query 自身の関連行を割合 \(\rho_q>0\) で含み、null は query–文書の対応を壊す。壊したのは、本 ページがその条件付けを落として query 上で平均したことである。

帰結は文言の問題ではなく、実質的な制約である。1 つのペア母集団から引いた無ラベルの パネルでは、混合をそれ自身の null から分離できない。 分離するには次の 3 つのいずれかが 要り、どれを取るかが、このモードが待っている未解決問題である。

  1. ラベル。 関連度判定があれば、judged negative が null を直接与える。ベンチマークでは 明示的な完全性の仮定の下で利用でき、配備では利用できない。
  2. 独立に正当化された null 母集団。 無関連であることが、仮定でなく構成で保証される ペアである。別の分離スコープ、宣言された保留集合、検証済みの無関連ペアなどが当たる。

    別コーパスは、自動的に妥当な null にはならない。語彙と長さの分布が、関連性とは無関係な 理由で周辺分布を動かすので、使う前にそれを計測しなければならない。 3. 1 つの標本から混合を同定できるだけの構造的仮定。 それは仮定するのではなく、述べて 反証可能にしなければならない。

そのいずれかが揃うまで、このモードは実装可能ではない。設計は D3-いま の定数と、D1・D2 の 構造的修正で進む。

したがって最初の実験は、ベンチマーク上のラベル付き診断である。条件付きの lexical 証拠が 存在するか、どれだけ大きいかを示せるので、配備用の推定器を誰かが作る前に知る価値がある。

null を何が供給するにせよ、パネルは本設計が必要とする性質を保つ。想起が何を返すかに依存 しないのでスコアは候補集合非依存であり、有界であり (文書数とクエリ数の上限)、較正サイド カーと同様に指紋付きである (モデル、次元、トークナイザ、null の定義、seed)。だからモデル 交換やスコアリング変更で無効化される。

密度をどう表現するか。 離散化した同時分布である。null からのコサイン分位ビンと lexical ビンの積で、lexical リストに不在なら独自のビン、存在する行は bm25 分位に入る。そこへ add-one 平滑化と、比を座標ごとに単調化する正則化を掛け、単調性契約 (どちらのアームの スコアを上げても融合スコアが下がらない) が成り立つようにする。

lexical アームでの不在は独自のビンを持つ観測であり、決して p 値 1 ではない。admission floor 未満の dense スコアは打ち切りであって、不在ではない。

Gate。 モードの出力はそれ自身の log 証拠尺度 (新しい gate 信号種別) で比較し、コサイン 閾値とは決して比較しない。較正済み gate の機構は、較正された信号を既に運んでいる。

永遠に無し — 学習したアーム重み。 ラベルに当てはめたモデルごと・タスクごとの重みは、 固定重みの問題を 1 段上で再導入するものであり、このラインの外にある。evidence モードが 条件を落とした場合の答えは D3-いま の定数であって、当てはめたベクトルではない。

D4. 深度、prior、件数は分離したまま

モードは深度/件数分離の候補深度を消費し、2.6 ページの prior 関数 (第 3 節) の前、再構成窓 (第 7 節) の前に適用され、参照もビンも応答件数から導出しない。件数だけを変えても各行の \(S^\star\) は変わらないこと。これは深度の作業が主張するのと同じ不変条件である。

2. 決める計測

D3-後で のいかなる実装よりも前に事前登録する。

計器。 凍結段リプレイからの行キー付きダンプである。各クエリの各候補行について、両方の 生スコア、パネル null に対する両方の超過確率、アームの存否と打ち切り、関連ラベル、各アームと 各融合則の下での順位を持つ。リプレイノートの per-query 要約では、規則の反転条件の評価も 条件付き証拠の推定もできない。これならできる。

アーム。 (a) 出荷済みの相互順位融合、(b) D3-いま の定数を 0.1 とした dense 優先、 (c) 最初の導出の平方根混合 (対称性が論じられるだけでなく計測されるように)、(d) evidence モード。

4 つとも同じ凍結リスト上で、両端モデル (ベンチマーク記録中の最弱と最強) で、22 タスク 全部で走らせる。飢餓が比較を交絡させないよう、D1 はすべてのアームに適用する。

成功。 2.6 ページが固定した条件: dense のみの順序 に対する NDCG@10 の 22 タスク平均が 両端モデルでゼロを上回る。admitted リストに対してでも gate 後のリストに対してでもない。

この実験が解けること、解けないこと。 すでに計測した task 別の差が、この比較の分解能に 下限を与える。(出荷融合 − dense) と (lexical 重み 0.1 − dense) の観測された散らばりを計画用の 代理とすると、22 タスクにわたる対の標準偏差は、モデルにより 2.6〜3.5 NDCG@10 点である。

22 タスクの片側対検定が通常の検出力で検出できる平均改善は約 2〜3 点で、1 点の改善に対する 検出力は 20% 未満である。per-query のオラクル差は 3〜6 点なので、その大部分を捉える規則は ここで見えるが、少しだけ捉える規則は見えない。

結果を見てから決めないよう、2 つの帰結を事前に登録する。決着しない結果は未解決と報告し、 決して「定数と同等」とは言わない。その主張には、宣言した同等性マージンと専用の検定が要る。 そして数字を見た後に、アームを足さず、パネルを大きくせず、評価を繰り返さない。

反証。 識別可能性ノート第 9 節の基準を、そのまま適用する。規則自身の反転不等式と 食い違う厳密な対の順序が 1 つでもあれば実装を反証し、検索深度で変わる参照プロファイルは 候補集合非依存を反証し、正則化後の単調性違反は表現を反証する。加えて次の 3 点がある。

  • アーム (b) 単独で成功条件を満たし、アーム (d) がどちらかのモデルでそれを対の不確かさを 超えて上回らないなら、evidence モードは出荷せず、代わりに D3-いま の既定値を動かす;
  • アーム (d) が宣言した作業量予算より大きいパネルでしか条件を満たさないなら、モードは 出荷せず、パネル予算を理由として記録する;
  • パネルからの同時 null が保留した全 null クエリで宣言した水準において反保守的なら、 ランキング結果を読む前に参照を棄却する。

3. 不変条件

  1. read path でモデルを呼ばない。 埋め込みは可、生成は不可。
  2. 候補集合非依存。 同じクエリ、行、スナップショット、スコープ、参照なら、他に何が 検索されても同じスコアになる。
  3. 決定論。 同じデータベース状態、同じパネル、同じクエリなら同じ順序になる。同点は 書き下した全順序で解く。
  4. default-off、契約不変。 既存の recall 応答形状は変わらない。新しいフィールド (fusion_mode、行ごとの証拠、フォールバックマーカー) は additive で、モードが off なら 存在しない。
  5. 有界な作業量。 パネル構築とスコアリングには宣言した上限があり、モードは上限を 超えるパネルの構築を拒否し、拒否したことを報告する。
  6. 参照に指紋。 古いパネルは古い較正と同じやり方で検出され、モードは出荷済みの融合に フォールバックし、そのことを報告する。

4. 作業の順序

  1. D1 と D2 — 構造的でモデル非依存、既存のリプレイで計測可能である (影響を受けるタスクで S1 と S3 が S0 と S2 まで上がり、他は変わらない)。欠陥の除去であって挙動の追加ではない ので、通常の ladder を通じて default-on で最初に出荷する。
  2. D3-いま — ノブ、既定 1.0。D1 / D2 と一緒に出荷する。
  3. 行キー付きダンプとパネルビルダーを、ベンチマーク側の計器として。
  4. 第 2 節の事前登録した比較。
  5. D3-後で — 比較がそれを選んだ場合にのみ実装する。ノブまたはモードの既定値の切替は、 ladder を通じてのみ行う。

5. 本ページが決めないこと

  • ベンチマークレジームでの heuristic gate の扱い (D2 参照)。
  • 擬似クエリ以外に記録されたクエリが無い配備でのパネルのクエリ源。ステップ 3 で計測。
  • confidence 層および prior 関数との相互作用。2.6 ページは prior を融合の後に置き、 本設計はその順序を保つ。
  • per-query のパネル。スコープごとに 1 つのパネルが最初の形である。