コンテンツにスキップ

2.6 系はいまどこまで来ているか

翻訳について: 正本は英語版です。この日本語版は参照用の翻訳で、内容が食い違う場合は英語版が優先されます。

更新日: 2026-10-01。このページは、2.6 系がどこまで進んだかを、項目ごとに証拠つきで 示します。このラインが何を建て、何をもって完了とするかは ラインのページ が、各リリースに何が入っているかは リリースノート が述べます。このページと リリースが食い違う場合、正しいのはリリースです。

2.6.0 はこのラインの最初の final リリースです。同じ日に 2.6.1、翌日 (2026-10-01) に 2.6.2、その翌日 (2026-10-02) に 2.6.3、2026-10-03 に 2.6.4 が続き、版を指定しない導入は 2.6.4 になります。 pre-release は 2.6.0aN と 2.6.0bN として PyPI にあります。2.5 系は Candidate になりました (SUPPORT.md)。

4 つの状態

以下の各行は、このうち 1 つだけを持ちます。設計が機能として読まれないように、分けて あります。

状態 意味
リリース済み 公開されたリリースに入っている。誰でも導入して呼び出せる。
開発中 master にコードはあるが、未リリースか、既定を決める測定がまだ無いままリリースされている。
研究中 仮説、実験、設計の比較の段階。サーバーのコードはまだ無い。
不採用・修正中 測って退けたか、誤りが見つかって設計し直している。これらの行はページに残します。

ラインの完了条件に対して

番号は 「完了」の意味 に従います。

# 条件 状態 証拠
1 想起プロセスと Cued Recall がゲートの背後で出荷される リリース済み 2.6.0a8、v0.3 ループの基本形: 呼び出し側は time_cue (いつ頃か、確かさつき) を渡せます。サーバーはその期間も件数と無関係な深さで探し、そこで見つかった行を品質ゲートの後に最大 3 / 2 / 1 段上げ、その検索が見つけて答えに入っていない記録 (件数で切られた記録を含む) に同じ数の行の別枠を取り、期間に何も無ければ 1 回だけ広げます (#325、#331–#333、#340、設計)。呼び出しごとの opt-in です。事前登録した判定則で LMEB の TMD (時期を述べる 1,167 問) に対して測り、返る行の NDCG の平均は手がかりありで 0.189 から 0.281 に、同じ数の手がかり無しの行では 0.204 になりました (結果)。LongMemEval では、前の方針は手がかり無しと区別できませんでした (結果)。手がかりの伝播と多段の停止は後続です。
2 最後の再ソートの扱いが決まっている リリース済み 2.6.0a7 confidence を有効にしても、confidence スコアは recall を並べ直さず、ゲートにも使われません。CPERSONA_CONFIDENCE_ORDERING=legacy で戻せます。far の重みと年齢の重みは、ゲートが通したものの順序だけを決める一本化した事前分布で、計測まで恒等の既定値です (#322、設計)。その後、far の重みを事前登録した判定則で測りました。reach 200,000 では、far リストが得る分を保ちつつ新しい答えを守れる一定の重みは無く、既定は 1 のままです (結果)。
3 深さと件数が分離されている 2.6.0a2 で リリース済み #274。CPERSONA_RECALL_DEPTH_FLOOR の既定は 0 で、測定で深さが選ばれるまで 2.5 系の結合を保ちます。
4 再構成想起がツールとして存在する 2.6.0a2 で リリース済み、a3 で拡張 ツール本体: #274。深さより広さ、payload の予算: #280、#286。item の形の統一と、何を落としたかを言う応答: #288、#289、#290。これまでの測定: 上限 1〜10 の count replay (記録自身が「既定を選ぶものではない」と述べています) と、事前登録した reader study。後者は 1 回目では reader が受け取る量が減らず、2 つの変更の後の再測定が、18 問で登録済みの判定則を満たしました。既定の件数は今も契約上の選択であり、測定された最適値ではありません。
5 適応的融合が両方のモデルで素の embedding を上回る 研究中 設計と、その根拠である段ごとの損失の分析: #260、#261、設計記録。サーバーのコードはありません。
6 ベンチマーク上のすべての失敗にコードと再生できる trace がある 開発中 2.6.0a7 でリリース: 求めに応じて recall と reconstruct が各段の残した行・落とした行・並べ替えを記録として返し、benchmarks/ の道具が記録と正解の参照から確定した失敗コードを付けます (#324、設計)。すべてのベンチマーク上の失敗への適用はまだです。
7 精度・トークン・遅延・メモリのフロンティアが動いた 研究中 1 軸を測りました。LMEB のうち、1 人の利用者の記憶を干し草の山にできる 15 タスクで、10 行の応答において、最良構成の 2.6.0 は最良構成の 2.5.12 より関連する記憶を上位に返しました。macro NDCG@10 は 57.36 → 59.12、上がったタスク 14・下がったタスク 1 で、事前登録した判定則によります (結果)。トークン・遅延・メモリは未測定なので、フロンティアはまだ示していません。
8 2.5 の baseline が抱える品質上の負債が、閉じられたか理由つきで持ち越された 開発中 ベンチマークの走行がどの較正の下で測られたかを、走行と一緒に記録するようになりました: #258。他の項目は未着手です。

完了条件の外で、このラインがリリースしたもの

リリース 追加したもの 証拠
2.6.0a1 識別子を検索できるまま保つ全文検索の正規化 #271
2.6.0a3 長いレコードを node に分け、検索索引の外に保つ。reconstruct の引用は最良の node から取る。レコードの一部を get_contents で展開する #282–#287、設計記録
2.6.0a4 宣言された連想記憶: エージェントが述べるエンティティ・別名・関係。reconstruct はそれを手がかりとして読み、有界にたどる。traverse は宣言された近傍を返す #291–#295、設計記録
2.6.0a7 エピソード境界ペナルティを既定で無効化: セッションごとにエピソードの要約が残る記憶では、答えを持つ記録を順位の下へ押し下げていたため #320
2.6.0a8 opt-in の関連の別枠: 同じ recall をより深く並べた時に、答えの最初の行から導かれる行のために 1 行の別枠を取る (CPERSONA_RECALL_PROPAGATION_SEAT、既定は off) #338
2.6.0a8 recall と reconstruct は各段を provider の枠を通して呼び、trace は宣言した予算と各段が受け取ったものを記録する。呼び出し側が受け取るものは変わらない #335、#336
2.6.0b1 機能の追加はなし: 2.6.0a1〜a8 のレビューで見つかった MEDIUM の欠陥 11 件の修正。他のプロジェクトから読めていたプロジェクトの別名、引用から漏れていた次の行の限定句、段数に上限のなかった reconstruct のたどり、10 字ずれて測られていたエピソードの引用、読み手が拒否するのに誰も作り直さなかったノード集合などです #356, #357, #358, #359, #361
2.6.0b2 機能の追加はなし: 残っていた MEDIUM の欠陥 5 件の修正。ヘッダと本文が食い違いうるメモリ上 DB のエクスポート、毎クエリ読む行を 0 と報告していた索引の status、行の上限で切られても完全に見えていた一覧、長さに上限のなかった session_key、コピーが要る窓を丸ごと保持していた索引の経路などです #363, #364, #365, #366
2.6.0 このラインの最初の final リリース。機能の追加はなし: Block による到達を既定で on にし、count を省略した reconstruct を 10 項目にし (この 2 つで、記憶から答えるためにこのリリースが推奨する構成になります)、alpha のレビューが登録した LOW の欠陥 43 件を修正。ノードの境界をまたいでいた Block の集合、表せる範囲を超えて例外になっていた時期の手がかり、待ち行列の全タスクを止めていた失敗する構築、どのゲートも認めていない脇の行に記録されていた recall の回数など。
2.6.1 実運用の報告から入れた修正と追加: サーバーが開いたままでも Windows で連続配置索引を再構築できる (bug-503)。recall のスコアが何を意味し、なぜ「一致するものは無い」を示せないか (契約 §12)。recall を促す Claude Code フックの例 (運用)。get_session_findings が準拠する SuperAuditor の版 (1.1) を示す #377、#378、#379、#380
2.6.2 1 ビット粗探索。既定は off (設計): 連続配置索引の隣に全レコードの 1 ビット索引。窓の外の席 = 走査窓の外のレコードのための 2 つの予約席 (CPERSONA_FAR_SEATS_ENABLED)。時間の手がかりの期間のうち、ベクトル側の上限を超えた残りの探索 (CPERSONA_CUE_COARSE_ENABLED)。候補数は事前登録した計測で 256 に決定 (結果)。ほかに recall の trace の網羅の台帳、空のクエリの時間の手がかりが期間のレコードをそれ自身の時刻順に並べる修正 (bug-502)、PyJWT 2.14.0 以上 #382, #383, #384, #387, #389, #390, #391, #392
2.6.3a1 pre-release。保存するベクトルに、それを作ったモデルのラベルを付けます (スキーマ 18): バックエンドが GET /capabilities で返す指紋 (CEmbedding 0.9.0 以降)、それが無ければ api トランスポートが送るモデル名か設定したモデル名。別のモデルが書いたベクトルを check_health が報告し (embedding_model)、CPERSONA_EMBEDDING_MODEL_MODE=reject でそのベクトルを問いと比べなくなります。既定の warn は recall の結果を何も変えません (設定) #395
2.6.3 2.6.3a1 の final で、コードの変更はなし: 版を指定しない導入でも、保存するベクトルにモデルのラベルが付き、スキーマが 18 に移行します。2.6.3a1 を本番で 8 時間使い、再起動なし・エラーなし・新しいベクトルはすべてラベル付き、を確かめてから出しました
2.6.4a1 pre-release。再構成想起 v1.2 (結果): Block を保存済みの int8 ベクトルで順位付けし、接する箇所は 1 つの引用にまとめ、先頭の引用の長さを項目の位置で決め (最初の CPERSONA_RECONSTRUCT_FULL_QUOTES (5) 項目は CPERSONA_RECONSTRUCT_QUOTE_CHARS (800)、それ以降は CPERSONA_RECONSTRUCT_TAIL_QUOTE_CHARS (400))、読み手が使わない欄を既定の応答から trace へ移します。非公開の実運用パックの test 150 問で、見える根拠の引用は 196 中 133 から 146 に増え、最初の応答の大きさの中央値は 2.6.3 の 0.662 倍になりました。ほかに check_health に coarse_index: 粗探索の設定が索引を読む間、無い・使えない索引を報告し、fix=true で作ります #398, #399
2.6.4a2 pre-release。時間の手がかりは、期間のうち走査窓より後ろの部分を、既定で粗探索の索引を通して探します (CPERSONA_CUE_COARSE_ENABLED 未設定)。使える索引が無ければその部分は探さず、recall は設定を off にした時と同じになり、time_cue.remainder がそう伝えます。true は 2.6.2 の意味のままです (1 ビット粗探索)。索引を自動で作るものはありません。範囲が窓の外に 1,000 件以上の記録を持ち索引が無い recall には、エージェントが伝えるための suggestion がセッションごとに 1 回付き、この動き方だけが索引を読む間、check_health は索引の不在を info として報告します #405
2.6.4 2.6.4a2 の final で、コードの変更はなし: 版を指定しない導入でも、reconstruct がレコードの一致した部分を item の位置に応じた大きさで引用し、時間の手がかりの期間のうち走査窓より後ろの部分を、粗探索の索引があれば既定でそれを通して探します。2.6.4a2 を本番で 6 時間使い、再起動なし・エラーなしを確かめてから出しました

連想の層はリリース済みで、既定では off です。既定にするかどうかは専用の A/B で決め ますが、その結果はまだ記録されていません。

不採用・修正中

何が 何が起きたか 証拠
適応的融合の reference panel (最初の仕様) null を特定できませんでした。指定した 2 つの密度が同じ分布だったため、定義した証拠では、混合をそれ自身の null から区別できませんでした。この定義の上にコードが書かれる前に、定義を置き換えました。 #262
rsf の固定の尺度 (bug-247 の修正) LongMemEval の 10 行で事前登録した判定則を満たしましたが、そこでは返す行も増えていました。LMEB Track B では 22 タスク中 19 で下がり (macro 58.53 → 57.51)、リリース前に元に戻しました。対象だったゲートの欠陥は未修正に戻っています。 結果
rsf のゲートだけを固定の尺度にし、順位はそのまま (bug-247 の第 2 案) 事前登録した 2 つの判定則はどちらも満たしました (LMEB Track B で下がったタスクはなし、macro 57.96 → 57.97。LongMemEval の 10 行で下がった問いもなし)。それでも merge しませんでした。既定で動く校正済みの融合ゲートの下では、実運用の記憶を集めた非公開パックで、大半の答えを空にするか薄くする閾値を選んだためです (10 行で返る行 9.89 → 2.16、根拠への到達 389 件中 295 → 204)。bug-247 は未修正のままです。 結果

このページに無いもの

日付です。ロードマップ は記述的な文書で、このページもそれに従います。 行が動くのは、日付が来た時ではなく、証拠ができた時です。