2.6 系はいまどこまで来ているか¶
翻訳について: 正本は英語版です。この日本語版は参照用の翻訳で、内容が食い違う場合は英語版が優先されます。
更新日: 2026-10-01。このページは、2.6 系がどこまで進んだかを、項目ごとに証拠つきで 示します。このラインが何を建て、何をもって完了とするかは ラインのページ が、各リリースに何が入っているかは リリースノート が述べます。このページと リリースが食い違う場合、正しいのはリリースです。
2.6.0 はこのラインの最初の final リリースです。同じ日に 2.6.1、翌日 (2026-10-01) に 2.6.2、その翌日 (2026-10-02) に 2.6.3、2026-10-03 に 2.6.4 が続き、版を指定しない導入は 2.6.4 になります。
pre-release は 2.6.0aN と 2.6.0bN として PyPI にあります。2.5 系は Candidate になりました
(SUPPORT.md)。
4 つの状態¶
以下の各行は、このうち 1 つだけを持ちます。設計が機能として読まれないように、分けて あります。
| 状態 | 意味 |
|---|---|
| リリース済み | 公開されたリリースに入っている。誰でも導入して呼び出せる。 |
| 開発中 | master にコードはあるが、未リリースか、既定を決める測定がまだ無いままリリースされている。 |
| 研究中 | 仮説、実験、設計の比較の段階。サーバーのコードはまだ無い。 |
| 不採用・修正中 | 測って退けたか、誤りが見つかって設計し直している。これらの行はページに残します。 |
ラインの完了条件に対して¶
番号は 「完了」の意味 に従います。
| # | 条件 | 状態 | 証拠 |
|---|---|---|---|
| 1 | 想起プロセスと Cued Recall がゲートの背後で出荷される | リリース済み 2.6.0a8、v0.3 | ループの基本形: 呼び出し側は time_cue (いつ頃か、確かさつき) を渡せます。サーバーはその期間も件数と無関係な深さで探し、そこで見つかった行を品質ゲートの後に最大 3 / 2 / 1 段上げ、その検索が見つけて答えに入っていない記録 (件数で切られた記録を含む) に同じ数の行の別枠を取り、期間に何も無ければ 1 回だけ広げます (#325、#331–#333、#340、設計)。呼び出しごとの opt-in です。事前登録した判定則で LMEB の TMD (時期を述べる 1,167 問) に対して測り、返る行の NDCG の平均は手がかりありで 0.189 から 0.281 に、同じ数の手がかり無しの行では 0.204 になりました (結果)。LongMemEval では、前の方針は手がかり無しと区別できませんでした (結果)。手がかりの伝播と多段の停止は後続です。 |
| 2 | 最後の再ソートの扱いが決まっている | リリース済み 2.6.0a7 | confidence を有効にしても、confidence スコアは recall を並べ直さず、ゲートにも使われません。CPERSONA_CONFIDENCE_ORDERING=legacy で戻せます。far の重みと年齢の重みは、ゲートが通したものの順序だけを決める一本化した事前分布で、計測まで恒等の既定値です (#322、設計)。その後、far の重みを事前登録した判定則で測りました。reach 200,000 では、far リストが得る分を保ちつつ新しい答えを守れる一定の重みは無く、既定は 1 のままです (結果)。 |
| 3 | 深さと件数が分離されている | 2.6.0a2 で リリース済み | #274。CPERSONA_RECALL_DEPTH_FLOOR の既定は 0 で、測定で深さが選ばれるまで 2.5 系の結合を保ちます。 |
| 4 | 再構成想起がツールとして存在する | 2.6.0a2 で リリース済み、a3 で拡張 | ツール本体: #274。深さより広さ、payload の予算: #280、#286。item の形の統一と、何を落としたかを言う応答: #288、#289、#290。これまでの測定: 上限 1〜10 の count replay (記録自身が「既定を選ぶものではない」と述べています) と、事前登録した reader study。後者は 1 回目では reader が受け取る量が減らず、2 つの変更の後の再測定が、18 問で登録済みの判定則を満たしました。既定の件数は今も契約上の選択であり、測定された最適値ではありません。 |
| 5 | 適応的融合が両方のモデルで素の embedding を上回る | 研究中 | 設計と、その根拠である段ごとの損失の分析: #260、#261、設計記録。サーバーのコードはありません。 |
| 6 | ベンチマーク上のすべての失敗にコードと再生できる trace がある | 開発中 | 2.6.0a7 でリリース: 求めに応じて recall と reconstruct が各段の残した行・落とした行・並べ替えを記録として返し、benchmarks/ の道具が記録と正解の参照から確定した失敗コードを付けます (#324、設計)。すべてのベンチマーク上の失敗への適用はまだです。 |
| 7 | 精度・トークン・遅延・メモリのフロンティアが動いた | 研究中 | 1 軸を測りました。LMEB のうち、1 人の利用者の記憶を干し草の山にできる 15 タスクで、10 行の応答において、最良構成の 2.6.0 は最良構成の 2.5.12 より関連する記憶を上位に返しました。macro NDCG@10 は 57.36 → 59.12、上がったタスク 14・下がったタスク 1 で、事前登録した判定則によります (結果)。トークン・遅延・メモリは未測定なので、フロンティアはまだ示していません。 |
| 8 | 2.5 の baseline が抱える品質上の負債が、閉じられたか理由つきで持ち越された | 開発中 | ベンチマークの走行がどの較正の下で測られたかを、走行と一緒に記録するようになりました: #258。他の項目は未着手です。 |
完了条件の外で、このラインがリリースしたもの¶
| リリース | 追加したもの | 証拠 |
|---|---|---|
| 2.6.0a1 | 識別子を検索できるまま保つ全文検索の正規化 | #271 |
| 2.6.0a3 | 長いレコードを node に分け、検索索引の外に保つ。reconstruct の引用は最良の node から取る。レコードの一部を get_contents で展開する |
#282–#287、設計記録 |
| 2.6.0a4 | 宣言された連想記憶: エージェントが述べるエンティティ・別名・関係。reconstruct はそれを手がかりとして読み、有界にたどる。traverse は宣言された近傍を返す |
#291–#295、設計記録 |
| 2.6.0a7 | エピソード境界ペナルティを既定で無効化: セッションごとにエピソードの要約が残る記憶では、答えを持つ記録を順位の下へ押し下げていたため | #320 |
| 2.6.0a8 | opt-in の関連の別枠: 同じ recall をより深く並べた時に、答えの最初の行から導かれる行のために 1 行の別枠を取る (CPERSONA_RECALL_PROPAGATION_SEAT、既定は off) |
#338 |
| 2.6.0a8 | recall と reconstruct は各段を provider の枠を通して呼び、trace は宣言した予算と各段が受け取ったものを記録する。呼び出し側が受け取るものは変わらない | #335、#336 |
| 2.6.0b1 | 機能の追加はなし: 2.6.0a1〜a8 のレビューで見つかった MEDIUM の欠陥 11 件の修正。他のプロジェクトから読めていたプロジェクトの別名、引用から漏れていた次の行の限定句、段数に上限のなかった reconstruct のたどり、10 字ずれて測られていたエピソードの引用、読み手が拒否するのに誰も作り直さなかったノード集合などです |
#356, #357, #358, #359, #361 |
| 2.6.0b2 | 機能の追加はなし: 残っていた MEDIUM の欠陥 5 件の修正。ヘッダと本文が食い違いうるメモリ上 DB のエクスポート、毎クエリ読む行を 0 と報告していた索引の status、行の上限で切られても完全に見えていた一覧、長さに上限のなかった session_key、コピーが要る窓を丸ごと保持していた索引の経路などです |
#363, #364, #365, #366 |
| 2.6.0 | このラインの最初の final リリース。機能の追加はなし: Block による到達を既定で on にし、count を省略した reconstruct を 10 項目にし (この 2 つで、記憶から答えるためにこのリリースが推奨する構成になります)、alpha のレビューが登録した LOW の欠陥 43 件を修正。ノードの境界をまたいでいた Block の集合、表せる範囲を超えて例外になっていた時期の手がかり、待ち行列の全タスクを止めていた失敗する構築、どのゲートも認めていない脇の行に記録されていた recall の回数など。 |
|
| 2.6.1 | 実運用の報告から入れた修正と追加: サーバーが開いたままでも Windows で連続配置索引を再構築できる (bug-503)。recall のスコアが何を意味し、なぜ「一致するものは無い」を示せないか (契約 §12)。recall を促す Claude Code フックの例 (運用)。get_session_findings が準拠する SuperAuditor の版 (1.1) を示す |
#377、#378、#379、#380 |
| 2.6.2 | 1 ビット粗探索。既定は off (設計): 連続配置索引の隣に全レコードの 1 ビット索引。窓の外の席 = 走査窓の外のレコードのための 2 つの予約席 (CPERSONA_FAR_SEATS_ENABLED)。時間の手がかりの期間のうち、ベクトル側の上限を超えた残りの探索 (CPERSONA_CUE_COARSE_ENABLED)。候補数は事前登録した計測で 256 に決定 (結果)。ほかに recall の trace の網羅の台帳、空のクエリの時間の手がかりが期間のレコードをそれ自身の時刻順に並べる修正 (bug-502)、PyJWT 2.14.0 以上 |
#382, #383, #384, #387, #389, #390, #391, #392 |
| 2.6.3a1 | pre-release。保存するベクトルに、それを作ったモデルのラベルを付けます (スキーマ 18): バックエンドが GET /capabilities で返す指紋 (CEmbedding 0.9.0 以降)、それが無ければ api トランスポートが送るモデル名か設定したモデル名。別のモデルが書いたベクトルを check_health が報告し (embedding_model)、CPERSONA_EMBEDDING_MODEL_MODE=reject でそのベクトルを問いと比べなくなります。既定の warn は recall の結果を何も変えません (設定) |
#395 |
| 2.6.3 | 2.6.3a1 の final で、コードの変更はなし: 版を指定しない導入でも、保存するベクトルにモデルのラベルが付き、スキーマが 18 に移行します。2.6.3a1 を本番で 8 時間使い、再起動なし・エラーなし・新しいベクトルはすべてラベル付き、を確かめてから出しました | |
| 2.6.4a1 | pre-release。再構成想起 v1.2 (結果): Block を保存済みの int8 ベクトルで順位付けし、接する箇所は 1 つの引用にまとめ、先頭の引用の長さを項目の位置で決め (最初の CPERSONA_RECONSTRUCT_FULL_QUOTES (5) 項目は CPERSONA_RECONSTRUCT_QUOTE_CHARS (800)、それ以降は CPERSONA_RECONSTRUCT_TAIL_QUOTE_CHARS (400))、読み手が使わない欄を既定の応答から trace へ移します。非公開の実運用パックの test 150 問で、見える根拠の引用は 196 中 133 から 146 に増え、最初の応答の大きさの中央値は 2.6.3 の 0.662 倍になりました。ほかに check_health に coarse_index: 粗探索の設定が索引を読む間、無い・使えない索引を報告し、fix=true で作ります |
#398, #399 |
| 2.6.4a2 | pre-release。時間の手がかりは、期間のうち走査窓より後ろの部分を、既定で粗探索の索引を通して探します (CPERSONA_CUE_COARSE_ENABLED 未設定)。使える索引が無ければその部分は探さず、recall は設定を off にした時と同じになり、time_cue.remainder がそう伝えます。true は 2.6.2 の意味のままです (1 ビット粗探索)。索引を自動で作るものはありません。範囲が窓の外に 1,000 件以上の記録を持ち索引が無い recall には、エージェントが伝えるための suggestion がセッションごとに 1 回付き、この動き方だけが索引を読む間、check_health は索引の不在を info として報告します |
#405 |
| 2.6.4 | 2.6.4a2 の final で、コードの変更はなし: 版を指定しない導入でも、reconstruct がレコードの一致した部分を item の位置に応じた大きさで引用し、時間の手がかりの期間のうち走査窓より後ろの部分を、粗探索の索引があれば既定でそれを通して探します。2.6.4a2 を本番で 6 時間使い、再起動なし・エラーなしを確かめてから出しました |
連想の層はリリース済みで、既定では off です。既定にするかどうかは専用の A/B で決め ますが、その結果はまだ記録されていません。
不採用・修正中¶
| 何が | 何が起きたか | 証拠 |
|---|---|---|
| 適応的融合の reference panel (最初の仕様) | null を特定できませんでした。指定した 2 つの密度が同じ分布だったため、定義した証拠では、混合をそれ自身の null から区別できませんでした。この定義の上にコードが書かれる前に、定義を置き換えました。 | #262 |
rsf の固定の尺度 (bug-247 の修正) |
LongMemEval の 10 行で事前登録した判定則を満たしましたが、そこでは返す行も増えていました。LMEB Track B では 22 タスク中 19 で下がり (macro 58.53 → 57.51)、リリース前に元に戻しました。対象だったゲートの欠陥は未修正に戻っています。 | 結果 |
rsf のゲートだけを固定の尺度にし、順位はそのまま (bug-247 の第 2 案) |
事前登録した 2 つの判定則はどちらも満たしました (LMEB Track B で下がったタスクはなし、macro 57.96 → 57.97。LongMemEval の 10 行で下がった問いもなし)。それでも merge しませんでした。既定で動く校正済みの融合ゲートの下では、実運用の記憶を集めた非公開パックで、大半の答えを空にするか薄くする閾値を選んだためです (10 行で返る行 9.89 → 2.16、根拠への到達 389 件中 295 → 204)。bug-247 は未修正のままです。 | 結果 |
このページに無いもの¶
日付です。ロードマップ は記述的な文書で、このページもそれに従います。 行が動くのは、日付が来た時ではなく、証拠ができた時です。