自己改善型 Agent
Agent は過去の意思決定を振り返り、自分の推論を採点し、実際に機能したルールを昇格させます
🔴 上級者向け 4つの独立した学習ループを持ちます。メソドロジー インジェクションと厳密なプレイブック適用はデフォルトで有効になっており、
DISABLE_*無効化スイッチで無効化できます。学習・バックテストループはSCENARIO_LEARNING=1、BACKTEST_ENABLED=1、LEARNING_RECORD_USAGE=1による 明示的なオプトインが必要です。詳細は システム設計 → メモリ をご覧ください。 Role Memory は例外で、デフォルトはshadowです。対象の手動ケースを生成・評価しますが、正式な判断には注入しません。
Minara Agent は単に実行するだけでなく、自己採点も行います。過去の意思決定は 実際の結果と照らし合わせて検証され、ルールは観測された正解率によって信頼を 獲得し、繰り返しのクエリパターンは承認可能な新しい分析フローとして浮上します。
できること
- 過去の取引を振り返る 先週のポジションをレビューするよう Agent に依頼すると、各ポジションをロジックエラー・データ不足・外因性イベント・分散のいずれかに分類し、実行可能なレッスンを記録します。
- 信頼を獲得したルールを確認する 定量ルールは隔離状態から始まり、選択した benchmark profile のバージョン付き昇格 policy を満たした場合だけ昇格します。Binary profile は Wilson を利用できますが、多因子 profile はその指標に固定されません。
- Agent が発見した新しいシナリオを承認する 繰り返しのクエリパターンが既存のシナリオにマッチしない場合、Agent は新しいシナリオを提案し、承認を求めます。
- 嗜好進化を追う 会話から採掘されたアンビエントルールは、明示的な承認を経てのみ
proposed → activeへ移行します。
プロンプトの例
reflect on my last 5 BTC trades
which methodologies has the agent learned this week?
show pending scenario proposals
approve scenario SCENARIO_LEARNED_ONCHAIN_DEEPDIVE_042
what preferences are currently pending for me?
why did the agent quarantine the "MVRV below 1 = buy" rule?出力例
プロンプト: show pending scenario proposals
Agent の応答:
📋 3 scenarios pending approval:
1. SCENARIO_LEARNED_ONCHAIN_DEEPDIVE_042 Clustered from 12 past misses with phrases like "on-chain flows," "whale accumulation," "exchange reserves"
- Confidence (Wilson LB): 0.62
- Proposed playbook (summary): Fetch exchange reserve deltas + whale wallet aging + stable outflows; cross-check with funding rates
- Times used in trial mode: 14 (9 correct)
Reply
/scenarios approve SCENARIO_LEARNED_ONCHAIN_DEEPDIVE_042to graduate, or/scenarios reject <id>to dismiss.
コマンド
- REPL:
/scenarios pending、/scenarios approve <id>、/preferences pending、/preferences approve <id>、/reflect <role-id> - CLI:
minara preferences - メソドロジー lint:
npm run lint:methodology
セーフティの姿勢
- シナリオ学習と backtest 学習は opt-in のままです。Role Memory は非注入の
shadowがデフォルトです。 - 昇格にはバージョン付き benchmark profile が宣言する統計的根拠が必要です。Wilson は binary outcome だけに適用されます。
- 降格は自動的に行われます(不正なルールは人の介入なしに再隔離されます)。
- シナリオと嗜好の昇格における最終的な判断は、常にユーザーが行います。
構成
それぞれ独立した昇格ゲートを持つ4つのループで構成されています。シナリオ学習、profile ベースのメソドロジー評価と backtest feedback、role-scope reflection、嗜好採掘です。Trading case と role case は決済済み手動取引だけを受け入れます。各ループについては、システム設計のメモリサブセクションに専用の設計文書があります。
- 学習システム ツール実行シーケンスの学習・メソドロジーストア・バックテストランナー。
- ロールメモリ ロール単位の意思決定リフレクション、2ステージ LLM 分類器。
- シナリオ分類器 フェーズ2の自己学習パイプライン(propose → bootstrap → graduate)。
4a. 嗜好ブリッジ(M4)
嗜好が active へ移行するタイミング(カード承認フロー、手動の /preferences approve、または強シグナルによる自動アクティベーションパス)に、嗜好ブリッジはその内容をプロンプトビルド・ツール呼び出し・分類器の実行時に実際に参照されるストアへ書き込みます。
personal_style→metadata.layer="style"とmetadata.preference_idタグを持つmemoriesミラーを生成します。スタイルのヒントはメモリスナップショットと検索に反映されます。hard_constraint→ 嗜好が有効な11次元のuser_tagsターゲットを指定し、かつ構造化ペイロードに有効な enum 値が含まれている場合、ブリッジはsource="learned_preference"としてタグを書き込みます。このソースはsource="user"タグを上書きできません。ユーザーの明示的な設定が常に優先されます。behavioral_preference → scenario→ ブリッジはscenario_preference_boostsエントリを記録します。分類器はスコアリング時にキーワードスコアをシナリオごとのブースト値で乗算するため、優先シナリオは同スコアの競合より上位に移動します。behavioral_preference → methodology→ ブリッジはメソドロジー行にpreference_boost乗数を設定します。retrieve()は ORDER BY においてこれを適用するため、優先されたメソドロジーは同ティア内で上位に浮上します。behavioral_preference → skill→ 保留中です。現在user_tagsスキーマは任意のタグ名を拒否するため、スキルルーティングの嗜好はタグにミラーリングできません。M4.1 パスで対応予定です。
active からの移行(deprecate / reject)はすべてのブリッジ書き込みを元に戻します。ブリッジ書き込みはベストエフォートです。失敗は learning/preference-bridge ロガーに記録され、状態遷移をブロックしたりロールバックしたりすることはありません。嗜好行が信頼できる情報源であり、ブリッジ行はキャッシュされたビューです。
セーフティレール
ユーザー向けの「Agent が記憶している内容」については、 メモリとパーソナライゼーション をご覧ください。 評価、フレームワーク帰属、自動 perps の除外境界は Trading Memory を参照してください。