MINARA

自我改進的 Agent

Agent 會回顧過去的決策、評估自己的推理,並沉澱經實踐驗證的有效規則

🔴 高級功能 : 四個獨立學習循環。方法論注入和嚴格劇本執行默認啟用,可通過 DISABLE_* 緊急停止開關關閉;學習循環和回測循環需通過 SCENARIO_LEARNING=1BACKTEST_ENABLED=1LEARNING_RECORD_USAGE=1 顯式啟用。詳見 System Design → Memory。 Role Memory 是例外:默認 shadow,會生成和評價符合條件的人工案例,但絕不注入正式決策。

Minara Agent 不只執行指令,還能自我評分。過去的決策會與實際結果對賬,規則通過觀察正確率獲得信任,重複出現的問題模式會轉化為你可批准的新分析流。

你可以做什麼

  • 反思過往交易 : 要求 Agent 回顧上週的倉位。它將每筆分類為邏輯錯誤、數據缺失、外生事件或隨機波動,並記錄可行的經驗。
  • 查看哪些規則獲得了信任 : 量化規則初始處於隔離狀態,只有滿足所選 benchmark profile 的版本化晉級策略才會正式化。二元 profile 可以使用 Wilson,多因子 profile 不會被強制壓縮成該指標。
  • 批准它發現的新場景 : 當重複查詢模式與內置場景不匹配時,Agent 會提議新場景並要求你批准。
  • 觀察偏好演化 : 從對話中挖掘的隱含規則僅在你顯式批准後才從 proposed 轉變到 active

示例提示詞

reflect on my last 5 BTC trades
which methodologies has the agent learned this week?
show pending scenario proposals
approve scenario SCENARIO_LEARNED_ONCHAIN_DEEPDIVE_042
what preferences are currently pending for me?
why did the agent quarantine the "MVRV below 1 = buy" rule?

示例輸出

提示詞show pending scenario proposals

Agent 響應

📋 3 scenarios pending approval

1. SCENARIO_LEARNED_ONCHAIN_DEEPDIVE_042 Clustered from 12 past misses with phrases like "on-chain flows," "whale accumulation," "exchange reserves"

  • Confidence (Wilson LB):0.62
  • Proposed playbook (summary):Fetch exchange reserve deltas + whale wallet aging + stable outflows;cross-check with funding rates
  • Times used in trial mode:14 (9 correct)

Reply /scenarios approve SCENARIO_LEARNED_ONCHAIN_DEEPDIVE_042 to graduate, or /scenarios reject <id> to dismiss.

命令

  • REPL:/scenarios pending/scenarios approve <id>/preferences pending/preferences approve <id>/reflect <role-id>
  • CLI:minara preferences
  • Methodology lint:npm run lint:methodology

安全策略

  • 場景學習和回測學習仍需顯式開啟;Role Memory 默認為不注入的 shadow
  • 正式化需要版本化 benchmark profile 聲明的統計證據;Wilson 只適用於 binary outcome。
  • 降級自動觸發(壞規則重新隔離,無需人工干預)。
  • 你始終是場景和偏好畢業的最後一道門檻。

工作原理

四個獨立循環各有獨立門檻:場景學習、基於 profile 的方法論評價與回測反饋、角色範圍內的反思、偏好挖掘。Trading 與 role case 只接納已結算的人工交易。System Design 的 Memory 小節 為每個循環提供專用設計文檔:

  • Learning System : 工具序列學習、方法論存儲、回測運行。
  • Role Memory : 每角色決策反思、兩階段 LLM 分類。
  • Scenario Classifier : 第二階段自學習管道(提議 → 引導 → 正式化)。

4a. 偏好銜接(M4)

當偏好轉入 active 狀態::通過卡片批准流、手動 /preferences approve 或強信號自動激活路徑::偏好橋接將其寫入實際在提示詞構建、工具調用、分類時消費它的存儲:

  • personal_style → 標記為 metadata.layer="style"metadata.preference_idmemories 鏡像。樣式提示會出現在記憶快照和搜索中。
  • hard_constraint → 當偏好命名有效的 11 維 user_tags 目標且其結構化負載包含有效的枚舉值時,橋接寫入標記為 source="learned_preference" 的標籤。該來源無法覆蓋 source="user" 標籤::顯式用戶設置始終優先。
  • behavioral_preference → scenario → 橋接記錄 scenario_preference_boosts 條目。分類器在評分時將其關鍵字分數乘以每場景加權,所以偏好場景在平手時優先於競爭對手。
  • behavioral_preference → methodology → 橋接設置方法論行上的 preference_boost 乘數。retrieve() 在 ORDER BY 中應用它,所以偏好方法論在其等級內浮到頂部。
  • behavioral_preference → skill : 延遲處理。user_tags schema 目前拒絕任意標籤名稱,所以技能路由偏好暫時無法鏡像到標籤。M4.1 路徑。

每次轉出 active 狀態(棄用/拒絕)都會撤銷每次橋接寫入。橋接寫入採用盡力原則:失敗通過 learning/preference-bridge logger 顯示,永遠不會阻止或回滾狀態轉換::偏好行是真實來源;橋接行是緩存視圖。

安全防護

關於用戶端"它記住你什麼"的角度,見 Memory & Personalization。關於評分、框架歸因及自動 perps 排除邊界,見 Trading Memory

本頁目錄