自我改進的 Agent
Agent 會回顧過去的決策、評估自己的推理,並沉澱經實踐驗證的有效規則
🔴 高級功能 : 四個獨立學習循環。方法論注入和嚴格劇本執行默認啟用,可通過
DISABLE_*緊急停止開關關閉;學習循環和回測循環需通過SCENARIO_LEARNING=1、BACKTEST_ENABLED=1、LEARNING_RECORD_USAGE=1顯式啟用。詳見 System Design → Memory。 Role Memory 是例外:默認shadow,會生成和評價符合條件的人工案例,但絕不注入正式決策。
Minara Agent 不只執行指令,還能自我評分。過去的決策會與實際結果對賬,規則通過觀察正確率獲得信任,重複出現的問題模式會轉化為你可批准的新分析流。
你可以做什麼
- 反思過往交易 : 要求 Agent 回顧上週的倉位。它將每筆分類為邏輯錯誤、數據缺失、外生事件或隨機波動,並記錄可行的經驗。
- 查看哪些規則獲得了信任 : 量化規則初始處於隔離狀態,只有滿足所選 benchmark profile 的版本化晉級策略才會正式化。二元 profile 可以使用 Wilson,多因子 profile 不會被強制壓縮成該指標。
- 批准它發現的新場景 : 當重複查詢模式與內置場景不匹配時,Agent 會提議新場景並要求你批准。
- 觀察偏好演化 : 從對話中挖掘的隱含規則僅在你顯式批准後才從
proposed轉變到active。
示例提示詞
reflect on my last 5 BTC trades
which methodologies has the agent learned this week?
show pending scenario proposals
approve scenario SCENARIO_LEARNED_ONCHAIN_DEEPDIVE_042
what preferences are currently pending for me?
why did the agent quarantine the "MVRV below 1 = buy" rule?示例輸出
提示詞:show pending scenario proposals
Agent 響應:
📋 3 scenarios pending approval:
1. SCENARIO_LEARNED_ONCHAIN_DEEPDIVE_042 Clustered from 12 past misses with phrases like "on-chain flows," "whale accumulation," "exchange reserves"
- Confidence (Wilson LB):0.62
- Proposed playbook (summary):Fetch exchange reserve deltas + whale wallet aging + stable outflows;cross-check with funding rates
- Times used in trial mode:14 (9 correct)
Reply
/scenarios approve SCENARIO_LEARNED_ONCHAIN_DEEPDIVE_042to graduate, or/scenarios reject <id>to dismiss.
命令
- REPL:
/scenarios pending、/scenarios approve <id>、/preferences pending、/preferences approve <id>、/reflect <role-id> - CLI:
minara preferences - Methodology lint:
npm run lint:methodology
安全策略
- 場景學習和回測學習仍需顯式開啟;Role Memory 默認為不注入的
shadow。 - 正式化需要版本化 benchmark profile 聲明的統計證據;Wilson 只適用於 binary outcome。
- 降級自動觸發(壞規則重新隔離,無需人工干預)。
- 你始終是場景和偏好畢業的最後一道門檻。
工作原理
四個獨立循環各有獨立門檻:場景學習、基於 profile 的方法論評價與回測反饋、角色範圍內的反思、偏好挖掘。Trading 與 role case 只接納已結算的人工交易。System Design 的 Memory 小節 為每個循環提供專用設計文檔:
- Learning System : 工具序列學習、方法論存儲、回測運行。
- Role Memory : 每角色決策反思、兩階段 LLM 分類。
- Scenario Classifier : 第二階段自學習管道(提議 → 引導 → 正式化)。
4a. 偏好銜接(M4)
當偏好轉入 active 狀態::通過卡片批准流、手動 /preferences approve 或強信號自動激活路徑::偏好橋接將其寫入實際在提示詞構建、工具調用、分類時消費它的存儲:
personal_style→ 標記為metadata.layer="style"和metadata.preference_id的memories鏡像。樣式提示會出現在記憶快照和搜索中。hard_constraint→ 當偏好命名有效的 11 維user_tags目標且其結構化負載包含有效的枚舉值時,橋接寫入標記為source="learned_preference"的標籤。該來源無法覆蓋source="user"標籤::顯式用戶設置始終優先。behavioral_preference → scenario→ 橋接記錄scenario_preference_boosts條目。分類器在評分時將其關鍵字分數乘以每場景加權,所以偏好場景在平手時優先於競爭對手。behavioral_preference → methodology→ 橋接設置方法論行上的preference_boost乘數。retrieve()在 ORDER BY 中應用它,所以偏好方法論在其等級內浮到頂部。behavioral_preference → skill: 延遲處理。user_tagsschema 目前拒絕任意標籤名稱,所以技能路由偏好暫時無法鏡像到標籤。M4.1 路徑。
每次轉出 active 狀態(棄用/拒絕)都會撤銷每次橋接寫入。橋接寫入採用盡力原則:失敗通過 learning/preference-bridge logger 顯示,永遠不會阻止或回滾狀態轉換::偏好行是真實來源;橋接行是緩存視圖。
安全防護
關於用戶端"它記住你什麼"的角度,見 Memory & Personalization。關於評分、框架歸因及自動 perps 排除邊界,見 Trading Memory。