自我改进的 Agent
Agent 会回顾过去的决策、评估自己的推理,并沉淀经实践验证的有效规则
🔴 高级功能 : 四个独立学习循环。方法论注入和严格剧本执行默认启用,可通过
DISABLE_*紧急停止开关关闭;学习循环和回测循环需通过SCENARIO_LEARNING=1、BACKTEST_ENABLED=1、LEARNING_RECORD_USAGE=1显式启用。详见 System Design → Memory。 Role Memory 是例外:默认shadow,会生成和评价符合条件的人工案例,但绝不注入正式决策。
Minara Agent 不只执行指令,还能自我评分。过去的决策会与实际结果对账,规则通过观察正确率获得信任,重复出现的问题模式会转化为你可批准的新分析流。
你可以做什么
- 反思过往交易 : 要求 Agent 回顾上周的仓位。它将每笔分类为逻辑错误、数据缺失、外生事件或随机波动,并记录可行的经验。
- 查看哪些规则获得了信任 : 量化规则初始处于隔离状态,只有满足所选 benchmark profile 的版本化晋级策略才会正式化。二元 profile 可以使用 Wilson,多因子 profile 不会被强制压缩成该指标。
- 批准它发现的新场景 : 当重复查询模式与内置场景不匹配时,Agent 会提议新场景并要求你批准。
- 观察偏好演化 : 从对话中挖掘的隐含规则仅在你显式批准后才从
proposed转变到active。
示例提示词
reflect on my last 5 BTC trades
which methodologies has the agent learned this week?
show pending scenario proposals
approve scenario SCENARIO_LEARNED_ONCHAIN_DEEPDIVE_042
what preferences are currently pending for me?
why did the agent quarantine the "MVRV below 1 = buy" rule?示例输出
提示词:show pending scenario proposals
Agent 响应:
📋 3 scenarios pending approval:
1. SCENARIO_LEARNED_ONCHAIN_DEEPDIVE_042 Clustered from 12 past misses with phrases like "on-chain flows," "whale accumulation," "exchange reserves"
- Confidence (Wilson LB):0.62
- Proposed playbook (summary):Fetch exchange reserve deltas + whale wallet aging + stable outflows;cross-check with funding rates
- Times used in trial mode:14 (9 correct)
Reply
/scenarios approve SCENARIO_LEARNED_ONCHAIN_DEEPDIVE_042to graduate, or/scenarios reject <id>to dismiss.
命令
- REPL:
/scenarios pending、/scenarios approve <id>、/preferences pending、/preferences approve <id>、/reflect <role-id> - CLI:
minara preferences - Methodology lint:
npm run lint:methodology
安全策略
- 场景学习和回测学习仍需显式开启;Role Memory 默认为不注入的
shadow。 - 正式化需要版本化 benchmark profile 声明的统计证据;Wilson 只适用于 binary outcome。
- 降级自动触发(坏规则重新隔离,无需人工干预)。
- 你始终是场景和偏好毕业的最后一道门槛。
工作原理
四个独立循环各有独立门槛:场景学习、基于 profile 的方法论评价与回测反馈、角色范围内的反思、偏好挖掘。Trading 与 role case 只接纳已结算的人工交易。System Design 的 Memory 小节 为每个循环提供专用设计文档:
- Learning System : 工具序列学习、方法论存储、回测运行。
- Role Memory : 每角色决策反思、两阶段 LLM 分类。
- Scenario Classifier : 第二阶段自学习管道(提议 → 引导 → 正式化)。
4a. 偏好衔接(M4)
当偏好转入 active 状态::通过卡片批准流、手动 /preferences approve 或强信号自动激活路径::偏好桥接将其写入实际在提示词构建、工具调用、分类时消费它的存储:
personal_style→ 标记为metadata.layer="style"和metadata.preference_id的memories镜像。样式提示会出现在记忆快照和搜索中。hard_constraint→ 当偏好命名有效的 11 维user_tags目标且其结构化负载包含有效的枚举值时,桥接写入标记为source="learned_preference"的标签。该来源无法覆盖source="user"标签::显式用户设置始终优先。behavioral_preference → scenario→ 桥接记录scenario_preference_boosts条目。分类器在评分时将其关键字分数乘以每场景加权,所以偏好场景在平手时优先于竞争对手。behavioral_preference → methodology→ 桥接设置方法论行上的preference_boost乘数。retrieve()在 ORDER BY 中应用它,所以偏好方法论在其等级内浮到顶部。behavioral_preference → skill: 延迟处理。user_tagsschema 目前拒绝任意标签名称,所以技能路由偏好暂时无法镜像到标签。M4.1 路径。
每次转出 active 状态(弃用/拒绝)都会撤销每次桥接写入。桥接写入采用尽力原则:失败通过 learning/preference-bridge logger 显示,永远不会阻止或回滚状态转换::偏好行是真实来源;桥接行是缓存视图。
安全防护
关于用户端"它记住你什么"的角度,见 Memory & Personalization。关于评分、框架归因及自动 perps 排除边界,见 Trading Memory。