MINARA

自我改进的 Agent

Agent 会回顾过去的决策、评估自己的推理,并沉淀经实践验证的有效规则

🔴 高级功能 : 四个独立学习循环。方法论注入和严格剧本执行默认启用,可通过 DISABLE_* 紧急停止开关关闭;学习循环和回测循环需通过 SCENARIO_LEARNING=1BACKTEST_ENABLED=1LEARNING_RECORD_USAGE=1 显式启用。详见 System Design → Memory。 Role Memory 是例外:默认 shadow,会生成和评价符合条件的人工案例,但绝不注入正式决策。

Minara Agent 不只执行指令,还能自我评分。过去的决策会与实际结果对账,规则通过观察正确率获得信任,重复出现的问题模式会转化为你可批准的新分析流。

你可以做什么

  • 反思过往交易 : 要求 Agent 回顾上周的仓位。它将每笔分类为逻辑错误、数据缺失、外生事件或随机波动,并记录可行的经验。
  • 查看哪些规则获得了信任 : 量化规则初始处于隔离状态,只有满足所选 benchmark profile 的版本化晋级策略才会正式化。二元 profile 可以使用 Wilson,多因子 profile 不会被强制压缩成该指标。
  • 批准它发现的新场景 : 当重复查询模式与内置场景不匹配时,Agent 会提议新场景并要求你批准。
  • 观察偏好演化 : 从对话中挖掘的隐含规则仅在你显式批准后才从 proposed 转变到 active

示例提示词

reflect on my last 5 BTC trades
which methodologies has the agent learned this week?
show pending scenario proposals
approve scenario SCENARIO_LEARNED_ONCHAIN_DEEPDIVE_042
what preferences are currently pending for me?
why did the agent quarantine the "MVRV below 1 = buy" rule?

示例输出

提示词show pending scenario proposals

Agent 响应

📋 3 scenarios pending approval

1. SCENARIO_LEARNED_ONCHAIN_DEEPDIVE_042 Clustered from 12 past misses with phrases like "on-chain flows," "whale accumulation," "exchange reserves"

  • Confidence (Wilson LB):0.62
  • Proposed playbook (summary):Fetch exchange reserve deltas + whale wallet aging + stable outflows;cross-check with funding rates
  • Times used in trial mode:14 (9 correct)

Reply /scenarios approve SCENARIO_LEARNED_ONCHAIN_DEEPDIVE_042 to graduate, or /scenarios reject <id> to dismiss.

命令

  • REPL:/scenarios pending/scenarios approve <id>/preferences pending/preferences approve <id>/reflect <role-id>
  • CLI:minara preferences
  • Methodology lint:npm run lint:methodology

安全策略

  • 场景学习和回测学习仍需显式开启;Role Memory 默认为不注入的 shadow
  • 正式化需要版本化 benchmark profile 声明的统计证据;Wilson 只适用于 binary outcome。
  • 降级自动触发(坏规则重新隔离,无需人工干预)。
  • 你始终是场景和偏好毕业的最后一道门槛。

工作原理

四个独立循环各有独立门槛:场景学习、基于 profile 的方法论评价与回测反馈、角色范围内的反思、偏好挖掘。Trading 与 role case 只接纳已结算的人工交易。System Design 的 Memory 小节 为每个循环提供专用设计文档:

  • Learning System : 工具序列学习、方法论存储、回测运行。
  • Role Memory : 每角色决策反思、两阶段 LLM 分类。
  • Scenario Classifier : 第二阶段自学习管道(提议 → 引导 → 正式化)。

4a. 偏好衔接(M4)

当偏好转入 active 状态::通过卡片批准流、手动 /preferences approve 或强信号自动激活路径::偏好桥接将其写入实际在提示词构建、工具调用、分类时消费它的存储:

  • personal_style → 标记为 metadata.layer="style"metadata.preference_idmemories 镜像。样式提示会出现在记忆快照和搜索中。
  • hard_constraint → 当偏好命名有效的 11 维 user_tags 目标且其结构化负载包含有效的枚举值时,桥接写入标记为 source="learned_preference" 的标签。该来源无法覆盖 source="user" 标签::显式用户设置始终优先。
  • behavioral_preference → scenario → 桥接记录 scenario_preference_boosts 条目。分类器在评分时将其关键字分数乘以每场景加权,所以偏好场景在平手时优先于竞争对手。
  • behavioral_preference → methodology → 桥接设置方法论行上的 preference_boost 乘数。retrieve() 在 ORDER BY 中应用它,所以偏好方法论在其等级内浮到顶部。
  • behavioral_preference → skill : 延迟处理。user_tags schema 目前拒绝任意标签名称,所以技能路由偏好暂时无法镜像到标签。M4.1 路径。

每次转出 active 状态(弃用/拒绝)都会撤销每次桥接写入。桥接写入采用尽力原则:失败通过 learning/preference-bridge logger 显示,永远不会阻止或回滚状态转换::偏好行是真实来源;桥接行是缓存视图。

安全防护

关于用户端"它记住你什么"的角度,见 Memory & Personalization。关于评分、框架归因及自动 perps 排除边界,见 Trading Memory

本页目录