MINARA

자기 개선 Agent

Agent가 과거 결정을 반성하고, 자체 추론을 평가하며, 실제로 효과 있는 규칙을 졸업시키는 방법을 설명합니다.

🔴 고급 : 독립적인 학습 루프 4개로 구성됩니다. 방법론 주입과 엄격한 플레이북 적용은 기본 활성화 상태이며, DISABLE_* 비활성화 스위치로 비활성화할 수 있습니다. 학습/백테스트 루프는 SCENARIO_LEARNING=1, BACKTEST_ENABLED=1, LEARNING_RECORD_USAGE=1 환경 변수를 통해 명시적으로 활성화해야 합니다. 자세한 내용은 시스템 설계 → 메모리를 참조하십시오. Role Memory는 예외로 기본값이 shadow입니다. 대상 수동 사례를 생성·평가하지만 공식 결정에는 주입하지 않습니다.

Minara Agent는 단순히 실행하는 데 그치지 않습니다. 과거 결정을 실제 결과와 대조하여 평가하고, 규칙은 관찰된 정확도를 통해 신뢰를 획득하며, 반복되는 질문 패턴은 새로운 분석 흐름으로 표면화되어 사용자가 승인할 수 있습니다.

사용 가능한 기능

  • 과거 거래 반성 : 지난주 포지션 검토를 요청하면, Agent가 각 건을 논리 오류, 데이터 누락, 외부 이벤트, 분산 중 하나로 분류하고 실행 가능한 교훈을 기록합니다.
  • 신뢰를 획득한 규칙 확인 : 정량 규칙은 격리 상태로 시작하고 선택한 benchmark profile의 버전이 지정된 승급 policy를 만족할 때만 졸업합니다. Binary profile은 Wilson을 사용할 수 있지만 다요인 profile은 해당 지표에 고정되지 않습니다.
  • 발견한 새 시나리오 승인 : 반복되는 쿼리 패턴이 기본 제공 시나리오와 일치하지 않을 경우, Agent가 새 시나리오를 제안하고 사용자의 승인을 요청합니다.
  • 선호도 진화 관찰 : 대화에서 추출한 주변 규칙은 사용자의 명시적 승인이 있을 때만 proposed → active로 전환됩니다.

예시 프롬프트

reflect on my last 5 BTC trades
which methodologies has the agent learned this week?
show pending scenario proposals
approve scenario SCENARIO_LEARNED_ONCHAIN_DEEPDIVE_042
what preferences are currently pending for me?
why did the agent quarantine the "MVRV below 1 = buy" rule?

예시 출력

프롬프트: show pending scenario proposals

Agent 응답:

📋 승인 대기 중인 시나리오 3개:

1. SCENARIO_LEARNED_ONCHAIN_DEEPDIVE_042 "on-chain flows", "whale accumulation", "exchange reserves" 등의 표현이 포함된 과거 미스 12건을 클러스터링하여 도출

  • 신뢰도(Wilson 하한): 0.62
  • 제안 플레이북(요약): 거래소 보유량 변화 + 고래 지갑 에이징 + 스테이블 유출을 조회한 후 펀딩 비율과 교차 검증
  • 트라이얼 모드 사용 횟수: 14회(9회 정확)

/scenarios approve SCENARIO_LEARNED_ONCHAIN_DEEPDIVE_042 로 졸업하거나, /scenarios reject <id> 로 기각하십시오.

명령어

  • REPL: /scenarios pending, /scenarios approve <id>, /preferences pending, /preferences approve <id>, /reflect <role-id>
  • CLI: minara preferences
  • 방법론 린트: npm run lint:methodology

안전 기본 설정

  • 시나리오 및 backtest 학습은 opt-in이며 Role Memory는 주입하지 않는 shadow가 기본값입니다.
  • 졸업에는 버전이 지정된 benchmark profile이 선언한 통계적 근거가 필요합니다. Wilson은 binary outcome에만 적용됩니다.
  • 강등은 자동으로 이루어집니다. 불량 규칙은 사람의 개입 없이 다시 격리됩니다.
  • 시나리오 및 선호도 졸업의 최종 승인권은 항상 사용자에게 있습니다.

구현 방식

4개의 독립적인 루프가 각자의 졸업 관문을 가지고 있습니다. 시나리오 학습, profile 기반 방법론 평가와 backtest feedback, 역할 범위 반성, 선호도 마이닝입니다. Trading case와 role case는 정산된 수동 거래만 허용합니다. 각각은 시스템 설계의 메모리 섹션에 전용 설계 문서가 있습니다.

4a. 선호도 브리지 (M4)

선호도가 카드 승인 흐름, 수동 /preferences approve, 또는 강한 신호 자동 활성화 경로를 통해 active 상태로 전환되면, 선호도 브리지가 이를 프롬프트 빌드 / 도구 호출 / 분류기 실행 시점에 실제로 소비하는 저장소에 기록합니다.

  • personal_style: metadata.layer="style"metadata.preference_id 태그가 부여된 memories 미러를 생성합니다. 스타일 힌트는 메모리 스냅샷과 검색에 반영됩니다.
  • hard_constraint: 선호도가 유효한 11차원 user_tags 대상을 명시하고, 구조화된 페이로드에 유효한 열거형 값이 포함된 경우, source="learned_preference"로 태그를 기록합니다. 이 소스는 source="user" 태그를 덮어쓸 수 없습니다. 사용자가 명시적으로 설정한 값은 항상 우선합니다.
  • behavioral_preference → scenario: 브리지가 scenario_preference_boosts 항목을 기록합니다. 분류기는 점수 산정 시 키워드 점수에 시나리오별 부스트를 곱하므로, 선호 시나리오는 동점 경쟁자보다 앞에 위치합니다.
  • behavioral_preference → methodology: 브리지가 방법론 행에 preference_boost 배수를 설정합니다. retrieve()는 ORDER BY 절에 이를 적용하므로, 선호 방법론이 같은 등급 내에서 상위로 부상합니다.
  • behavioral_preference → skill: 보류 중입니다. 현재 user_tags 스키마는 임의 태그 이름을 허용하지 않으므로, 스킬 라우팅 선호도는 태그로 미러링할 수 없습니다. M4.1 경로에서 처리될 예정입니다.

active 상태에서 벗어나는 모든 전환(deprecate / reject)은 모든 브리지 기록을 되돌립니다. 브리지 기록은 최선 시도(best-effort) 방식으로 수행됩니다. 실패 시 learning/preference-bridge 로거를 통해 보고되며, 상태 전환을 차단하거나 되돌리지 않습니다. 선호도 행이 진실의 원천이며, 브리지 행은 캐시된 뷰입니다.

안전 장치

사용자 관점에서 "Agent가 기억하는 것"에 대한 내용은 메모리 및 개인화를 참조하십시오. 평가, 프레임워크 귀속, 자동 perps 제외 경계는 Trading Memory를 참조하십시오.

목차