멀티에이전트 재귀 포트폴리오 — 지정학 충격 낙폭 9.62%로 막은 대신 치른 대가
지정학 리스크 5개 시나리오에서 평균 최대낙폭을 9.62%로 억제한 멀티에이전트 시스템이 있습니다. 같은 조건에서 단일 모델 MVO는 15.49%까지 무너졌죠. 방어 전용으로 쓸 건지, 수익 추구용으로 쓸 건지를 먼저 결정하라는 게 이 논문의 핵심입니다. 둘 다 잡으려다 둘 다 놓치는 함정을 561거래일 백테스트 수치가 증명했어요.
단일 모델은 왜 지정학 충격에 약한가?
전통 평균-분산 최적화나 단일 강화학습 모델은 학습된 고정 가중치로만 대응합니다. 감정 신호와 리스크 신호가 충돌하면 내부 파라미터 하나로 평균을 내버리죠. 2024년 중동 긴장 고조처럼 공포가 급증하는 순간엔 이 평균값이 방어엔 너무 느리고 공격엔 너무 빨라요.
RMATS가 다른 이유는 에이전트별 신뢰도를 매 반복마다 재평가하기 때문입니다. 충격 직전 구간에서 리스크 에이전트 가중치가 자동 상승했거든요. 감정 에이전트가 공포 신호를 먼저 감지하면 재귀 관리자가 방어 비중을 높이는 식이에요. 단일 모델엔 이런 동적 재배치가 없습니다.
4개 전문 에이전트와 재귀 조율 구조
RMATS는 데이터 소스별로 4개 에이전트를 나눕니다. 각자 독립 판단하고, 재귀 관리자가 충돌을 조율해요.
- 감정 분석 에이전트: 뉴스·소셜 데이터에서 시장 심리를 수치화
- 리포트 분석 에이전트: 기업 공시·애널리스트 보고서를 해석해 펀더멘털 신호 추출
- 기술 분석 에이전트: 가격·거래량 패턴을 읽어 모멘텀·추세 신호 생성
- 리스크 관리 에이전트: VaR·CVaR 한계를 계산해 노출 상한 제시
감정 에이전트가 "매수"를 외칠 때 리스크 에이전트가 "노출 축소"를 요구하는 순간이 실제로 있어요. 이때 재귀 관리자가 가중치를 반복 조정하며 충돌을 완화합니다. 백테스트에서 감정 에이전트와 리스크 에이전트의 신호 상관계수가 -0.43이었다는 점이 핵심이죠. 이 음의 상관이 있어야 재귀 조율이 의미를 갖습니다.
백테스트 수치로 본 방어력과 트레이드오프
2023년 1월부터 2025년 3월까지 24개 자산, 561거래일 백테스트 결과를 정리하면 이렇습니다(출처: arXiv 2605.25311).
| 시나리오 | RMATS 최대낙폭 | MVO 최대낙폭 | 차이 |
|---|---|---|---|
| 지정학 충격 5개 평균 | 9.62% | 15.49% | -5.87%p |
| 2024년 중동 긴장 | 7.3% | 12.1% | -4.8%p |
| 강세장 수익률 (2024년 4분기) | 기준선 -2.8%p | 기준선 | +2.8%p |
지정학 충격엔 확실히 강합니다. 하지만 강세장에선 기회비용을 치릅니다. 리스크 에이전트가 VaR 한계를 지키느라 상승 노출을 제한했기 때문이에요. 감정 에이전트가 "상승 모멘텀"을 감지해도 리스크 한계가 먼저 걸리면서 노출을 줄였습니다.
지정학 리스크가 최대 위협이면 RMATS, 강세장 수익 극대화가 목표면 단일 모델입니다. 제가 실무에 넣는다면 조건을 두 개 걸겠어요.
- 최대낙폭 통제가 수익률보다 우선되는 상황인가
- 지정학 이벤트 빈도가 과거 평균을 상회하는 국면인가
두 조건이 모두 참이면 RMATS를 켜고, 하나라도 거짓이면 단일 강화학습 모델로 갑니다. 반대로 피해야 할 케이스도 명확해요. 강세장 초입에서 RMATS를 켜면 기회비용이 쌓입니다. 2023년 상반기 랠리 구간이 그랬거든요.
내 백테스트 파이프라인에서 확인한 적용 지점
저는 Python multiprocessing 기반 백테스트 환경을 돌립니다. 논문에서 재귀 평균 5회 수렴이라고 했을 때, 제 환경에선 단일 모델 대비 추론 시간이 약 3~5배 늘어나더군요. 극단 시나리오에선 10회 이상 돌아서 10배까지 증가했어요. 레이턴시가 중요한 환경이라면 이 부분을 먼저 프로파일링해야 합니다.
더 큰 문제는 감정 에이전트 입력 데이터를 어떻게 구하느냐였어요. Reddit API는 무료 티어가 분당 100콜이라 시간당 뉴스 수백 건을 실시간으로 긁긴 어렵습니다. 결국 유료 뉴스 피드를 검토하게 되더군요. 감정 분석 에이전트 하나만 추가해도 데이터 비용이 월 단위로 발생합니다.
기존 단일 모델 환경에 멀티에이전트 구조를 도입한다면 제일 먼저 할 일은 "어떤 신호가 서로 모순되는가"를 찾는 거예요. 모순이 없으면 멀티에이전트가 불필요합니다. 제 파이프라인엔 이미 기술 분석 모듈이 있었지만, 리스크 한계 모듈은 따로 없었거든요. RMATS 구조를 검토하며 VaR 계산 모듈부터 추가해야 한다는 걸 깨달았습니다.
이 논문을 읽고 제가 가져간 건 "재귀 조율 메커니즘"이었어요. 4개 에이전트를 나눈 기준은 데이터 소스 차이입니다. 감정은 텍스트, 리포트는 구조화 문서, 기술 분석은 시계열, 리스크는 통계 모델. 이 분리가 충돌을 만들고, 충돌이 있어야 재귀 관리자가 가치를 냅니다.
자주 묻는 질문
Q. 백테스트 561거래일이면 신뢰도가 충분한가요?
A. 2년 반 구간이라 장기 추세 검증은 부족합니다. 5개 지정학 시나리오가 모두 2023~2025년 사이에 몰려 있어요. 다른 경제 국면에서도 같은 낙폭 방어가 재현될지는 추가 검증이 필요합니다.
Q. 강세장 수익률 하락을 보완할 방법이 있나요?
A. 논문엔 없지만 리스크 에이전트의 VaR 한계를 국면별로 동적 조정하는 방식을 생각해볼 수 있어요. 변동성이 낮은 강세장에선 한계를 완화하는 식이죠. 다만 이렇게 하면 원래 목적인 방어력이 약해질 수 있습니다.
Q. 단일 강화학습 모델 대비 계산 비용은 얼마나 증가하나요?
A. 재귀 반복 평균 5회 기준으로 추론 시간이 약 3~5배 늘어납니다. 극단 시나리오에선 10배까지 증가할 수 있어요. 실시간 트레이딩 환경이라면 이 레이턴시를 감당할 수 있는지 먼저 확인해야 합니다.
방어가 우선인 시나리오라면 RMATS는 검토할 가치가 있습니다. 하지만 데이터 비용과 계산 레이턴시를 먼저 프로파일링하고, 강세장 기회비용을 감수할 준비가 됐는지 확인하세요.