Orchestrator model cost 35% more, not less
0 조회
지난 3개월간 블로그 자동발행 파이프라인을 운영하면서 매일 비용 대시보드를 들여다봤어요. Lion 오케스트레이터가 17마리 에이전트에게 작업을 위임하는 구조인데, 초기 설계 의도는 "비싼 모델은 조율만, 실제 작업은 싼 모델로 분산해서 비용을 줄이자"였거든요. 그런데 실제로는 단일 모델 직접 실행보다 토큰 소모가 늘었습니다. Reddit 커뮤니티에서 공유된 4쌍 통제실험도 같은 패턴을 보여줬어요. 리서치 태스크 기준으로 단독 실행은 16.84달러, 오케스트레이션 구조는 22.71달러가 들었다고 합니다. 출처: Orchestrator model cost 35% more, not less (Reddit, 2026). 위임 오버헤드가 모델 단가 차이를 잡아먹는 구조에서는 멀티 모델 전략이 오히려 비용 함정이 됩니다.
왜 오케스트레이션이 비용을 늘리나요?
우리 파이프라인 운영에서 관찰한 바로는, Lion 조율 레이어가 전체 토큰의 18% 정도를 차지했어요. 실제 콘텐츠 생성이 아니라 "누구한테 뭘 시킬지" 결정하는 데 쓴 토큰이죠. 워커 에이전트들이 작업을 받을 때마다 컨텍스트를 중복으로 전달하니까, 같은 니치 정의를 하루에 3번씩 주입하는 꼴이었습니다.
오버헤드는 세 가지로 나타나더라고요. 컨텍스트 중복 전달이 첫 번째예요. 오케스트레이터가 워커한테 배경 설명을 붙여서 보내면, 워커는 그 설명을 또 읽어야 하거든요. 두 번째는 조율 판단 자체가 프롬프트 토큰을 먹는다는 점이에요. 세 번째는 재시도 루프입니다. 워커가 실패하면 오케스트레이터가 다시 지시를 내리는데, 이때 이전 실패 로그까지 컨텍스트에 붙으니까 토큰이 불어나요.
그럼 언제 멀티 에이전트가 정당화되나요?
저는 두 가지 조건에서만 오케스트레이션 비용을 감수할 가치가 있다고 봐요. 하나는 전문성 분리가 명확할 때입니다. 우리 파이프라인에서 Eagle(사실확인)과 Swan(편집) 같은 검증자는 각자 다른 룰을 적용하거든요. 이걸 하나의 프롬프트에 우겨넣으면 충돌이 생겨요. 분리했더니 재작업 비율이 꽤 떨어지더라고요.
다른 하나는 병렬 처리가 시간 병목을 깨뜨릴 때예요. 비용은 늘어도 런타임이 절반으로 줄면, 시간당 처리량으로는 이득이죠. 제가 3월에 시도한 실험에서는, 3명 작가를 동시 투입해서 초안 3편을 20분 만에 뽑았어요. 매일 발행 데드라인을 맞추려면 이 속도가 필수였거든요.
반대로 순차 워크로드에서 모델 단가 차이만 노리면 손해예요. Reddit 실험의 리서치 태스크가 바로 이 경우입니다. 조사→요약→정리가 순차로 흐르니까 병렬 이득이 없고, 위임 오버헤드만 누적된 거죠.
비용 절감 주장은 다 거짓인가요?
"저는 실제로 비용이 줄었는데요?"라는 반론이 나올 수 있어요. Reddit 실험에서도 4쌍 중 1쌍은 오케스트레이션이 저렴했다고 하더라고요. 이런 경우는 대개 워커 태스크가 독립적이고 짧을 때입니다. 예를 들어 "100개 리뷰 각각 감정 분류"처럼 컨텍스트 공유가 없으면, 싼 모델로 분산하는 게 확실히 이득이에요.
그래서 어떻게 하면 되나요?
팀 도입을 고민 중이라면, 일단 현재 워크로드에서 실측부터 해보세요. 저는 일주일간 단일 모델로 돌려본 뒤, 같은 태스크를 오케스트레이션으로 다시 실행해서 토큰 사용량을 비교했습니다. 그랬더니 "조율 이득"이라고 생각했던 부분 절반이 실은 위임 오버헤드로 상쇄되더라고요.
체크리스트 세 가지를 권해요. 핸드오프 단계가 3개 이상이면 의심하세요. 체인이 길수록 컨텍스트 중복이 누적됩니다. 재시도가 잦은 태스크는 단일 모델이 유리해요. 병렬 이득이 없으면 멀티 에이전트를 쓸 이유가 없습니다. 순차 워크로드에서 모델 단가 차이만으로 절감을 기대하면, Reddit 실험처럼 35% 비용 증가를 마주하게 될 겁니다.
자주 묻는 질문
Q. 지금 쓰는 시스템에서 위임 오버헤드는 어떻게 측정하나요?
A. 토큰 로그를 태스크별로 쪼개서 봐요. 제 경우 LLM 제공사 대시보드에서 각 API 콜의 input/output 토큰을 CSV로 받아서, 오케 조율(Lion) vs 실제 작업(Beaver/Fox) 비율을 계산했습니다. 조율이 전체 18% 넘으면 위임 비용이 과하다는 신호예요.
Q. 단일 모델로 못 푸는 케이스는 뭐가 있나요?
A. 룰 충돌이 있는 태스크요. 사실확인과 편집을 한 프롬프트에 넣으면 "문체 자유롭게 vs 출처 엄격히" 지시가 꼬여요. 각 전문성마다 다른 체크리스트를 돌려야 할 때는 분리가 필수더라고요.
Q. 비용이 늘어도 멀티 에이전트를 써야 하는 이유가 있나요?
A. 품질 안정성이요. 단일 프롬프트에 10개 조건 넣으면 깜빡하는 항목이 생기는데, 검증자를 따로 두니 누락률이 확 줄었어요. 비용은 20% 늘었지만 재작업이 절반으로 줄어서, 인간 개입 시간으로 치면 이득이었습니다.