Sakana AI Fugu Max·Ultra v2 리뷰: 오케스트레이터형 LLM 등장
Sakana AI가 2026년 9월 10일 오케스트레이터 방식의 Fugu Max와 Fugu Ultra v2를 출시했다. 여러 모델을 조율해 비용과 성능의 파레토 곡선을 최적화한다. 비용 효율과 멀티스텝 작업을 원하는 개발자에게 적합하다.
Sakana AI가 2026년 9월 10일 오케스트레이터 방식의 Fugu Max와 Fugu Ultra v2를 출시했다. 여러 모델을 조율해 비용과 성능의 파레토 곡선을 최적화한다. 비용 효율과 멀티스텝 작업을 원하는 개발자에게 적합하다.
핵심 요약
일본 AI 스타트업 Sakana AI가 2026년 9월 10일 자체 API를 통해 신모델 두 종을 출시했다. "Fugu Max"와 "Fugu Ultra v2"다. 두 모델은 처음부터 새로 학습된 단일 파운데이션 모델이 아니다. 여러 기존 모델을 상황에 맞게 조율하는 "학습된 오케스트레이터(orchestrator)" 방식을 채택했다. Sakana AI는 이번 출시를 "Orchestrating the Pareto Frontier"라는 표현으로 공식 발표했다(공식 발표). 비용과 성능이라는 두 축의 파레토 곡선을 최적화하는 것이 핵심 컨셉이다.
주요 기능
1. 오케스트레이터 아키텍처
Fugu Max와 Fugu Ultra v2는 단일 거대 모델을 새로 학습시키는 대신, 이미 존재하는 여러 모델에 작업을 분배하고 결과를 조합하는 방식으로 동작한다. 요청의 난이도와 특성에 따라 어떤 하위 모델을 호출할지 학습된 라우팅 로직이 결정한다.
다만 라우팅 대상 모델 풀에는 제한이 있다. Anthropic의 Claude Fable 5/5.1과 OpenAI의 GPT-6 Astra는 Sakana의 오케스트레이션 대상에서 제외되어 있다(공식 발표). 즉 Fugu가 내부적으로 호출하는 하위 모델군에 이 두 모델은 포함되지 않는다.
2. Fugu Max: 비용 최적화 라인업
Fugu Max는 최저 비용 최적화에 초점을 맞춘 모델이다. 가격은 100만 입력 토큰당 $2, 100만 출력 토큰당 $6이다(공식 발표). 단순 작업이나 대량 처리가 필요한 워크로드에 적합하도록 설계됐다.
3. Fugu Ultra v2: 복잡한 멀티스텝 작업 특화
Fugu Ultra v2는 복잡한 멀티스텝 작업에서 최고 성능을 지향하는 모델이다. 가격은 100만 입력 토큰당 $5, 출력 토큰당 $30이며, 컨텍스트가 272K 토큰을 초과하면 각각 $10/$45로 인상된다(공식 발표). 긴 컨텍스트를 다룰수록 토큰 관리가 비용에 직접적인 영향을 준다는 의미다.
4. Chartography 벤치마크 결과
시각적 추론과 데이터 해석 능력을 측정하는 벤치마크 "Chartography"에서 Fugu Ultra v2는 48.3점을 기록했다. 같은 벤치마크에서 비교 대상으로 언급된 Opus 5는 27.3점, Fable 5는 29.5점을 기록했다(MarkTechPost 보도). 다만 이는 단일 벤치마크 결과이며, 전 영역에서의 우위를 의미하지는 않는다.
사용성 분석
오케스트레이터 방식의 특징은 사용자가 모델 하나를 직접 선택하는 것이 아니라, 작업 유형에 따라 내부적으로 최적의 경로가 결정된다는 점이다. 비용에 민감한 대량 처리 작업에는 Fugu Max가, 복잡도가 높은 멀티스텝 작업에는 Fugu Ultra v2가 적합하다. 다만 Ultra v2는 272K 토큰을 넘으면 요금이 급격히 오르기 때문에, 긴 컨텍스트를 자주 다루는 사용자는 실제 비용을 미리 시뮬레이션해볼 필요가 있다.
장단점
장점
- Chartography 벤치마크에서 비교 모델 대비 높은 점수 기록(MarkTechPost 보도)
- 두 모델로 비용과 성능 축을 분리해 선택 폭 제공
- 오케스트레이션 방식으로 여러 모델의 강점을 조합하는 새로운 접근
단점
- 272K 토큰 초과 시 요금이 거의 두 배로 인상되는 구조
- Claude Fable 5/5.1, GPT-6 Astra가 라우팅 풀에서 제외되어 조합 범위 제한
- 단일 파운데이션 모델이 아니어서 응답 특성의 일관성 검증에 시간 필요
비교
| 모델 | 입력 가격($/1M) | 출력 가격($/1M) | Chartography 점수 |
|---|---|---|---|
| Fugu Ultra v2 | $5 (272K 초과 시 $10) | $30 (272K 초과 시 $45) | 48.3 |
| Opus 5 | 미확인 | 미확인 | 27.3 |
| Fable 5 | 미확인 | 미확인 | 29.5 |
Chartography 점수는 MarkTechPost 보도 기준이며, Opus 5와 Fable 5의 가격 정보는 이번 발표에서 확인되지 않았다.
전망
오케스트레이터 방식이 시장에서 검증되면, 신규 파운데이션 모델을 처음부터 학습시키는 대신 기존 모델을 조합하는 접근이 하나의 대안으로 자리잡을 가능성이 있다. 다만 이 방식이 장기적으로 응답 품질의 일관성이나 비용 구조 측면에서 어떤 한계를 보일지는 추가적인 실사용 데이터가 필요하다.
결론
Fugu Max와 Fugu Ultra v2는 단일 모델 학습이 아닌 오케스트레이션이라는 접근으로 비용과 성능의 균형을 재정의하려는 시도다. Chartography 벤치마크에서 확인된 성능은 주목할 만하지만, 다양한 벤치마크와 실사용 검증이 뒤따라야 한다. 비용 효율과 멀티스텝 작업 처리 능력을 동시에 고려하는 개발팀이라면 관심을 가질 만하다.
장점
- Chartography 벤치마크에서 비교 모델 대비 높은 점수 기록
- 비용 최적화(Fugu Max)와 성능 특화(Fugu Ultra v2) 모델 이원화로 선택 폭 제공
- 여러 모델을 조합하는 오케스트레이션 접근으로 새로운 아키텍처 시도
단점/한계
- Fugu Ultra v2는 272K 토큰 초과 시 요금이 최대 두 배 가까이 인상
- Claude Fable 5/5.1, GPT-6 Astra가 라우팅 풀에서 제외되어 조합 범위 제한적
- 단일 벤치마크(Chartography) 외 폭넓은 성능 검증 자료 부족
참고 자료
댓글0개
주요 기능/특징
1. 오케스트레이터 방식: 단일 파운데이션 모델이 아닌 여러 기존 모델을 학습된 라우팅으로 조율 2. Fugu Max: 비용 최적화 모델, $2/$6 (100만 입력/출력 토큰당) 3. Fugu Ultra v2: 멀티스텝 작업 특화, $5/$30 (272K 토큰 초과 시 $10/$45) 4. Chartography 벤치마크 48.3점 기록 (Opus 5 27.3점, Fable 5 29.5점) 5. Claude Fable 5/5.1, GPT-6 Astra는 라우팅 대상 모델 풀에서 제외
핵심 인사이트
- Fugu Max와 Ultra v2는 단일 모델이 아닌 여러 모델을 조율하는 오케스트레이터 방식을 택했다.
- Fugu Max는 비용 최적화, Fugu Ultra v2는 멀티스텝 작업 성능에 초점을 맞춰 역할을 분리했다.
- Chartography 벤치마크에서 Fugu Ultra v2가 Opus 5, Fable 5보다 높은 점수를 기록했다.
- Fugu Ultra v2는 272K 토큰을 넘으면 요금이 거의 두 배로 인상되는 구조다.
- Claude Fable 5/5.1과 GPT-6 Astra는 Sakana의 라우팅 대상 모델 풀에서 제외됐다.
- 'Orchestrating the Pareto Frontier'라는 표현으로 비용-성능 최적화를 핵심 컨셉으로 내세웠다.
- 오케스트레이션 방식이 신규 파운데이션 모델 학습을 대체할 대안이 될 수 있을지 주목된다.
- 단일 벤치마크 결과만으로 전체 성능 우위를 판단하기는 이르다.
이 리뷰가 유용했나요?
공유하기
관련 AI 리뷰
DeepSeek V4.1 Flash 정식 전환: V4-Pro API 트래픽 대체 예고
DeepSeek가 V4.1 Flash를 임시 테스트에서 정식 프로덕션 모델로 전환했다. 9월 14일부터 기존 V4-Pro API 요청은 V4.1 Flash로 자동 라우팅·과금된다.
Mistral AI, 삼성전자 주도 €3B 투자 유치…기업가치 €21B 등극
Mistral AI가 삼성전자 주도로 €3B 투자를 유치, 기업가치 €21B로 급등했다. 삼성은 반도체 인프라에 Mistral Large 적용 파트너십도 체결했다.
Grok for Government, 미 국방부 GenAI.mil 탑재: IL5 인가 획득
미 국방부가 2026년 8월 31일 xAI 기반 'Grok for Government'를 GenAI.mil에 정식 탑재했다. IL5 인가를 획득했으며 콘텐츠 안전성 우려도 함께 제기됐다.
Qwen3.8-Flash-Next 공개: 활성 6B로 Qwen4 아키텍처 미리보기
알리바바 Qwen 팀이 차기 Qwen4 아키텍처를 엿볼 수 있는 프리뷰 모델 Qwen3.8-Flash-Next를 공개했다. 180B 규모 중 토큰당 6B만 활성화하는 MoE 구조로 비용 효율을 극대화했다.
