Claude Opus 5 출시: 벤치마크 2배 향상, Fable 5 절반 가격 육박
Anthropic이 2026년 7월 24일 Claude Opus 5를 공식 출시했다. Frontier-Bench에서 Opus 4.8 대비 2배 이상, ARC-AGI-3에서 GPT-5.6 Sol 대비 4배 높은 점수를 기록했고, 가격은 Fable 5의 절반 수준이다.
Anthropic이 2026년 7월 24일 Claude Opus 5를 공식 출시했다. Frontier-Bench에서 Opus 4.8 대비 2배 이상, ARC-AGI-3에서 GPT-5.6 Sol 대비 4배 높은 점수를 기록했고, 가격은 Fable 5의 절반 수준이다.
핵심 요약
Anthropic이 2026년 7월 24일 공식 블로그를 통해 신규 최상위 모델 Claude Opus 5를 발표했다(Anthropic 공식 발표). CNBC, The Decoder, Axios 등 주요 테크 매체도 같은 날 이 소식을 일제히 보도하며 성능과 가격 두 측면에서 의미 있는 변화라고 평가했다(교차 보도).
이번 발표의 핵심은 두 가지다. 첫째, 복수의 프론티어 벤치마크에서 이전 세대 대비 큰 폭의 성능 향상을 기록했다. 둘째, 코딩 특화 벤치마크에서 현재 업계 최고점을 보유한 경쟁 모델 Fable 5에 근접한 성적을 내면서도, API 가격은 그 절반 수준에 가깝게 책정됐다.
벤치마크로 확인된 성능 향상
공식 발표에 따르면 Opus 5는 세 가지 벤치마크에서 다음과 같은 결과를 기록했다.
- Frontier-Bench v0.1: 43.3%를 기록했다. 이는 이전 모델인 Opus 4.8 대비 2배 이상 높은 점수다(공식 발표).
- ARC-AGI-3: 30.2%를 기록해, 경쟁사의 최신 모델인 GPT-5.6 Sol 대비 약 4배 높은 점수를 보였다(공식 발표, 교차 보도).
- CursorBench 3.2: 코딩 벤치마크에서는 현재 최고점을 보유한 Fable 5와 0.5%포인트 이내로 근접한 성적을 냈다(교차 보도).
세 벤치마크를 종합하면, Opus 5는 범용 추론 영역에서는 이전 세대 대비 뚜렷한 도약을 이뤘고, 코딩 특화 영역에서는 업계 최상위권과 대등한 수준까지 따라잡았다는 해석이 가능하다.
벤치마크 비교표
| 벤치마크 | Claude Opus 5 점수 | 비교 대상 | 비교 결과 |
|---|---|---|---|
| Frontier-Bench v0.1 | 43.3% | Opus 4.8 | 2배 이상 향상 |
| ARC-AGI-3 | 30.2% | GPT-5.6 Sol | 약 4배 높은 점수 |
| CursorBench 3.2 | Fable 5 대비 0.5%p 이내 | Fable 5 | 업계 최고점과 근접 |
(참고: Opus 4.8과 GPT-5.6 Sol의 절대 점수는 확인된 출처에 별도로 공개되지 않아, 상대적 배수로만 확인됐다.)
가격 정책: 절반 가격에 근접한 비용 효율
Opus 5의 API 가격은 100만 입력 토큰당 5달러, 100만 출력 토큰당 25달러로 책정됐다(공식 발표). CNBC와 The Decoder는 이 가격 수준이 CursorBench 3.2 최고점을 보유한 Fable 5의 토큰 단가 대비 절반에 가깝다는 점에 주목했다(교차 보도). 즉 Opus 5는 코딩 성능에서 업계 최상위권과 거의 대등한 수준을 보이면서도, 대량 API 호출이 필요한 개발자와 기업 고객에게는 비용 부담을 상당히 낮출 수 있는 선택지로 제시됐다.
사용성 분석
이번 발표는 벤치마크 수치와 가격표 중심으로 이뤄졌으며, 컨텍스트 윈도우 크기나 멀티모달 지원 범위 등 세부 스펙은 확인된 출처에서 구체적으로 다뤄지지 않았다. 따라서 실제 사용성에 대한 평가는 API가 개발자들에게 폭넓게 공개되고 실사용 사례가 쌓인 이후에 더 명확해질 것으로 보인다. 다만 코딩 벤치마크에서 보인 성적을 고려하면, 복잡한 리팩토링이나 다중 파일 수정 등 에이전틱 코딩 작업에 우선 활용될 가능성이 높다.
장단점
장점은 명확하다. Frontier-Bench와 ARC-AGI-3 등 범용 추론 벤치마크에서 이전 세대 대비 큰 폭으로 향상됐고, 코딩 벤치마크에서는 업계 최상위권과 거의 격차가 없다. 여기에 더해 Fable 5 대비 절반 수준에 가까운 가격은 비용 효율성 측면에서 뚜렷한 강점이다. 반면 한계도 있다. 출력 토큰 가격이 입력 대비 5배 높아 긴 응답이 필요한 작업에서는 비용이 빠르게 늘어날 수 있고, 비교 대상 모델들의 절대 점수가 공개되지 않아 상대적 배수로만 성능을 가늠해야 한다는 점도 아쉽다. 컨텍스트 윈도우나 멀티모달 지원 등 세부 스펙 정보가 아직 부족한 점도 초기 평가의 한계로 남는다.
전망
Anthropic이 범용 추론과 코딩 성능을 동시에 끌어올리면서도 가격을 낮춘 전략은, 프론티어 모델 경쟁이 성능뿐 아니라 비용 효율성 중심으로 옮겨가고 있음을 보여준다. 특히 Fable 5와의 가격·성능 비교가 반복적으로 언급된다는 점에서, 향후 경쟁사들도 유사한 가격 인하 압박을 받을 가능성이 크다. Opus 5가 실제 API 공개 이후 개발자 커뮤니티에서 어떤 실사용 평가를 받을지가 다음 관전 포인트다.
결론
Claude Opus 5는 벤치마크 수치와 가격 정책만 놓고 보면 이전 세대 대비 확실한 진전을 이룬 모델이다. 범용 추론 능력 향상과 코딩 벤치마크에서의 경쟁력, 여기에 절반 수준에 가까운 가격까지 갖추면서 대량 API 사용이 필요한 개발자와 기업에 특히 매력적인 선택지로 떠올랐다. 다만 세부 스펙 공개와 실사용 검증이 아직 남아 있는 만큼, 종합적인 평가는 시간을 두고 지켜볼 필요가 있다.
장점
- Frontier-Bench, ARC-AGI-3 등 범용 추론 벤치마크에서 이전 세대 대비 큰 폭의 성능 향상
- CursorBench 3.2 코딩 벤치마크에서 업계 최고 수준과 근접한 경쟁력
- Fable 5 대비 절반 수준에 가까운 토큰 단가로 비용 효율성 확보
- 범용 추론과 코딩 영역 모두에서 균형 잡힌 성능 개선
단점/한계
- 컨텍스트 윈도우, 멀티모달 지원 등 세부 스펙이 공식 자료에서 구체적으로 확인되지 않음
- Opus 4.8, GPT-5.6 Sol의 절대 점수가 공개되지 않아 상대적 배수 비교에 의존해야 함
- 출력 토큰 가격이 입력 대비 5배 높아 긴 응답을 요구하는 워크로드에서는 비용 부담이 커질 수 있음
참고 자료
댓글0개
주요 기능/특징
1. Frontier-Bench v0.1에서 43.3%로 Opus 4.8 대비 2배 이상 향상 2. ARC-AGI-3에서 30.2%로 GPT-5.6 Sol 대비 약 4배 높은 점수 3. CursorBench 3.2 코딩 벤치마크에서 Fable 5 최고점 대비 0.5%p 이내로 근접 4. API 가격은 100만 입력 토큰당 $5, 출력 토큰당 $25로 책정 5. Fable 5 대비 절반 수준에 가까운 가격으로 비용 효율성 확보
핵심 인사이트
- Frontier-Bench 점수가 이전 세대 대비 2배 이상 향상되며 범용 추론 능력이 크게 개선됐다
- ARC-AGI-3에서 GPT-5.6 Sol 대비 4배 높은 점수는 복잡한 패턴 추론 영역에서 격차를 크게 벌렸다는 의미다
- CursorBench 3.2에서 Fable 5와 0.5%p 이내로 근접해 코딩 특화 시장에서도 최상위권 경쟁력을 확보했다
- 가격이 Fable 5 대비 절반 수준에 근접해 동급 성능 대비 비용 효율성이 두드러진다
- 범용 추론과 코딩 벤치마크 모두에서 균형 잡힌 성능 향상을 보여줬다는 점이 특징적이다
- 가격 정책은 대량 API 호출이 필요한 개발자·기업 고객에게 실질적인 비용 절감 유인이 될 수 있다
- 출력 토큰 가격이 입력 대비 5배 높게 책정돼 응답 길이가 긴 워크로드에서는 비용 구조를 따져볼 필요가 있다
- 컨텍스트 윈도우, 멀티모달 지원 범위 등 세부 스펙은 확인된 출처에 명시되지 않아 추가 확인이 필요하다
이 리뷰가 유용했나요?
공유하기
관련 AI 리뷰
Claude 음성모드 대개편: Opus·Sonnet 탑재, Gmail·Slack 자동화
Anthropic이 2026년 7월 23일 Claude 음성모드에 Opus·Sonnet 모델 선택 기능과 Gmail·Slack 등 앱 연동 자동화를 추가했다. 기존 Haiku 전용 체제에서 벗어나 음성으로 실제 업무 처리가 가능해졌다.
Claude for Teachers 출시: K-12 교사에게 프리미엄 기능 무료 제공
Anthropic이 미국 K-12 인증 교사에게 Claude 프리미엄 기능을 1년간 무료 제공한다. 교육과정 연계와 프라이버시 보호가 특징이며, 교육 AI 경쟁이 치열해지고 있다.
Claude Code, 내장 브라우저 탑재: 클린 세션으로 외부 웹 직접 조작
Anthropic이 Claude Code 데스크톱 앱에 탭 기반 내장 브라우저를 추가했다. 로그인 정보 없는 클린 프로필로 문서·이슈 트래커를 직접 열람·클릭·입력한다.
Claude Reflect 출시: 사용 습관 되돌아보는 AI 성찰 대시보드
Anthropic이 Claude 사용 패턴을 시각화하는 'Reflect' 대시보드를 공개했다. 성찰형 질문과 사용 중단 알림을 제공하지만, 재방문 유도라는 비판도 나온다.
