Claude Opus 5 출시: 벤치마크 2배 향상, Fable 5 절반 가격 육박
Anthropic이 2026년 7월 24일 Claude Opus 5를 공식 출시했다. Frontier-Bench에서 Opus 4.8 대비 2배 이상, ARC-AGI-3에서 GPT-5.6 Sol 대비 4배 높은 점수를 기록했고, 가격은 Fable 5의 절반 수준이다.
Anthropic이 2026년 7월 24일 Claude Opus 5를 공식 출시했다. Frontier-Bench에서 Opus 4.8 대비 2배 이상, ARC-AGI-3에서 GPT-5.6 Sol 대비 4배 높은 점수를 기록했고, 가격은 Fable 5의 절반 수준이다.
핵심 요약
Anthropic이 2026년 7월 24일 공식 블로그를 통해 신규 최상위 모델 Claude Opus 5를 발표했다(Anthropic 공식 발표). CNBC, The Decoder, Axios 등 주요 테크 매체도 같은 날 이 소식을 일제히 보도하며 성능과 가격 두 측면에서 의미 있는 변화라고 평가했다(교차 보도).
이번 발표의 핵심은 두 가지다. 첫째, 복수의 프론티어 벤치마크에서 이전 세대 대비 큰 폭의 성능 향상을 기록했다. 둘째, 코딩 특화 벤치마크에서 현재 업계 최고점을 보유한 경쟁 모델 Fable 5에 근접한 성적을 내면서도, API 가격은 그 절반 수준에 가깝게 책정됐다.
벤치마크로 확인된 성능 향상
공식 발표에 따르면 Opus 5는 세 가지 벤치마크에서 다음과 같은 결과를 기록했다.
- Frontier-Bench v0.1: 43.3%를 기록했다. 이는 이전 모델인 Opus 4.8 대비 2배 이상 높은 점수다(공식 발표).
- ARC-AGI-3: 30.2%를 기록해, 경쟁사의 최신 모델인 GPT-5.6 Sol 대비 약 4배 높은 점수를 보였다(공식 발표, 교차 보도).
- CursorBench 3.2: 코딩 벤치마크에서는 현재 최고점을 보유한 Fable 5와 0.5%포인트 이내로 근접한 성적을 냈다(교차 보도).
세 벤치마크를 종합하면, Opus 5는 범용 추론 영역에서는 이전 세대 대비 뚜렷한 도약을 이뤘고, 코딩 특화 영역에서는 업계 최상위권과 대등한 수준까지 따라잡았다는 해석이 가능하다.
벤치마크 비교표
| 벤치마크 | Claude Opus 5 점수 | 비교 대상 | 비교 결과 |
|---|---|---|---|
| Frontier-Bench v0.1 | 43.3% | Opus 4.8 | 2배 이상 향상 |
| ARC-AGI-3 | 30.2% | GPT-5.6 Sol | 약 4배 높은 점수 |
| CursorBench 3.2 | Fable 5 대비 0.5%p 이내 | Fable 5 | 업계 최고점과 근접 |
(참고: Opus 4.8과 GPT-5.6 Sol의 절대 점수는 확인된 출처에 별도로 공개되지 않아, 상대적 배수로만 확인됐다.)
가격 정책: 절반 가격에 근접한 비용 효율
Opus 5의 API 가격은 100만 입력 토큰당 5달러, 100만 출력 토큰당 25달러로 책정됐다(공식 발표). CNBC와 The Decoder는 이 가격 수준이 CursorBench 3.2 최고점을 보유한 Fable 5의 토큰 단가 대비 절반에 가깝다는 점에 주목했다(교차 보도). 즉 Opus 5는 코딩 성능에서 업계 최상위권과 거의 대등한 수준을 보이면서도, 대량 API 호출이 필요한 개발자와 기업 고객에게는 비용 부담을 상당히 낮출 수 있는 선택지로 제시됐다.
사용성 분석
이번 발표는 벤치마크 수치와 가격표 중심으로 이뤄졌으며, 컨텍스트 윈도우 크기나 멀티모달 지원 범위 등 세부 스펙은 확인된 출처에서 구체적으로 다뤄지지 않았다. 따라서 실제 사용성에 대한 평가는 API가 개발자들에게 폭넓게 공개되고 실사용 사례가 쌓인 이후에 더 명확해질 것으로 보인다. 다만 코딩 벤치마크에서 보인 성적을 고려하면, 복잡한 리팩토링이나 다중 파일 수정 등 에이전틱 코딩 작업에 우선 활용될 가능성이 높다.
장단점
장점은 명확하다. Frontier-Bench와 ARC-AGI-3 등 범용 추론 벤치마크에서 이전 세대 대비 큰 폭으로 향상됐고, 코딩 벤치마크에서는 업계 최상위권과 거의 격차가 없다. 여기에 더해 Fable 5 대비 절반 수준에 가까운 가격은 비용 효율성 측면에서 뚜렷한 강점이다. 반면 한계도 있다. 출력 토큰 가격이 입력 대비 5배 높아 긴 응답이 필요한 작업에서는 비용이 빠르게 늘어날 수 있고, 비교 대상 모델들의 절대 점수가 공개되지 않아 상대적 배수로만 성능을 가늠해야 한다는 점도 아쉽다. 컨텍스트 윈도우나 멀티모달 지원 등 세부 스펙 정보가 아직 부족한 점도 초기 평가의 한계로 남는다.
전망
Anthropic이 범용 추론과 코딩 성능을 동시에 끌어올리면서도 가격을 낮춘 전략은, 프론티어 모델 경쟁이 성능뿐 아니라 비용 효율성 중심으로 옮겨가고 있음을 보여준다. 특히 Fable 5와의 가격·성능 비교가 반복적으로 언급된다는 점에서, 향후 경쟁사들도 유사한 가격 인하 압박을 받을 가능성이 크다. Opus 5가 실제 API 공개 이후 개발자 커뮤니티에서 어떤 실사용 평가를 받을지가 다음 관전 포인트다.
결론
Claude Opus 5는 벤치마크 수치와 가격 정책만 놓고 보면 이전 세대 대비 확실한 진전을 이룬 모델이다. 범용 추론 능력 향상과 코딩 벤치마크에서의 경쟁력, 여기에 절반 수준에 가까운 가격까지 갖추면서 대량 API 사용이 필요한 개발자와 기업에 특히 매력적인 선택지로 떠올랐다. 다만 세부 스펙 공개와 실사용 검증이 아직 남아 있는 만큼, 종합적인 평가는 시간을 두고 지켜볼 필요가 있다.
장점
- Frontier-Bench, ARC-AGI-3 등 범용 추론 벤치마크에서 이전 세대 대비 큰 폭의 성능 향상
- CursorBench 3.2 코딩 벤치마크에서 업계 최고 수준과 근접한 경쟁력
- Fable 5 대비 절반 수준에 가까운 토큰 단가로 비용 효율성 확보
- 범용 추론과 코딩 영역 모두에서 균형 잡힌 성능 개선
단점/한계
- 컨텍스트 윈도우, 멀티모달 지원 등 세부 스펙이 공식 자료에서 구체적으로 확인되지 않음
- Opus 4.8, GPT-5.6 Sol의 절대 점수가 공개되지 않아 상대적 배수 비교에 의존해야 함
- 출력 토큰 가격이 입력 대비 5배 높아 긴 응답을 요구하는 워크로드에서는 비용 부담이 커질 수 있음
참고 자료
댓글0개
주요 기능/특징
1. Frontier-Bench v0.1에서 43.3%로 Opus 4.8 대비 2배 이상 향상 2. ARC-AGI-3에서 30.2%로 GPT-5.6 Sol 대비 약 4배 높은 점수 3. CursorBench 3.2 코딩 벤치마크에서 Fable 5 최고점 대비 0.5%p 이내로 근접 4. API 가격은 100만 입력 토큰당 $5, 출력 토큰당 $25로 책정 5. Fable 5 대비 절반 수준에 가까운 가격으로 비용 효율성 확보
핵심 인사이트
- Frontier-Bench 점수가 이전 세대 대비 2배 이상 향상되며 범용 추론 능력이 크게 개선됐다
- ARC-AGI-3에서 GPT-5.6 Sol 대비 4배 높은 점수는 복잡한 패턴 추론 영역에서 격차를 크게 벌렸다는 의미다
- CursorBench 3.2에서 Fable 5와 0.5%p 이내로 근접해 코딩 특화 시장에서도 최상위권 경쟁력을 확보했다
- 가격이 Fable 5 대비 절반 수준에 근접해 동급 성능 대비 비용 효율성이 두드러진다
- 범용 추론과 코딩 벤치마크 모두에서 균형 잡힌 성능 향상을 보여줬다는 점이 특징적이다
- 가격 정책은 대량 API 호출이 필요한 개발자·기업 고객에게 실질적인 비용 절감 유인이 될 수 있다
- 출력 토큰 가격이 입력 대비 5배 높게 책정돼 응답 길이가 긴 워크로드에서는 비용 구조를 따져볼 필요가 있다
- 컨텍스트 윈도우, 멀티모달 지원 범위 등 세부 스펙은 확인된 출처에 명시되지 않아 추가 확인이 필요하다
이 리뷰가 유용했나요?
공유하기
관련 AI 리뷰
Anthropic, 기업 데이터 보존 정책 철회하고 EFS 도입
Anthropic이 기업 고객 반발로 30일 데이터 보존 의무화를 철회했다. 대신 고객 클라우드에 데이터를 저장하는 EFS를 무상 도입한다.
Claude 세션 탈취 사건: 인포스틸러가 비밀번호·2FA 없이 계정 장악
Vidar, Lumma 등 범용 인포스틸러가 감염된 PC에서 Claude 로그인 세션을 훔쳐 비밀번호·2FA 없이 계정에 침투했다. Anthropic은 강제 로그아웃과 결제수단 삭제로 대응했다.
Anthropic, 연구자 대상 Claude 좌석 1만 개 무료 개방
Anthropic이 대학·비영리 연구기관 PI에게 Claude Team 좌석 1만 개를 무료 또는 월 15달러에 제공한다. 자연과학부터 공학까지 전 분야가 대상이다.
Claude와 Cowork 메모리 통합: 전 플랜 기본 적용, 민감정보 기본 비저장
Anthropic이 2026년 8월 25일 Claude 채팅과 Cowork에서 따로 작동하던 메모리 기능을 통합했다. Free·Pro·Max 전 플랜에 기본 적용되며, 건강·신념 등 민감 정보는 기본적으로 저장하지 않는다.
