xAI Grok 4.6 출시: 에이전틱 코딩 강화, 자기검증으로 신뢰성 개선
xAI가 8월 12일 Grok 4.6을 출시했다. 장시간 에이전틱 코딩과 자기검증에 초점을 맞춰 DeepSWE·APEX-Agents 점수가 크게 올랐다. 컨텍스트는 경쟁 모델보다 좁다.
xAI가 8월 12일 Grok 4.6을 출시했다. 장시간 에이전틱 코딩과 자기검증에 초점을 맞춰 DeepSWE·APEX-Agents 점수가 크게 올랐다. 컨텍스트는 경쟁 모델보다 좁다.
핵심 요약
xAI가 2026년 8월 12일 Grok 4.6을 공식 발표했다 (공식 발표: x.ai/news/grok-4-6). Grok 4.5를 기반으로 하며, 장시간 실행되는 에이전트(long-running agents), 에이전틱 코딩, 대화형·시각적 작업에 초점을 맞춘 업데이트다. xAI API, xAI 자체 코딩 툴인 Grok Build, Cursor, OpenRouter, Vercel, Cloudflare를 통해 즉시 이용할 수 있다.
주요 기능
1. 자기검증(Self-Verification) 강화
xAI에 따르면 Grok 4.6의 핵심 개선점은 작업을 진행하기 전 스스로 검증하고 테스트를 더 자주 수행하는 자기검증 습관이다. 큐레이션된 추론 데이터셋과 엔지니어링 예제, 개선된 최적화 기법으로 훈련했다고 밝혔다. 이는 장시간 실행되는 에이전트 작업에서 중간 오류가 누적되는 것을 줄이기 위한 설계다.
2. 컨텍스트 윈도우와 입출력 사양
컨텍스트 윈도우는 500,000 토큰이다. 지식 컷오프는 2026년 2월 1일이다. 텍스트와 이미지를 입력으로 받고 텍스트로만 출력하며, 출력 길이에는 제한이 없다.
3. 에이전틱 코딩 벤치마크 향상
DeepSWE 벤치마크에서 65.9점을 기록해 Grok 4.5의 54점 대비 약 12점 올랐다. APEX-Agents에서는 57.5점으로 4.5의 47.1점 대비 약 10.4점 향상됐다 (공식 발표 기준).
벤치마크 비교
| 벤치마크 | Grok 4.5 | Grok 4.6 |
|---|---|---|
| DeepSWE | 54.0 | 65.9 |
| APEX-Agents | 47.1 | 57.5 |
| Artificial Analysis Intelligence Index | - | 61 |
| GDPval-AA v2 Elo | - | 1753 |
Artificial Analysis Intelligence Index에서 Grok 4.6은 61점으로 GPT-5.6 Sol과 동점을 기록했다. Claude Fable 5는 62점으로 1점 앞섰다.
가격 정보
| 구분 | 입력(100만 토큰) | 출력(100만 토큰) |
|---|---|---|
| 표준 | $2 | $6 |
| Fast | $4 | $12 |
표준 요금은 Grok 4.5와 동일한 헤드라인 가격을 유지했다. 8월 19일까지 Grok Build와 Cursor에서 포함 사용량 2배 프로모션이 제공된다.
사용성 분석
Grok 4.6은 xAI API 외에도 Grok Build, Cursor, OpenRouter, Vercel, Cloudflare 등 개발자가 자주 쓰는 여러 채널에서 바로 접근할 수 있다. Cursor와 Grok Build를 통한 통합은 반복적인 코드 작성-검증 루프가 필요한 에이전틱 코딩 워크플로우에 적합하다. 다만 초대형 문서나 대규모 코드베이스를 한 번에 처리해야 하는 작업에서는 500K 토큰이라는 컨텍스트 상한이 제약으로 작용할 수 있다.
장점
- 에이전틱 코딩 성능: DeepSWE, APEX-Agents 모두 두 자릿수 개선폭을 기록했다.
- 자기검증 설계: 장시간 실행 작업에서 오류 누적을 줄이는 방향으로 훈련됐다.
- 가격 유지: 성능은 올랐지만 표준 요금은 Grok 4.5와 동일하다.
- 다양한 배포 채널: API 외 Cursor, Vercel, Cloudflare 등에서 즉시 사용 가능하다.
단점 및 한계
- 좁은 컨텍스트: 500K 토큰은 GPT-5.6 Sol(105만 토큰), Claude Fable 5(100만 토큰)에 비해 절반 이하다.
- 종합 지능 지표에서 근소한 열세: Artificial Analysis Intelligence Index에서 Claude Fable 5에 1점 뒤진다.
- 텍스트 전용 출력: 이미지 입력은 지원하나 출력은 텍스트로만 제한된다.
경쟁 모델 비교
Grok 4.6은 GPT-5.6 Sol과 Artificial Analysis Intelligence Index에서 동점을 이루며 프론티어 모델 대열에 합류했다. 그러나 컨텍스트 윈도우 격차는 여전히 뚜렷하다. GDPval-AA v2 Elo 1753은 전문 지식노동 작업 기준으로, 실무 적용 가능성을 가늠하는 참고 지표다 (공식 발표 기준).
결론
Grok 4.6은 에이전틱 코딩과 자기검증이라는 명확한 목표 아래 개선된 모델이다. DeepSWE와 APEX-Agents에서의 향상폭은 실질적이며, 가격은 이전 버전과 동일하게 유지됐다. 컨텍스트 윈도우가 경쟁 모델보다 좁다는 점은 대규모 문서 처리 용도에는 아쉬운 부분이다. 반복적인 코드 작성과 검증이 중요한 장시간 에이전트 작업을 하는 개발자에게 우선 추천할 만하다.
장점
- DeepSWE, APEX-Agents 등 에이전틱 코딩 벤치마크에서 두 자릿수 개선폭 달성
- 자기검증 강화로 장시간 실행되는 에이전트 작업의 신뢰성 개선
- 성능 향상에도 표준 API 가격을 Grok 4.5와 동일하게 유지
- Grok Build, Cursor, OpenRouter, Vercel, Cloudflare 등 다양한 채널에서 즉시 사용 가능
단점/한계
- 컨텍스트 윈도우 500K 토큰이 GPT-5.6 Sol, Claude Fable 5 대비 절반 이하로 좁다
- Artificial Analysis Intelligence Index에서 Claude Fable 5에 1점 뒤처진다
- 이미지 입력은 지원하나 출력은 텍스트로만 제한된다
참고 자료
댓글0개
주요 기능/특징
1. 500,000 토큰 컨텍스트 윈도우, 지식 컷오프 2026년 2월 1일 2. 자기검증 강화로 장시간 에이전트 작업 신뢰성 개선 3. DeepSWE 65.9점(+11.9), APEX-Agents 57.5점(+10.4) 달성 4. 텍스트+이미지 입력, 텍스트 전용 출력, 출력 길이 제한 없음 5. 입력 $2/출력 $6(표준), Fast 변형은 2배 요금
핵심 인사이트
- xAI는 2026년 8월 12일 Grok 4.6을 공식 발표하며 장시간 에이전트와 에이전틱 코딩을 핵심 목표로 제시했다
- DeepSWE 점수가 Grok 4.5의 54점에서 65.9점으로, APEX-Agents는 47.1점에서 57.5점으로 개선됐다
- 자기검증(self-verification) 훈련 방식이 도입되어 작업 진행 전 스스로 검증·테스트하는 습관이 강화됐다
- Artificial Analysis Intelligence Index 61점으로 GPT-5.6 Sol과 동점이나 Claude Fable 5(62점)에는 근소하게 뒤처진다
- 컨텍스트 윈도우 500K 토큰은 GPT-5.6 Sol(105만)과 Claude Fable 5(100만) 대비 좁은 편이다
- 표준 가격은 Grok 4.5와 동일한 입력 $2/출력 $6을 유지해 성능 대비 가격 경쟁력을 지켰다
- 8월 19일까지 Grok Build와 Cursor에서 포함 사용량 2배 프로모션을 제공한다
- xAI API 외에 Grok Build, Cursor, OpenRouter, Vercel, Cloudflare에서 즉시 사용할 수 있다
이 리뷰가 유용했나요?
공유하기
관련 AI 리뷰
Mistral Large 4 공개: 1조 파라미터 희소 MoE, 오픈웨이트 예정
Mistral AI가 2026년 10월 6일 Mistral Large 4 프리뷰를 공개했다. 총 1조, 활성 490억 파라미터의 희소 MoE이며 가중치는 10월 말까지 공개 예정이다.
Cohere North 2 출시: 세션 간 메모리와 비용 통제를 더한 에이전트 플랫폼
Cohere가 2026년 10월 5일 엔터프라이즈 에이전트 플랫폼 North 2를 발표했다. 새 오케스트레이션 하네스, 세션 간 메모리, 비용 통제, 에어갭까지 지원하는 배포가 핵심이다.
StepFun Step 5 Preview 리뷰: 600B MoE, 1M 컨텍스트 신규 LLM
중국 StepFun이 600B 파라미터 MoE 모델 Step 5 Preview를 출시했다. 1M 컨텍스트와 저가 API가 특징이다. 오픈웨이트는 10월 15일 공개된다.
Grok Bot 음성 모드 출시: 말로 업무 위임하는 AI 팀원
xAI가 Grok Bot에 음성 대화 모드를 추가했다. Grok Voice Think Fast 2.0 기반으로 데스크톱·모바일에서 말로 업무를 위임할 수 있다.
