Gemini 3.6 Flash·3.5 Flash-Lite 출시: 코딩·에이전트 벤치마크 대폭 향상
Google이 2026년 7월 21일 Gemini 3.6 Flash와 3.5 Flash-Lite를 출시했다. 코딩·컴퓨터 사용 벤치마크가 개선됐고 지식 컷오프도 2026년 3월로 갱신됐다.
Google이 2026년 7월 21일 Gemini 3.6 Flash와 3.5 Flash-Lite를 출시했다. 코딩·컴퓨터 사용 벤치마크가 개선됐고 지식 컷오프도 2026년 3월로 갱신됐다.
핵심 요약
Google이 2026년 7월 21일 Gemini 3.6 Flash와 경량 모델 Gemini 3.5 Flash-Lite를 공식 출시했다. 두 모델 모두 코딩·에이전트 작업 벤치마크에서 이전 세대 대비 뚜렷한 개선을 기록했다. Gemini 3.6 Flash는 지식 컷오프를 2026년 3월로 갱신해 이전 모델(2025년 1월)보다 최신 정보 반영 범위를 크게 넓혔다.
주요 기능
1. Gemini 3.6 Flash: 코딩·에이전트 벤치마크 개선
공식 발표에 따르면 Gemini 3.6 Flash는 다음과 같은 벤치마크 향상을 보였다 (괄호는 이전 3.5 Flash 점수).
| 벤치마크 | Gemini 3.6 Flash | 이전 3.5 Flash |
|---|---|---|
| DeepSWE | 49% | 37% |
| MLE Bench | 63.9% | 49.7% |
| GDPval-AA | 1421점 | 1349점 |
| OSWorld-Verified | 83% | 78.4% |
2. 토큰 효율성 개선
Google은 Gemini 3.6 Flash가 이전 모델 대비 출력 토큰을 17% 줄였다고 밝혔다. reasoning step과 tool call 횟수도 함께 감소했다. 공식 발표는 이를 'delivers higher precision with fewer unwanted code edits and reduced execution loops'라고 설명했다.
3. 지식 컷오프 대폭 갱신
Gemini 3.6 Flash의 지식 컷오프는 2026년 3월이다. 이전 3.5 Flash의 2025년 1월 대비 14개월 이상 최신 정보를 반영한다.
4. 가격 정책
Gemini 3.6 Flash는 입력 100만 토큰당 $1.50, 출력 100만 토큰당 $7.50이다.
5. Gemini 3.5 Flash-Lite: 경량 버전 동시 출시
Google은 같은 날 경량 모델 Gemini 3.5 Flash-Lite도 함께 출시했다. 가격은 입력 100만 토큰당 $0.30, 출력 100만 토큰당 $2.50으로 3.6 Flash보다 저렴하다. 벤치마크 결과는 다음과 같다 (괄호는 이전 세대 점수).
| 벤치마크 | Gemini 3.5 Flash-Lite | 이전 세대 |
|---|---|---|
| Terminal-Bench 2.1 | 54% | 31% |
| GDM-MRCR v2 | 72.2% | 60.1% |
| GDPval-AA v2 | 1140점 | 642점 |
| SWE-Bench Pro | 54.2% | 49.6% |
| OSWorld-Verified | 74.0% | 65.1% |
사용성 분석
Gemini 3.6 Flash는 코딩 자동화와 컴퓨터 사용 에이전트 작업에 적합하다. OSWorld-Verified 83% 기록은 화면 조작 기반 에이전트 작업에서 신뢰도가 높아졌음을 보여준다. 출력 토큰이 17% 줄어든 점은 API 비용과 응답 지연 감소로 직접 이어진다.
Gemini 3.5 Flash-Lite는 비용에 민감한 대량 처리 작업에 적합하다. Terminal-Bench 2.1에서 54%를 기록해 이전 세대(31%) 대비 큰 폭으로 개선됐지만, 여전히 3.6 Flash보다는 낮은 성능대에 위치한다.
장단점
장점
- DeepSWE·MLE Bench·OSWorld-Verified 등 주요 벤치마크 전반 개선
- 출력 토큰 17% 감소로 비용·응답 속도 효율화
- 지식 컷오프 2026년 3월로 최신 정보 반영 범위 확대
- Flash-Lite 저비용 옵션 동시 제공으로 선택지 확대
단점
- Gemini 3.6 Flash 가격은 3.5 Flash-Lite 대비 여전히 높음 (입력 $1.50 vs $0.30)
- 벤치마크 개선폭이 항목별로 상이해 모든 작업에서 균일한 향상 보장 안 됨
- 두 모델 모두 최상위 플래그십(Pro급) 대비 추론 성능 한계 존재
비교: 이전 세대 대비 변화
Gemini 3.6 Flash는 이전 3.5 Flash 대비 OSWorld-Verified에서 78.4%에서 83%로, DeepSWE에서 37%에서 49%로 개선됐다. Gemini 3.5 Flash-Lite는 전작 대비 Terminal-Bench 2.1에서 31%에서 54%로 가장 큰 폭의 향상을 기록했다.
전망
Google은 공식 발표에서 'We have already started our most ambitious pre-training run yet, for Gemini 4'라며 차기 모델 Gemini 4의 사전학습을 이미 시작했다고 밝혔다. 이번 Flash 라인업 갱신은 차기 플래그십 출시 전 실용성과 비용 효율을 강화하는 중간 단계로 해석된다.
결론
Gemini 3.6 Flash와 3.5 Flash-Lite는 코딩·에이전트 벤치마크 전반에서 확인 가능한 개선을 보였다. 비용 효율과 최신 지식 반영이 중요한 개발자, 대량 API 호출이 필요한 기업 사용자에게 적합한 선택지다.
장점
- DeepSWE·MLE Bench·OSWorld-Verified 등 핵심 벤치마크 전반 개선 확인
- 출력 토큰 17% 감소로 비용 및 응답 속도 효율화
- 지식 컷오프 2026년 3월로 최신 정보 반영 범위 확대
- 고성능(3.6 Flash)과 저비용(3.5 Flash-Lite) 두 가지 선택지 동시 제공
단점/한계
- Gemini 3.6 Flash 가격이 3.5 Flash-Lite 대비 여전히 높음 (입력 $1.50 vs $0.30)
- 벤치마크 개선폭이 항목별로 편차가 있어 모든 작업에서 균일한 향상은 보장되지 않음
- 두 모델 모두 최상위 플래그십(Pro급) 대비 추론 성능에는 한계 존재
참고 자료
댓글0개
주요 기능/특징
1. Gemini 3.6 Flash: DeepSWE 49%(이전 37%), MLE Bench 63.9%(이전 49.7%), OSWorld-Verified 83%(이전 78.4%) 달성 2. 출력 토큰 17% 감소로 reasoning step·tool call 횟수 감소 3. 지식 컷오프 2026년 3월로 갱신 (이전 2025년 1월) 4. 가격: 입력 100만 토큰당 $1.50, 출력 100만 토큰당 $7.50 5. Gemini 3.5 Flash-Lite 동시 출시: 입력 $0.30, 출력 $2.50, Terminal-Bench 2.1 54%(이전 31%)
핵심 인사이트
- Gemini 3.6 Flash의 OSWorld-Verified 83% 기록은 컴퓨터 사용 에이전트 작업의 신뢰도 향상을 보여준다
- 출력 토큰 17% 감소는 성능 향상과 동시에 API 비용 절감 효과를 낸다
- 지식 컷오프가 2025년 1월에서 2026년 3월로 갱신되며 최신 정보 반영 범위가 크게 넓어졌다
- Gemini 3.5 Flash-Lite의 Terminal-Bench 2.1 31%→54% 향상은 경량 모델 라인업의 실용성을 높인다
- 두 모델 동시 출시는 고성능(3.6 Flash)과 저비용(3.5 Flash-Lite)의 이원화 전략을 보여준다
- Google이 Gemini 4 사전학습 착수를 공식 언급하며 차기 플래그십 개발이 진행 중임을 시사했다
- GDPval-AA 점수 개선(1349→1421, 642→1140)은 실무 작업 대응력이 두 모델 모두에서 향상됐음을 나타낸다
이 리뷰가 유용했나요?
공유하기
관련 AI 리뷰
Gemini 3.8 Flash 출시, 사이버보안 특화 변형 'Cyber' 제한 공개
구글이 2026년 9월 2일 Gemini 3.8 Flash를 출시했다. 1M 토큰 컨텍스트와 effort level 조절 기능을 갖췄고, 사이버보안 전용 변형 Cyber는 검증된 보안팀에만 제한 공개된다.
구글 어시스턴트 9월 4일 종료: Android 전체가 Gemini로 전환
Google이 9월 4일부터 Android·Wear OS의 Google Assistant 접근을 순차 제거하고 Gemini로 완전 대체한다. 되돌리기는 불가능하다.
Google DeepMind, 암호화 기반 이중맹검 AI 평가 파일럿 공개
Google DeepMind가 벤치마크 오염을 막는 세계 최초 이중맹검 AI 평가를 파일럿했다. Confidential Computing으로 평가자와 모델 제공자 모두의 데이터를 보호한다.
Google Chat, 사이드패널 대신 Ask Gemini 정식 통합
2026년 8월 26일부터 Google Chat 사이드패널이 사라지고 Ask Gemini로 전면 교체된다. 대화 기록 미이전 등 한계도 함께 살펴본다.
