2026.09.17
4
0
0
GeminiNEW

Gemini 3.8 Live 공개, 실시간 음성 대화 중 추론까지 수행

Google이 2026년 9월 15일 실시간 음성 AI 'Gemini 3.8 Live'와 확장 추론판 'Live Extended Thinking'을 발표했다. 97개 언어 자동 전환과 말하며 추론하는 기능이 핵심이다.

#Gemini#Google#Gemini 3.8 Live#Gemini 3.8 Live Extended Thinking#음성AI
Gemini 3.8 Live 공개, 실시간 음성 대화 중 추론까지 수행
AI 핵심 요약

Google이 2026년 9월 15일 실시간 음성 AI 'Gemini 3.8 Live'와 확장 추론판 'Live Extended Thinking'을 발표했다. 97개 언어 자동 전환과 말하며 추론하는 기능이 핵심이다.

핵심 요약

Google이 2026년 9월 15일 실시간 음성 대화에 특화된 AI 모델 두 가지를 공식 발표했다 (Google 공식 블로그). "Gemini 3.8 Live"와 확장 추론 버전인 "Gemini 3.8 Live Extended Thinking"이다. 이 모델은 지난 9월 2일 출시된 범용 멀티모달 모델 "Gemini 3.8 Flash"와는 별개의 제품이다. Gemini 3.8 Flash가 1M 토큰 컨텍스트를 갖춘 텍스트·멀티모달 범용 모델이라면, Gemini 3.8 Live 계열은 음성 대화 자체에 특화된 별도 모델 라인이다.

기능 소개

1. 97개 언어 실시간 자동 전환

대화 도중 사용자가 언어를 바꿔도 모델이 이를 자동으로 감지해 실시간으로 전환한다. 지원 언어는 97개다 (Google 공식 블로그). 별도의 언어 설정 변경 없이 다국어 대화가 자연스럽게 이어진다.

2. 대화를 유지한 채 백그라운드 도구 호출

대화 중간에 도구나 API를 호출해도 대화 흐름이 끊기지 않는다. 예약, 조회, 결제 같은 작업을 음성 대화와 동시에 백그라운드에서 처리할 수 있다는 의미다.

3. 말하면서 동시에 추론하는 Extended Thinking

Gemini 3.8 Live Extended Thinking의 핵심 차별점은 "말하면서 동시에 추론"하는 구조다. 답변을 만들기 전에 멈춰서 생각하는 방식이 아니라, 발화와 추론, 도구 호출을 동시에 처리한다.

4. 공식 벤치마크 성능

Google이 공식 발표한 벤치마크는 다음과 같다.

벤치마크점수대상 모델
Artificial Analysis Speech-to-Speech Quality Index82.6점 (업계 1위 주장)3.8 Live Extended Thinking
τ-Voice 에이전트 작업 완료율68.6%Gemini 3.8 Live 계열
Sierra τ-Voice-banking35.1%Gemini 3.8 Live 계열
Big Bench Audio97.7%Gemini 3.8 Live 계열
Speech Agent Arena2위Gemini 3.8 Live

ServiceNow EVA-Bench에서는 비용 대비 성능 곡선인 Pareto Frontier를 달성했다고 발표했다 (Google 공식 블로그).

사용성 분석

배포는 순차적으로 이뤄진다. 개발자는 Gemini API와 Google AI Studio를 통해 먼저 접근할 수 있다. 엔터프라이즈 사용자는 Gemini Enterprise 비공개 미리보기와 Google Cloud를 통해 이용한다. 일반 사용자는 Search Live, Gemini Live, Google Workspace(Docs, Gmail, Keep)에서 순차적으로 만나게 된다. 채널별로 접근 시점에 차이가 있어, 이 시점에서 전면적인 사용성 판단은 제한적이다.

장단점

장점

  1. 97개 언어를 대화 중 자동 감지·전환해 다국어 환경에 유리하다.
  2. 대화를 끊지 않고 백그라운드에서 도구·API 호출을 수행한다.
  3. Extended Thinking은 발화와 추론을 동시에 처리해 응답 지연을 줄인다.
  4. Big Bench Audio 97.7%, τ-Voice 68.6% 등 복수 벤치마크에서 높은 점수를 기록했다 (Google 공식 발표).
  5. ServiceNow EVA-Bench에서 비용 대비 성능 최적 곡선을 달성했다고 발표했다.

단점

  1. 구체적인 가격이 공개되지 않았다. 공식 발표에는 "높은 비용 효율성"이라는 표현만 있을 뿐 정확한 요금 수치는 없다.
  2. 배포가 개발자, 엔터프라이즈, 일반 사용자 순으로 나뉘어 있어 일부 사용자는 즉시 이용할 수 없다.
  3. Speech Agent Arena에서는 1위가 아닌 2위에 그쳤다.

전망

음성 대화 중 실시간으로 도구를 호출하고 추론까지 수행하는 방식은 음성 에이전트가 실제 업무에 투입될 수 있는 조건에 가까워졌다는 신호다. Sierra τ-Voice-banking처럼 금융권 특화 벤치마크가 포함된 점은 Google이 엔터프라이즈 음성 에이전트 시장을 겨냥하고 있음을 보여준다. 다만 가격 정책이 아직 공개되지 않은 만큼, 실제 도입 비용은 향후 발표를 지켜봐야 한다.

결론

Gemini 3.8 Live와 Extended Thinking은 Gemini 3.8 Flash와 별개로 음성 대화 자체에 집중한 모델이다. 다국어 자동 전환과 대화 유지형 도구 호출은 음성 에이전트 구축에 실질적인 도움이 될 것으로 보인다. 다만 구체적 가격이 미공개 상태이고 채널별 배포 시차가 있어, 지금 시점에서는 개발자와 엔터프라이즈 얼리어답터에게 우선 추천한다.

장점

  • 97개 언어 실시간 자동 감지·전환
  • 대화를 유지한 채 백그라운드에서 도구·API 호출 가능
  • 복수 공식 벤치마크에서 높은 점수 (Big Bench Audio 97.7%, τ-Voice 68.6% 등)
  • ServiceNow EVA-Bench에서 비용 대비 성능 최적화 달성 발표

단점/한계

  • 구체적인 가격 정보가 공식 발표에 명시되지 않음
  • 배포가 개발자·엔터프라이즈·일반 사용자 순으로 단계적이라 일부 사용자는 즉시 이용 불가
  • Speech Agent Arena에서는 1위가 아닌 2위에 그침

댓글0

주요 기능/특징

1. 대화 중 97개 언어 자동 감지 및 실시간 전환 (Google 공식 발표) 2. 대화 흐름을 유지한 채 백그라운드에서 도구·API 호출 수행 3. Extended Thinking: 말하면서 동시에 추론하는 구조 (핵심 차별점) 4. Artificial Analysis Speech-to-Speech Quality Index 82.6점, Big Bench Audio 97.7% 등 복수 벤치마크 상위권 기록 (Google 공식 발표) 5. 개발자(Gemini API, AI Studio) → 엔터프라이즈(Gemini Enterprise, Google Cloud) → 일반 사용자(Search Live, Gemini Live, Workspace) 순 단계적 배포

핵심 인사이트

  • Gemini 3.8 Live는 9월 2일 출시된 범용 모델 Gemini 3.8 Flash와는 별도의 음성 특화 모델 라인이다
  • 97개 언어를 대화 중 자동 감지·전환하는 기능은 다국어 고객 응대에 실질적 이점이다
  • 대화를 끊지 않고 백그라운드에서 도구·API를 호출하는 구조는 음성 에이전트의 실무 적용 가능성을 높인다
  • Extended Thinking의 '말하면서 동시에 추론'하는 방식은 응답 지연을 줄이는 핵심 차별점이다
  • Artificial Analysis Speech-to-Speech Quality Index 82.6점은 Google이 업계 1위라고 주장한 수치다
  • Sierra τ-Voice-banking 벤치마크 포함은 금융권 음성 에이전트 시장을 겨냥한 것으로 해석된다
  • ServiceNow EVA-Bench에서 비용 대비 성능 Pareto Frontier를 달성했다고 발표했다
  • 배포가 개발자, 엔터프라이즈, 일반 사용자 순으로 단계적으로 이뤄져 접근 시점에 차이가 있다

이 리뷰가 유용했나요?

공유하기