2026.07.25
28
0
0
GPTNEW

ChatGPT 음성으로 컴퓨터 제어: 데스크톱 앱에 GPT-Live 탑재

OpenAI가 2026년 7월 24일 ChatGPT 데스크톱 앱에 풀듀플렉스 음성 기능을 출시했다. Work·Codex 환경에서 음성만으로 컴퓨터와 다중 에이전트를 제어할 수 있다.

#ChatGPT#OpenAI#GPT-Live#음성AI#Codex
ChatGPT 음성으로 컴퓨터 제어: 데스크톱 앱에 GPT-Live 탑재
AI 핵심 요약

OpenAI가 2026년 7월 24일 ChatGPT 데스크톱 앱에 풀듀플렉스 음성 기능을 출시했다. Work·Codex 환경에서 음성만으로 컴퓨터와 다중 에이전트를 제어할 수 있다.

핵심 요약

OpenAI가 2026년 7월 24일 macOS·Windows용 ChatGPT 데스크톱 앱에 음성 기능을 정식 출시했다고 발표했다. 7월 8일 공개된 풀듀플렉스(full-duplex) 음성 모델 GPT-Live를 기반으로, 사용자는 ChatGPT Work와 Codex 환경에서 음성만으로 컴퓨터를 조작하고 여러 에이전트의 작업을 동시에 지시할 수 있게 됐다. OpenAI 공식 발표와 OpenAI 개발자 커뮤니티 공지를 통해 확인됐다.

왜 중요한가

기존 Advanced Voice Mode는 한쪽이 말하면 다른 쪽이 기다리는 턴 기반(turn-based) 방식이었다. GPT-Live는 입력과 출력을 동시에 처리하는 풀듀플렉스 구조로, 사용자가 대화 중 자연스럽게 끼어들 수 있다. 이번 업데이트의 핵심은 이 기술을 모바일을 넘어 데스크톱의 실제 작업 환경, 즉 코드 작성과 에이전트 조율까지 확장했다는 점이다.

기능 상세

항목내용
핵심 기술GPT-Live 기반 풀듀플렉스 음성 아키텍처
적용 환경ChatGPT 데스크톱 앱의 Work·Codex 모드
컴퓨터 제어음성 명령으로 웹사이트·앱 탐색 등 컴퓨터 사용 작업 수행
화면 인식macOS Appshots 기능으로 활성 창·로컬 파일·코드베이스 구조 인식
다중 에이전트하나의 음성 명령으로 여러 Codex 에이전트 작업 동시 조율
원격 제어iOS 앱에서 데스크톱 Codex 음성 기능 원격 접근 지원
제공 플랜Plus, Pro, Business, Edu, Enterprise (macOS·Windows 글로벌 순차 배포)

OpenAI가 공개한 시연에서는 개발자가 단일 음성 명령으로 새 스레드 생성, 풀 리퀘스트 작성, 버그 원인 파악까지 연속 작업을 처리하는 모습이 소개됐다. 사용자는 데스크톱 앱에서 Work 또는 Codex를 선택한 뒤 음성 버튼이나 단축키로 기능을 실행하며, 대화 도중 자연스럽게 끼어들거나 실시간 텍스트로 대화 내용을 확인할 수 있다.

사용성 분석

모바일 버전이 대화의 자연스러움에 초점을 맞췄던 것과 달리, 데스크톱 버전은 복잡한 다단계 명령을 실제로 실행하는 데 강점이 있다. 특히 개발자에게는 코드 작성·리뷰·배포까지 이어지는 작업을 손을 떼지 않고 음성으로 지시할 수 있다는 점이 매력적이다. 다만 이번 발표에는 구체적인 명령 인식 정확도나 응답 지연시간 등 정량적 성능 지표는 공개되지 않았다.

장단점

장점은 명확하다. 풀듀플렉스 구조 덕분에 대화가 훨씬 자연스러워졌고, Work·Codex 환경과 결합해 실질적인 업무·개발 자동화가 가능해졌다. macOS Appshots을 통한 화면 맥락 인식과 iOS 원격 제어는 실용성을 높이는 요소다. 반면 이번 업데이트는 Plus 이상 유료 플랜에 집중돼 있어 무료 사용자의 체감 효과는 제한적이며, 정확한 인식률이나 실패 시 복구 방식 등 세부 안정성 정보는 아직 부족하다.

전망

이번 발표는 Anthropic이 같은 주간 Claude 음성모드에 Opus·Sonnet 모델과 Gmail·Slack 자동화를 추가한 것과 맞물려 주목받고 있다. OpenAI가 풀듀플렉스 대화 경험과 자체 에이전트(Codex) 제어에 집중한 반면, Anthropic은 외부 생산성 앱 연동에 무게를 뒀다는 점에서 두 회사의 음성 AI 전략이 갈리는 모습이다. 음성 인터페이스가 차세대 AI 에이전트의 주요 입력 방식으로 자리잡을지 여부가 향후 관전 포인트다.

결론

ChatGPT 데스크톱 음성 기능은 코딩과 에이전트 작업을 손이 아닌 음성으로 처리하려는 개발자·업무 사용자에게 실질적인 변화를 예고한다. 다만 유료 플랜 중심 출시와 미공개된 정량적 성능 지표를 고려하면, 실제 업무 도입 전 직접 사용해보며 정확도를 점검하는 과정이 필요하다.

장점

  • 풀듀플렉스 구조로 자연스러운 끼어들기 대화 가능
  • 음성만으로 컴퓨터 조작과 다중 에이전트 조율 가능
  • macOS Appshots로 화면 맥락을 자동 인식해 명령 정확도 향상
  • iOS 앱을 통한 원격 제어로 이동 중에도 Codex 작업 지시 가능

단점/한계

  • Plus 이상 유료 플랜 중심으로 배포돼 무료 사용자는 체감 효과 제한적
  • 정확한 명령 인식률·응답 지연시간 등 정량적 성능 지표 미공개
  • 이번 발표에 실패 시 복구 절차 등 세부 안정성 정보 부족

댓글0

주요 기능/특징

1. GPT-Live 기반 풀듀플렉스 음성 아키텍처로 자연스러운 끼어들기 대화 지원 2. ChatGPT Work·Codex 환경에서 음성으로 컴퓨터·다중 에이전트 제어 3. macOS Appshots으로 활성 창·로컬 파일·코드베이스 구조 인식 4. 단일 음성 명령으로 스레드 생성부터 풀 리퀘스트 작성까지 연속 작업 처리 5. iOS 앱을 통한 데스크톱 Codex 음성 기능 원격 접근

핵심 인사이트

  • 턴 기반 대화에서 풀듀플렉스로의 전환은 AI 음성 인터페이스의 자연스러움을 한 단계 끌어올린다
  • 음성 기능이 모바일 대화 보조를 넘어 데스크톱 개발 워크플로우까지 확장되고 있다
  • 다중 에이전트를 음성 하나로 동시 조율하는 기능은 코딩 자동화의 진입장벽을 낮춘다
  • macOS Appshots을 통한 화면 맥락 인식은 별도 설명 없이도 정확한 작업 지시를 가능케 한다
  • Plus 이상 유료 플랜 중심 출시는 초기 타깃이 파워유저·개발자임을 시사한다
  • 같은 주 발표된 Claude 음성모드 업데이트와 비교하면 OpenAI는 자체 에이전트 제어, Anthropic은 외부 앱 연동에 집중하는 차이가 뚜렷하다
  • 정량적 인식 정확도나 지연시간 지표가 공개되지 않아 실제 성능은 사용자 검증이 필요하다

이 리뷰가 유용했나요?

공유하기