Gemini 3.8 Live와 3.8 Live Extended Thinking

3 weeks ago 20

Google이 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking을 출시함. 각각 규모 확장과 비용 효율, 고난도 작업과 다단계 추론에 초점을 맞춘 음성 대화 모델임 Gemini 3.8 Live는 준실시간 시각 입력을 대화 맥락에 반영하고, 97개 지원 언어를 대화 중 자동 감지해 전환함 Extended Thinking은 추론과 발화를 동시에 수행함. 복잡한 작업을 처리하는 동안 짧은 응답으로 요청을 확인하고 진행 상황을 음성으로 전달해 대화 흐름을 유지함 Extended Thinking은 Artificial Analysis Speech to Speech Quality Index에서 82.6점으로 종합 1위를 기록함. Gemini 3.8 Live는 사용자 선호도를 평가하는 Speech Agent Arena에서 2위를 차지함 두 모델은 Gemini API와 Google AI Studio에서 출시일부터 순차 제공되며, 기업용은 비공개 프리뷰로 제공됨. 일반 사용자의 이용 범위는 모델과 서비스, 구독 등급에 따라 다름 모델별 설계와 대화 방식 Gemini 3.8 Live는 규모 확장과 비용 효율을 목표로 대화 지능, 매끄러운 대화 흐름, 시각 정보에 기반한 응답을 결합함 Gemini 3.8 Live Extended Thinking은 고난도 작업을 위한 모델로, 더 높은 지능과 다단계 추론을 제공함 두 모델은 개발자와 기업이 프로덕션용 음성 에이전트를 구축할 수 있도록 설계됐으며, Gemini 앱, Google Workspace, Search에서 음성으로 복잡한 작업을 수행하는 데 활용됨 Gemini 3.8 Live는 준실시간 시각 입력으로 대화 맥락을 보강하고, 대화 도중 97개 지원 언어를 자동 감지해 전환함 도구와 API 호출은 백그라운드에서 실행하므로, 작업이 완료되기 전에도 요청을 확인하고 대화를 계속할 수 있음 Extended Thinking은 추론과 발화를 동시에 수행하며 복잡한 작업 중에도 대화 흐름을 유지함 “확인해 볼게요” 같은 초기 음성 응답으로 요청을 자연스럽게 확인함 다단계 백그라운드 작업이 진행되는 동안 실시간 진행 상황을 음성으로 전달함 음성 대화와 작업 수행 평가 Extended Thinking은 음성 품질, 에이전트 작업 완료, 추론 평가에서 다음 성적을 기록함 Artificial Analysis의 Speech to Speech Quality Ind...

Read Entire Article