Gemini 3.5 Transcribe: 실시간·녹음 음성을 정밀하게 텍스트로 변환

4 hours ago 2

Google이 배경 소음과 전문 용어, 말더듬, 자기 수정까지 처리해 정돈된 텍스트로 바꾸는 고정밀 음성-텍스트 모델을 공개함 gemini-3.5-transcribe-live는 Live API에서 1초 미만 지연 시간의 양방향 스트리밍을, gemini-3.5-transcribe는 Interactions API에서 화자 구분과 단어 단위 타임스탬프를 지원함 Artificial Analysis 측정 평균 단어 오류율(WER)은 스트리밍 4.0%, 비스트리밍 2.6% 이며, Chirp 3보다 최종 전사 시간이 70% 단축됨 85개 이상의 언어와 지역 억양·방언, 맞춤 어휘, 실시간 언어 전환을 지원하고 녹음 음원에서는 최대 3명의 화자를 구분하지만, 3명 초과 지원은 실험 단계임 개발자와 기업을 위한 공개 프리뷰가 시작됐으며 Gboard, Google Antigravity, Google AI Studio, Gemini macOS 앱에 적용되고 Chrome의 모든 웹 입력 필드에도 추가될 예정임 실시간과 녹음용 전사 API 실시간 스트리밍은 Live API의 gemini-3.5-transcribe-live를 통해 연속 양방향 스트리밍과 1초 미만 지연 시간을 제공함 대화형 음성 앱과 음성 에이전트, 실시간 자막 도구에 활용할 수 있음 사전 녹음 처리는 Interactions API의 gemini-3.5-transcribe로 녹음, 회의, 통화 기록 등을 변환함 화자 구분과 단어 단위 타임스탬프를 지원해 통화 후 분석 파이프라인에 활용 가능함 두 모델은 Google AI Studio의 Gemini API와 Gemini Enterprise Agent Platform에서 제공됨 발화 의도를 반영하는 전사 스마트 전사는 “화요일에 만나자—아니, 수요일” 같은 자기 수정을 반영하고 “음”, “어” 같은 군더더기를 제거한 뒤 텍스트 서식까지 자동으로 정리함 자연스러운 말하기 방식에서 사용자의 의도를 파악하고, 음성으로 작업을 실행하도록 설계됨 함수 호출을 이용해 이미지 생성이나 파일 분석 같은 복잡한 작업을 다른 Gemini 모델에 위임할 수 있음 현재 Gemini macOS 앱에서 이용 가능함 사용자가 제공한 맞춤 어휘를 바탕으로 전문 용어와 고유한 철자를 인식함 85개 이상의 언어를 자동으로 감지·전사하며, 지역 억양과 다양한 방언, 실시간 언어 전환도 처리함 사전 녹음 음원에서는 타임스탬프와 함께 최대 3명의 발화를 구분함...

Read Entire Article