GPT‑Live‑1 API는 듣기와 말하기를 동시에 처리하고, 복잡한 추론과 작업은 연결된 모델·도구에 위임해 백엔드 작업 중에도 대화를 이어갈 수 있음 단일 음성 모델이 입력·출력 오디오를 함께 처리하므로 음성 인식–추론–음성 합성을 연결하는 구조의 지연과 불안정한 단계 간 인계를 피할 수 있음 초기 평가에서 Speak는 기존 턴 기반 시스템 대비 끼어들기를 거의 80% 줄임. OpenAI의 Full Duplex Bench에서는 GPT‑Realtime‑2.1보다 30%포인트 높은 성능을 보였으며, GPT‑6 Astra의 중간 추론 설정과 결합해 Tau3 1위를 기록함 시스템 프롬프트로 말투·속도·대화 스타일을 조정하고 백엔드 모델과 에이전트 하네스를 선택할 수 있으며, 전화 통화·배경 소음 처리·장시간 대화·전사문·명시적 턴 경계도 지원함 프런트엔드 음성 계층은 분당 0.05달러이며, 작업별 추론 깊이·속도·비용에 맞춰 백엔드를 결합할 수 있음. 기업은 OpenAI Presence를 통해 실시간 음성 업무 흐름을 구축할 수도 있음 동시 청취·발화와 대화 제어 ChatGPT에서 처음 공개한 GPT‑Live를 GPT‑Live‑1 API로 제공하며, 음성 앱과 기업 업무 흐름에 활용할 수 있음 듣기와 말하기를 동시에 수행하고, Codex 및 ChatGPT Work 시연처럼 연결된 모델과 도구에 더 깊은 추론과 작업을 위임할 수 있음 끼어들기 처리는 들어오는 오디오와 나가는 오디오를 단일 모델이 함께 추론하는 방식으로 동작함 초기 평가에서 Speak는 언어 튜터가 답하기 전 학습자에게 생각할 시간을 더 주면서, 기존 턴 기반 시스템보다 끼어들기를 거의 80% 줄임 시스템 프롬프트로 에이전트의 말투·속도·대화 스타일을 제품과 사용자, 업무 목표에 맞게 조정할 수 있음 무음 컨텍스트 관리와 배경 소음 처리를 개선해 대화를 끊거나 모든 처리 단계를 소리 내어 말하지 않고 진행할 수 있음 장시간 상호작용에서도 컨텍스트 유지와 대화 품질이 개선됨 식당 예약부터 고객 지원까지 전화 통화용 전이중(full-duplex) 음성 에이전트를 배포할 수 있음 음성 계층을 단순화하고 백엔드를 선택하는 구조 기존 음성 에이전트는 음성 인식(STT)–추론 모델–음성 합성(TTS) 을 연결하므로, 각 인계 단계에서 지연이 늘고 타이밍·컨텍스트·대화 리듬을 잃을 여지가 생김 사용자가 끼어들거나 멈추거나 대화 방향을 바꿀 때의 단계 간 조율도 개...
OpenAI, 동시 청취·발화가 가능한 GPT‑Live‑1 API 출시
3 weeks ago
26
Related
D2Coding 폰트 1.4.0 릴리즈 소식을 전합니다.
39 minutes ago
1
FE News 26년 10월 소식을 전해드립니다.
43 minutes ago
1
자율주행 데이터에서 시간은 어떻게 맞춰지는가
46 minutes ago
1
2026년 개발자 현황
53 minutes ago
1
Strands Decider 2B - 소형 오픈소스 의사결정 모델
1 hour ago
3
Tell HN: GitHub이 한 달이 지나도 제 소프트웨어의 크랙 복제본 삭제를 거부합니다
1 hour ago
3
Penguin Mail - AI를 탑재한 Linux용 오픈소스 Rust 이메일 클라이언트
2 hours ago
3
Show GN: 이메일 피싱 모의훈련을 전화로 옮겼습니다. 예고 없는 전화
3 hours ago
3
Tips
click
Popular
프로들도 줄지어 샷 점검… KLPGA 스타 사랑방 된 더헤븐CC 연습장
2 weeks ago
73
iOS 27, iPadOS 27, macOS 27
3 weeks ago
69
손흥민 선제골 발판·골대 불운…LAFC, 7경기 만에 승리
3 weeks ago
65
영림원소프트랩, 나람 통합 ERP 구축…사료 제조·물류·회계 데이터 하나로
2 weeks ago
62
'이 악문' 김영범, 자유형 50m '대회 신기록' 금메달
2 weeks ago
55
© Clint IT 2026. All rights are reserved









English (US) ·