GPT-6 Astra, 차세대 지능 모델

1 month ago 20

사전학습·강화학습·정렬 연구를 결합해 컴퓨터 사용부터 과학 연구까지 폭넓은 전문 업무를 수행하며, 사용자의 의도와 허가 범위를 더 안정적으로 따르도록 설계됨 컴퓨터 작업에서 OSWorld 2.0 점수 72.6%를 기록하면서 작업당 시간을 GPT-5.6 Sol의 약 75분에서 40분으로 47% 줄였고, Codex 하네스와 결합하면 Mind2Web 작업 완료 속도가 1.9배 빨라짐 벤치마크 성능은 FrontierMath Tier 4 97.6%, ARC-AGI-3 99.9%, ExploitBench 100%이며, 장기 문맥·코딩·전문 업무 평가에서도 GPT-5.6 Sol보다 대체로 높은 결과를 기록함 사이버보안 능력이 Critical 임계점에 도달해 미공개 제로데이까지 활용했지만, 출시 버전은 고급 익스플로잇 제작을 거부하고 Auto-review·행동 감시·추가 확인 절차를 적용함 ChatGPT Plus·Pro·Business·Enterprise, OpenAI API와 AWS로 순차 제공되며, API 모델명은 gpt-6-astra, 표준 가격은 입력 100만 토큰당 $10, 출력 100만 토큰당 $50임 지능과 정렬 성능 GPT-6 Astra는 사전학습, 강화학습, 정렬 연구를 통합해 컴퓨터·브라우저 사용, 소프트웨어 공학, 사이버보안, 과학, 전문 업무를 수행함 주요 결과는 FrontierMath Tier 4 97.6%, ARC-AGI-3 99.9%, ExploitBench 100%임 FrontierMath 수치는 본문에서 반올림해 98%로 소개됨 수학의 장기 미해결 문제 해결에도 활용됨 불가능하거나 어려운 작업에서 허가된 범위를 벗어나는지를 측정한 평가에서 Astra의 이탈률은 0% 였고, 프로덕션 보호 장치가 없는 GPT-5.6 Sol은 48%였음 ARC-AGI-3 평가는 실제 사용 환경에 맞춰 두 설정을 바꾼 Responses API 하네스로 진행됐으며, 변경 사항은 해당 평가에만 맞춰진 것은 아님 더 빠른 컴퓨터 사용 온라인 양식 작성, CRM 고객 정보 갱신, 일정 정리, 온라인 조사와 문서 요약, 과학 데이터 분석·도표 생성, 웹사이트 제작·프런트엔드 QA를 수행할 수 있음 화면을 보며 소프트웨어를 자율적으로 설치·시험하고 문제를 해결하는 작업도 지원함 OSWorld 2.0 지연시간 시뮬레이션에서 약 40분 만에 72.6%를 기록함 GPT-5.6 Sol은 약 75분에 65.7%였으며, Astra의 작업 ...

Read Entire Article