같은 GPT-6 Astra도 ARC-AGI-3의 동일한 High 추론 설정에서 하네스에 따라 54.8%와 99.9% 를 기록함. 즉, 장기 실행 에이전트는 모델뿐 아니라 메모리, 도구, 문맥 관리, 제어 루프를 합친 시스템으로 평가해야 함 요청 사이에 이전 추론 상태를 보존하고 긴 대화를 압축하는 하네스에서는 앞서 수행한 작업을 재활용할 수 있었으며, 평가 비용도 약 4만 700달러에서 1만 8,800달러로 줄어듦 별도로 제공되는 과거 문맥 검색, 비동기 도구 호출, 실행 중 지시 변경은 이전 요구사항을 찾고, 도구를 기다리는 동안 다른 일을 하며, 바뀐 요구를 반영하도록 도움 다만 과거 문맥 검색은 출시 당시 실험적 기능이며, 지시 변경이 이미 수행한 작업을 되돌리지는 않으므로 도구 실행 관리와 승인 경계는 애플리케이션이 책임져야 함 벤치마크 포화가 AGI를 입증하는 것은 아니며, 도입 전에는 공통 조건의 모델 비교와 실제 배포 시스템 평가를 구분해 실제 업무의 결과 품질, 오류 복구, 지연시간과 총비용을 확인하는 방식을 제안 AGI 판단에는 아직 증거가 부족함 OpenAI 사장 Greg Brockman은 출시 브리핑에서 최종 판단은 다른 이들에게 맡기면서도 “I think we're there”라고 말함 The Washington Post에 따르면 그는 Astra가 AGI에 해당한다고 믿음 OpenAI Charter는 AGI를 경제적으로 가치 있는 대부분의 작업에서 인간을 능가하는 고도로 자율적인 시스템으로 정의함 출시 벤치마크 하나만으로 이 조건을 입증할 수 없음 Astra가 대부분의 경제적 작업에서 인간을 안정적으로 능가한다는 증거는 아직 없음 OpenAI가 보고한 성능은 FrontierMath Tier 4 98%, ARC-AGI-3 99.9% 이며, 컴퓨터 사용·코딩 성능도 크게 향상됨 Astra가 브라우저, 개발 도구, 스프레드시트 등에서 더 적은 감독으로 작업하도록 추진함 Astra는 범용 디지털 작업자를 향한 유의미한 진전이지만, ‘pre-AGI’라는 명칭 역시 측정 가능한 기준을 주지 못함 ARC Prize는 Astra를 큰 진전으로 평가하면서도 ARC-AGI-3 포화는 AGI의 증거가 아님을 분명히 함 벤치마크는 결정론적 규칙을 가진 제한된 환경을 사용함 실제 업무는 더 복잡하며 에이전트의 실수에 따른 결과를 감당해야 함 99.9%는 모델 단독이 아니라 하네스를 포함한 결과임 에이전트 하네스(...
Related
Penguin Mail - AI를 탑재한 Linux용 오픈소스 Rust 이메일 클라이언트
1 hour ago
2
Show GN: 이메일 피싱 모의훈련을 전화로 옮겼습니다. 예고 없는 전화
1 hour ago
3
토론토 기반 VPN 업체, 적법 접근 법안으로 캐나다 떠날 계획
2 hours ago
3
Claude Code의 메시지 제안 기능: 진짜 고객은 모델이라는 생각
3 hours ago
3
Show GN: 추천링크·UTM으로 오프라인 소개의 성과를 추적하는 구조
4 hours ago
3
소프트웨어 팩토리 패턴 시도하기
5 hours ago
3
Show GN: 웹 변경 모니터링하는 크롬 확장프로그램
5 hours ago
3
Tips
click
Popular
프로들도 줄지어 샷 점검… KLPGA 스타 사랑방 된 더헤븐CC 연습장
2 weeks ago
73
iOS 27, iPadOS 27, macOS 27
3 weeks ago
69
손흥민 선제골 발판·골대 불운…LAFC, 7경기 만에 승리
3 weeks ago
65
영림원소프트랩, 나람 통합 ERP 구축…사료 제조·물류·회계 데이터 하나로
2 weeks ago
62
'이 악문' 김영범, 자유형 50m '대회 신기록' 금메달
2 weeks ago
55
© Clint IT 2026. All rights are reserved

4 weeks ago
21








English (US) ·