글쓰기·수학·코딩 전반에서 GPT-5.6보다 개선된 GPT-6 Astra는 특히 3D 렌더링·애니메이션과 컴퓨터 사용에서 큰 진전을 보임 루프형 트랜스포머는 같은 가중치의 블록을 여러 번 적용해 유효 깊이를 늘림 — 가중치 저장 메모리는 줄지만 반복 계산과 각 패스의 KV 캐시 비용까지 사라지지는 않음 Astra의 루프형 구조 채택은 공식 확인되지 않은 보도에 머물며, 짧아진 사고 사슬이나 추론 감시 가능성 저하가 루프 때문이라는 증거도 확립되지 않음 에이전트 성능은 하네스와 지침 파일에도 영향을 받으므로, 공통 하네스 평가와 실제 사용 환경을 구분하고 오래된 AGENTS.md·SKILL.md를 재검토할 필요가 있음 반복 계산은 지식 저장보다 다단계 문제 해결에 도움이 되며, 충분한 모델 규모에서는 같은 계산 예산으로 품질을 높일 수 있음 — 다만 효과는 모델 크기·학습 예산·작업·학습 방식에 따라 달라짐 Astra의 성능과 벤치마크 해석 사용 경험에서 GPT-6 Astra는 매우 강력한 모델로 평가되며, GPT-5.6 대비 글쓰기·수학·코딩의 전반적인 개선 중에서도 3D 렌더링과 애니메이션의 도약이 두드러짐 ARC-AGI-3에서 99.9% 를 기록해 GPT-5.6 Sol의 7.8% 를 크게 웃돎 이 벤치마크는 논리 퍼즐 해결과 일반화를 함께 측정함 수학·코딩·컴퓨터 사용 벤치마크는 실제 활용에 더 가까운 평가임 Artificial Analysis Coding Agent Index v1.4에서는 최상위권이지만 압도적인 격차는 없으며, 여러 작업을 혼합한 Artificial Analysis Intelligence Index에서도 비슷한 양상이 나타남 독립 평가는 개발사의 자체 평가보다 신뢰할 여지가 있지만, 벤치마크별 하네스 구성을 함께 봐야 함 GDPval-AA와 AA-Briefcase는 여러 LLM에 동일한 최소 구성의 오픈소스 Stirrup 하네스를 사용함 Intelligence Index v4.2의 Terminal-Bench v2.1은 Terminus 2, τ³-Banking은 τ-Bench 하네스를 사용함 별도의 Coding Agent Index에서는 서로 다른 코딩 에이전트 하네스도 비교함 공통 하네스는 비교 조건을 맞추지만, 모델은 보통 특정 주력 하네스를 염두에 두고 학습되며 해당 하네스도 모델의 강점을 살리도록 개발됨 일부 에이전트 평가가 Astra의 주력 하네스 성능을 과소평가할 가능성은 있으나...
GPT-6 Astra, 루프형 트랜스포머와 숨겨진 추론
3 weeks ago
24
Related
Strands Decider 2B - 소형 오픈소스 의사결정 모델
52 minutes ago
0
Tell HN: GitHub이 한 달이 지나도 제 소프트웨어의 크랙 복제본 삭제를 거부합니다
55 minutes ago
1
Penguin Mail - AI를 탑재한 Linux용 오픈소스 Rust 이메일 클라이언트
1 hour ago
3
Show GN: 이메일 피싱 모의훈련을 전화로 옮겼습니다. 예고 없는 전화
2 hours ago
3
토론토 기반 VPN 업체, 적법 접근 법안으로 캐나다 떠날 계획
2 hours ago
3
Claude Code의 메시지 제안 기능: 진짜 고객은 모델이라는 생각
3 hours ago
3
Show GN: 추천링크·UTM으로 오프라인 소개의 성과를 추적하는 구조
5 hours ago
3
Tips
click
Popular
프로들도 줄지어 샷 점검… KLPGA 스타 사랑방 된 더헤븐CC 연습장
2 weeks ago
73
iOS 27, iPadOS 27, macOS 27
3 weeks ago
69
손흥민 선제골 발판·골대 불운…LAFC, 7경기 만에 승리
3 weeks ago
65
영림원소프트랩, 나람 통합 ERP 구축…사료 제조·물류·회계 데이터 하나로
2 weeks ago
62
'이 악문' 김영범, 자유형 50m '대회 신기록' 금메달
2 weeks ago
55
© Clint IT 2026. All rights are reserved









English (US) ·