GPT-6 Astra, 루프형 트랜스포머와 숨겨진 추론

3 weeks ago 24

글쓰기·수학·코딩 전반에서 GPT-5.6보다 개선된 GPT-6 Astra는 특히 3D 렌더링·애니메이션과 컴퓨터 사용에서 큰 진전을 보임 루프형 트랜스포머는 같은 가중치의 블록을 여러 번 적용해 유효 깊이를 늘림 — 가중치 저장 메모리는 줄지만 반복 계산과 각 패스의 KV 캐시 비용까지 사라지지는 않음 Astra의 루프형 구조 채택은 공식 확인되지 않은 보도에 머물며, 짧아진 사고 사슬이나 추론 감시 가능성 저하가 루프 때문이라는 증거도 확립되지 않음 에이전트 성능은 하네스와 지침 파일에도 영향을 받으므로, 공통 하네스 평가와 실제 사용 환경을 구분하고 오래된 AGENTS.md·SKILL.md를 재검토할 필요가 있음 반복 계산은 지식 저장보다 다단계 문제 해결에 도움이 되며, 충분한 모델 규모에서는 같은 계산 예산으로 품질을 높일 수 있음 — 다만 효과는 모델 크기·학습 예산·작업·학습 방식에 따라 달라짐 Astra의 성능과 벤치마크 해석 사용 경험에서 GPT-6 Astra는 매우 강력한 모델로 평가되며, GPT-5.6 대비 글쓰기·수학·코딩의 전반적인 개선 중에서도 3D 렌더링과 애니메이션의 도약이 두드러짐 ARC-AGI-3에서 99.9% 를 기록해 GPT-5.6 Sol의 7.8% 를 크게 웃돎 이 벤치마크는 논리 퍼즐 해결과 일반화를 함께 측정함 수학·코딩·컴퓨터 사용 벤치마크는 실제 활용에 더 가까운 평가임 Artificial Analysis Coding Agent Index v1.4에서는 최상위권이지만 압도적인 격차는 없으며, 여러 작업을 혼합한 Artificial Analysis Intelligence Index에서도 비슷한 양상이 나타남 독립 평가는 개발사의 자체 평가보다 신뢰할 여지가 있지만, 벤치마크별 하네스 구성을 함께 봐야 함 GDPval-AA와 AA-Briefcase는 여러 LLM에 동일한 최소 구성의 오픈소스 Stirrup 하네스를 사용함 Intelligence Index v4.2의 Terminal-Bench v2.1은 Terminus 2, τ³-Banking은 τ-Bench 하네스를 사용함 별도의 Coding Agent Index에서는 서로 다른 코딩 에이전트 하네스도 비교함 공통 하네스는 비교 조건을 맞추지만, 모델은 보통 특정 주력 하네스를 염두에 두고 학습되며 해당 하네스도 모델의 강점을 살리도록 개발됨 일부 에이전트 평가가 Astra의 주력 하네스 성능을 과소평가할 가능성은 있으나...

Read Entire Article