Beam - Reflection의 5,010억 매개변수 오픈 웨이트 모델

1 day ago 3

Reflection이 코딩, 추론, 에이전트 작업용 첫 오픈 웨이트 모델 Beam을 소개함. 총 5,010억 개 중 230억 개 매개변수를 활성화하는 희소 MoE 구조이며, 현재 최종 레드팀 테스트와 평가를 진행 중임 코딩과 에이전트 작업에서 GLM 5.2와 경쟁하고 Qwen 3.8-Max에 근접하는 성능을 보임. Kimi K3 등에는 절대 성능에서 뒤지지만, 고급 추론 벤치마크에서는 GLM 5.2와 비슷한 점수를 추론 연산량의 3~4분의 1로 달성함 23.8조 토큰 사전학습과 대규모 강화학습을 결합함. 강화학습에는 NVIDIA GB300 GPU 10,500개를 4주간 투입했으며, 연산량을 늘리는 동안 평가 성능의 정체는 관찰되지 않음 불필요한 토큰을 억제하는 길이 페널티로 성능과 토큰 사용량의 절충을 개선함. 사용자는 추론 노력 설정을 통해 작업 난도와 연산 예산에 맞춰 응답 길이와 추론 수준을 조절할 수 있음 이달 중 Apache 2.0 라이선스로 가중치를 공개하고, 기술 보고서, 모델 카드, 실행/평가/미세조정 도구를 제공할 계획임. 현재는 일부 사용자에게 초기 버전을 제공하며 조기 접근 신청을 받고 있음 모델 성능과 추론 효율 Beam은 총 5,010억 개 매개변수 중 230억 개를 활성화하는 희소 혼합 전문가 모델(Mixture-of-Experts, MoE)로, 코딩과 에이전트 성능에 중점을 둠 서구권 오픈 웨이트 모델의 성능 경계를 확장하며, 더 큰 GLM 5.2와 경쟁하고 코딩 및 에이전트 작업에서 Qwen 3.8-Max에 근접함 Kimi K3 같은 선도 오픈 모델은 절대 성능에서 앞서며, Beam의 차별점은 추론 시 효율에 있음 코딩 벤치마크에서는 GLM 5.2와 비슷하거나 일부 더 높은 점수를 기록했으나, 최신 상위 모델과의 격차도 남아 있음 SWE Bench Pro v1은 Beam 65.5, GLM 5.2 62.1, Qwen 3.8 Max 67.7임 Terminal Bench v2.1은 Beam 80.1, GLM 5.2 81.0, Qwen 3.8 Max 86.6, Kimi K3 88.3, DeepSeek V4.1 Flash 90.6임 DeepSWE v1.1은 Beam 44.4, GLM 5.2 44.0, Kimi K3 68.0, DeepSeek V4.1 Flash 74.2임 SWE Bench Pro v2-Hard 77.2, SWE Atlas Codebase QnA 34.6, SWEBench Mu...

Read Entire Article