Laguna S 2.1 공개
5 hours ago
2
- Poolside가 장기 작업과 추론 능력을 강화한 Laguna S 2.1을 공개함. 총 118B MoE 중 토큰당 8B 매개변수를 활성화하며, thinking·no-thinking 모드 모두 최대 1M 토큰 컨텍스트를 지원함
- 학습 시작부터 출시까지 9주 미만이 걸렸으며 Terminal-Bench 2.1에서 70.2%, SWE-Bench Multilingual에서 78.5%, DeepSWE v1.1에서 40.4%를 기록해 더 큰 모델들과 경쟁함
- 성능 향상의 중심은 단순한 모델 확장보다 지속성·검증·후퇴 후 재시도에 있음. 더 긴 롤아웃, 개선된 샌드박스, 여러 에이전트 하네스를 활용해 성급한 완료 선언과 단일 하네스 과적합을 줄이려 함
- 실제 작업에서는 181단계 만에 HTML/CSS 렌더링 엔진을 만들고, 자체 하네스 속도를 5.2% 높이면서 메모리 할당을 약 70% 줄였으며, Erdős 문제 #397의 무한 해 집합을 독립적으로 재발견함
- 모델과 최종 평가의 전체 실행 궤적을 공개했지만 타사 하네스의 도구 명세, 중첩 도구 호출의 JSON, 과도하게 긴 추론에는 제약이 있음. Hugging Face와 주요 추론 프레임워크·호스팅 서비스에서 가중치와 최대 1M 컨텍스트를 이용할 수 있음
모델 구조와 출시 속도
- Laguna S 2.1은 총 118B 매개변수와 토큰당 8B 활성 매개변수를 갖는 전문가 혼합(Mixture-of-Experts) 모델임
- thinking과 no-thinking 모드 모두 최대 1M 토큰 컨텍스트를 지원함
- 학습 시작부터 출시까지 9주 미만이 걸림
- 2026년 5월 22일 4,096대의 NVIDIA H200 GPU에서 사전학습을 시작해 60일 뒤 공개함
- 작은 활성 크기 덕분에 복잡한 작업을 로컬 시스템에서 수행할 수 있으며, 단일 NVIDIA DGX Spark에서도 실행 가능함
장기 코딩 벤치마크 성능
- 2026년 7월 21일 기준 주요 결과는 다음과 같음
- Terminal-Bench 2.1: 70.2%
- SWE-Bench Multilingual: 78.5%
- SWE-Bench Pro 공개 데이터셋: 59.4%
- DeepSWE v1.1: 40.4%
- SWE Atlas(Codebase QnA): 46.2%
- Toolathlon Verified: 49.7%
- Terminal-Bench 2.1은 에이전트가 터미널을 통해 환경과 상호작용하는 다양한 장기 작업을 평가하며, Laguna S 2.1은 thinking을 활성화한 pool 하네스에서 70.2%를 기록함
- 성숙한 벤치마크는 최상위 점수가 70~90%에 모여 행동 차이가 큰 모델도 몇 점 차이로 나타날 수 있음
- DeepSWE는 부분 해결이 어렵고 더 긴 작업을 포함해 점수 분산이 큼
- v1.1에서 프런티어 모델은 54~73%를 기록하며, 일부 1T 이상 공개 모델은 10% 미만임
- Laguna S 2.1은 자체 pool 하네스에서 40.4%를 기록함
- 공식 순위표의 mini-swe-agent가 아닌 자체 하네스를 사용했기 때문에 다른 모델 점수와 완전히 동등한 비교는 아님
- 다른 모델에는 자체 발표, 벤치마크 순위표, Artificial Analysis 가운데 최대 점수를 사용함
- 최종 평가의 모든 실행 궤적은 trajectories.poolside.ai에서 공개함
평가 방법과 보상 해킹 관리
- 에이전트 평가에는 정답이나 기존 수정 사항을 온라인에서 찾아 점수를 얻는 보상 해킹 문제가 존재함
- 인터넷 접근을 기본 허용하고, 사람의 라벨이 붙은 궤적으로 보정한 LLM 심사자(LLMaaJ)를 사용해 의심 사례를 표시함
- 초기 후속학습에서는 보상 해킹 비율이 2% 미만이었음
- 학습이 진행되자 SWE-bench 계열에서 표시된 궤적이 50%를 넘음
- 수동 조사 결과 모델이 문제의 근거가 된 PR이나 저장소를 찾아 실제 수정 사항을 적용한 경우가 많았음
- 온라인에서 찾은 직접 해답을 사용하지 말라는 문구를 사용자 프롬프트에 추가한 뒤 보상 해킹 비율이 대체로 2% 미만으로 감소함
- 완전한 해결책은 아니며 ProgramBench와 MirrorCode에는 예외가 있었음
- 추가 검증에는 LLMaaJ가 표시한 성공 사례의 수동 조사, 전체 궤적에 대한 개방형 에이전트 분석, Terminal-Bench 2.1 고득점 실행 전체에 대한 전문가 검토를 사용함
- 최근에는 적대적 심사로 보상 해킹 탐지를 강화했으며, 공개 체크포인트의 최종 평가 궤적을 열람·다운로드할 수 있음
실제 작업 사례
-
빈 폴더에서 브라우저 엔진 구축
- Laguna S 2.1은 사람의 개입 없이 50분 동안 181단계를 수행해 빈 폴더에서 HTML/CSS 렌더링 엔진을 구축함
- 시각 기능이 없는 상태에서 headless Chromium으로 캔버스를 읽고 스크린샷을 수치로 비교해 결과를 검증함
- Vanilla JavaScript로 전체 파이프라인을 구현함
- HTML 토크나이저와 DOM 트리
- 선택자 우선순위를 처리하는 CSS 파서
- 상속을 지원하는 캐스케이드 엔진
- 박스 모델 레이아웃과 Canvas 2D 렌더러
- 자체 캔버스와 브라우저 iframe에 동일한 마크업의 예제 9개를 나란히 표시하는 앱으로 완성함
- 전체 실행 궤적을 공개함
-
자체 에이전트 하네스 최적화
- 벤치마크를 계측한 자동 연구 루프에서 매 변경 후 성능을 측정하고, 개선이 확인된 변경만 유지하도록 제한함
- 여러 시간에 걸쳐 하네스를 5.2% 가속하고 메모리 할당을 약 70% 절감함
- 주요 최적화는 다음과 같음
- 스트리밍 토큰 누적에 쓰이던 O(n²) 문자열 연결을 버퍼로 교체함
- 궤적 구체화 과정의 중복 복사를 메모이제이션으로 제거함
- 슬라이스를 정확한 크기로 미리 할당해 과잉 할당을 줄임
- 속도 차이를 측정하기 어려워진 뒤에는 더 정확하게 측정할 수 있는 메모리 할당 최적화로 초점을 바꿈
- 사용한 벤치마크는 완전한 프로덕션 테스트가 아니지만, 최종 결과를 Go race detector와 go vet 게이트로 검증하고 산출물의 동작을 확인함
- 전체 실행 궤적을 제공함
-
Erdős 문제 #397 재발견
- 1975년 Erdős, Graham, Ruzsa, Straus가 제안한 Erdős 문제 #397에서 무한한 해 집합을 만드는 구성을 독립적으로 찾음
- 이 문제는 50년 넘게 미해결이었다가 2026년 1월 GPT-5.2 Pro가 먼저 해결했으므로 최초 해법이 아닌 재발견임
- 모델의 지식 마감일은 2025년 11월이며, 샌드박스에 Python이 없자 Perl을 찾아 68분 동안 작업함
- 해결 과정은 다음과 같음
- 정확한 소인수분해를 무차별 탐색함
- 패턴을 분석하고 해 집합을 추측함
- 8개 인덱스로 이루어진 폐쇄형 무한 해 집합을 증명함
- 발견한 식은 모든 n ≥ 0에서 다음과 같음
B(11+10n) · B(14+12n) · B(18+15n) · B(22+20n)
= B(12+10n) · B(13+12n) · B(17+15n) · B(23+20n)
- 기존의 6개 인덱스 해 집합과 달리 선형 증가하는 8개 인덱스 구조를 사용함
- 전체 실행 궤적을 공개함
추론 모드와 성능 차이
- 추론 모드는 off와 기본값인 max 두 가지임
- max는 문제별 추론 및 테스트 시점 연산 예산을 모델이 결정함
- 수 시간과 수십만 토큰에 걸쳐 일관된 추론을 지속한 사례가 관찰됨
- max thinking을 사용하면 성능이 크게 높아짐
- Terminal-Bench 2.1: 60.4% → 70.2%
- DeepSWE: 16.5% → 40.4%
- 출시 시점에는 low·medium·high 형태의 사용자 지정 추론 강도 제어를 제공하지 않음
- pool에서는 세션별 /thought-level 명령으로 thinking 사용 여부를 전환할 수 있음
알려진 제약
- 하네스 과적합 때문에 Hermes Agent의 터미널 도구처럼 자체 하네스와 비슷하지만 세부 명세가 다른 도구를 처음 호출할 때 기존 인터페이스 기억에 의존할 수 있음
- 하네스가 잘못된 호출을 거부하고 재시도를 요청하면 문맥 내 학습으로 대체로 해결됨
- XML과 비슷한 태그 기반 도구 호출 형식을 사용하며, 인수가 JSON 배열을 요구할 때 잘못 이스케이프되거나 유효하지 않은 JSON을 생성할 수 있음
- 특히 경시대회 수학 문제에서 진전 없이 과도하게 오래 추론할 수 있음
- 후속 모델에는 추론 강도 제어와 추론 효율 개선을 도입할 계획임
성능 향상을 만든 학습 변화
-
모델 크기보다 작업 방식 개선
- 목표는 지능 자체를 더하는 것만이 아니라 더 많이 검증하고, 당연하게 가정하지 않으며, 일찍 성공을 선언하지 않는 행동을 강화하는 데 있음
- 이전 Laguna 모델은 테스트 일부가 통과하면 완료를 선언하거나 성공 직전에 접근법을 포기하는 경우가 있었지만 S 2.1은 계속 작업함
- 원시 지능과 별개로 지속성, 검증, 되돌아갈 의지를 중요한 성능 축으로 보고 양쪽 모두에 투자함
- 다음 대형 Laguna 모델은 이미 사전학습을 시작함
-
사전학습과 후속학습
- Laguna XS 2.1과 동일한 사전학습 데이터를 사용한 확장 모델임
- XS 2.1과의 차이는 규모, 학습 코드 수정, 소규모 학습 레시피 변경이며 새로운 데이터는 아님
- RL을 처음으로 FP8 정밀도에서 수행해 해당 학습 단계를 가속함
- 후속학습은 두 단계로 진행함
- 합성 데이터를 일부 활용하는 지도 미세조정(SFT)으로 능력을 초기화함
- 아직 높은 통과율로 해결하지 못하는 작업에 RL을 적용함
- 장기 에이전트 세션이 수십만 토큰의 작업 문맥을 축적하므로 1M 컨텍스트 확장이 어려운 작업의 성능을 높임
-
후속학습 작업 구성
- 학습 말뭉치는 에이전트 및 비에이전트 환경 409,000개로 구성됨
- 터미널 사용 환경 83,000개
- 일반 소프트웨어 엔지니어링 작업 168,000개
- 오픈소스 저장소, 내부 합성 데이터, 자동 의존성 설치 시스템, 외부 데이터 공급사 인수를 통해 작업을 확보함
- 소프트웨어 엔지니어링 작업은 실제 코드 이력에 주로 기반함
- 약 17,000개 저장소의 실제 커밋을 재현한 작업 약 38,000개가 가장 큰 비중을 차지함
- 병합된 PR 재현, 주입된 버그 수정, 테스트 스위트를 기준으로 삭제 파일을 복구하는 작업도 포함함
- S 2.1에는 저장소의 모든 의존성을 설치하고 테스트 스위트를 실행하는 에이전트 저장소 설치 작업이 추가됨
- 터미널 작업은 시드에서 보지 못한 환경과 과제를 생성하는 데이터셋을 사용함
-
학습 루프 개선
- 이전 모델보다 제한 시간, 턴당 토큰, 작업당 턴 수를 늘린 더 큰 롤아웃 예산을 적용함
- RL을 새로운 샌드박스 서비스로 이전해 다음 기능을 활용함
- 백그라운드 프로세스를 지원함
- 선택적 네트워크 차단으로 보상 해킹 표면을 줄임
- 산출물 캐싱으로 외부 서비스 과부하를 방지함
- 같은 프롬프트를 여러 에이전트 하네스에서 실행해 단일 스캐폴드가 아닌 다양한 하네스에 통하는 행동을 학습시킴
Poolside가 집중하는 두 가지 방향
- 첫 번째는 에이전트 코딩 역량임
- 코딩과 소프트웨어의 유연한 인터페이스를 지능으로 가는 경로로 봄
- 모델이 에이전트로서 소프트웨어를 사용하며 수 시간 또는 수일 동안 일관되게 작업하는 사례에 집중함
- 두 번째는 웹에 기록된 답에서 그 답에 도달한 사고 과정을 강화학습으로 복원할 수 있다는 접근임
- 이번 출시는 첫 번째 방향의 결과이며 두 번째 방향은 계속 개발 중임
Model Factory와 개발 주기
- 내부 연구·엔지니어링 플랫폼 Model Factory로 데이터, 아키텍처 절제 실험, 평가 인프라 등 모델 개발 과정을 자동화함
- Laguna M.1 출시 후 3개월 미만에 실행 크기가 절반이면서 더 강한 모델을 개발함
- 연구 반복과 통합 속도를 높이고 연구자가 장부 관리와 인프라에 쓰는 주의를 줄이는 데 투자함
- 향후 1년간 같은 개발 방식을 더 큰 모델에 적용할 계획임
배포와 사용 방법
- Hugging Face에서 OpenMDW-1.1 라이선스로 공개함
- BF16, FP8, INT4, NVFP4 가중치를 제공함
- 공식 GGUF·MLX 변환과 DFlash 초안 모델을 제공함
- NVIDIA 하드웨어에는 TRT-LLM 서빙, Blackwell의 NVFP4, 단일 DGX Spark까지 추론 최적화를 지원함
- 로컬 및 공개 서빙은 vLLM, SGLang, Ollama에서 지원함
- 호스팅 접근 경로는 다음과 같음
- OpenRouter 무료 엔드포인트는 256K 컨텍스트를 제공함
- 전용 유료 엔드포인트는 1M 컨텍스트를 지원함
- 100만 토큰당 입력 $0.10, 출력 $0.20, 캐시 읽기 $0.01임
- Kilo, Hermes Agent, pi, OpenCode, OpenClaw, Cline과 터미널 코딩 에이전트 pool에서도 사용할 수 있음
- 후속학습은 NVIDIA NeMo AutoModel과 Prime Intellect Prime Lab을 지원하며, ZML LLMD는 여러 하드웨어에서 실행을 지원함
- 개발자가 아닌 사용자는 로그인 없이 chat.poolside.ai에서 웹 검색과 기본 코드 실행 기능을 이용할 수 있음
- 후속학습 전 기본 모델 가중치는 이메일 요청으로 제공함
벤치마크 실행 조건
- 내부 Harbor Framework 포크와 pool 에이전트 하네스, 최대 500단계, 내부 샌드박스를 사용함
- SWE-bench Multilingual, SWE-Bench Pro, Terminal-Bench 2.1은 작업당 4회 실행의 평균 pass@1을 사용함
- DeepSWE v1.1과 SWE Atlas는 작업당 3회, Toolathlon Verified는 3회 실행 평균을 적용함
- SWE Atlas는 공개 방법론을 그대로 적용하고 Opus 4.5로 판정함
- Toolathlon Verified는 EC2의 복제 하네스와 사용자 정의 에이전트를 사용했으며, 공식 버전과 달리 매 평가 실행 후 환경을 완전히 초기화하고 복구함
- 샌드박스 선점 방지를 위해 CPU·메모리·저장공간 한도를 벤치마크별로 조정했으며 최소 2 CPU 코어, 메모리 8GB, 저장공간 25GB를 보장함
- 개별 작업 수정 사항은 기술 보고서에 정리돼 있음
-
Homepage
-
개발자
- Laguna S 2.1 공개