Dream-RSI는 코딩 에이전트 자체를 바꾸지 않고, 어느 탐색을 이어가고 병렬화하며 중단할지 결정하는 탐색 정책 코드를 반복적으로 개선하는 프레임워크임 완료된 탐색 이력을 재생 시뮬레이터로 만들어 대안 정책을 저비용으로 평가함. 코딩 에이전트와 평가기를 다시 실행하지 않지만, 기록에 없는 결과를 생성할 수는 없음 온라인 탐색 → 시뮬레이터 구축 → 오프라인 정책 개선을 반복함. 개선된 정책을 온라인에 배포해 새 탐색 이력을 수집하고 시뮬레이터 풀을 확장함 알고리듬 공학, 수학 최적화, GPU 커널 공학의 8개 과제에서 경쟁력 있는 결과를 얻음. Lasso에서는 SimpleTES보다 빠른 해법을 탐색 에이전트 호출 최대 약 162배 적게 사용해 찾음 성능 개선은 과제별로 차이가 있음. 수학의 자기상관 과제에서는 최고 비교 결과에 미치지 못했으며, 정책 선택의 비악화 보장도 고정된 과거 이력의 평균 재생 점수에만 적용됨 고정 탐색과 온라인 정책 최적화의 병목 재귀적 자기 개선(RSI)의 기본 과정은 후보 생성, 평가, 피드백 반영, 다음 시도 개선을 반복하는 탐색 루프임 알고리듬 설계, 개방형 수학 최적화, 시스템 설계, 에이전트 자기 개선에 활용되며, 어려운 과제에서는 수천 번의 생성/평가 주기가 필요함 장기 탐색에서 부적절한 탐색 조율은 계산 자원과 시간을 낭비하고 확장성을 제한함 수작업으로 만든 고정 탐색 전략은 축적된 경험으로 개선되지 않으며, 비효율적인 방향에 계산 자원을 반복 배정할 수 있음 탐색 정책을 온라인에서 최적화하는 방식에도 두 가지 병목이 있음 지연되고 비싼 피드백: 개별 후보와 달리 정책의 품질은 여러 생성/평가 주기에 걸친 탐색 결과를 관찰해야 판단할 수 있음 방대한 메타 정책 공간: 새 정책이 나쁠 수 있어 많은 대안을 시험해야 하고, 각 시험에 긴 온라인 실행이 필요함 탐색 이력을 재생 가능한 세계로 활용 완료된 탐색 이력은 과거 의사결정과 코드 실행 결과를 담은 탐색 트리로 구성할 수 있음 기존의 정적 텍스트 문맥이나 가중치 미세조정용 데이터 활용과 달리, 이미 관찰한 탐색 공간을 재생하는 시뮬레이터로 사용함 논문에서 재생 시뮬레이터(replay simulator) 와 세계(world)는 같은 의미로 쓰임 이 접근은 한 번 이동하며 만든 지도로 실제 장소를 다시 방문하지 않고 경로를 검토하는 방식과 같음 모델 기반 강화학습, World Models, Dreamer 계열처럼 실제 상...
Dream-RSI: 진화하는 세계를 통한 재귀적 자기 개선
2 weeks ago
21
Related
D2Coding 폰트 1.4.0 릴리즈 소식을 전합니다.
1 hour ago
2
FE News 26년 10월 소식을 전해드립니다.
1 hour ago
3
자율주행 데이터에서 시간은 어떻게 맞춰지는가
1 hour ago
2
2026년 개발자 현황
1 hour ago
3
Strands Decider 2B - 소형 오픈소스 의사결정 모델
2 hours ago
3
Tell HN: GitHub이 한 달이 지나도 제 소프트웨어의 크랙 복제본 삭제를 거부합니다
2 hours ago
3
Penguin Mail - AI를 탑재한 Linux용 오픈소스 Rust 이메일 클라이언트
3 hours ago
3
Show GN: 이메일 피싱 모의훈련을 전화로 옮겼습니다. 예고 없는 전화
4 hours ago
3
Tips
click
Popular
프로들도 줄지어 샷 점검… KLPGA 스타 사랑방 된 더헤븐CC 연습장
2 weeks ago
73
iOS 27, iPadOS 27, macOS 27
3 weeks ago
69
손흥민 선제골 발판·골대 불운…LAFC, 7경기 만에 승리
3 weeks ago
65
영림원소프트랩, 나람 통합 ERP 구축…사료 제조·물류·회계 데이터 하나로
2 weeks ago
62
'이 악문' 김영범, 자유형 50m '대회 신기록' 금메달
2 weeks ago
55
© Clint IT 2026. All rights are reserved









English (US) ·