Dust는 토큰마다 활성값에 독립적인 잡음을 더하고 손실 감소량을 보상으로 삼아 그래디언트를 추정하는 0차 최적화 방법으로, 큰 탐색 집단을 사용하면 사전학습에서 역전파에 근접하거나 일부 설정에서 더 낮은 손실을 달성함 가상 집단(virtual population) 방식으로 각 토큰을 탐색 개체처럼 활용하므로, 가중치를 개체마다 복제하지 않고 한 번의 순전파에서 수천 개 개체를 병렬 평가할 수 있음 가중치 공간을 탐색하는 EGGROLL-Transformer보다 훨씬 효율적이며, 100만 토큰 이상에서의 효율 차이는 외삽 기준 약 1,000~10,000배에 달함 큰 모델이 오히려 집단 크기 대비 효율적인 결과를 보였으며, 2억 4,300만 파라미터 모델은 대부분의 집단 크기에서 약 120배 작은 모델보다 낮은 손실을 기록함 비슷한 성능에 훨씬 많은 연산량이 필요해 아직 역전파를 실용적으로 대체하기는 어려우며, 현재의 연산 자원 수준에서 대안이 되려면 효율을 여러 자릿수 규모로 개선해야 함 역전파 대신 탐색으로 학습하기 Dust의 목표는 미분 가능성과 해석적 구조에 대한 의존을 줄이고, 대규모 탐색으로 트랜스포머를 처음부터 사전학습하는 것임 역전파는 미분 가능성을 요구하며, 기존 신경망 구조와 최적화기, 하드웨어는 이 제약을 중심으로 발전해 옴 Dust는 트랜스포머 언어 모델 사전학습에서 역전파와 경쟁할 수 있는 최초의 0차 방법을 목표로 함 출발점은 연산량과 함께 확장되는 일반적 방법이 결국 우세해진다는 The Bitter Lesson임 AlphaGo Zero는 사람의 데이터로 초기 학습을 돕는 방식보다, 충분한 연산량을 투입한 자기 대국 방식이 더 나은 결과를 낼 수 있음을 보여줌 미분 가능성과 역전파도 적은 연산량에서는 유용한 귀납적 편향이지만, 연산량이 풍부한 환경에서는 사용 가능한 구조를 제한할 수 있음 그래디언트 기반 방법도 손실 지형을 최적으로 탐색하지 못할 수 있으며, 이것이 신경망의 높은 데이터 요구량과 관련될 가능성이 있음 더 유연한 탐색 기반 기여도 할당(credit assignment) 이 일반화 개선으로 이어질 가능성을 탐구함 활성값 공간은 잠재적 추론을 탐색할 수 있는 후보임 기계적 해석 가능성 연구는 언어로 표현할 수 있는 추론과 그렇지 않은 추론 모두 활성값에 자리함을 보여줌 활성값을 탐색하는 학습은 잠재적 추론에 대한 탐색으로 발전할 가능성이 있음 활성값 교란과 토큰별 가상 집단 기존...
Dust - 역전파 없이 트랜스포머 사전학습하기
22 hours ago
4
Related
Octop - 가족과 소규모 팀이 함께 쓰는 셀프 호스팅 AI 비서
16 minutes ago
0
Show GN: brgr – Claude Code나 Codex가 다른 코딩 에이전트에게 일을 맡기는 herd...
18 minutes ago
0
이메일을 직접 호스팅하는 분들, 무엇을 사용하시나요?
44 minutes ago
0
질량으로 따지면 지구에서 가장 우세한 종은 무엇일까?
1 hour ago
3
OpenAI, AI가 도출한 수학 연구 원고 722편과 증명 자료 공개
1 hour ago
2
Show GN: 안심품 - KC인증 제품만 검색
1 hour ago
3
밀리초 단위로 벤치마크하기
2 hours ago
3
Tips
click
Popular
프로들도 줄지어 샷 점검… KLPGA 스타 사랑방 된 더헤븐CC 연습장
2 weeks ago
73
iOS 27, iPadOS 27, macOS 27
3 weeks ago
69
손흥민 선제골 발판·골대 불운…LAFC, 7경기 만에 승리
3 weeks ago
65
영림원소프트랩, 나람 통합 ERP 구축…사료 제조·물류·회계 데이터 하나로
2 weeks ago
62
'이 악문' 김영범, 자유형 50m '대회 신기록' 금메달
2 weeks ago
55
© Clint IT 2026. All rights are reserved









English (US) ·