1 / 1
4-3
Solar Open 2 완전정복 · 4강 / 5강 · 4-3 / 3

완전 비동기 RL 상세와 MOPD

기다림 없는 학습을 지탱하는 5가지 기술과, 12명의 전문가를 한 모델로 합치는 MOPD의 시스템 엔지니어링을 파헤칩니다

Solar Open 2 기술 보고서 기반 · 초심자를 위한 쉬운 해설
완전 비동기 RL — 5가지 장치

기다림 없는 학습을 지탱하는 5가지 기술

완전 비동기 RL — 5가지 장치 (이어서)

나머지 두 가지 장치와 실제 효과

동기식 (기존)
완전 비동기 (Solar Open 2)
동기식은 가장 느린 작업 하나 때문에 전체가 멈춰 기다립니다. 비동기식은 끝나는 대로 바로 다음 라운드로 넘어갑니다.
통합의 기술

MOPD — 12명의 전문가를 한 명으로

12명의 전문가
각 분야 전문가의 노하우가 학생 모델 1개로 압축됩니다
💡
쉽게 말하면

12과목 과외 선생님의 노하우를 한 학생이 실전 문제를 풀어가며 배우는 것과 비슷해요.

왜 MOPD인가

왜 그냥 정답을 외우게 하지 않았나

💡
쉽게 말하면

모범답안을 통째로 외우게 하면, 시험에서 조금만 다른 문제가 나와도 당황합니다. 그 대신 학생이 직접 문제를 풀어보게 하고, 그 답안을 바로 그 자리에서 선생님이 첨삭해주는 방식이 훨씬 실전에 강해요.

MOPD를 250B까지 — 시스템 엔지니어링 4대 난관 (1/2)

아이디어는 쉬운데, 실제로 돌리는 게 어려웠다

26GB → 1.1GB
[L×V] 확률분포 대신 은닉상태 전송 시 마이크로배치당 메모리
48배
어휘 크기(196,608) 대비 히든 크기(4,096)의 축소 비율
MOPD를 250B까지 — 시스템 엔지니어링 4대 난관 (2/2)

전송과 교사 풀 관리도 발목을 잡았다

O(batch)
교사가 12개여도 총 교사 연산량은 배치 크기에만 비례
1개 GPU + 12개 CPU
GPU 상주 교사 1개, 나머지는 CPU 스냅샷으로 hot-swap
정리

4강 핵심 정리

다음 강의

5강 예고: 이렇게 완성된 모델의 실제 성적표를 확인하고, 강의를 마무리합니다.