1 / 1
3-1
Solar Open 2 완전정복 · 3강 / 5강 · 3-1 / 3

4단계 개요와 선택적 가중치 전이

학습이 4단계로 어떻게 진행되는지, 그리고 선배 모델에게서 무엇을 얼마나 물려받았는지 살펴봅니다

Solar Open 2 기술 보고서 3장 기반 · 초심자를 위한 쉬운 해설 + 원문 수치
큰 그림

학습은 4단계로 진행됩니다

1
1단계

기억 물려받기

1세대의 핵심만 재사용

2
2단계

기초 다지기

10조 토큰으로 폭넓게 학습

3
3단계

엄선 학습

품질 좋은 1조 토큰만 재학습

4
4단계

길이 늘리기

1M 토큰 확장 + 체크포인트 합치기

1단계

선배의 기억, 전부 말고 핵심만

0
물려받은 지식 비율
0
학습 효율 개선
💡
쉽게 말하면

이사할 때 중요한 가구만 챙기고, 새 집 구조에 안 맞는 건 새로 사는 것과 같아요.

1단계 · 상세

선택적 가중치 전이 — 전체 내역표 (원문 표 2)

구성요소별 전이 여부 (원문 표 2)
구성요소모양 관계파라미터처리
토큰 임베딩/출력층동일1.61B✓ 전이
정규화 층동일<0.01B✓ 전이
소프트맥스 어텐션 q/k/v/o (12개 층)동일 (GQA 기하 유지)0.91B✓ 전이
소프트맥스 어텐션 시그모이드 게이트신규 부품<0.01B✗ 무작위 초기화
선형 어텐션 q/o (36개 층)신규, GQA q/o에서 재매핑2.42B✓ 전이
선형 어텐션 k/v·decay/write 게이트·컨볼루션신규 부품, 대응 없음≈2.5B✗ 무작위 초기화
MoE 공유 전문가 (48개 층)동일0.75B✓ 전이
MoE 라우팅 전문가(×320)+라우터128→320, 1:1 매핑 불가≈241.7B✗ 무작위 초기화
무작위 초기화된 부분(약 244.3B) 중 대부분(241.7B)이 라우팅 전문가입니다 — 즉 '전문가 팀'은 새로 뽑고, 나머지 뼈대는 그대로 물려받은 셈입니다.
비교 관점

왜 이 방식이 특별한가