학습이 4단계로 어떻게 진행되는지, 그리고 선배 모델에게서 무엇을 얼마나 물려받았는지 살펴봅니다
1세대의 핵심만 재사용
10조 토큰으로 폭넓게 학습
품질 좋은 1조 토큰만 재학습
1M 토큰 확장 + 체크포인트 합치기
이사할 때 중요한 가구만 챙기고, 새 집 구조에 안 맞는 건 새로 사는 것과 같아요.
| 구성요소 | 모양 관계 | 파라미터 | 처리 |
|---|---|---|---|
| 토큰 임베딩/출력층 | 동일 | 1.61B | ✓ 전이 |
| 정규화 층 | 동일 | <0.01B | ✓ 전이 |
| 소프트맥스 어텐션 q/k/v/o (12개 층) | 동일 (GQA 기하 유지) | 0.91B | ✓ 전이 |
| 소프트맥스 어텐션 시그모이드 게이트 | 신규 부품 | <0.01B | ✗ 무작위 초기화 |
| 선형 어텐션 q/o (36개 층) | 신규, GQA q/o에서 재매핑 | 2.42B | ✓ 전이 |
| 선형 어텐션 k/v·decay/write 게이트·컨볼루션 | 신규 부품, 대응 없음 | ≈2.5B | ✗ 무작위 초기화 |
| MoE 공유 전문가 (48개 층) | 동일 | 0.75B | ✓ 전이 |
| MoE 라우팅 전문가(×320)+라우터 | 128→320, 1:1 매핑 불가 | ≈241.7B | ✗ 무작위 초기화 |