영어·한국어 전체 성적표를 원문 그대로 확인하고, 남은 4강의 여정을 미리 살펴봅니다
비슷한 체급의 오픈소스 강자들, 그리고 실전에서 자주 쓰이는 빠른 상용 모델들까지 함께 세워두고 공정한 기준으로 재본 성적표라고 보시면 됩니다.
| Benchmark | Solar Open 2 (250B-A15B) | Solar Open 1 (102B-A12B) | Command A+ (218B-A25B) | Mistral Medium 3.5 (128B dense) | MiMo-V2.5 (310B-A15B) | DeepSeek-V4-Flash (284B-A13B) |
|---|---|---|---|---|---|---|
| MMLU-Pro | 86.2 | 80.4 | 79.0 | 81.2 | 84.6 | 85.9 |
| GPQA-Diamond | 86.3 | 66.2 | 75.6 | 77.5 | 83.0 | 88.9 |
| HLE (no tools) | 28.8 | 11.5 | 11.4 | 12.8 | 24.3 | 32.3 |
| LiveCodeBench v6 | 92.4 | 56.5 | 86.1 | 84.9 | 89.1 | 92.3 |
| ArtifactsBench | 55.9 | 43.4 | 42.8 | 49.8 | 59.3 | 61.0 |
| HMMT2602 | 93.9 | 68.9 | 73.5 | 62.9 | 61.4 | 94.7 |
| AIME2026 | 95.7 | 87.7 | 96.0 | 89.0 | 92.3 | 97.0 |
| MultiChallenge | 61.0 | 40.5 | 45.8 | 49.8 | 39.0 | 62.0 |
| IFBench | 80.0 | 57.7 | 73.9 | 69.0 | 67.1 | 80.3 |
| AA-LCR | 62.3 | 36.0 | 46.0 | 61.0 | 62.7 | 63.7 |
| SWE-Bench Verified | 70.4 | 15.4 | 14.4 | 69.6 | 73.0 | 73.8 |
| Terminal Bench Hard | 28.3 | 2.3 | 25.0 | 33.3 | 41.7 | 34.1 |
| APEX-Agents | 16.6 | 2.4 | 1.6 | 6.1 | 13.4 | 13.2 |
| MCP-Atlas | 58.2 | 34.4 | 27.2 | 30.7 | 63.9 | 58.2 |
| τ3 (banking) | 19.6 | 7.4 | 5.8 | 5.8 | 8.7 | 22.3 |
| GDPval-AA v2 (ELO) | 1128 | – | 712 | 929 | 1145 | 1187 |
💡 지식·추론 / 지시따르기·긴컨텍스트 / 에이전트, 3개 영역으로 나뉜 지표입니다. Solar Open 2는 MMLU-Pro, LiveCodeBench v6, APEX-Agents에서 비교군 최고를 기록했습니다. (표의 ELO는 체스처럼 모델끼리 맞대결시켜 상대적 실력을 매기는 점수 방식이에요.)
영어 시험 세트가 국제 공인 시험이라면, 이 시험들은 한국 상황에 맞춘 '국내용 전문 자격시험'이라고 보시면 됩니다.
| Benchmark | Solar Open 2 | Solar Open 1 | MiMo-V2.5 | DeepSeek-V4-Flash | Claude Haiku 4.5 | GPT-5.4 mini |
|---|---|---|---|---|---|---|
| KMMLU-Pro | 78.4 | 64.0 | 69.1 | 78.9 | 67.9 | 78.1 |
| CLIcK | 90.7 | 78.9 | 78.4 | 89.2 | 53.5 | 89.6 |
| HAE-RAE v1.1 | 73.8 | 73.3 | 61.7 | 73.1 | 38.5 | 69.4 |
| Ko-AIME'25 | 97.7 | 80.0 | 88.0 | 98.0 | 81.7 | 90.7 |
| HRM8K | 92.2 | 87.6 | 90.7 | 93.4 | 90.6 | 91.3 |
| KBank-MMLU | 80.8 | 65.5 | 71.0 | 79.5 | 68.9 | 79.0 |
| KBL | 75.5 | 65.5 | 69.8 | 72.8 | 69.9 | 75.3 |
| KorMedMCQA | 93.0 | 84.4 | 87.7 | 94.1 | 87.0 | 94.2 |
| Ko-GDPval | 86.8 | 3.4 | 81.0 | 85.0 | 68.3 | 59.4 |
| Avg. | 85.4 | 67.0 | 77.5 | 84.9 | 69.6 | 80.8 |
💡 Solar Open 2가 6개 모델 중 평균 1위(85.4)입니다. 자세한 분석은 5강에서 다룹니다.
하이브리드 어텐션, NoPE
기억 계승, 데이터 큐레이션
에이전트 훈련, MOPD
벤치마크, Ko-GDPval
2강 예고: 이 모델은 정확히 어떻게 설계되었을까요? '두 가지 읽기 방식을 섞는 기술'을 공개합니다.