한국어 성적표를 확인하고, 실전 업무 능력을 재는 Ko-GDPval을 알아봅니다
| Benchmark | Solar Open 2 | Solar Open 1 | MiMo-V2.5 | DeepSeek-V4-Flash | Claude Haiku 4.5 | GPT-5.4 mini |
|---|---|---|---|---|---|---|
| KMMLU-Pro | 78.4 | 64.0 | 69.1 | 78.9 | 67.9 | 78.1 |
| CLIcK | 90.7 | 78.9 | 78.4 | 89.2 | 53.5 | 89.6 |
| HAE-RAE v1.1 | 73.8 | 73.3 | 61.7 | 73.1 | 38.5 | 69.4 |
| Ko-AIME'25 | 97.7 | 80.0 | 88.0 | 98.0 | 81.7 | 90.7 |
| HRM8K | 92.2 | 87.6 | 90.7 | 93.4 | 90.6 | 91.3 |
| KBank-MMLU | 80.8 | 65.5 | 71.0 | 79.5 | 68.9 | 79.0 |
| KBL | 75.5 | 65.5 | 69.8 | 72.8 | 69.9 | 75.3 |
| KorMedMCQA | 93.0 | 84.4 | 87.7 | 94.1 | 87.0 | 94.2 |
| Ko-GDPval | 86.8 | 3.4 | 81.0 | 85.0 | 68.3 | 59.4 |
| Avg. | 85.4 | 67.0 | 77.5 | 84.9 | 69.6 | 80.8 |
| Model | 규모 | 점수 | Data | Content Structure | Quality | Value Format | Constraint | File Format |
|---|---|---|---|---|---|---|---|---|
| DeepSeek-V4-Pro | 1.6T | 86.9 | 82.1 | 90.5 | 96.6 | 84.2 | 81.0 | 99.4 |
| Solar Open 2 | 250B | 86.8 | 83.5 | 89.1 | 96.5 | 79.2 | 82.0 | 99.8 |
| DeepSeek-V4-Flash | 284B | 85.0 | 81.0 | 87.6 | 95.9 | 78.2 | 78.3 | 100.0 |
| MiMo-V2.5-Pro | 1T | 84.6 | 80.6 | 87.7 | 95.2 | 75.8 | 78.5 | 99.2 |
| MiMo-V2.5 | 310B | 81.0 | 76.2 | 84.0 | 93.4 | 72.6 | 73.1 | 97.9 |
| Claude Haiku 4.5 | closed | 68.3 | 60.6 | 71.3 | 88.6 | 56.2 | 59.7 | 99.8 |
| GPT-5.4 mini | closed | 59.4 | 54.4 | 54.6 | 85.7 | 36.8 | 43.7 | 97.5 |
Solar Open 2는 DeepSeek-V4-Pro(1.6T, 자신보다 6배 이상 큰 모델)에 근소하게 뒤처지며, 그 외 모든 모델을 앞섭니다. 세부적으로는 Data·Constraint·File Format에서 DeepSeek-V4-Pro보다도 앞서고, Value Format 항목(79.2 vs 84.2)에서 가장 큰 격차가 있습니다 — 숫자·서식 정밀도가 향후 과제임을 시사합니다.
Solar Open 2가 가장 약한 항목인 Value Format이 바로 이 숫자·서식 정밀도를 재는 기준입니다 — 앞서 살펴본 "향후 과제"와 정확히 같은 지점입니다.