1 / 1
5-2
Solar Open 2 완전정복 · 5강 / 5강 · 5-2 / 3

한국어 성적과 Ko-GDPval

한국어 성적표를 확인하고, 실전 업무 능력을 재는 Ko-GDPval을 알아봅니다

Solar Open 2 기술 보고서 5장·6장 기반 · 초심자를 위한 쉬운 해설 + 원문 수치
원문 표 4

전체 한국어 성적표

BenchmarkSolar Open 2Solar Open 1MiMo-V2.5DeepSeek-V4-FlashClaude Haiku 4.5GPT-5.4 mini
KMMLU-Pro78.464.069.178.967.978.1
CLIcK90.778.978.489.253.589.6
HAE-RAE v1.173.873.361.773.138.569.4
Ko-AIME'2597.780.088.098.081.790.7
HRM8K92.287.690.793.490.691.3
KBank-MMLU80.865.571.079.568.979.0
KBL75.565.569.872.869.975.3
KorMedMCQA93.084.487.794.187.094.2
Ko-GDPval86.83.481.085.068.359.4
Avg.85.467.077.584.969.680.8
한국어 성적

6개 모델 중 압도적 1위

85.4
6개 모델 중 평균 최고점 — DeepSeek-V4-Flash(84.9), GPT-5.4 mini(80.8), Claude Haiku 4.5(69.6) 앞섬
+18.4
Solar Open 1(67.0) 대비 세대 개선폭
1위
CLIcK(90.7, 언어&문화) · KBank-MMLU(80.8) · KBL(75.5), 전문 도메인 3개 중 2개 1위
블라인드 정성 평가(어느 모델의 답변인지 가린 채 사람이 채점) (Figure 12) — Solar Open 2 vs DeepSeek-V4-Flash, 한국어 대화 835턴
선호율 · Solar Open 2
44.1%
선호율 · DeepSeek-V4-Flash
26.6%
결정적 승리(상대 오답/붕괴) · Solar Open 2
21.2%
결정적 승리 · DeepSeek-V4-Flash
8.5%
가장 큰 격차는 정렬(alignment)·정직성·안전성 영역에서 나타났습니다 — 예를 들어 한국 사회에서 의견이 갈리는 이슈에 어느 쪽을 단정할지, 어디까지 신중하게 말을 아낄지처럼 문화적 맥락에 대한 판단력이 요구되는 질문들입니다.
전문 도메인 벤치마크

Ko-GDPval이란?

원문 표 5

Ko-GDPval 전체 순위표

Model규모점수DataContent StructureQualityValue FormatConstraintFile Format
DeepSeek-V4-Pro1.6T86.982.190.596.684.281.099.4
Solar Open 2250B86.883.589.196.579.282.099.8
DeepSeek-V4-Flash284B85.081.087.695.978.278.3100.0
MiMo-V2.5-Pro1T84.680.687.795.275.878.599.2
MiMo-V2.5310B81.076.284.093.472.673.197.9
Claude Haiku 4.5closed68.360.671.388.656.259.799.8
GPT-5.4 miniclosed59.454.454.685.736.843.797.5

Solar Open 2는 DeepSeek-V4-Pro(1.6T, 자신보다 6배 이상 큰 모델)에 근소하게 뒤처지며, 그 외 모든 모델을 앞섭니다. 세부적으로는 Data·Constraint·File Format에서 DeepSeek-V4-Pro보다도 앞서고, Value Format 항목(79.2 vs 84.2)에서 가장 큰 격차가 있습니다 — 숫자·서식 정밀도가 향후 과제임을 시사합니다.

채점 기준 뜯어보기

6가지 채점 기준이 보는 것

Solar Open 2가 가장 약한 항목인 Value Format이 바로 이 숫자·서식 정밀도를 재는 기준입니다 — 앞서 살펴본 "향후 과제"와 정확히 같은 지점입니다.