무엇을 어떻게 평가했는지 알아보고, 영어권 성적표를 확인합니다
사람으로 치면 수능·전공 시험·실무 인턴 평가처럼, 저마다 다른 능력을 재는 별도의 '시험 과목'이라고 보시면 됩니다.
| Benchmark | Solar Open 2 | Solar Open 1 | Command A+ | Mistral Medium 3.5 | MiMo-V2.5 | DeepSeek-V4-Flash |
|---|---|---|---|---|---|---|
| MMLU-Pro | 86.2 | 80.4 | 79.0 | 81.2 | 84.6 | 85.9 |
| GPQA-Diamond | 86.3 | 66.2 | 75.6 | 77.5 | 83.0 | 88.9 |
| HLE (no tools) | 28.8 | 11.5 | 11.4 | 12.8 | 24.3 | 32.3 |
| LiveCodeBench v6 | 92.4 | 56.5 | 86.1 | 84.9 | 89.1 | 92.3 |
| ArtifactsBench | 55.9 | 43.4 | 42.8 | 49.8 | 59.3 | 61.0 |
| HMMT2602 | 93.9 | 68.9 | 73.5 | 62.9 | 61.4 | 94.7 |
| AIME2026 | 95.7 | 87.7 | 96.0 | 89.0 | 92.3 | 97.0 |
| MultiChallenge | 61.0 | 40.5 | 45.8 | 49.8 | 39.0 | 62.0 |
| IFBench | 80.0 | 57.7 | 73.9 | 69.0 | 67.1 | 80.3 |
| AA-LCR | 62.3 | 36.0 | 46.0 | 61.0 | 62.7 | 63.7 |
| SWE-Bench Verified | 70.4 | 15.4 | 14.4 | 69.6 | 73.0 | 73.8 |
| Terminal Bench Hard | 28.3 | 2.3 | 25.0 | 33.3 | 41.7 | 34.1 |
| APEX-Agents | 16.6 | 2.4 | 1.6 | 6.1 | 13.4 | 13.2 |
| MCP-Atlas | 58.2 | 34.4 | 27.2 | 30.7 | 63.9 | 58.2 |
| τ3 (banking) | 19.6 | 7.4 | 5.8 | 5.8 | 8.7 | 22.3 |
| GDPval-AA v2 (ELO) | 1128 | – | 712 | 929 | 1145 | 1187 |
ELO는 체스 랭킹 산정 방식처럼, 두 모델의 산출물을 사람이 짝지어 비교한 승패를 누적해 매기는 상대 실력 점수입니다 — 숫자가 클수록 더 자주 이겼다는 뜻입니다.
레시피를 바꾼 부분과 성적이 가장 많이 오른 부분이 정확히 일치한다는 뜻입니다 — 목표한 곳을 목표한 만큼 개선한 셈이죠.