가벼운 AI로도 충분할까
AI 모델 6개에 같은 질문 3개를 던져 비교했다. 2031년 프로야구 우승팀, 대한민국에서 가장 높은 산, 직장에서 쓰는 호칭을 물었다. 짧은 답을 얻는 데는 값싸고 빠른 가벼운 모델로 충분한지, 이유까지 설명받으려면 상위 모델을 써야 하는지가 이번 관심사다.
결과는 정답보다 설명에서 갈렸다. 정답이 정해진 두 문제는 6개 모델이 모두 맞혔다. 반면 직장 예절 문제에서는 아예 답을 거부한 모델도 나왔다. 채점 평균은 GPT-6 Astra가 9.7점으로 가장 높았고, 가벼운 모델인 GPT-6 Luna가 9.3점으로 뒤를 이었다.
어떻게 시험했나
9월 24일 모든 모델에 똑같은 지시문을 넣었다. 설정은 손대지 않고 문제마다 한 번씩만 실행했다. 상위 모델로는 앤트로픽의 Claude Opus 5.5, 오픈AI의 GPT-6 Astra, xAI의 Grok 4.5를 썼다. 가벼운 모델로는 앤트로픽의 Claude Haiku 4.5, 오픈AI의 GPT-6 Luna, 구글의 Gemini 3.5 Flash를 골랐다. 이 가운데 Grok 4.5는 이전 세대 상위 모델이다. xAI는 9월 21일 Grok 4.7을 공개했다.
Gemini 3.5 Flash와 Grok 4.5는 GitHub Copilot에서 돌렸다. 실행 경로가 달라 응답 속도를 그대로 비교하기는 어렵다. 시간은 모델마다 “OK” 한마디를 받는 데 걸린 시간을 먼저 재고, 그 값을 각 문제의 응답 시간에서 빼서 계산했다.
채점은 사람이 아니라 AI가 했다. Claude Opus 5와 GPT-6 Sol이 어느 모델의 답인지 모르는 상태에서 각각 1~10점을 매겼다. 정답이 있는 문제는 두 채점자가 모두 맞다고 봐야 정답으로 인정했다. 말투와 설명의 품질을 보는 점수와 정답 수는 따로 읽어야 한다.
2031년 우승팀, 모른다고 답할까
아직 알 수 없는 일을 지어내지 않는지 보려고 물었다.
2031년 한국 프로야구 한국시리즈 우승팀은 어디야? 모르면 모른다고 답해.
6개 모델이 모두 모른다고 답해 정답 판정을 받았다. GPT-6 Astra와 GPT-6 Luna는 대회가 아직 열리지 않았다는 이유를 덧붙여 나란히 9.5점을 받았다. 응답은 GPT-6 Luna가 0.3초, GPT-6 Astra가 1.0초였다. 이 문제에서는 더 오래 기다린 상위 모델이 더 높은 점수를 받지는 않았다.
Grok 4.5는 “모른다”, Gemini 3.5 Flash는 “모릅니다"로 짧게 끝냈다. 짧은 답을 보는 두 채점자의 기준은 엇갈렸다. Gemini 3.5 Flash에 Claude Opus 5는 설명이 부족하다며 7점을 줬지만, GPT-6 Sol은 간결하다며 10점을 줬다. Claude Haiku 4.5는 불필요한 영어 표현과 학습 데이터 기준 시점을 붙여 평균 6.5점에 머물렀다.
한라산 높이, 몇 m로 답했나
범위에 맞는 산을 고르고 높이까지 한 문장에 담는지 봤다.
대한민국에서 가장 높은 산은 어디이고 높이는 얼마인가? 한 문장으로.
모든 모델이 한라산을 골라 정답 처리됐다. Claude Opus 5.5와 GPT-6 Luna는 위치와 해발 1,947m를 한 문장에 담아 각각 10점을 받았다. GPT-6 Astra, Gemini 3.5 Flash, Grok 4.5는 각각 9.5점이었다. 핵심 답이 같아도 문장 길이와 높이를 적는 방식에서 평가가 조금 갈렸다.
눈에 띈 답은 Claude Haiku 4.5의 1,950m다. Claude Opus 5는 공식 수치와 다르다며 5점을 줬다. GPT-6 Sol은 흔히 쓰이는 높이지만 덜 정밀하다며 8점을 줬다. 한라산을 맞혔다는 정답 판정과 달리, 높이의 정확성에는 이견이 남았다. 정답 수만 보면 놓치기 쉬운 차이다.
부장님께 과장님 부재를 어떻게 전할까
더 높은 상사에게 다른 상사의 부재를 알릴 때, 쓸 만한 문장과 그 이유를 함께 내놓는지 봤다.
회사에서 부장님께 과장님이 자리에 없다고 전할 때, 요즘 직장에서 자연스럽게 쓰는 말 한 문장을 써 주고, 그렇게 말하는 이유를 한 줄로 설명해 줘.
GPT-6 Astra는 “부장님, 과장님은 지금 자리에 안 계십니다"라는 문장을 내놓았다. 이유로는 듣는 사람의 직급이 더 높아도 언급하는 상사를 높인다는 점을 들었다. 두 채점자가 모두 10점을 줬다. GPT-6 Luna는 같은 문장을 썼지만 이유가 높임말 어휘 차이에 머물러 8.5점을 받았다. 문장만 필요할 때와 설명까지 필요할 때의 차이가 드러났다.
Claude Opus 5.5와 Gemini 3.5 Flash는 각각 9점이었다. 두 모델은 듣는 사람보다 직급이 낮은 사람을 낮춰 말하는 압존법을 설명에 끌어왔다. 채점에서는 설명이 단정적이거나 길다는 지적이 나왔다. Grok 4.5의 “안 계세요"는 보고 상황에 다소 가볍고 이유도 막연하다는 평가로 7점을 받았다.
Claude Haiku 4.5는 직장 대화 조언이 자기 전문 범위를 벗어난다며 요청을 거부했다. 문장도 이유도 내놓지 않아 두 채점자에게 각각 1점을 받았다. 호칭을 틀린 것이 아니라, 요청받은 일 자체를 하지 않은 경우다.
이번 라운드 성적표
| 모델 | 평균 채점 점수 | 정답 | 평균 응답 시간 | 출력 속도(초당 글자) |
|---|---|---|---|---|
| GPT-6 Astra | 9.7점 | 2/2 | 1.9초 | 38 |
| GPT-6 Luna | 9.3점 | 2/2 | 0.8초 | 79 |
| Claude Opus 5.5 | 9.2점 | 2/2 | 1.6초 | 56 |
| Gemini 3.5 Flash | 9.0점 | 2/2 | 1.7초 | 27 |
| Grok 4.5 | 8.2점 | 2/2 | 0.8초 | 45 |
| Claude Haiku 4.5 | 4.7점 | 2/2 | 2.2초 | 43 |
응답 시간은 준비 시간을 뺀 값이다. 실행 경로가 달라 참고용으로만 보면 된다.
정답 2/2는 우승팀 문제와 한라산 문제의 결과다. 직장 호칭 문제는 정답 수에 넣지 않았다. 모든 모델이 같은 정답 수를 기록했지만, 세 문제에서 같은 수준의 답을 했다는 뜻은 아니다.
그래서 뭘 쓰면 될까
빨리 답이 필요하면 GPT-6 Luna가 유력하다. 이번에 평균 0.8초로 답하면서 9.3점을 받았다. 기본 상식을 묻거나 짧은 직장 표현을 얻는 데는 가벼운 모델로도 충분했다.
왜 그렇게 말하는지까지 설명받으려면 GPT-6 Astra가 앞섰다. 직장 호칭 문제에서 유일하게 두 채점자 모두에게 10점을 받았다. 평균 응답은 GPT-6 Luna보다 1.1초 길었고, 점수는 0.4점 높았다. 더 기다린 값은 정답보다 설명에서 나왔다.
여러 종류의 질문에 두고 쓸 모델을 고를 때는 누적 성적도 볼 만하다. GPT-6 Luna는 이번에 좋은 점수를 받았지만 누적 정답은 5/7이다. 이번 결과만으로 상위 모델이 필요 없다거나, 가벼운 모델이면 다 된다고 말하기는 어렵다.
지금까지 누적 순위
3개 라운드의 평균 채점 점수 순이다. 같은 점수는 공동 순위로 묶었다.
| 순위 | 모델 | 평균 채점 점수 | 정답 | 평균 응답 시간 |
|---|---|---|---|---|
| 1 | GPT-6 Astra | 9.1점 | 7/7 | 2.3초 |
| 공동 2 | Grok 4.5 | 8.9점 | 7/7 | 2.1초 |
| 공동 2 | Claude Opus 5.5 | 8.9점 | 7/7 | 1.6초 |
| 4 | Gemini 3.5 Flash | 8.8점 | 7/7 | 2.4초 |
| 5 | GPT-6 Luna | 7.6점 | 5/7 | 0.8초 |
| 6 | Claude Haiku 4.5 | 6.8점 | 7/7 | 5.2초 |
이번 비교로 알 수 없는 것
이번 시험은 문제 3개를 모델마다 한 번씩만 돌린 결과다. AI가 매긴 점수는 참고 값이다. 짧은 답을 얼마나 좋아하는지에 따라서도 점수가 달라졌다. 한국어 일상 질문에서 가벼운 모델의 가능성은 확인했다. 다만 모델을 고를 때는 정답 수만 보지 말고 설명이 충실한지, 요청을 실제로 수행하는지도 함께 봐야 한다. 같은 질문을 여러 번 물어도 품질이 유지되는지는 앞으로 살펴볼 대목이다.

문제 1에 대한 모델별 실제 답 (2026년 9월 24일 실행, 앞부분만)

문제 2에 대한 모델별 실제 답 (2026년 9월 24일 실행, 앞부분만)

문제 3에 대한 모델별 실제 답 (2026년 9월 24일 실행, 앞부분만)
