가벼운 AI도 계산을 맞힐까

장보기 계산부터 일정 잡기까지, 숫자 앞에서 AI는 믿을 만할까. 계산과 논리를 묻는 세 문제를 여섯 모델에 냈다. 이 가운데 다섯 모델이 세 문제를 모두 맞혔다. 값싸고 빠른 가벼운 모델 두 개도 여기에 들었다. 할인 순서를 지키고 회의 조건을 빠짐없이 살피는 일에 비싼 상위 모델이 꼭 필요한지 비교했다.

이렇게 시험했다

2026년 9월 24일, 여섯 모델에 같은 프롬프트(AI에게 주는 지시문)를 주고 기본 설정으로 문제마다 한 번씩 실행했다. 상위 모델로는 앤트로픽의 Claude Opus 5.5, 오픈AI의 GPT-6 Astra, xAI의 Grok 4.5를 골랐다. Grok 4.5는 xAI의 이전 세대 상위 모델이다. 가벼운 모델은 앤트로픽의 Claude Haiku 4.5, 오픈AI의 GPT-6 Luna, 구글의 Gemini 3.5 Flash다.

Gemini 3.5 Flash와 Grok 4.5는 GitHub Copilot으로 실행했다. 실행 경로가 달라 응답 속도를 그대로 견주기는 어렵다. 시간은 모델마다 짧은 확인 응답에 걸린 시간을 먼저 쟀다. 이를 준비 시간으로 보고 각 문제의 측정값에서 뺐다.

심사는 Claude Opus 5와 GPT-6 Sol이 맡았다. 두 심사위원은 답변을 쓴 모델 이름을 모르는 상태에서 각각 10점 만점으로 점수를 매겼다. 둘 다 맞았다고 봐야 정답으로 인정하고, 의견이 갈리면 판정 갈림으로 처리했다. 정답 여부와 별개로 설명 길이와 답변 형식도 점수에 영향을 줬다.

문제 1: 할인 뒤 얼마를 썼을까

할인, 쿠폰, 포인트를 정해진 순서대로 계산하는지 보는 문제다.

5만 원짜리 운동화를 20% 할인한 뒤, 그 가격에서 5천 원 쿠폰을 쓰고, 마지막으로 결제 금액의 10%를 포인트로 돌려받는다. 실제로 쓴 돈(결제 금액에서 포인트를 뺀 값)은 얼마인가? 마지막 줄에 답만 적어.

정답은 3만 1500원이다. 할인 뒤 가격은 4만 원, 쿠폰을 쓰고 결제하는 금액은 3만 5000원이다. 여기서 돌려받는 포인트 3500원을 빼야 한다. GPT-6 Luna를 뺀 다섯 모델이 이 값을 맞혔다. GPT-6 Luna는 ‘3만 1천 원’이라고 답해 500원 차이로 틀렸다.

Gemini 3.5 Flash와 Grok 4.5는 금액만 짧게 적어 각각 10점을 받았다. Claude Opus 5.5와 GPT-6 Astra는 계산 과정을 쓰고 마지막 줄에 답을 따로 적어 각각 9점이었다. Claude Haiku 4.5도 계산은 정확했다. 다만 설명이 길고 굵은 글씨를 쓴 점이 감점 사유가 돼 8점에 그쳤다. 이 문제의 점수 차이는 계산 실력뿐 아니라 답을 어떻게 적었는지도 함께 보여준다.

문제 1에 대한 모델별 실제 답 (2026년 9월 24일 실행, 앞부분만)

문제 1에 대한 모델별 실제 답 (2026년 9월 24일 실행, 앞부분만)

문제 2: 회의할 한 시간이 있을까

조건을 모두 채우는 답이 없을 때, 무리하게 시간을 제안하지 않는지 보는 문제다.

세 사람이 1시간짜리 회의를 잡으려 한다. 민수는 오전 10시~오후 1시에만 된다. 지영은 오전 11시~오후 3시에만 된다. 태호는 정오(12시)~오후 4시에만 되지만, 오후 12시 30분~1시 30분은 점심이라 안 된다. 세 사람이 모두 가능한 1시간을 찾아라. 없으면 없다고 답하라. 마지막 줄에 답만 적어.

세 사람이 함께할 수 있는 시간은 정오부터 오후 12시 30분까지다. 30분뿐이라 한 시간 회의는 잡을 수 없다. Claude Opus 5.5, Claude Haiku 4.5, GPT-6 Astra, Gemini 3.5 Flash, Grok 4.5가 이를 맞혔다. GPT-6 Luna는 ‘오후 1시~2시’를 제안했다. 이 시간은 민수가 되는 시간을 벗어나고 태호의 점심시간과도 겹친다.

GPT-6 Astra는 공통 시간이 30분이라는 근거를 짧게 붙였다. Gemini 3.5 Flash와 Grok 4.5는 불가능하다는 결론만 적었다. 이 두 답변에 Claude Opus 5는 설명이 없다며 각각 6점을 줬다. 반면 GPT-6 Sol은 정확하고 간결하다며 각각 10점을 줬다. 정답 판정은 같아도 좋은 답변을 보는 기준은 달랐다.

문제 2에 대한 모델별 실제 답 (2026년 9월 24일 실행, 앞부분만)

문제 2에 대한 모델별 실제 답 (2026년 9월 24일 실행, 앞부분만)

문제 3: 100일 뒤는 언제일까

해를 넘기는 날짜와 요일을 함께 정확히 계산하는지 보는 문제다.

2026년 9월 24일(목요일)로부터 100일 뒤는 몇 년 몇 월 며칠, 무슨 요일인가? 마지막 줄에 답만 적어.

이번에는 여섯 모델이 모두 2027년 1월 2일 토요일을 맞혔다. Claude Opus 5.5는 월별 날짜 수와 요일 계산을 설명해 평균 9.5점을 받았다. GPT-6 Astra, Gemini 3.5 Flash, Grok 4.5는 날짜와 요일만 적어 각각 9점이었다.

앞선 두 문제를 틀린 GPT-6 Luna도 이 문제는 0.3초 만에 맞혀 8.5점을 받았다. Claude Haiku 4.5 역시 정답으로 8.5점을 받았지만 답하는 데 10초가 걸렸다. 설명을 길게 적는지, 답만 적는지에 따라 기다리는 시간과 답변 분량이 갈렸다. 답이 길다고 점수가 꼭 높아지지도 않았다.

문제 3에 대한 모델별 실제 답 (2026년 9월 24일 실행, 앞부분만)

문제 3에 대한 모델별 실제 답 (2026년 9월 24일 실행, 앞부분만)

라운드 성적표

모델평균 심사 점수정답평균 응답 시간출력 속도(초당 글자)
Claude Opus 5.59.0점3/32.0초94
Claude Haiku 4.58.2점3/37.4초36
GPT-6 Astra8.8점3/32.6초29
GPT-6 Luna3.7점1/30.4초44
Gemini 3.5 Flash9.0점3/33.8초3
Grok 4.59.0점3/33.0초3

응답 시간은 준비 시간을 뺀 값이다. 실행 경로가 달라 참고용으로만 봐야 한다.

출력 속도는 답변 글자 수를 응답 시간으로 나눈 값이다. Gemini 3.5 Flash와 Grok 4.5처럼 답만 짧게 쓴 모델은 이 수치가 낮게 나온다. 초당 글자 수만 보고 빠른 모델을 고르기보다, 정답 여부와 전체 응답 시간을 함께 봐야 한다.

그래서 뭘 쓰면 될까

짧은 계산 답이 필요하다면 Gemini 3.5 Flash가 선택지다. 세 문제를 모두 맞히고 평균 9.0점을 받았다. 가벼운 모델로도 충분했다는 뜻이다. Claude Haiku 4.5도 정답 수는 같았다. 다만 평균 응답이 7.4초로 이번 비교에서 가장 오래 걸렸다.

빨리 답을 받고 싶다면 Claude Opus 5.5를 살펴볼 만하다. 세 문제를 모두 맞힌 모델 가운데 평균 응답이 2.0초로 가장 짧았다. 세 문제 모두 풀이를 적어, 계산 근거까지 확인하려는 경우에도 쓸 만하다. GPT-6 Luna는 평균 0.4초로 가장 빨랐지만 두 문제를 틀렸다. 이번 결과만 놓고 보면 정확한 계산용으로 권하기는 어렵다.

상위 모델이라 더 오래 기다려야 한다는 결과도 나오지 않았다. Claude Opus 5.5와 GPT-6 Astra는 세 문제를 모두 맞혔고, 평균 응답도 가벼운 Claude Haiku 4.5보다 짧았다. 다만 정답 수는 Gemini 3.5 Flash와 같았다. 이번 세 문제만으로 상위 모델이 꼭 필요하다고 보기는 어렵다.

지금까지 누적 순위

두 라운드의 평균 심사 점수 순이며, 같은 점수는 공동 순위로 표시했다.

순위모델평균 심사 점수정답평균 응답 시간
1Grok 4.59.3점5/52.8초
공동 2GPT-6 Astra8.8점5/52.6초
공동 2Claude Opus 5.58.8점5/51.7초
4Gemini 3.5 Flash8.7점5/52.7초
5Claude Haiku 4.57.9점5/56.7초
6GPT-6 Luna6.7점3/50.8초

이번 비교의 한계

문제는 세 개뿐이고, 모델마다 한 번씩만 실행했다. AI가 매긴 심사 점수도 참고 값이다. 설명을 얼마나 요구하느냐에 따라 같은 정답도 점수가 달라졌다. 그래도 가벼운 모델이 일상 계산을 모두 맞힐 수 있다는 점은 확인했다. 다음에는 문제를 늘리고 여러 번 반복해도 이 정확도가 유지되는지 살펴볼 차례다.

모델 비교계산과 논리Claude Opus 5.5Gemini 3.5 FlashGPT-6 Luna