사내 공지를 세 줄로 줄이는 과제에서 모델 간 차이는 날짜가 아니라 주의사항에서 드러났다. 다섯 모델 모두 주요 날짜는 담았다. 하지만 “제한될 수 있다"는 가능성을 확정된 조치로 바꾸거나, 재택근무자 방문 안내를 점검 대상으로 바꾼 답이 나왔다. GPT-6 Astra와 GPT-6 Luna는 필요한 정보와 원문의 표현 강도를 모두 지켜 두 심사 AI에게 가장 높은 점수를 받았다.

어떤 공지를 요약하게 했나

과제는 보안 점검 공지를 직장인이 30초 안에 읽을 수 있게 세 줄로 줄이는 것이었다. 점검 기간만 옮겨 적으면 끝나는 일이 아니다. 희망 시간 제출 마감일, 사전 준비, 백신을 설치하지 않았을 때의 불이익, 재택근무자 일정까지 챙겨야 한다. 실제로 넣은 지시문은 다음과 같다.

아래 공지문을 직장인이 30초 안에 읽을 수 있게 세 줄로 요약해 줘. 날짜와 해야 할 일은 빠뜨리지 마.

[공지] 사내 보안 점검 안내
10월 7일(화)부터 10월 9일(목)까지 전 직원 노트북 보안 점검을 실시합니다. 각 팀은 10월 2일(목)까지 팀별 점검 희망 시간을 인사팀 메일로 보내 주십시오. 점검은 1대당 약 20분이 걸리며, 점검 전 개인 파일을 백업해 두시기 바랍니다. 백신이 설치되지 않은 노트북은 점검 당일 업무망 접속이 제한될 수 있습니다. 재택근무자는 10월 10일(금) 본사 방문 일정으로 따로 안내드립니다.

어떻게 비교했나

2026년 9월 24일, 같은 지시문과 기본 설정으로 모델마다 한 번씩 실행했다. 비교 대상은 앤트로픽 Claude Opus 5.5와 Claude Haiku 4.5, 오픈AI GPT-6 Astra와 GPT-6 Luna, 구글 Gemini 3.5 Flash다.

Gemini 3.5 Flash만 GitHub Copilot으로 실행했다. 거치는 경로가 다르므로 응답 시간을 그대로 견주기는 어렵다. 채점은 Claude Opus 5와 GPT-6 Sol이 맡았고, 두 심사 AI는 누구의 답인지 모르는 상태에서 점수를 매겼다. 비교 대상인 Claude Opus 5.5와 심사를 맡은 Claude Opus 5는 서로 다른 모델이다.

결과 한눈에 보기

요약에는 정해진 정답 문장이 없다. 그래서 아래 표의 ‘정답 여부’는 이번 과제가 요구한 형식을 지켰는지, 원문 정보를 그대로 남겼는지를 뜻한다. 심사 점수는 Claude Opus 5, GPT-6 Sol 순서다. 응답 시간은 답을 받기까지 걸린 시간이며, 사람이 그 답을 읽는 시간과는 다르다.

모델응답 시간답 길이정답 여부(이번 과제 기준)심사 점수
Claude Opus 5.53.7초185자부분 충족: 백업을 의무로 강화8점 / 9점
Claude Haiku 4.57.4초207자부분 충족: 형식, 누락, 단정 문제7점 / 7점
GPT-6 Astra8.7초183자충족9점 / 10점
GPT-6 Luna6.9초183자충족9점 / 10점
Gemini 3.5 Flash7.9초207자부분 충족: 주의사항 누락과 의미 변경6점 / 8점

GPT-6 Astra와 GPT-6 Luna는 답 길이와 심사 점수가 똑같았다. Claude Opus 5.5는 기록상 답이 가장 빨리 나왔다. 그러나 표현을 정확히 옮겼는지에서는 두 모델보다 낮은 점수를 받았다. 빠르고 짧은 답인지와 원문을 충실히 옮겼는지는 따로 봐야 한다.

모델별로 어떻게 달랐나

앤트로픽 Claude Opus 5.5의 실제 답 (2026년 9월 24일 실행)

앤트로픽 Claude Opus 5.5의 실제 답 (2026년 9월 24일 실행)

앤트로픽 Claude Haiku 4.5의 실제 답 (2026년 9월 24일 실행)

앤트로픽 Claude Haiku 4.5의 실제 답 (2026년 9월 24일 실행)

오픈AI GPT-6 Astra의 실제 답 (2026년 9월 24일 실행)

오픈AI GPT-6 Astra의 실제 답 (2026년 9월 24일 실행)

오픈AI GPT-6 Luna의 실제 답 (2026년 9월 24일 실행)

오픈AI GPT-6 Luna의 실제 답 (2026년 9월 24일 실행)

구글 Gemini 3.5 Flash의 실제 답 (2026년 9월 24일 실행)

구글 Gemini 3.5 Flash의 실제 답 (2026년 9월 24일 실행)

Claude Opus 5.5는 날짜와 준비 사항을 번호가 붙은 세 줄에 담았고, 1대당 20분이라는 점검 시간도 남겼다. 다만 ‘개인 파일 백업 필수’라고 써 원문보다 의무를 강하게 만들었다. Claude Opus 5는 굵은 글씨가 많아 시선이 분산된다고 지적했다.

Claude Haiku 4.5는 주요 날짜와 백업 안내를 담았다. 하지만 제목과 빈 줄을 덧붙여 세 줄이라는 요청을 벗어났다. ‘업무망 접속이 제한되며’라고 써 가능성을 확정된 조치로 바꿨고, 1대당 약 20분이라는 정보도 빠졌다.

GPT-6 Astra는 점검 일정, 팀이 제출할 내용, 직원이 준비할 일을 꾸밈 없는 세 줄로 정리했다. ‘제한될 수 있으며’라고 써 원문의 조건을 그대로 살렸다. 점검 시간과 재택근무자 별도 안내까지 담아 9점과 10점을 받았다.

GPT-6 Luna도 모든 날짜와 점검 시간, 주의사항을 세 줄에 넣었다. 재택근무자는 ‘본사 방문 일정을 별도 안내합니다’로 정리했다. Claude Opus 5는 한국어가 자연스럽고 간결하다고 평가했다.

Gemini 3.5 Flash는 굵은 글씨와 항목 구분으로 마감일을 눈에 띄게 배치했다. 그러나 백신 설치 확인을 강조하다 업무망 접속 제한 가능성과 점검 시간을 빠뜨렸다. 재택근무자를 ‘본사 방문 점검 대상’이라고 써 안내의 의미도 바꿨다.

그래서 어떤 모델을 쓸까

이번처럼 한국어 공지에서 날짜와 예외 조건을 함께 지켜야 한다면 GPT-6 Astra와 GPT-6 Luna를 먼저 살펴볼 만하다. 두 모델의 점수는 같았다. 이 결과만으로 어느 쪽 요약이 더 낫다고 가르기는 어렵다.

번호와 강조 표시가 들어간 답을 원한다면 Claude Opus 5.5도 후보다. 다만 사내 공지에 그대로 붙여 쓰기 전에 ‘필수’처럼 의무를 강하게 만든 단어가 없는지 확인해야 한다.

이 결과, 어디까지 믿을까

모델마다 한 번씩만 실행했다. 다시 시도하면 답과 응답 시간이 달라질 수 있다. 심사 점수도 AI가 매긴 참고 값이며, 실제 직장인이 30초 안에 읽고 이해했는지를 잰 수치는 아니다. 이번 비교가 보여 주는 것은 하나다. 요약을 맡길 때는 날짜뿐 아니라 빠진 조건과 세진 표현까지 확인해야 한다. 여러 번 실행해도 이런 차이가 그대로 나타나는지가 다음 확인 과제다.

Claude Opus 5.5Claude Haiku 4.5GPT-6 AstraGPT-6 LunaGemini 3.5 Flash