GPT-6 솔·루나 vs 클로드 오퍼스 5.5: 성능·가격·속도 비교
같은 날 나온 네 모델을 독립 측정 기준으로 비교한다. 성능은 클로드, 가격과 응답 속도는 GPT-6. 다만 '작업당 비용'은 다른 답을 낸다.

핵심 요약
- 2026년 9월 22일 OpenAI가 GPT-6 솔(입력 100만 토큰당 2달러)과 루나(0.10달러)를 전작 반값에 내놓았고, 같은 날 앤스로픽은 오퍼스 5.5(4달러)를 냈다. 최상위 페이블 5.1은 10달러다(VentureBeat).
- 독립 평가기관 아티피셜 애널리시스 기준으로 성능은 오퍼스 5.5(58점) > 페이블 5.1(53점) > 솔(48점) > 루나(37점), 응답 속도는 루나 > 솔 > 오퍼스 5.5 > 페이블 5.1이다. 첫 토큰까지 걸리는 시간은 솔이 오퍼스 5.5의 3분의 1이다(Artificial Analysis).
- 토큰 단가는 솔이 오퍼스 5.5의 절반이지만, 같은 과제를 끝내는 작업당 비용은 설정에 따라 역전된다. 답은 "어느 모델이 최고인가"가 아니라 "내 일에 어느 등급이 맞는가"다.
오퍼스 5.5 글에서 9월 22일을 “최상위 지능의 값이 하루에 두 번 내린 날”이라고 썼다. 이 글은 그날 나온 모델들을 한 표에 놓고 비교한다. 두 회사 발표 자료는 각자 유리한 상대와 설정을 골랐으므로, 가능한 한 같은 기관이 같은 방법으로 잰 숫자를 우선하고 회사 발표 수치는 따로 표시했다.
무슨 일이 있었나: 하루에 나온 세 모델
OpenAI는 9월 3일 최상위 모델 아스트라를 낸 뒤 19일 만에 중간 등급 솔과 경량 등급 루나를 냈다. 회사는 솔을 “성능과 비용의 균형”, 루나를 “대량 반복 작업”용으로 나눴고(더에이아이), 반값 가격이 한시적 할인이 아니라고 확인했다(VentureBeat). 앤스로픽의 등급도 세 층이다. 등급으로 맞추면 다음과 같다.
| 등급 | OpenAI | 앤스로픽 |
|---|---|---|
| 최상위 | GPT-6 아스트라 | 클로드 페이블 5.1 |
| 중간 | GPT-6 솔 | 클로드 오퍼스 5.5 |
| 경량 | GPT-6 루나 | 클로드 하이쿠 (5.5는 미출시) |
이 글은 솔·루나와 페이블 5.1·오퍼스 5.5 네 모델을 다룬다. 등급이 다른 모델을 한 표에 놓는 것이므로, 숫자의 차이가 곧 우열은 아니다.
성능: 독립 지수와 회사 발표
독립 측정. 아티피셜 애널리시스는 10개 평가를 같은 방법으로 돌려 지능 지수를 낸다. 네 모델의 최고 설정 점수다.
| 모델 | 지능 지수 (최고 설정) | 순위 | 출처 |
|---|---|---|---|
| 클로드 오퍼스 5.5 | 58 | 1위 | AA 비교 |
| 클로드 페이블 5.1 | 53 | 4위 | AA 페이블 5.1 |
| GPT-6 솔 | 48 | AA 비교 | |
| GPT-6 루나 | 37 | AA 루나 |
같은 기관의 세부 항목에서 오퍼스 5.5와 솔의 차이가 가장 컸던 곳은 터미널 작업 자동화(터미널벤치 4.0)로 57% 대 26%였고, 가장 작았던 곳은 업무 자동화(오토메이션벤치)로 63% 대 60%였다(TechRepublic). 분야별 지수에서도 금융·법률·공학·경제 모두 오퍼스 5.5가 10점 안팎 앞섰다.
페이블 5.1이 오퍼스 5.5보다 낮게 나온 것은 눈여겨볼 대목이다. 앤스로픽 스스로 오퍼스 5.5가 “대부분의 작업에서 페이블 5.1급”이라고 했고, 독립 지수는 그 말을 넘어선다. 다만 페이블 5.1은 안전 분류기가 일부 과제를 거부하면 실패로 집계되므로, 이 점수가 순수 능력만 반영하는 것은 아니다.
회사 발표. OpenAI는 솔이 업무 자동화(오토메이션벤치)에서 33.2%로 페이블 5.1(31.4%)과 오퍼스 5(26.9%)를 앞선다고 발표했다(Vellum). 그러나 비교 상대는 오퍼스 5.5가 아니라 오퍼스 5였고, 오퍼스 5.5의 같은 항목 점수는 앤스로픽 발표로 40.0%다. 두 회사 수치를 나란히 놓으면 솔의 우위는 사라진다. 각자 유리한 상대를 고른 전형적인 경우다.
가격: 토큰 단가와 작업당 비용
토큰 단가. 네 모델의 공식 가격이다.
| 모델 | 입력 100만 토큰 | 출력 100만 토큰 | 캐시 읽기 | 컨텍스트 |
|---|---|---|---|---|
| 클로드 페이블 5.1 | 10달러 | 50달러 | 0.25달러 | 100만 |
| 클로드 오퍼스 5.5 | 4달러 | 20달러 | 0.20달러 | 100만 |
| GPT-6 솔 | 2달러 | 10달러 | 0.20달러 | 105만 |
| GPT-6 루나 | 0.10달러 | 0.50달러 | 0.01달러 | 105만 |
출처: VentureBeat, AI타임스, 각사 공식 가격.
단가만 보면 솔은 오퍼스 5.5의 절반, 페이블 5.1의 5분의 1이다. 루나는 페이블 5.1의 100분의 1이다.
작업당 비용. 그러나 모델마다 같은 과제에 쓰는 토큰 양이 다르다. 아티피셜 애널리시스는 지능 지수 전체를 돌리는 데 든 실제 비용을 과제당으로 환산한다.
| 모델 (설정) | 지능 지수 | 과제당 비용 | 출처 |
|---|---|---|---|
| 페이블 5.1 | 53 | 7.63달러 | AA |
| 오퍼스 5.5 (최고) | 58 | 5.98달러 | AA |
| 오퍼스 5.5 (기본·중간) | 51 | 1.34달러 | TechRepublic |
| 솔 (최고) | 48 | 1.06달러 | TechRepublic |
| 솔 (최저) | 34 | 0.13달러 | AA |
| 루나 (최고) | 37 | 0.07달러 | AA |
단가표와 다른 그림이다. 오퍼스 5.5 기본 설정은 과제당 1.34달러에 51점, 솔 최고 설정은 1.06달러에 48점이다. 비용이 비슷해지면 성능 차이도 좁아진다. 반대로 루나는 최고 설정에서도 7센트로, 37점이면 충분한 대량 작업에서는 비교 대상이 없다.
속도: 초당 토큰과 첫 응답 시간
속도는 두 가지다. 답을 쓰기 시작하기까지 걸리는 시간과, 쓰기 시작한 뒤 초당 몇 토큰을 내는가.
| 모델 (설정) | 출력 속도 (토큰/초) | 첫 토큰까지 | 출처 |
|---|---|---|---|
| GPT-6 루나 (최고) | 141 | 107초 | AA |
| GPT-6 솔 (최고) | 116 | 최저 설정 1.7초 | AA |
| 클로드 오퍼스 5.5 (매우 높음) | 92 | 최저 설정 5.0초 | AA |
| 클로드 페이블 5.1 | 66 | 274초 | AA |
아티피셜 애널리시스 측정. 첫 토큰 시간은 추론 시간을 포함하므로 설정에 따라 수십 배 차이가 난다.
출력 속도는 GPT-6 쪽이 빠르다. 루나가 페이블 5.1의 두 배 이상이다. 첫 응답은 더 극적이다. 페이블 5.1은 답을 시작하기 전에 평균 4분 반을 생각하고, 같은 최저 설정끼리 비교하면 솔이 오퍼스 5.5의 3분의 1이다. 즉답이 필요한 용도라면 이 차이가 성능 점수보다 크게 느껴진다.
직접 써 본 사람의 결과
교육 플랫폼 데이터캠프의 필자는 두 모델에 같은 과제를 줬다. 20초마다 중력이 뒤집히는 테트리스를 파일 하나로 만들라는 것이다(DataCamp).
| 항목 | GPT-6 솔 | 클로드 오퍼스 5.5 |
|---|---|---|
| 대화 턴 / 도구 호출 | 6턴 / 9회 | 3턴 / 2회 |
| 핵심 기능(중력 반전) | 5/5 | 5/5 |
| 완성도·시각 품질 | 5/5, 5/5 | 4/5, 4/5 |
| 비용 | 0.26달러 | 0.87달러 |
| 처리 토큰 | 12만 | 10.8만 |
출처: DataCamp, 한 과제 한 번 실행.
오퍼스 5.5는 절반의 턴으로 정답에 도달했고, 솔은 여러 번 고쳐 가며 더 다듬어진 결과를 3분의 1 비용으로 냈다. 한 번 실행이지만 독립 지수와 같은 그림이다. 오퍼스 5.5는 더 깊이 생각하고, 솔은 더 싸고 빠르게 반복한다.
인간에게 무엇이 달라지는가
“최고 모델”이라는 질문이 낡았다. 오퍼스 5.5는 가장 똑똑하고, 루나는 가장 싸고 빠르며, 솔은 그 사이에서 비용 대비 성능이 좋고, 페이블 5.1은 가장 어려운 장기 작업에 남는다. “어느 AI가 제일 좋아요”라는 질문에는 이제 “무슨 일에 쓰려고요”라고 되물어야 한다.
단가가 아니라 청구서를 봐야 한다. 이 글의 가장 중요한 표는 작업당 비용 표다. 솔은 오퍼스 5.5의 반값이지만 최고 설정으로 돌리면 오퍼스 5.5 기본 설정과 비용이 비슷해진다. 오퍼스 5.5 글에서 코드래빗이 발견한 것과 같은 현상이다. 값싼 모델을 더 세게 돌리는 것과 비싼 모델을 가볍게 돌리는 것이 같은 값이 되는 지점이 있다.
속도가 새로운 차별점이 된다. 성능 지수가 5점 차이일 때 사용자가 느끼는 것은 그 5점이 아니라 첫 답까지 5초인가 2초인가다. AI 에이전트 글에서 다룬 것처럼 에이전트가 수십 번 도구를 부르는 작업에서는 이 차이가 곱해진다. OpenAI가 이번에 강조한 것도 성능보다 속도와 값이었다.
반론과 불확실성
첫째, 아티피셜 애널리시스는 독립적이지만 하나의 기관이다. 평가 선정과 가중치가 다르면 순위가 바뀔 수 있고, 페이블 5.1은 안전 분류기의 거부가 실패로 집계되어 낮게 나왔을 수 있다.
둘째, 속도는 측정 시점의 서버 부하에 좌우되고, 첫 토큰 시간은 추론 설정에 따라 수십 배 달라진다.
셋째, 작업당 비용은 지능 지수를 돌리는 데 든 비용이지 실제 업무 비용이 아니다. 데이터캠프의 테스트도 한 번 실행이다.
PRISM AGENDA의 시각
네 모델을 한 표에 놓고 나서 나에게 남은 것은 순위가 아니라 하나의 그래프다. 가로축이 작업당 비용, 세로축이 성능인 그래프에서 네 모델은 거의 한 직선 위에 있다. 7센트에 37점, 1달러에 48점, 1.3달러에 51점, 6달러에 58점. 두 회사가 같은 날 값을 내린 뒤 이 직선은 아래로 내려갔지만, 직선의 모양은 그대로다. 더 내면 더 똑똑하고, 덜 내면 덜 똑똑하다.
이것이 의미하는 것은 두 가지다. 하나는 어느 회사도 지금 “같은 값에 훨씬 똑똑한” 자리를 갖고 있지 않다는 것이다. 회사들이 서로를 보며 값을 맞추는 시장에서 그런 자리는 오래 가지 않는다. 다른 하나는 선택의 부담이 사용자에게 왔다는 것이다. 예전에는 최고 모델 하나를 고르면 됐다. 이제는 일마다 등급을 고르고, 등급 안에서 노력 수준을 고르고, 그 조합의 청구서를 확인해야 한다.
나는 이 부담이 나쁘지 않다고 본다. 전기처럼 AI도 소비량을 알고 쓰는 재화가 되어 가는 중이다. 다만 한 가지는 남는다. 직선의 가장 오른쪽, 페이블 5.1이 있는 자리는 과제당 7.63달러다. 그 자리에서 무엇이 가능한지는 그 값을 낼 수 있는 사람만 안다. 직선이 내려가는 것은 좋은 소식이지만, 오른쪽 끝은 여전히 멀다.
자주 묻는 질문
GPT-6 솔과 클로드 오퍼스 5.5 중 무엇이 더 나은가? 독립 평가기관 아티피셜 애널리시스의 지능 지수에서 오퍼스 5.5가 58점, 솔이 48점으로 오퍼스 5.5가 앞선다. 특히 터미널 작업 자동화에서 차이가 컸다. 그러나 솔은 토큰 단가가 절반이고 첫 응답이 3배 빠르다. 최고 성능이 필요하면 오퍼스 5.5, 비용과 속도가 중요하면 솔이다.
GPT-6 루나는 어디에 쓰는 모델인가? 입력 100만 토큰당 0.10달러, 출력 0.50달러로 페이블 5.1의 100분의 1 값이다. 지능 지수는 37점으로 네 모델 중 가장 낮지만 출력 속도는 초당 141토큰으로 가장 빠르다. 분류, 요약, 대량 반복 처리처럼 최상위 성능이 필요 없는 작업용이다.
클로드 페이블 5.1은 오퍼스 5.5보다 나은가? 아티피셜 애널리시스 지수에서는 오퍼스 5.5(58점)가 페이블 5.1(53점)보다 높다. 다만 페이블 5.1은 안전 분류기의 거부가 실패로 집계된 영향이 있을 수 있고, 앤스로픽은 이 모델을 가장 어려운 장기 작업용으로 구분한다. 값은 2.5배이고 첫 응답까지 평균 4분 반이 걸린다.
다음 질문
- 노력 수준이라는 새 변수: 같은 모델을 얼마나 세게 돌릴지는 누가 정하는가.
- 지능의 가격 직선: AI 성능과 비용의 관계는 왜 한 줄로 수렴하는가.
- 기술동향 카테고리의 다른 글 보기



댓글
첫 댓글을 남겨 주세요.