클로드 소넷 5.5 비교: 오퍼스 반값에 2점 차, 토큰은 60% 더
소넷 5.5를 오퍼스 5.5, 소넷 5, GPT-6 솔·아스트라와 독립 측정으로 비교한다. 지능 지수 2위, 값은 그대로, 과제당 비용은 올랐다

핵심 요약
- 앤스로픽이 2026년 9월 28일 클로드 소넷 5.5를 냈다. 값은 소넷 5와 같은 입력 100만 토큰당 2달러, 출력 10달러. GPT-6 솔과 정확히 같은 값이다. 회사는 출력 속도 30% 향상, 과제당 비용 최대 30% 절감을 내세웠다(The Decoder).
- 독립 측정에서 지능 지수 56점으로 전체 2위. 오퍼스 5.5(58)에 2점 뒤지고 GPT-6 아스트라(53), GPT-6 솔(48)을 앞선다. 터미널 작업 자동화에서는 소넷 5의 10%에서 64~70%로 뛰어 오퍼스 5.5를 넘었다(Artificial Analysis).
- 그러나 같은 측정에서 과제당 토큰을 역대 최다인 약 19만 3천 개 썼다. 오퍼스 5.5보다 60% 많고 GPT-6 아스트라의 7배다. 그래서 지수 과제당 비용은 7.60달러로 오퍼스 5.5(5.98달러)보다 비싸다. "값은 그대로, 성능은 오퍼스급"의 대가가 여기 있다.
일주일 전 오퍼스 5.5 글에서 “최상위 성능이 20% 싸진 날”을 다뤘고, GPT-6 솔·루나 비교 글에서 네 모델을 비용 대 성능 직선 위에 놓았다. 9월 28일 그 직선에 점이 하나 더 찍혔다. 클로드 소넷 5.5다. 이 글은 새 점이 어디에 찍혔는지, 그리고 그 위치가 회사의 설명과 어디서 다른지를 독립 측정으로 확인한다.
무슨 일이 있었나: 값을 동결한 이유
소넷 5.5는 클로드 5.5 세대의 두 번째 모델이다. 오퍼스 5.5가 값을 20% 내린 것과 달리 소넷 5.5는 값을 그대로 뒀다. 대신 같은 일을 더 적은 토큰으로 끝내 과제당 비용을 최대 30% 낮춘다는 것이 회사의 설명이다(Unite.AI).
| 항목 | 소넷 5.5 | 비교 |
|---|---|---|
| 출시 | 2026년 9월 28일 | 오퍼스 5.5 출시 6일 뒤 |
| 가격 | 입력 2달러 · 출력 10달러 · 캐시 읽기 0.20달러 (100만 토큰당) | 소넷 5와 동일. GPT-6 솔과 동일. 오퍼스 5.5의 절반 |
| 회사 주장 | 출력 30% 이상 빠름, 과제당 비용 최대 30% 절감 | 단가가 아니라 토큰 절약으로 |
| 용도 | 범위가 분명한 일상 업무, 버그 수정, 문서·슬라이드·스프레드시트 | 복잡한 추론은 오퍼스 5.5 |
| 제공 | 클로드 앱·API, AWS, 구글 클라우드, 마이크로소프트 애저 | 즉시 |
출처: The Decoder, AI타임스.
값을 동결한 것은 전략이다. GPT-6 솔이 9월 22일 값을 반으로 내려 2달러/10달러가 됐다. 소넷 5.5는 같은 값에 “오퍼스급 성능”을 붙여 맞섰다. ZDNet 코리아는 이를 OpenAI의 가성비 전략에 대한 앤스로픽의 대응으로 읽었다(ZDNet Korea). 단가 경쟁 대신 효율 경쟁을 택한 것이다.
성능: 회사 발표와 독립 측정
회사 발표. 앤스로픽이 낸 수치에서 가장 큰 변화는 코딩이다.
| 벤치마크 | 소넷 5.5 | 소넷 5 | 오퍼스 5.5 | GPT-6 솔 |
|---|---|---|---|---|
| 터미널벤치 4.0 (터미널 작업 자동화) | 70.6% | 10.3% | 66.4% | 미공개 |
| 커서벤치 4.0 (코드 편집) | 55.5% | 34.1% | 57.8% | 미공개 |
| GDPval-AA (44개 직종 업무) | 1,844 | 1,449 | 1,846 | 1,487 |
| 차트 이해 | 61.6% | 15.6% | 64.4% | 53.6% |
출처: The Decoder가 정리한 앤스로픽 발표. 회사 측 측정. 오퍼스 5.5 터미널벤치는 매우 높음 설정 기준.
터미널 작업 자동화에서 10%에서 70%로 뛴 것은 세대 교체라기보다 다른 모델이 된 수준이다. 업무 능력 지표에서는 오퍼스 5.5와 2점 차이로 사실상 같다.
독립 측정. 아티피셜 애널리시스는 출시 직후 자체 평가를 돌렸다(Artificial Analysis).
| 모델 (최고 설정) | 지능 지수 | 순위 |
|---|---|---|
| 클로드 오퍼스 5.5 | 58 | 1위 |
| 클로드 소넷 5.5 | 56 | 2위 |
| GPT-6 아스트라 | 53 | |
| GPT-6 솔 | 48 | |
| 클로드 소넷 5 | 38 |
같은 기관의 세부 항목에서 소넷 5.5는 터미널벤치 64%(소넷 5보다 50%p 상승), 업무 자동화 71%(오퍼스 5.5의 70%와 동률), 업무 능력 1,844(오퍼스 5.5의 1,846과 동률)를 냈다. 뒤지는 곳은 사실 지식이다. 사실 지식 평가에서 54%로 오퍼스 5.5의 66%에 12%p 못 미쳤다. 회사 발표와 독립 측정이 같은 방향을 가리킨다. 일을 시키는 능력은 오퍼스급, 아는 것은 그보다 적다.
비용: 단가는 같고 청구서는 다르다
여기서 회사 설명과 독립 측정이 갈린다. 회사는 “과제당 비용 최대 30% 절감”이라 했다. 아티피셜 애널리시스의 측정은 반대다.
| 모델 (최고 설정) | 지수 과제당 출력 토큰 | 지수 과제당 비용 |
|---|---|---|
| 클로드 소넷 5.5 | 약 19만 3천 개 (역대 최다) | 7.60달러 |
| 클로드 오퍼스 5.5 | 소넷 5.5보다 약 60% 적음 | 5.98달러 |
| 클로드 소넷 5 | 소넷 5.5보다 약 60% 적음 | 약 5달러 |
| GPT-6 아스트라 | 소넷 5.5의 약 7분의 1 | 3.26달러 |
| GPT-6 솔 | 1.06달러 |
출처: Artificial Analysis, OfficeChai. 지능 지수 전체를 돌리는 데 든 실제 비용을 과제당으로 환산.
소넷 5.5는 최고 설정에서 과제당 약 19만 3천 개의 출력 토큰을 썼다. 이 기관이 측정한 모델 중 가장 많다. 오퍼스 5.5보다 60% 많고 GPT-6 아스트라의 7배다. 그 결과 단가가 절반인데도 과제당 비용은 오퍼스 5.5보다 27% 비쌌고, 소넷 5보다 50% 올랐다. 회사의 “30% 절감”은 회사가 고른 작업 묶음에서, 독립 기관의 “50% 상승”은 어려운 추론 과제 묶음에서 나온 수치다. 둘 다 거짓은 아니다. 다만 오퍼스 5.5 글에서 코드래빗이 발견한 것과 같은 현상이 반복된다. 단가와 청구서는 다른 숫자다.
이 차이는 노력 설정에서 온다. 같은 소넷 5.5를 설정만 바꿔 잰 결과다.
| 노력 설정 | 지능 지수 | 출력 속도 (토큰/초) | 지수 과제당 비용 |
|---|---|---|---|
| 최고 | 56 | 139 | 7.60달러 |
| 매우 높음 | 52 | 113 | |
| 높음 | 47 | 93 | |
| 중간 | 41 | 104 | |
| 낮음 | 36 | 85 | 0.41달러 |
출처: Artificial Analysis. 최저와 최고 설정의 과제당 비용 차이는 18배.
설정 하나로 비용이 18배 갈리고, 낮음 설정의 점수(36)는 소넷 5 최고 설정(38)과 비슷하다. 소넷 5.5는 생각할 자유를 주면 많이 생각하는 모델이다. Jev AI 벤치마크 글에서 봤듯 이제 모델 선택만큼 설정 선택이 청구서를 정한다.
처음 붙은 최상위급 안전장치
소넷 5.5에는 이전 소넷에 없던 것이 둘 붙었다(TheNextWeb). 첫째, 최상위 모델에만 있던 사이버 안전장치다. 소넷 5.5의 사이버 능력이 오퍼스 5 수준에 이르러, 위험도 높은 사이버 요청은 소넷 5로 눈에 보이게 넘어간다. 둘째, 추론 추출 방지 분류기다. 연구자들이 공개된 에이전트 기록에서 사고 블록 31만 5천 개를 해독해 API 키 62개, 비밀번호 33개, 개인 키 7개를 복원한 사건이 계기다. 소넷 5.5는 추론을 발급 계정에 묶고, 가짜 계정으로 모델을 증류하려는 시도를 막는 분류기를 달았다.
이것은 스텔스 모델 글에서 본 문제의 반대편이다. 익명으로 풀린 모델은 아무것도 막지 않고, 이름 있는 중간 등급 모델에는 최상위급 제한이 내려온다. 중간 등급의 능력이 최상위에 닿으면서 제한도 따라 내려온 것이다.
인간에게 무엇이 달라지는가
“오퍼스를 살 이유”가 다시 좁아진다. 6일 전 오퍼스 5.5가 페이블 5.1의 이유를 좁혔다면, 소넷 5.5는 오퍼스 5.5의 이유를 좁힌다. 업무 능력에서 2점 차이라면 대부분의 일은 절반 값의 모델로 된다. 남는 이유는 사실 지식(12%p 차이)과 복잡한 장기 추론이다. 모델 등급이 “어떤 일에 쓰는가”의 구분으로 바뀌고 있다.
중간 등급의 청구서를 의심해야 한다. 단가가 같다고 비용이 같지 않다. 소넷 5.5를 최고 설정으로 돌리면 오퍼스 5.5보다 비쌀 수 있다. 200달러 요금제 글에서 본 “계량기”의 필요가 여기서도 나온다. 어느 설정에서 얼마를 쓰는지 보지 않으면 싼 모델이 비싼 모델이 된다.
GPT-6 솔과의 선택이 정확히 갈린다. 같은 2달러/10달러에서 소넷 5.5는 지수 56, 솔은 48이다. 그러나 과제당 비용은 7.60달러 대 1.06달러다. 성능의 천장이 필요하면 소넷 5.5, 같은 값에 많은 일을 돌려야 하면 솔이다. 둘은 경쟁 모델이라기보다 다른 용도의 모델이다.
안전장치가 중간 등급의 표준이 된다. 사이버 능력이 오퍼스 5에 이르는 순간 제한이 따라왔다. 앞으로 중간 등급이 최상위에 가까워질수록 제한도 같이 내려온다. 싸고 강한 모델을 쓰는 사용자는 그 제한도 함께 받는다.
반론과 불확실성
첫째, 독립 측정은 출시 며칠 안의 결과이고 한 기관의 지수다. 항목 선정과 가중치가 다르면 순위가 바뀔 수 있다.
둘째, “과제당 19만 3천 토큰”은 최고 설정에서 어려운 추론 과제를 돌린 수치다. 회사가 말한 30% 절감은 일상 업무 기준일 수 있고, 두 주장은 서로 다른 작업에서 나왔다. 실제 청구서는 각자의 작업에서 재야 한다.
셋째, 프론티어코드 평가에서 최고 설정이 매우 높음 설정보다 못한 이상 현상이 보고됐다. 코드 검토 기능이 시간 초과를 일으킨 것으로, 설정과 성능의 관계가 단순하지 않다.
넷째, GPT-6 솔과의 직접 비교 수치는 대부분 회사 발표나 지수 기관의 것이고, 실사용 비교는 아직 없다.
PRISM AGENDA의 시각
나는 소넷 5.5를 “오퍼스급 성능을 반값에”라는 문장보다 값은 같고 토큰은 60% 더 쓴다는 문장으로 기억하려 한다. 전자는 회사의 문장이고 후자는 계량기의 문장이다. 둘 다 맞지만 청구서를 받는 쪽에서 중요한 것은 후자다.
일주일 사이에 세 회사가 같은 일을 했다. OpenAI는 단가를 반으로 내렸고, 앤스로픽은 오퍼스의 단가를 20% 내리고 소넷의 단가를 동결했다. 겉으로는 값 내리기 경쟁이다. 속을 보면 더 오래 생각하는 모델들이 나오고 있고, 오래 생각하는 만큼 토큰을 쓴다. 단가는 내려가고 소비량은 올라간다. 제번스의 역설이 청구서 단위에서 작동한다.
그래서 내가 바라는 것은 모델을 고를 때 지수 순위와 단가표 옆에 과제당 비용 열을 하나 더 두는 습관이다. 소넷 5.5는 그 열에서 오퍼스 5.5보다 비싸고 솔보다 7배 비싸다. 그 숫자를 보고도 소넷 5.5를 고를 이유는 충분히 있다. 다만 그 숫자를 보지 않고 고르는 것과는 다른 선택이다.
자주 묻는 질문
클로드 소넷 5.5는 오퍼스 5.5보다 나은가? 일을 시키는 능력에서는 거의 같다. 회사 발표에서 터미널 작업 자동화는 소넷 5.5(70.6%)가 오퍼스 5.5(66.4%)를 앞섰고, 업무 능력 지표는 1,844 대 1,846으로 동률이다. 독립 지수에서는 56 대 58로 2점 뒤진다. 뒤지는 곳은 사실 지식(54% 대 66%)이다. 단가는 절반이지만 최고 설정에서 토큰을 60% 더 써서 과제당 비용은 오히려 높을 수 있다.
소넷 5.5와 GPT-6 솔 중 무엇을 써야 하나? 단가는 둘 다 입력 2달러, 출력 10달러로 같다. 독립 지수는 소넷 5.5가 56, 솔이 48로 소넷 5.5가 높다. 그러나 지수 과제당 비용은 소넷 5.5가 7.60달러, 솔이 1.06달러다. 성능의 천장이 필요한 일은 소넷 5.5, 같은 값에 많은 양을 처리해야 하는 일은 솔이 맞는다.
소넷 5.5의 과제당 비용이 왜 30% 줄었다는 회사 발표와 다른가? 측정한 작업이 다르다. 회사의 30% 절감은 자체 선정한 일상 업무 묶음 기준이고, 아티피셜 애널리시스의 50% 상승은 어려운 추론 과제를 최고 설정으로 돌린 결과다. 소넷 5.5는 생각할 자유를 주면 많이 생각하는 모델이라 설정에 따라 토큰 사용량이 크게 달라진다. 실제 비용은 각자의 작업과 설정에서 직접 재야 한다.
다음 질문
- 과제당 비용 열: 모델 비교표에 청구서 기준을 넣으면 순위는 어떻게 바뀌나.
- 중간 등급의 제한: 싸고 강한 모델에 최상위급 안전장치가 붙으면 무엇이 달라지나.
- 기술동향 카테고리의 다른 글 보기



댓글
첫 댓글을 남겨 주세요.