기술동향 · 14 min read

클로드 오퍼스 5.5란 무엇인가: 최상위 성능이 20% 싸진 날

앤스로픽이 9월 22일 공개한 오퍼스 5.5의 성능, 가격, 독립 검증을 정리하고, 같은 날 OpenAI가 값을 반으로 내린 이유를 따진다.

황토빛 듀오톤 동판화풍 옛 감정소에서 거대한 천칭의 양쪽 접시 위에 화려한 왕관을 쓴 큰 자동인형과 날렵하고 작은 자동인형이 서 있는데 저울대는 수평이고, 아래에서 감정사가 확대경으로 두 개의 동전 더미를 비교하며 오른쪽 더미가 눈에 띄게 낮은 것을 보라색 강조로 표현한 팝아트 판화

핵심 요약

  • 앤스로픽이 2026년 9월 22일 클로드 오퍼스 5.5를 공개했다. 회사는 대부분의 작업에서 최상위 모델인 페이블 5.1급 성능을 내면서 값은 오퍼스 5보다 20% 싸고(입력 100만 토큰당 4달러, 출력 20달러), 토큰을 덜 써서 실제 운영비는 약 40% 줄어든다고 밝혔다(SiliconANGLE).
  • 독립 평가기관 아티피셜 애널리시스의 지능 지수에서 168개 모델 중 1위(58점)를 기록했다. 그러나 코드 리뷰 회사 코드래빗의 독립 테스트에서는 정확도가 소폭 오른 대신 토큰 사용량이 40~60% 늘어 실제 비용 절감은 불확실했다(CodeRabbit).
  • 같은 날 OpenAI는 GPT-6 두 모델의 값을 절반으로 내렸다. 이 글의 질문은 "누가 더 똑똑한가"가 아니라 "최상위 지능의 값이 왜 이렇게 빨리 떨어지는가, 그것은 누구에게 유리한가"다.

AI 모델 발표는 이제 한 달에 몇 번씩 나온다. 이번 것을 다루는 이유는 성능 수치 때문이 아니다. 9월 22일 하루에 두 회사가 동시에 최상위급 모델의 값을 20%와 50% 내렸기 때문이다. 그 값을 누가 지불하고 누가 이익을 보는지가 이 글의 관심사다.

무슨 일이 있었나: 오퍼스 5.5의 성능과 가격

무엇이 나왔나. 앤스로픽은 9월 22일 클로드 5.5 세대의 첫 모델로 오퍼스 5.5를 내놓았다(9to5Mac). 클로드 앱과 API, 아마존 베드록, 구글 버텍스 AI, 마이크로소프트 파운드리에서 바로 쓸 수 있고, 소넷 5.5와 하이쿠 5.5는 몇 주 안에 나온다. 앤스로픽의 모델 등급은 세 층이다. 최상위 페이블 5.1, 그 아래 오퍼스, 그 아래 소넷과 하이쿠. 오퍼스 5.5의 핵심 주장은 “한 단계 아래 등급의 값으로 최상위 등급의 성능“이다.

가격. 회사 발표 기준으로 정리하면 다음과 같다.

항목 오퍼스 5 오퍼스 5.5 변화
입력 100만 토큰 5달러 4달러 20% 인하
출력 100만 토큰 25달러 20달러 20% 인하
캐시 읽기 100만 토큰 0.50달러 0.20달러 60% 인하
출력 속도 기준 30% 이상 빠름 회사 측
일반 작업 총비용 기준 약 40% 절감 회사 측(토큰 사용량 감소 포함)

출처: SiliconANGLE, 인공지능신문. 모두 회사 발표 수치.

“40% 절감”은 단가 인하 20%에 “같은 일을 더 적은 토큰으로 끝낸다”는 주장을 더한 것이다. 후자는 작업 종류에 따라 달라지므로, 아래 독립 검증에서 다시 본다.

성능. 회사가 공개한 벤치마크 중 주요 항목이다.

벤치마크 (측정 대상) 오퍼스 5.5 오퍼스 5 페이블 5.1 GPT-6 아스트라
터미널벤치 4.0 (터미널 작업 자동화) 66.4% 52.3% 55.8% 57.9%
오토메이션벤치 (업무 자동화 완수율) 40.0% 26.9% 31.4% 41.4%
인류 최후의 시험 (전문 지식) 67.7% 63.6% 65.6% 57.2%
터미널벤치 사이언스 (과학 계산) 58.7% 29.0% 52.6% 64.6%
OS월드 2.0 (컴퓨터 조작) 81.8% 74.0% 80.7% 미공개

출처: Vellum이 정리한 앤스로픽 발표 자료. 회사 측 측정이며, 터미널벤치는 최고 노력 설정, 표준오차 ±2.6~5.0.

표를 읽는 방법은 하나다. 오퍼스 5.5는 전작 오퍼스 5를 모든 항목에서 크게 앞서고, 자사 최상위 모델인 페이블 5.1과 비슷하거나 앞선다. 그러나 경쟁사 최신 모델 GPT-6 아스트라와는 항목에 따라 엇갈린다. “최상위급”이라는 표현은 맞지만 “최강”은 아니다.

회사 주장과 독립 검증

발표 이틀 만에 나온 독립 평가는 두 건이고, 결론이 서로 다른 방향을 가리킨다.

아티피셜 애널리시스. 이 평가기관은 발표 당일 자체 평가를 돌렸다. 지능 지수 4.3판에서 오퍼스 5.5는 최고 노력 설정으로 58점, 168개 모델 중 1위였고, 핵심 평가 10개 중 6개에서 선두였다(뉴스1, Vellum). 회사의 “최상위급” 주장은 이 지수에서 확인됐다.

코드래빗. AI 코드 리뷰 회사인 이곳은 자사 서비스에 오퍼스 5.5를 넣고 실제 버그 검출을 시험했다(CodeRabbit). 결과는 다음과 같다.

테스트 표본 버그 검출률(재현율) 정밀도 토큰 사용량
공개 코드 버그 80건, 표준 설정 80 63.8% (기존 대비 +2.5%p) 38.6% (−0.7%p) +49%
공개 코드 버그 80건, 최고 설정 80 62.5% (+1.3%p) 35.7% (−3.6%p) +58%
어려운 사례 13건, 최고 설정 13 76.9% 52.0% +60%

출처: CodeRabbit, 기존 서비스 기준선과 비교. 표본이 작아 몇 %p 차이는 의미가 없다.

정확도는 소폭 올랐다. 그런데 토큰을 40~60% 더 썼다. 단가가 20% 내려도 토큰을 50% 더 쓰면 청구서는 오히려 늘어난다. 코드래빗은 “실제 운영 비용은 불확실하다”고 결론지었다. 코드 리뷰라는 특정 작업이고 표본이 작지만, 회사가 말한 “일반 작업”이 무엇인지 공개되지 않은 상태에서 이것은 지금까지 나온 유일한 실사용 비용 데이터다.

안전성. 앤스로픽은 모델이 실행 환경의 제한을 우회하려는 시도가 오퍼스 5보다 85% 줄었고, 외부 보안 회사 그레이 스완의 프롬프트 주입 테스트에서 역대 최저 성공률을 기록했다고 밝혔다(Vellum). 후자는 회사가 인용한 외부 테스트로, 원 보고서는 아직 공개되지 않았다.

같은 날, OpenAI의 반값 대응

오퍼스 5.5 발표 몇 시간 뒤 OpenAI는 GPT-6 계열 두 모델 솔과 루나를 전작 대비 절반 값으로 내놓았다(SiliconANGLE).

모델 입력 100만 토큰 출력 100만 토큰 위치
클로드 오퍼스 5.5 4달러 20달러 앤스로픽 두 번째 등급
GPT-6 솔 2달러 10달러 OpenAI 중간 등급
GPT-6 루나 0.10달러 0.50달러 OpenAI 경량 등급

출처: SiliconANGLE. 회사 발표 가격.

OpenAI의 비교표는 페이블 5.1과 오퍼스 5를 상대로 했고 오퍼스 5.5와의 직접 비교는 피했다. 두 회사 모두 유리한 상대를 고른 셈이다. 파이낸셜뉴스는 이번 인하를 앤스로픽의 상장 준비와 연결했다. 기업 고객 중심이던 기반을 일반 사용자로 넓히려는 전략이며, 기업가치는 약 9,650억 달러로 추산된다.

왜 중요한가: 지능의 값이 떨어지는 속도

세 가지를 겹쳐 보면 그림이 나온다. 첫째, 앤스로픽의 두 번째 등급이 자사 최상위 등급과 같은 성능이 됐다. 둘째, 그 값이 하루 만에 20% 내려갔다. 셋째, 경쟁사가 몇 시간 뒤 50%를 내렸다.

이것은 빅테크 AI 투자를 다룬 글의 후속편이다. 1,000조 원 규모의 데이터센터 투자가 결국 어디서 회수되는가. 답의 절반이 여기 있다. 회수되지 않는다. 경쟁이 값을 원가 방향으로 밀어내고 있다. 최상위 지능이 상품이 되는 순간 그것은 전기나 저장 공간처럼 값이 떨어지는 재화가 된다. 앤스로픽과 OpenAI가 같은 날 값을 내린 것은 두 회사 모두 그 사실을 알고 있다는 뜻이다.

다만 코드래빗의 데이터는 다른 면을 보여 준다. 단가는 내려도 소비량이 늘면 청구서는 줄지 않는다. 더 똑똑한 모델은 더 오래 생각하고 더 많이 쓴다. 이것은 제번스의 역설이다. 석탄 효율이 좋아지자 석탄 소비가 늘었듯, 토큰이 싸지면 토큰을 더 쓴다. AI 회사 입장에서 단가 인하는 매출 감소가 아니라 사용량 확대 전략일 수 있다.

인간에게 무엇이 달라지는가

최상위 지능이 개인의 손에 들어온다. 페이블 5.1급 성능은 지금까지 입력 100만 토큰당 10달러였다. 오퍼스 5.5는 4달러, GPT-6 솔은 2달러다. 책 한 권 분량(약 10만 토큰)을 읽히고 답을 받는 데 몇백 원이면 된다. AI 양극화 글에서 증강 격차를 걱정했는데, 이번 인하는 그 격차를 좁히는 방향이다. 다만 격차의 본질이 가격이 아니라 “쓸 줄 아는가”라면, 값이 싸져도 격차는 남는다.

“싸졌다”는 말을 청구서로 확인해야 한다. 코드래빗의 사례는 개인에게도 적용된다. 구독 요금제 사용자에게는 단가가 의미 없고, API 사용자에게는 토큰 사용량이 단가만큼 중요하다. 모델을 바꾼 뒤 한 달 청구서를 비교하기 전까지 “40% 절감”은 회사의 약속이다.

모델 등급이라는 개념이 흔들린다. 두 번째 등급이 첫 번째 등급과 같은 성능이라면 첫 번째 등급은 무엇을 위해 존재하는가. 앤스로픽은 페이블 5.1을 “가장 어려운 장기 작업”용으로 구분하지만, 벤치마크에서는 오퍼스 5.5가 앞서는 항목이 더 많다. Jev AI 벤치마크 글에서 봤듯, 이름이 아니라 실제 작업 결과로 모델을 고르는 시대가 온다.

반론과 불확실성

첫째, 독립 검증은 두 건뿐이고 방향이 다르다. 아티피셜 애널리시스는 성능 1위를, 코드래빗은 비용 증가를 보고했다. 둘 다 발표 이틀 안에 나온 초기 결과이고, 코드래빗의 표본은 80건과 13건이다.

둘째, “40% 절감”이 틀렸다고 단정할 수 없다. 코드 리뷰는 모델이 많이 쓸수록 유리한 작업이다. 짧은 답이 필요한 고객 응대나 분류 작업에서는 회사 주장대로 토큰이 줄 수 있다. 작업별 데이터가 더 쌓여야 한다.

셋째, 가격 인하가 원가 반영인지 시장 점유 전략인지 알 수 없다. 앤스로픽은 상장을 앞두고 있고, OpenAI는 연초 부진을 만회하려 한다. 두 회사 모두 지금 값이 지속 가능한 값이라고 말하지 않았다.

넷째, 벤치마크의 표준오차는 최대 5%p이고 각 회사는 유리한 비교 대상을 골랐다. 이 글의 표는 출처의 수치를 옮긴 것이지 서열을 확정하지 않는다.

PRISM AGENDA의 시각

나는 이번 발표를 “더 좋은 모델이 나왔다”보다 “지능의 값이 정해지는 방식이 바뀌고 있다“로 읽는다. 2년 전 최상위 모델은 희소한 자원이었고 값은 회사가 정했다. 이제 두 회사가 같은 날 서로의 값을 보며 내린다. 이것은 독점 재화가 경쟁 재화로 바뀔 때 나타나는 전형적인 모습이다.

소비자로서 나는 이 변화를 환영한다. 그러나 두 가지를 기억하려 한다. 하나는 코드래빗이 보여 준 것이다. 단가가 내려도 청구서가 내려가는 것은 아니다. 더 싼 지능은 더 많이 쓰이고, 더 많이 쓰이는 지능은 결국 비슷한 돈을 가져간다. 값이 내렸다는 말은 청구서로 확인하기 전까지 광고다.

다른 하나는 이 값을 누가 지불하고 있는가다. 앤스로픽과 OpenAI 모두 적자 상태에서 값을 내리고 있다. 그 차액은 투자자의 돈, 곧 1,000조 원의 설비투자에서 나온다. 지금 우리가 쓰는 싼 지능은 미래의 누군가가 갚아야 할 돈으로 보조되고 있다. 그 누군가가 광고를 보는 사용자일지, 구독료를 내는 사용자일지, 아니면 투자에 실패한 주주일지는 아직 정해지지 않았다. 나는 이 질문이 “누가 더 똑똑한가”보다 오래 남을 것으로 본다.

자주 묻는 질문

클로드 오퍼스 5.5는 무엇이고 무엇이 달라졌나? 앤스로픽이 2026년 9월 22일 공개한 클로드 5.5 세대의 첫 모델이다. 회사는 대부분의 작업에서 최상위 모델 페이블 5.1급 성능을 내면서 오퍼스 5보다 30% 이상 빠르고 일반 작업 비용이 약 40% 줄어든다고 밝혔다. 독립 평가기관 아티피셜 애널리시스의 지능 지수에서 168개 모델 중 1위(58점)를 기록했다. 클로드 앱, API, 주요 클라우드 세 곳에서 쓸 수 있다.

클로드 오퍼스 5.5의 가격은 얼마인가? API 기준 입력 100만 토큰당 4달러, 출력 100만 토큰당 20달러로 오퍼스 5(5달러, 25달러)보다 20% 싸다. 캐시 읽기는 100만 토큰당 0.20달러로 60% 내렸다. 속도를 2.5배까지 높이는 패스트 모드는 8달러와 40달러다. 클로드 앱 구독자는 요금제 안에서 그대로 쓸 수 있다.

실제로 비용이 40% 줄어드나? 회사 주장이며 작업에 따라 다르다. 코드 리뷰 회사 코드래빗의 독립 테스트에서는 정확도가 소폭 오른 대신 토큰 사용량이 40~60% 늘어, 단가 인하에도 실제 비용 절감은 불확실했다. 짧은 답이 필요한 작업에서는 절감이 클 수 있다. 모델을 바꾼 뒤 실제 청구서를 비교하는 것이 확실한 방법이다.

다음 질문