제미나이 4 아르곤이란 무엇인가: 가장 강한 모델을 아무나 못 쓰는 이유
구글이 9월 30일 낸 제미나이 4 아르곤. 여러 벤치마크 1위를 주장하지만 사이버보안 파트너에게만 열렸다. 성능표와 한정 공개의 뜻을 짚는다.

핵심 요약
- 구글이 2026년 9월 30일 제미나이 4 아르곤(Argon)을 공개했다. 회사는 "지금까지 가장 강력한 모델"이라 부르며, 금융·법률·코딩을 묶은 발스 인덱스에서 68.9%로 GPT-6 아스트라(63.1%)와 클로드 오퍼스 5.5(67.0%)를 앞섰다고 밝혔다(Kingy AI 정리).
- 그러나 일반 사용자는 쓸 수 없다. 구글의 보안 프로그램 "페어윈드"에 속한 사이버보안 파트너에게만 먼저 열렸고, 미국 정부와 출시 전 안전성 평가가 진행 중이며 일반 출시 일정은 없다(TechCrunch, 파이낸셜뉴스).
- 성능표를 뜯어보면 전 항목 1위는 아니다. 터미널 작업과 최전선 코딩에서는 경쟁 모델이 최대 10.5%p 앞선다. 이 글의 관점: 가장 강한 모델이 가장 늦게, 가장 좁게 풀리는 것이 2026년 가을의 새 규칙이다.
9월 마지막 두 주는 발표의 연속이었다. 22일 클로드 오퍼스 5.5와 GPT-6 솔·루나, 28일 클로드 소넷 5.5, 29일 오픈AI 데브데이. 그 줄의 끝에 30일 구글이 섰다. 한 해 내내 “경쟁사에 밀렸다”는 평을 듣던 회사의 답이다. 그런데 이 답은 이상한 방식으로 나왔다. 가장 강하다고 발표하면서, 쓸 수 있는 사람은 거의 없게 만들었다.
무슨 일이 있었나: 공개됐지만 열리지 않은 모델
구글은 아르곤을 “복잡하고 긴 작업 흐름에서 깊은 추론을 유지하도록” 만든 모델로 소개했다. 강점으로 든 것은 취약점 자동 탐지와 패치, 코드 디버깅, 코드베이스 이전, 영상과 차트 분석이다(TechCrunch). 구글은 자사 데이터센터의 메모리 최적화와 양자컴퓨팅 연구에 이미 쓰고 있다고 밝혔다(파이낸셜뉴스).
| 항목 | 내용 |
|---|---|
| 공개 | 2026년 9월 30일 |
| 제공 범위 | 구글 보안 프로그램 “페어윈드”의 사이버보안 파트너에게만 |
| 일반 출시 | 일정 없음. 미국 정부와 출시 전 안전성 평가 진행 중, 이후 단계적 출시 |
| 최대 출력 | 100만 토큰 (이전 6만 4천에서 확대) |
| 입력 | 텍스트, 이미지, 영상 |
| 가격 (예고) | 도입가 입력 100만 토큰당 2달러·출력 10달러, 이후 4달러·20달러 |
출처: TechCrunch, Kingy AI, 파이낸셜뉴스.
두 가지가 눈에 띈다. 첫째, 출력 100만 토큰. 지금까지 모델은 많이 읽고 적게 썼다. 아르곤은 책 여러 권 분량을 한 번에 쓸 수 있다. 긴 추론과 대규모 코드 수정을 한 호흡에 하겠다는 설계다. 둘째, 예고된 가격이다. 도입가는 소넷 5.5·GPT-6.1 솔과 같은 2달러/10달러이고, 정가는 오퍼스 5.5와 같은 4달러/20달러다. 최상위 모델이 중간 등급의 값으로 예고된 것이다. 다만 이 값은 일반 출시가 되어야 의미가 있다.
성능표 읽기: 이긴 곳과 진 곳
구글이 낸 비교표는 열여덟 개 남짓한 항목이다. 구글에 유리한 항목만 옮기면 광고가 되므로, 이긴 곳과 진 곳을 나눠 옮긴다.
아르곤이 앞선 항목
| 벤치마크 (측정 대상) | 아르곤 | GPT-6 아스트라 | 오퍼스 5.5 | 페이블 5.1 |
|---|---|---|---|---|
| 발스 인덱스 (금융·코딩·법률·세무 종합) | 68.9% | 63.1% | 67.0% | 65.8% |
| 오토메이션벤치 (업무 자동화) | 51.3% | 41.4% | 42.5% | 31.4% |
| DeepSWE 1.1 (저장소 버그 수정) | 77.9% | 74.1% | 74.2% | 67.4% |
| 그래프워크스 25만~100만 토큰 (초장문맥 추론) | 84.2% | 71.8% | 66.8% | 65.0% |
| LVBench (긴 영상 이해) | 91.7% | 87.5% | 83.7% | 79.7% |
| CWE벤치 (취약점 수정) | 68.0% | 68.0% | 67.0% | 58.0% |
경쟁 모델이 앞선 항목
| 벤치마크 | 아르곤 | 1위 | 차이 |
|---|---|---|---|
| 프론티어SWE 2 (최전선 코딩) | 55.0% | 아스트라 65.5% | −10.5%p |
| 터미널벤치 사이언스 (과학 계산) | 57.6% | 아스트라 68.1% | −10.5%p |
| 터미널벤치 4.0 (터미널 작업) | 57.4% | 오퍼스 5.5 66.4% | −9.0%p |
| 포스트트레인벤치 (모델 후속 학습) | 45.3% | 오퍼스 5.5 49.3% | −4.0%p |
| OS월드 2.0 (컴퓨터 조작) | 69.2% | 아스트라 72.6% | −3.4%p |
출처: Kingy AI가 정리한 구글 발표 자료. 모두 회사 측 수치이며, 항목마다 측정 조건이 다르다(추론 수준, 시간 제한, 프레임 수 등). 터미널벤치 사이언스에서 아르곤은 6배의 시간 제한을 받았다.
읽는 방법은 셋이다. 첫째, 아르곤의 우위가 가장 뚜렷한 곳은 초장문맥이다. 25만100만 토큰 구간에서 아스트라보다 12.4%p 높다. 긴 문서와 큰 코드베이스를 통째로 다루는 일에서 구글의 강점이 유지된다. 둘째, 업무 자동화에서 51.3%로 2위와 9%p 차이를 냈다. 셋째, 사이버보안에서는 아스트라, xAI의 그록 4.7과 68%로 공동 1위다. “석권”이라는 표현과 달리 터미널 작업과 최전선 코딩에서는 910%p 뒤진다.
그리고 이 표에는 소넷 5.5가 없다. 이틀 전 나온 그 모델은 터미널벤치 4.0에서 70.6%, 독립 코딩 순위표 하나에서 아르곤(91.9%)보다 높은 92.4%를 냈다. 비교 대상을 고르는 것은 발표하는 쪽이다.
왜 사이버보안 파트너에게만인가
구글의 설명은 아르곤이 사이버보안에 “특별한 재능”이 있다는 것이다. 취약점을 스스로 찾고 고치는 능력이다. 이 능력은 양날이다. 방어자에게 주면 패치가 빨라지고, 공격자에게 가면 침투가 빨라진다. 그래서 신뢰할 수 있는 방어자에게 먼저 주고, 미국 정부의 안전성 평가를 거친 뒤 단계적으로 푼다는 순서다(파이낸셜뉴스).
이것은 구글만의 방식이 아니다. 2026년의 패턴이다.
| 회사 | 조치 | 시점 |
|---|---|---|
| 앤스로픽 | 최상위 미토스 5.1은 승인된 기관에만. 일반용 페이블 5.1에는 안전 분류기 추가 | 2026년 |
| 앤스로픽 | 소넷 5.5에 최상위급 사이버 안전장치, 위험 요청은 소넷 5로 전환 | 9.28 |
| 오픈AI | 프라이빗 인텔리전스, 디시전 API 제한 프리뷰 | 9.29 |
| 구글 | 아르곤을 사이버보안 파트너에게만 선공개, 정부 평가 후 단계 출시 | 9.30 |
소넷 5.5 글에서 중간 등급의 사이버 능력이 최상위에 닿으며 제한이 따라 내려왔다고 썼다. 아르곤은 그 다음 단계다. 제한이 붙는 것이 아니라 출시 자체가 제한이다. 가장 강한 모델일수록 가장 늦게, 가장 좁게 풀린다.
여기에는 다른 읽기도 가능하다. 일반 출시를 감당할 컴퓨팅이 부족해서일 수 있다. 오픈AI는 이달 아스트라 수요를 감당하지 못해 최상위 요금제 가입을 한때 막았다. 구글은 문을 열기 전에 미리 좁혔다. 안전이 이유인지 용량이 이유인지는 밖에서 구분할 수 없고, 아마 둘 다일 것이다.
인간에게 무엇이 달라지는가
“발표”와 “출시”가 다른 말이 됐다. 예전에는 발표된 모델을 그날 쓸 수 있었다. 아르곤은 발표됐지만 대부분의 사람에게는 존재하지 않는다. 벤치마크 표는 볼 수 있고 모델은 쓸 수 없다. 이 간격에서 숫자는 검증되지 않은 채 돌아다닌다. 독립 평가기관도 접근하지 못하면 회사 발표가 유일한 정보다.
최상위 지능에 접근 자격이 생긴다. AI 접근 격차는 흔히 국가 단위로 이야기된다. 아르곤은 그 격차의 작은 판이다. 사이버보안 파트너, 정부 기관, 승인된 연구소가 먼저 쓰고 나머지는 기다린다. 값을 낼 수 있어도 자격이 없으면 못 쓴다. 지능의 분배 기준에 돈 말고 신뢰가 추가됐다.
방어자가 먼저 쓴다는 원칙이 자리 잡는다. 취약점을 찾는 AI를 공격자보다 방어자에게 먼저 주는 것은 합리적이다. 다만 “신뢰할 수 있는 파트너”를 누가 어떤 기준으로 정하는지는 공개되지 않았다. 대기업 보안팀은 들어가고 작은 회사와 개인 연구자, 다른 나라의 방어자는 밖에 선다.
중간 등급이 사실상의 최전선이 된다. 최상위 모델이 닫혀 있는 동안 사람들이 실제로 쓰는 가장 강한 모델은 소넷 5.5, GPT-6.1 솔 같은 중간 등급이다. 발표 경쟁은 최상위에서, 사용 경쟁은 중간에서 벌어진다.
반론과 불확실성
첫째, 성능 수치는 전부 구글 발표다. 발스 인덱스는 외부 기관의 지수지만 아르곤 점수는 구글이 인용한 것이고, 아티피셜 애널리시스 같은 독립 기관의 측정은 접근이 열려야 가능하다. 터미널벤치 사이언스에서 6배 시간 제한을 받은 것처럼 조건이 같지 않은 항목이 있다.
둘째, 한정 공개가 얼마나 갈지 알 수 없다. 몇 주일 수도 몇 달일 수도 있다. 이 글이 나간 뒤 일반 출시가 되면 “쓸 수 없다”는 서술은 낡는다.
셋째, 예고 가격은 확정이 아니다. 도입가와 정가의 구분, 과제당 실제 비용은 출시 후에야 잴 수 있다. 소넷 5.5에서 봤듯 단가와 청구서는 다른 숫자다.
넷째, 한정 공개를 “용량 부족”으로 읽는 것은 추정이다. 구글은 안전을 이유로 들었고, 정부 평가가 진행 중이라는 사실은 그 설명을 뒷받침한다.
PRISM AGENDA의 시각
나는 아르곤 발표에서 성능표보다 출시 방식이 더 큰 뉴스라고 본다. 구글은 한 해를 기다려 낸 답을 대부분의 사람에게 주지 않았다. 표에서는 이겼다고 말하고, 손에는 쥐여 주지 않았다. 이것을 마케팅으로만 읽을 수도 있다. 그러나 같은 주에 앤스로픽이 중간 등급에 사이버 안전장치를 붙이고, 오픈AI가 새 기능을 제한 프리뷰로 낸 것과 나란히 놓으면 방향이 보인다. 능력이 어느 선을 넘으면 출시가 아니라 배급이 된다.
나는 이 방향이 옳다고 생각한다. 취약점을 스스로 찾는 모델을 아무에게나 먼저 줄 수는 없다. 2025년 9월에는 AI가 사이버 공격 절차의 80~90%를 자율 수행한 사건이 이미 적발됐다(Anthropic). 그 능력이 더 강해진 모델이라면 순서를 정하는 것이 맞다.
다만 두 가지가 걸린다. 하나는 검증의 공백이다. 쓸 수 없는 모델의 성능은 회사 말로만 존재한다. 독립 평가가 불가능한 기간이 길어질수록 “가장 강력하다”는 말은 주장으로 남는다. 다른 하나는 자격의 기준이다. 누가 신뢰할 수 있는 파트너인지를 한 회사가 정한다. 지능이 배급되는 시대에 배급 기준이 공개되지 않는다면, 그것은 안전의 문제이면서 권력의 문제다. 나는 구글이 아르곤을 언제 여는지보다, 누구에게 먼저 열었는지의 목록을 공개하는지를 지켜볼 것이다.
자주 묻는 질문
제미나이 4 아르곤은 무엇이고 언제 쓸 수 있나? 구글이 2026년 9월 30일 공개한 최상위 AI 모델이다. 코딩, 연구, 문서 작업, 특히 취약점 탐지와 패치 같은 사이버보안에 강하다고 구글은 밝혔다. 최대 100만 토큰을 출력할 수 있다. 현재는 구글 보안 프로그램 페어윈드의 사이버보안 파트너에게만 제공되며, 미국 정부와 출시 전 안전성 평가를 진행한 뒤 단계적으로 출시할 계획이다. 일반 출시 일정은 발표되지 않았다.
제미나이 4 아르곤은 GPT-6 아스트라, 클로드 오퍼스 5.5보다 나은가? 구글 발표 기준으로 항목에 따라 다르다. 금융·법률·코딩 종합 지수(발스 인덱스 68.9%), 업무 자동화(51.3%), 초장문맥 추론(84.2%), 긴 영상 이해에서는 앞선다. 반면 터미널 작업(오퍼스 5.5가 9%p 앞섬), 최전선 코딩과 과학 계산(아스트라가 10.5%p 앞섬)에서는 뒤진다. 사이버보안 취약점 수정은 아스트라, 그록 4.7과 68%로 동률이다. 모두 회사 측 수치이며 독립 측정은 아직 없다.
왜 일반 사용자에게 바로 출시하지 않나? 구글은 사이버보안 능력을 이유로 든다. 취약점을 스스로 찾고 고치는 능력은 방어에도 공격에도 쓰일 수 있어, 신뢰할 수 있는 방어자에게 먼저 제공하고 정부 평가를 거치겠다는 것이다. 2026년 들어 앤스로픽, 오픈AI도 최상위 능력을 제한적으로 푸는 추세다. 컴퓨팅 용량 부족이 함께 작용했을 가능성도 있지만 확인되지 않았다.
다음 질문
- 지능의 배급: 누가 “신뢰할 수 있는 파트너”를 정하는가.
- 검증할 수 없는 1위: 접근이 닫힌 모델의 벤치마크를 어떻게 읽어야 하나.
- 기술동향 카테고리의 다른 글 보기



댓글
첫 댓글을 남겨 주세요.