기술동향 · 17 min read

미스트랄 라지 4란 무엇인가: 유럽산 1조 파라미터 공개 가중치 모델

미스트랄 라지 4는 1조 파라미터 공개 가중치 모델이다. 사양·가격, 회사 주장과 독립 평가의 차이, 아직 풀리지 않은 가중치를 정리한다.

인디고 블루 듀오톤 동판화풍 19세기 파리 박람회장에서 프록코트 차림의 기술자들이 밧줄과 체인 호이스트로 마차만 한 거대한 주철 추를 대형 저울 위로 끌어올리고, 저울 옆에 자물쇠가 채워진 현대식 서버 랙이 핫 마젠타로 빛나는 팝아트 판화

허깅페이스에 아직 내려받을 수 없는 모델 페이지 하나가 올라와 있다. 이름은 Mistral-Large-4-1T-A52B, 별명은 "르 숑크(Le Chonk)". 10월 9일 현재 704명이 공개를 기다린다고 표시돼 있다(Hugging Face). 프랑스 미스트랄 AI가 10월 6일 공개 미리보기로 내놓은 1조 파라미터 모델이다. 미국도 중국도 아닌 곳에서 나온 가장 큰 공개 가중치 모델이라는 점에서, 이 글은 무엇이 확인된 사실이고 무엇이 아직 약속인지를 가른다.

핵심 요약

  • 미스트랄 라지 4는 총 1조 파라미터, 토큰당 활성 490억의 혼합전문가(MoE) 멀티모달 모델로, 10월 6일 API 공개 미리보기로 나왔다. 가격은 입력 100만 토큰당 1.36달러, 출력 4.18달러다(Mistral AI).
  • 독립 평가기관 아티피셜 애널리시스의 지능 지수는 38점으로 GPT-6 루나(최대 설정, 38점)와 같고, 미국·중국 밖에서 나온 모델 중 최고다(Artificial Analysis). 반면 또 다른 독립 평가 Vals 지수에서는 45개 모델 중 33위다(Vals AI).
  • "공개 가중치"라고 불리지만 가중치는 아직 내려받을 수 없다. 공개 시점은 "10월 말", 라이선스 조건은 미공개다(Online Tech Tips).

목차

무슨 일이 있었나: 파리에서 나온 1조 파라미터

미스트랄 AI는 2026년 10월 6일 미스트랄 라지 4를 "연구 공개 미리보기"로 내놓았다. 지금은 자사 개발 플랫폼 미스트랄 스튜디오와 API로만 쓸 수 있고, 모델 가중치 파일은 "이달 말" 공개하겠다고 했다(Mistral AI). 허깅페이스 모델 페이지에는 예상 시점이 10월 31일로 적혀 있다(Hugging Face).

공개 가중치(open weights) 모델이란 학습이 끝난 모델의 매개변수 파일을 누구나 내려받아 자기 서버에서 돌릴 수 있게 공개한 모델을 말한다. 학습 데이터와 코드까지 여는 오픈소스와는 다르다. 미스트랄은 이 모델을 160개 이상 언어로 학습시켰고, 유럽에 있는 자사 데이터센터의 엔비디아 그레이스 블랙웰 GPU 3,800장으로 처음부터 훈련했다고 밝혔다(Mistral AI). 더넥스트웹은 훈련에 약 두 달, 전력 약 10메가와트가 들었다고 전했다(The Next Web). 미스트랄 측은 이 GPU 수가 중국 경쟁사의 2~3분의 1 수준이라고 주장했다(Basic Tutorials). 이 비교는 회사 측 주장이며 상대 회사의 GPU 수는 공개된 바 없다.

어떻게 작동하고 무엇이 다른가

핵심 사양은 아래와 같다. 모두 미스트랄이 밝힌 수치다.

항목 수치 비고 출처
총 파라미터 1조(1.05조) 혼합전문가 구조 Mistral AI
토큰당 활성 파라미터 490억 임베딩·출력층 포함 520억 Hugging Face
비전 인코더 16억 문서·차트·도면·지리 이미지 입력 TestingCatalog
문맥 길이 100만 토큰(문서) / 51만2천(독립 평가 표기) 아래 '반론' 참조 Basic Tutorials, Vals AI
가격(API) 입력 1.36달러 / 출력 4.18달러 100만 토큰당. 캐시 입력 0.14달러 Artificial Analysis
출시 할인 첫 2주 50% 입력 0.68 / 출력 2.09달러 Online Tech Tips
가중치 공개 10월 말 예정 라이선스 미공개 Hugging Face

혼합전문가(MoE)란 모델 안에 여러 "전문가" 신경망을 두고 입력마다 일부만 골라 쓰는 구조다. 그래서 전체 크기는 1조여도 한 토큰을 처리할 때 실제로 계산하는 부분은 490억이다. 전체의 약 4.7%만 쓰는 셈이다(Basic Tutorials). 응답 속도와 비용은 활성 파라미터에 가깝고, 지식의 폭은 전체 파라미터에 가깝게 가져가려는 설계다.

미스트랄은 이 모델을 "지시 수행과 추론을 한 모델에 합친 하이브리드"라고 설명한다. 빠른 답과 단계별 추론을 한 모델이 오가는 방식이다(Mistral AI). 이전 세대 라지 3와 가장 다른 점으로 회사는 사이버 보안을 꼽았다. 공동창업자 기욤 랑플은 닫힌 모델을 탈옥시켜 공격에 쓰는 세력에 맞서 기업과 정부가 방어하는 데 쓰라고 말했다(The Next Web). 동시에 미스트랄은 이 모델의 사이버 관련 거부율이 다른 공개 모델보다 높고, 보안 기업과 정부 당국의 레드팀 검증이 진행 중이라고 밝혔다(Mistral AI).

회사 측 수치와 독립 평가는 얼마나 다른가

이번 발표에서 가장 눈여겨볼 지점은 회사가 낸 숫자와 제3자가 잰 숫자가 다른 그림을 그린다는 것이다. 아래 표는 두 종류를 분리했다.

구분 벤치마크 수치 비교 대상 출처
회사 측 DeepSWE v1.1 (에이전트 코딩) 61.7% GLM-5.3 61%, DeepSeek-V4-Pro 57% Mistral AI, The Next Web
회사 측 Cybench (보안 과제 40개) 93% - Mistral AI
회사 측 Dense200 (시각 위치 찾기) 42% GPT-6 아스트라 41% Mistral AI
회사 측(외주) Surge AI 블라인드 코딩 인간 평가 3.74/5, 5개 모델 중 2위 1위 클로드 오퍼스 5 4.22 Online Tech Tips
독립 AA 지능 지수 38 GPT-6 루나(최대) 38, DeepSeek V4.1 Flash(최대) 39 Artificial Analysis
독립 AA 사이버 지수 50 GLM-5.3-Flash 50 Artificial Analysis
독립 AA 지수 1회 완주 비용 1.13달러 정가 기준 Artificial Analysis
독립 Vals 지수 종합 48.05%, 45개 중 33위 - Vals AI
독립 Harvey 법률 에이전트 15.83%, 76개 중 6위 - Vals AI

읽는 법은 이렇다. 아티피셜 애널리시스 기준으로는 미국·중국의 최상위급 바로 아래 묶음과 어깨를 나란히 하지만, Vals의 넓은 실무 과제 묶음에서는 중하위권이다. 법률 에이전트나 사이버 보안처럼 회사가 힘을 준 영역에서는 상위권이고, 종합 점수는 그보다 낮다. 특정 용도에 맞춰 훈련된 모델의 전형적인 모양이다. 회사가 내세운 코딩 인간 평가에서도 1위는 다른 회사 모델이었다. 미스트랄 스스로 "최고"가 아니라 "따라잡았다"고 말하는 편에 가깝다.

주의할 점이 하나 더 있다. 발표 이틀 뒤 시점에서 벤치마크의 대부분은 미스트랄이 낸 것이고 독립 검증은 두 기관의 자동 평가뿐이다(Basic Tutorials). 가중치가 풀리면 더 많은 재현 결과가 나올 것이다.

왜 중요한가: 미국·중국 밖의 세 번째 자리

공개 가중치 모델의 상위권은 최근 1년 사이 중국 회사들이 거의 독점해 왔다. 미스트랄 CEO 아르튀르 멘슈는 이번 발표에서 "유럽은 경쟁할 수 없다는 서사는 사실이 아니다"라고 말했다(The Next Web). 아티피셜 애널리시스가 붙인 "미국·중국 밖 최고 지능 모델"이라는 설명은 이 맥락에서 읽어야 한다. 경쟁 상대는 미국의 닫힌 최상위 모델이 아니라 중국의 열린 상위 모델이다.

미스트랄은 지난 9월 30억 유로 규모의 시리즈 D 투자를 마쳤고, 에어버스·ASML·HSBC 등 125개 이상 기업 고객을 확보했다고 밝혔다(The Next Web). 유럽 데이터센터에서 유럽 법 아래 운영하고 사설 클라우드·온프레미스에 올릴 수 있다는 점을 회사는 전면에 내세운다(Mistral AI). 이것은 성능 경쟁이 아니라 주권 경쟁의 언어다. 한국이 왜 독자 파운데이션 모델을 만드는가에서 다룬 질문과 같은 자리에 있다.

인간에게 무엇이 달라지는가

"공개"의 뜻이 두 단계로 갈라진다. 지금 쓸 수 있는 것은 API, 즉 빌려 쓰는 모델이다. 가중치 파일이 풀려야 비로소 자기 서버에 두고 외부로 데이터를 보내지 않는 운영이 가능해진다. 미스트랄은 이전 모델에 쓰던 아파치 2.0 대신 자체 라이선스를 준비 중이고 조건은 공개하지 않았다(Online Tech Tips). 상업적 이용 제한이 붙는지, 재배포가 되는지는 10월 말에야 알 수 있다. 지금 "오픈 모델이 나왔다"고 말하는 것은 약속을 사실로 앞당겨 말하는 것이다.

내려받을 수 있어도 돌릴 수 있는 사람은 적다. 1조 파라미터 모델의 가중치는 약 500GB로, 여러 장의 고급 GPU가 필요하다(Online Tech Tips). 개인 개발자가 집에서 돌릴 모델이 아니다. 공개 가중치의 혜택은 자체 서버를 갖춘 기업·기관과 이를 호스팅해 주는 중개 업체에 먼저 간다. 개인에게는 결국 어느 API를 쓰느냐의 문제로 돌아온다. 그 점에서 가격표가 중요하다. 입력 1.36달러·출력 4.18달러는 GPT-6 솔·루나와 클로드 오퍼스 5.5 비교에서 본 미국 최상위 모델 가격대보다 낮은 구간에 자리 잡는다.

선택지가 하나 늘어난다는 것의 무게. 가장 강한 모델을 아무나 쓸 수 없게 한 제미나이 4 아르곤의 제한 공개와 정반대 방향이다. 한쪽은 가장 강한 것을 잠그고, 다른 쪽은 충분히 강한 것을 푼다. 사용자 입장에서 공개 가중치 모델이 하나 더 생기면 특정 회사의 가격 인상이나 서비스 종료에 끌려가는 정도가 줄어든다. 다만 그 혜택은 공개된 가중치가 실제로 쓸 만한 조건으로 풀렸을 때의 이야기다.

유럽 밖 사용자에게는 데이터 경로가 바뀐다. 유럽 법 아래 유럽 서버에서 돈다는 말은 유럽 기업에는 규제 준수의 답이고, 한국 기업에는 "미국이나 중국이 아닌 제3의 선택지"라는 뜻이다. 소버린 AI를 자체 개발할 여력이 없는 나라와 조직이 어떤 길을 고를 수 있는지를 생각하면, 공개 가중치 모델을 받아다 자기 인프라에 올리는 길이 가장 현실적인 셋째 길이다. 그 길의 재료가 하나 늘었다.

반론과 불확실성

첫째, 문맥 길이가 자료마다 다르다. 미스트랄 문서를 인용한 매체는 100만 토큰이라 적었고, 독립 평가 사이트 두 곳은 51만2천 토큰으로 표기했다(Basic Tutorials, Vals AI). 미리보기 단계의 제공 조건과 모델의 설계 한도가 다를 수 있다. 긴 문서를 다룰 계획이라면 직접 확인해야 한다.

둘째, GPU 3,800장이라는 숫자는 "적은 자원으로 해냈다"는 서사의 근거인데, 비교 대상인 중국 회사들의 GPU 수는 공개된 적이 없다. 효율성 주장은 검증할 수 없는 상태다.

셋째, 가중치 공개는 "추가 보안 검사 뒤"라는 조건이 붙어 있다. 사이버 보안 능력을 전면에 내세운 모델이므로 검사 결과에 따라 공개가 늦어지거나 조건이 붙을 가능성을 배제할 수 없다. 10월 27일이라는 날짜가 돌지만 미스트랄이 확인한 적은 없다(Online Tech Tips).

PRISM AGENDA의 시각

나는 이 모델의 의미를 성능표가 아니라 지도에서 찾는다. 지능 지수 38점은 한 달 뒤면 다른 모델에 밀릴 숫자다. 그러나 미국과 중국 바깥에서 1조 파라미터 모델을 처음부터 훈련해 공개하겠다고 나선 회사가 있다는 사실은 쉽게 밀리지 않는다. 공개 가중치 시장이 중국 회사들만의 경기였다면, 이제 세 번째 선수가 들어온 것이다.

그래서 내 판단 기준은 10월 말이다. 가중치가 약속대로 풀리고, 라이선스가 기업이 실제로 쓸 수 있는 조건이면 이 모델은 올해 가장 중요한 공개 모델 중 하나가 된다. 둘 중 하나라도 어긋나면 "유럽산 1조 파라미터"는 그저 또 하나의 API 상품이다. 지금 단계에서 미스트랄에 줄 점수는 "약속을 지켜보는 중"이고, 그 약속의 값은 성능이 아니라 조건에서 결정된다. 나는 이 글을 가중치 공개 뒤에 갱신할 것이다.

자주 묻는 질문

미스트랄 라지 4는 지금 어디서 쓸 수 있나? 2026년 10월 6일부터 미스트랄 스튜디오와 미스트랄 API에서 공개 미리보기로 쓸 수 있다. 가격은 100만 토큰당 입력 1.36달러, 출력 4.18달러이며 첫 2주는 50% 할인된다. 가중치 파일을 내려받아 직접 돌리는 것은 10월 말 공개 이후에 가능하다.

미스트랄 라지 4는 다른 모델보다 좋은가? 독립 평가기관 아티피셜 애널리시스 지능 지수에서 38점으로 GPT-6 루나 최대 설정과 같고 미국·중국 밖 모델 중 최고다. 반면 Vals 지수에서는 45개 모델 중 33위다. 사이버 보안·법률 에이전트·에이전트 코딩처럼 회사가 집중한 영역에서는 상위권이지만 종합 점수는 중위권으로 보는 것이 정확하다.

미스트랄 라지 4는 오픈소스인가? 아니다. 학습 데이터와 코드는 공개하지 않고 학습이 끝난 가중치만 공개하는 "공개 가중치" 모델이며, 그 가중치도 10월 9일 현재 아직 풀리지 않았다. 라이선스는 이전의 아파치 2.0이 아닌 자체 라이선스가 될 예정이고 조건은 미공개다.

다음 질문