Jev AI 독립 벤치마크: 가격, 정확도, 질문에 따라 갈리는 성능
외부 테스트 3건 정리. Jev는 최상위 모델과 같은 정확도에 50배 싸지만, 질문 방식에 따라 62%와 95%를 오간다.

핵심 요약
- 공개 일주일 만에 외부 테스트가 세 건 나왔다. 42개 인용 검증 과제에서 Jev는 GPT-5.4, Claude Sonnet 5와 같은 85.7% 정확도를 냈고, 건당 비용은 GPT-5.4의 약 1/50, 속도는 4배였다(jev-bench).
- 그러나 피싱 메일 2,000건 테스트에서는 질문 하나로 물으면 62.6%, 다섯 질문으로 쪼개 물으면 95.0%였다(XenoSpectrum). 성능이 모델이 아니라 질문 설계에 달려 있다.
- 가격은 입력 100만 토큰당 0.042달러에 출력 무료, 요청당 컨텍스트 6만 4천 토큰. 판단 이유를 설명하지 못하는 한계는 그대로다. 결론: 대량 판정의 1차 필터로는 검증됐고, 최종 판단자로는 아직이다.
지난 글에서 Jev를 소개하며 한 가지 유보를 달았다. 핵심 수치가 모두 회사 자체 평가이고 독립 검증이 없다는 것이었다. 일주일이 지났고, 개발자들이 직접 돌려 본 결과가 쌓이기 시작했다. 이 글은 그 결과를 정리한다. 회사가 말한 것과 외부에서 확인된 것이 어디서 겹치고 어디서 갈라지는지, 그리고 실제로 쓰려면 얼마가 들고 무엇을 조심해야 하는지다.
무슨 일이 있었나: 세 건의 독립 검증
인용 검증 벤치마크. 개발자 제이미 워터스가 9월 20일부터 22일까지 돌린 jev-bench는 “이 문장이 인용한 출처가 실제로 그 내용을 말하는가”를 판정하는 과제 42개로 구성됐다. 논문에서 뽑은 까다로운 실제 사례 18개와 정답이 분명한 대조군 24개다.
| 모델 | 전체 정확도 | 쉬운 24개 | 어려운 18개 | 건당 비용 | 건당 시간 |
|---|---|---|---|---|---|
| Jev 1.13 | 85.7% | 91.7% | 77.8% | $0.000025 | 0.23초 |
| GPT-5.4 | 85.7% | 100% | 66.7% | $0.001289 | 1.01초 |
| Claude Sonnet 5 | 85.7% | 100% | 66.7% | $0.002228 | 2.76초 |
| Gemini 3.1 Pro | 81.0% | 100% | 55.6% | $0.004824 | 3.78초 |
출처: jev-bench, 표본 42건, 2026.9.20~22 측정. 표본이 작아 몇 %p 차이는 의미가 없다.
세 모델의 전체 점수가 같다는 것보다 흥미로운 것은 틀린 위치다. 대형 모델들은 쉬운 문제를 모두 맞히고 어려운 문제에서 틀렸다. Jev는 쉬운 문제에서도 두 개를 틀렸지만 어려운 문제는 더 많이 맞혔다. 그리고 확신도가 달랐다. GPT-5.4와 Gemini는 42개 답 전부에 0.8 이상의 확신을 붙였는데 실제 정답률은 81~86%였다. Jev가 0.8 이상 확신을 붙인 29개의 정답률은 93.1%였다. 확신도가 실제 정확도를 반영하는 정도에서 Jev가 앞섰다. 확신도로 자동 처리와 사람 검토를 나누는 것이 Jev의 설계 목적이므로, 이 결과는 그 설계가 작동한다는 첫 외부 증거다.
피싱 메일 판정. XenoSpectrum이 정리한 테스트는 피싱 1,000건과 정상 1,000건의 이메일 데이터셋을 썼다. 결과가 갈렸다.
| 질문 방식 | Jev | Claude Haiku 4.5 |
|---|---|---|
| “피싱인가?” 한 질문 (2,000건) | 62.6% | 81.3% |
| 신호 다섯 개로 쪼갠 질문 (검증용 1,000건) | 95.0% | 93.2% |
| 참고: 두 줄짜리 정규식 규칙 | 91.8% |
출처: XenoSpectrum, 데이터셋 PhishNChips v5.2, 학습용 1,000건으로 가중치를 맞춘 뒤 별도 1,000건으로 검증.
한 질문으로 물으면 Jev는 Haiku보다 19%p 낮았다. 그런데 “단축 URL이나 무료 호스팅을 쓰는가”, “무료 이메일 주소로 기관을 사칭하는가” 같은 신호 다섯 개로 쪼개서 묻자 95%로 올라 Haiku를 넘었다. 같은 데이터, 같은 모델, 질문만 바꾼 결과다. 비용은 단일 질문에서 Haiku의 1/12, 다섯 질문에서 1/27이었다.
LLM 판정자 대체. AI 관측 회사 Arize는 에이전트의 행동 기록을 심사하는 “AI 판정자” 역할에 Jev를 넣어 봤다. 행사 목록 검열 50건에서 Jev 96%, Gemini Flash-Lite 86%. 스팸 메일 1만 8,514건에서는 정답 데이터로 학습시킨 전통 분류기와 통계적으로 구별되지 않는 결과를 냈다. Arize의 결론은 분명했다. 모든 기록을 Jev로 훑고, 걸린 것만 비싼 모델로 이유를 묻는 2단 구조가 맞는다는 것이다.
가격과 제한: 실제로 얼마이고 무엇을 못 하나
공개된 사양을 한 곳에 모으면 다음과 같다.
| 항목 | 내용 | 출처 |
|---|---|---|
| 가격 | 입력 100만 토큰당 0.042달러, 출력 무료 | OpenRouter |
| 요청당 최대 토큰 | 6만 4천 (상황 정보 + 가장 긴 질문은 3만 2천 이내) | Cloudflare AI docs |
| 질문 유형 | 보기 선택(choice), 등급 점수(score), 참일 확률(noul) 세 가지 | Cloudflare AI docs |
| 접근 경로 | TypeSafe 직접 API, OpenRouter, Cloudflare Workers AI | 각 문서 |
| 프레임워크 | LangChain 공식 연동(분류기, 도구 호출 검문 미들웨어), LlamaIndex 리랭커·라우터 | LangChain Docs |
| 회사가 공개한 약점 | 아홉 가지 실패 유형 목록. 개수 세기 불가, 긴 입력에서 정확도 저하 등 | XenoSpectrum 정리 |
| 미공개 | 모델 구조, 공식 보정 지표(ECE·신뢰도 곡선) |
가격은 회사 발표 그대로 유지되고 있으며 OpenRouter와 Cloudflare 같은 제3자 경로에서도 같은 값이다. 다만 회사는 여전히 이 가격이 보조금 없는 원가인지 확언하지 않았다.
왜 중요한가: 성능은 모델이 아니라 질문에 있다
세 테스트를 겹쳐 보면 하나의 그림이 나온다. Jev는 한 번에 하나의 좁은 판단을 잘한다. “이 메일이 피싱인가”는 넓은 판단이고, “이 메일에 단축 URL이 있는가”는 좁은 판단이다. 넓은 판단을 던지면 대형 언어 모델에 진다. 좁은 판단 여러 개로 쪼개서 던지고 결과를 조합하면 이긴다.
이것은 언어 모델과 정반대의 성질이다. 피싱 테스트에서 Haiku는 단일 질문(81.3%)보다 다섯 질문 조합(93.2%)이 나았지만, Haiku의 가장 좋은 단일 신호 하나(94.2%)가 조합보다 높았다. 언어 모델은 스스로 신호를 종합하므로 쪼개 주는 것이 별 도움이 안 된다. Jev는 종합 능력이 없는 대신 쪼개진 질문 하나하나를 싸고 빠르고 일관되게 처리한다.
따라서 Jev를 도입한다는 것은 모델을 바꾸는 일이 아니라 판단을 분해하는 일이다. “이 고객 문의를 어느 팀에 보낼까”를 그대로 묻는 것이 아니라, 환불 언급 여부, 감정의 강도, 기존 고객 여부, 긴급 표현 여부로 나눠 묻고 규칙으로 합치는 것이다. 이 분해를 잘하는 사람이 Jev에서 95%를 뽑고, 못 하는 사람이 62%를 얻는다. 두 줄짜리 정규식이 91.8%를 낸 것도 같은 맥락이다. 분해가 좋으면 도구가 단순해도 된다.
인간에게 무엇이 달라지는가
AI를 잘 쓰는 능력의 내용이 바뀐다. 지난 2년간 “프롬프트를 잘 쓴다”는 것은 대형 모델에게 맥락과 역할을 잘 설명하는 일이었다. Jev 같은 결정 모델에서는 반대로 문제를 가장 작은 단위의 판단으로 쪼개고, 그 판단들을 어떤 규칙으로 합칠지 설계하는 일이다. 전자는 글쓰기에 가깝고 후자는 설계에 가깝다. 어느 쪽이 더 어려운지는 사람마다 다르겠지만, 요구되는 능력이 다르다는 것은 분명하다.
“AI가 확신한다”는 말의 무게가 달라진다. 인용 검증 테스트에서 대형 모델들은 틀린 답에도 0.8 이상의 확신을 붙였다. 사람이 그 확신도를 믿고 자동 처리했다면 틀린 여섯 건이 그대로 통과됐을 것이다. Jev의 확신도는 실제 정확도에 가까웠다. 이것은 에이전트에게 권한을 넘기는 문제의 핵심과 닿아 있다. 확신도로 자동 처리와 사람 검토를 나누려면, 그 확신도가 정직해야 한다. 정직한 확신도는 성능만큼 중요한 사양이 된다.
검증이 싸지면 검증이 늘어난다. Arize의 결론처럼 모든 행동 기록을 Jev로 훑는 데 드는 비용은 무시할 만하다. 지금까지 표본만 검사하던 것을 전수 검사할 수 있게 된다. 에이전트가 하루에 내리는 수만 건의 판단을 모두 감시하는 것이 현실적인 비용이 되면, 사람의 역할은 검사자에서 검사 기준을 설계하는 사람으로 옮겨 간다.
이유 없는 판정이 대량으로 쌓인다. 세 테스트 모두가 지적하는 한계는 같다. Jev는 왜 그렇게 판정했는지 말하지 않는다. 틀린 판정이 있어도 어디를 고쳐야 할지 알 수 없다. 대량 판정에 쓰일수록 이 문제는 커진다. 지난 글에서 말한 “이유를 물을 권리”가 기술 설계 차원에서도 필요하다는 뜻이다. Arize의 2단 구조는 이 공백을 비싼 모델로 메우는 방식이고, 그것이 현재로서는 유일한 답이다.
반론과 불확실성
첫째, 세 테스트 모두 표본이 작거나 특정 과제에 국한된다. 42건, 50건, 2,000건이다. 개인 개발자와 한 회사가 각자 돌린 결과이며, 학술적 검증이나 대규모 재현은 아직 없다.
둘째, 피싱 테스트의 다섯 질문은 학습용 1,000건으로 가중치를 맞춘 뒤 검증용 1,000건에 적용했다. 이것은 사실상 작은 학습 과정이다. 질문을 쪼개는 것만으로 95%가 나온 것이 아니라, 어떤 질문이 잘 맞는지를 데이터로 찾은 결과다. 새 과제마다 이 과정이 필요하다.
셋째, 비교 대상이 균일하지 않다. 벤치마크마다 GPT-5.4, Claude Haiku 4.5, Gemini Flash-Lite로 상대가 다르고, 회사 자체 평가는 GPT-5.6 Terra와 Opus 5를 썼다. 이 글은 각 테스트의 수치를 그대로 옮겼을 뿐 모델 간 서열을 매기지 않는다.
넷째, 공식 보정 지표가 없다. 확신도가 정직하다는 결론은 42건짜리 한 테스트에서 나온 것이다. 회사는 ECE나 신뢰도 곡선을 공개하지 않았다.
PRISM AGENDA의 시각
일주일 전 나는 “회사 주장을 독립 검증으로 확인해야 한다”고 썼다. 이제 절반은 확인됐다. 싸고 빠르다는 주장은 사실이고, 좁은 판단에서 최상위 모델과 겨룬다는 것도 사실이다. 그러나 나머지 절반에서 회사 발표에는 없던 조건이 드러났다. 성능이 질문 설계에 극단적으로 의존한다는 것이다. 62%와 95%는 다른 모델의 점수가 아니라 같은 모델에게 같은 데이터를 다르게 물은 결과다.
이것은 Jev의 결함이라기보다 결정 모델이라는 범주의 성격이라고 본다. 언어 모델은 사람이 어설프게 물어도 알아서 종합해 준다. 그 편리함의 값이 비싸고 느리고 확신도가 부풀려진 것이었다. 결정 모델은 그 편리함을 거두는 대신 값을 낮췄다. 남은 일은 사람에게 돌아온다. 무엇을 물을지 정확히 정하는 일이다.
그래서 나는 Jev의 등장을 “AI가 더 똑똑해졌다”가 아니라 “AI를 쓰는 사람에게 더 정확한 사고를 요구하기 시작했다“로 읽는다. 대형 모델의 시대는 질문을 대충 해도 되는 시대였다. 결정 모델의 시대는 질문을 쪼갤 줄 아는 사람과 모르는 사람의 결과가 33%p 벌어지는 시대다. 도구는 싸졌고, 도구를 다루는 능력의 값은 올랐다.
자주 묻는 질문
Jev AI의 가격은 얼마인가? 입력 100만 토큰당 0.042달러이고 출력은 무료다. TypeSafe 직접 API 외에 OpenRouter와 Cloudflare Workers AI에서도 같은 가격으로 쓸 수 있다. 요청당 최대 6만 4천 토큰이며, 상황 정보와 가장 긴 질문을 합쳐 3만 2천 토큰 이내여야 한다. 회사는 이 가격이 장기적으로 유지될지 확언하지 않았다.
Jev AI는 실제로 정확한가? 과제에 따라 다르다. 42건 인용 검증에서는 GPT-5.4, Claude Sonnet 5와 같은 85.7%를 냈고, 행사 목록 검열 50건에서는 96%로 Gemini Flash-Lite(86%)를 앞섰다. 그러나 피싱 판정을 한 질문으로 물으면 62.6%, 신호 다섯 개로 쪼개 물으면 95.0%로 질문 설계에 따라 크게 흔들린다. 모두 소규모 독립 테스트이며 대규모 검증은 아직 없다.
Jev AI를 어디에 쓰면 좋은가? 독립 테스트들이 공통으로 권하는 용도는 대량 판정의 1차 필터다. 고객 문의 분류, 스팸·피싱 판정, 에이전트 행동 기록의 전수 검사, 어떤 모델로 보낼지 정하는 교통정리 등이다. 판단을 좁은 질문 여러 개로 쪼개 물을 때 성능이 나온다. 판정 이유를 설명하지 못하므로, 걸러진 사례를 사람이나 대형 모델이 다시 보는 2단 구조로 쓰는 것이 권장된다.
다음 질문
- 확신도는 얼마나 믿을 수 있나: AI의 “자신 있다”를 검증하는 방법.
- 판단을 쪼개는 기술: 결정 모델 시대의 프롬프트는 설계도에 가까워진다.
- 기술동향 카테고리의 다른 글 보기



댓글
첫 댓글을 남겨 주세요.