[AI] Jev: 문장 대신 판단과 확률을 반환하는 모델

Jev의 State와 Question 구조, 병렬 판단 방식, 확률과 confidence의 차이 및 활용 한계를 살펴봅니다.

시스템에서 AI에 필요한 답은 짧을 때가 많습니다.
문의의 담당 부서를 고르거나 긴급 대응이 필요한지 판단하는 경우, 프로그램은 선택값과 판단 기준을 필요로 합니다.

TypeSafe의 Jev는 이런 작업을 위해 만들어진 모델입니다.
State를 읽고 미리 정의한 Question에 판단값과 확률을 반환합니다.
Jev의 입력과 출력, 병렬 판단 방식, 확률을 해석할 때 구분해야 할 내용을 살펴봅니다.

1. System One과 판단형 출력

TypeSafe는 빠르고 구조화된 의사결정을 위한 모델 계열을 System One이라고 부릅니다.
Jev는 이 계열의 첫 모델로, 코드가 바로 사용할 수 있는 값과 확률 분포를 출력합니다.

예를 들어 고객 문의를 읽고 담당 부서를 선택한다고 가정해 봅니다.
개발자가 결제·기술지원·영업이라는 후보를 정하면 Jev는 그중 하나와 각 후보의 확률을 반환합니다.
아래 수치는 원리를 설명하기 위한 가상 예시입니다.

담당 부서확률
결제0.85
기술지원0.10
영업0.05

프로그램은 결제 부서로 전달하거나, 확률이 충분하지 않으면 검토 대기열에 넣을 수 있습니다.
어떤 값에서 자동으로 처리할지는 모델을 사용하는 프로그램이 정합니다.

2. State와 Questions

Jev의 입력은 판단할 자료인 state와 Question을 담은 questions로 구성됩니다.
State에는 문의 내용과 관련 기록을, Question에는 무엇을 판단할지와 선택 기준을 넣습니다.

같은 문의를 두고 담당 부서와 긴급성을 함께 물을 수 있습니다.
두 Question은 같은 자료를 보지만 서로 다른 판단을 수행합니다.
담당 부서가 명확하더라도 긴급 대응이 필요한지는 불확실할 수 있습니다.

State는 문자열뿐 아니라 JSON 객체나 배열로 전달할 수 있습니다.
관련 자료에 이름을 붙여 묶으면 Question에서 어떤 정보를 참고해야 하는지 명확하게 표현할 수 있습니다.

현재 Jev는 텍스트만 입력받습니다.
JSON 입력은 구조화된 문맥을 전달하는 방식이며, 이미지·음성·영상 입력을 지원한다는 뜻은 아닙니다.
음성을 분석하려면 별도 음성인식으로 텍스트를 만든 뒤 전달해야 합니다.

3. 세 가지 Question 유형

Jev는 Noul, Choice, Score를 제공합니다.
Question이 요구하는 답의 형태에 따라 유형을 선택합니다.

유형질문 예시반환값
Noul긴급 대응이 필요한가?참일 확률을 나타내는 0~1 값
Choice어느 부서가 담당해야 하는가?선택값, 선택지별 확률, confidence
Score고객의 불편 정도는 어느 수준인가?단계별 확률, 확률 가중 점수, confidence

Choice는 서로 구분되는 후보 중 하나를 고를 때 사용합니다.
Score에는 낮음·중간·높음처럼 순서가 있는 기준을 제공합니다.

Score의 단계를 0·1·2로 두고 확률이 각각 0.1·0.6·0.3이라고 가정하면 가중 점수는 0×0.1 + 1×0.6 + 2×0.3 = 1.2입니다.
이 값은 단계별 판단을 하나의 수로 요약한 결과입니다.
실제 대기시간이나 피해 규모를 정밀하게 측정한 수치는 아닙니다.

API는 Choice에 최대 255개 선택지, Score에 2~10단계를 허용합니다.
Question의 식별자는 응답을 연결하는 용도이며 추론에 사용되지 않으므로 판단 기준은 instructionscriteria에 적어야 합니다.

4. 병렬 판단과 응답 속도

TypeSafe는 Jev가 확률을 토큰 단위로 순차 생성하지 않고 병렬로 출력한다고 설명합니다.
일반적인 자동회귀(autoregressive) 생성은 앞서 만든 토큰에 이어 다음 토큰을 반복해서 만듭니다.
Jev는 판단값을 출력하는 데 집중해 이 순차 생성 과정을 줄입니다.

여러 Question도 같은 State를 대상으로 서로 격리되어 평가됩니다.
담당 부서를 먼저 결정해야 긴급성을 평가할 수 있는 구조가 아니므로, 두 Question을 함께 처리할 수 있습니다.
다만 다음 판단이 앞선 답을 필요로 한다면 프로그램에서 호출 단계를 나눠야 합니다. -> Workflow 혹은 Logic

공식 발표의 모델 응답시간은 70~500ms입니다.
평가가 주로 서비스가 위치한 미국 서부에서 실행됐다는 조건도 함께 제시되어 있습니다.
한국에서의 네트워크 왕복시간이나 입력 전처리까지 포함한 전체 지연을 보장하는 수치는 아닙니다.

HuggingFace에서 Jev 구성 기반의 오픈 모델들이 출시되고 있습니다

실시간 시스템을 구성할 때는 Jev 호출시간과 입력이 들어온 뒤 결과가 표시될 때까지의 시간을 구분해야 합니다.

5. 확률과 Confidence

확률 0.8을 반환한 판단은 얼마나 믿을 수 있을까요?
이 질문에는 한 번의 정답 여부보다 여러 사례에서 확률과 결과가 얼마나 일치하는지가 중요합니다.

확률 보정(calibration)은 예측 확률과 실제 발생 비율의 일치를 뜻합니다.
0.8로 예측한 사례를 충분히 모았을 때 약 80%가 맞다면 그 구간에서는 확률과 정답률이 잘 맞는다고 볼 수 있습니다.
개별 답 하나의 정확성을 보장하는 의미는 아닙니다.

TypeSafe는 이 목적의 후속 학습을 RLCD(Reinforcement Learning for Calibrated Decisions)라고 부릅니다.
결정과 보정된 확률을 학습한다는 방향은 공개되어 있지만 이 설명만으로 구체적인 학습 절차를 재현할 수는 없습니다.

Choice와 Score의 confidence는 반환된 확률 분포에서 계산한 통계량입니다.
한 답에 확률이 집중되어 있는지, 여러 답으로 퍼져 있는지를 요약합니다.
따라서 confidence 0.9를 실제 업무 정답률 90%로 읽으면 안 됩니다.

출시 발표의 ‘환각 없음’이라는 표현도 출력 형식의 보장과 함께 읽어야 합니다.
허용된 선택지만 반환하더라도 잘못된 선택을 할 수 있습니다.
형식이 올바른 답과 내용이 올바른 답은 따로 확인해야 합니다.

6. 공개된 동작과 아키텍처 추정

Jev의 내부 구조 전체가 공개된 것은 아닙니다.
공식적으로 설명된 동작, 외부에서 관측한 결과, 그 결과를 설명하는 구현 가설을 구분해야 합니다.

Archer Hume은 API 호출을 통해 Question 간 정보 전달과 선택지 변화 등을 조사했습니다.
그 결과를 바탕으로 공유 문맥 처리, 격리된 Question 분기, 직접적인 확률 출력 구조를 제안했습니다.

공유 KV 캐시는 이런 동작을 구현하는 한 가지 가능한 방식입니다.
입력을 처리하면서 만든 중간 정보를 여러 Question이 활용하면 공통 자료를 반복해서 계산하는 비용을 줄일 수 있습니다.
그러나 실제 캐시 구조나 어텐션 방식이 확인된 것은 아닙니다.

인과적 Transformer, 특정 출력 헤드, 희소 MoE 역시 구현 가설입니다.
외부에서 비슷한 행동을 보이는 구조가 여러 개일 수 있으므로, API 관측만으로 기반 모델이나 내부 설계를 확정하기는 어렵습니다.

7. 적합한 작업과 한계

Jev는 답의 범위를 정할 수 있는 분류·라우팅·평가 작업에 활용할 수 있습니다.
Question마다 하나의 판단을 맡기고 여러 결과를 조합하는 규칙은 코드로 표현하는 방식입니다.

정확한 개수 계산이나 날짜 비교는 코드가 담당하는 편이 좋습니다.
공식 제한 문서도 숫자 계산, 복잡한 간접 추론, 무관한 내용이 많은 긴 입력을 약점으로 설명합니다.
입력 안에 포함된 적대적인 지시가 판단에 영향을 줄 수 있다는 점도 명시합니다.

자유로운 설명문이나 요약이 필요하면 별도 생성형 모델을 사용해야 합니다.
Jev에는 후보 선택과 판단을, 생성형 모델에는 설명을 맡기는 구성이 가능합니다.

한국어 입력은 가능하지만 영어와 같은 수준의 정확도를 전제할 수는 없습니다.
공식 문서는 영어 중심 학습이며 CJK를 포함한 다른 언어의 정확도가 낮을 수 있다고 밝힙니다.
한국어 업무에 적용할 때는 처리 속도와 함께 해당 데이터에서의 판단 품질을 확인해야 합니다.

Jev를 활용할 때 먼저 정할 것은 모델에 맡길 판단의 범위입니다.
입력 자료와 선택 기준을 명확히 하고 확률에 따라 프로그램이 어떻게 행동할지 설계해야 합니다.
빠른 판단값을 반환하는 특성은 이러한 기준과 결합될 때 업무 흐름에 연결할 수 있습니다.

참고 자료

2026년 9월 21일 공개 문서, Jev 1.13.0 기준입니다.