TypeSafe AI의 Jev: 새로운 기능, 작동 방식 및 대안 (2026)

올해 출시된 대부분의 모델들은 더 많은 일을 하는 것에 초점을 맞추었습니다. 이번 모델은 의도적으로 더 적은 일을 하는 것에 관한 것입니다.
TypeSafe AI는 대화도 하지 않고, 글을 쓰지도 않으며, 스스로를 설명하지도 않는 모델을 출시했습니다. 이 모델은 타입이 지정된 값과 확률로 질문에 답합니다. 이것이 제품 기능의 전부입니다.
이 가이드에서는 이 모델이 무엇인지, 그리고 세 가지 질문 유형이 어떻게 작동하는지 다룹니다. 또한 가격 책정, 개발사가 밝힌 단점, 그리고 대부분의 팀이 실제로 수행하는 작업과 비교했을 때 이 모델의 위치에 대해서도 알아봅니다.
출시된 내용
Jev는 TypeSafe의 플래그십 모델입니다. 개발사의 공식 문서에 따르면, 이는 "최초의 System One 모델"이기도 합니다.
이러한 프레임워크는 해당 카테고리의 다른 모델들이 작동하는 방식에 대한 불만에서 시작됩니다. 문서에 따르면, 대규모 언어 모델은 "사람이 읽을 수 있는 텍스트를 생성하도록 설계되었습니다." 코드에서 사용할 판단이 필요할 때 "이는 불일치를 발생시킵니다."
문서에서는 이러한 불일치를 명확히 설명합니다. 즉, "텍스트 생성 시스템이 구조화된 결정을 출력하도록 강제한 다음, 그 결과를 코드가 의존할 수 있는 형태로 다시 파싱"하고 있는 것입니다.
이번에 제시된 대안은 이러한 번거로운 과정을 없앱니다. Jev는 "상태에 대해 타입이 지정된 질문을 평가하고 구조화된 결과를 직접 반환합니다. 텍스트 생성도, 파싱도 없습니다."
이 회사의 웹사이트는 Jev를 기술 계보의 끝에 위치시킵니다. 초기 언어 모델에서 사전 학습된 LLM, RLHF 채팅 모델, RLVR 추론 모델을 거쳐, 이제는 "조정된 결정을 위한 강화 학습"을 뜻하는 RLCD에 도달했습니다.
System One 모델이란 무엇인가
이 이름은 차용된 것이며, 문서에서도 이를 직접 밝히고 있습니다. 이는 "Daniel Kahneman이 그의 저서 Thinking, Fast and Slow에서 대중화한 개념에서 유래"했습니다.
System 1은 빠르고 직관적입니다. System 2는 더 느리고 신중합니다. 여기서 "핵심은 빠르고 집중적인 판단에 있습니다."
기능적 정의는 비유보다 더 좁습니다. 이는 "소프트웨어가 직접 사용할 수 있는 빠르고 구조화된 결정을 내리도록 구축된 AI 모델 클래스"입니다. 이러한 모델은 "상태를 평가하고 타입이 지정된 답변과 확률을 반환"합니다.
한 문장이 Jev와 시장의 다른 모든 모델을 구분 짓습니다. "LLM과 마찬가지로 System One 모델은 자연어 입력을 이해합니다. 하지만 생성된 텍스트가 아닌, 타입이 지정된 결정과 확률을 반환합니다."
개발사는 이 모델이 하지 않는 영역도 명확히 밝히고 있습니다. System One 모델은 "답변을 작성하거나, 코드를 생성하거나, 추론에 대한 설명을 제공하지 않습니다."
세 가지 질문 유형
Jev에는 프롬프트를 입력하지 않습니다. 답변 범위를 정의하면 모델이 그 안에서 선택합니다.
세 가지 기본형이 있습니다. 문서에서는 각각의 예를 제공합니다.
| 기본형 | 질문 | 답변 범위 | 출력 |
|---|---|---|---|
| Choice | 어떤 팀이 이 티켓을 처리해야 합니까? | billing, technical 또는 account | choice: "billing" |
| Score | 이 고객은 얼마나 좌절했습니까? | 0 = 차분함, 1 = 좌절함, 2 = 매우 좌절함 | score: 1.4 |
| Noul | 이 메시지가 환불을 요청하고 있습니까? | True 또는 false | noul: 0.95 |
Choice는 정의된 세트에서 하나의 옵션을 선택합니다. Score는 순서가 있고 서술적인 단계를 기준으로 평가합니다. Noul은 예/아니오 질문이 참일 확률을 반환합니다.
Score 예시는 다시 한번 살펴볼 가치가 있습니다. 답변은 1이 아니라 1.4입니다. Jev는 가장 가까운 단계로 단정 짓는 대신, 명명된 두 단계 사이에 사례를 배치하고 있습니다. 이는 텍스트 모델이 반환하는 그 어떤 것과도 다른 출력 형태입니다.
비용 및 지원 입력 형식
가격 책정 페이지가 이례적으로 명확합니다. 모델 출시 소식에서 흔히 쓸 수 있는 말은 아닙니다.
현재 모델은 jev-1.13.0입니다. 가격은 10억 토큰당 $42, 즉 100만 토큰당 $0.042입니다. 문서에서는 요금이 "입력 토큰당" 부과되며 "출력 토큰은 무료"임을 명시하고 있습니다.
속도 제한은 초당 250,000 토큰 및 분당 1,200회 요청으로 공표되었습니다. 컨텍스트 길이는 요청당 64k 토큰입니다. 그중 32k는 상태와 가장 긴 질문을 위해 사용할 수 있습니다.
입력은 텍스트만 가능합니다. 문서에 따르면 Jev는 "문자열, JSON 객체 및 텍스트 배열을 평가"합니다. 또한 "이미지, 오디오 및 비디오는 (아직) 지원되지 않습니다"라고 덧붙였습니다.
모든 것은 단일 엔드포인트인 POST /v1/systemone을 통해 실행됩니다. model 필드가 호출을 처리할 모델을 선택합니다.
| 속성 | 값 |
|---|---|
| 모델 | jev-1.13.0 |
| 가격 | 10억 토큰당 $42 / 100만 토큰당 $0.042, 입력만 해당 |
| 출력 토큰 | 무료 |
| 속도 제한 | 초당 250,000 토큰, 분당 1,200회 요청 |
| 컨텍스트 | 요청당 64k, 상태 및 가장 긴 질문에 32k 제공 |
| 입력 유형 | 텍스트만 가능 |
주목해야 할 부분은 신뢰도입니다
가격이 주요 뉴스라면, 신뢰도 처리 방식은 더 흥미로운 설계 결정입니다.
모든 Choice 및 Score 답변은 옵션이나 단계 전반에 걸쳐 probabilities 속성을 가집니다. 문서에서는 이를 어떻게 해석해야 하는지 설명합니다. 분포가 "하나의 결과에 집중되어 있으면 확신하는 답변을 의미하고, 퍼져 있으면 불확실한 답변을 의미합니다."
별도의 confidence 속성은 해당 형태를 0에서 1 사이의 단일 숫자로 축소합니다. 문서에 명시된 목적은 "직접 계산하지 않고도 임계값을 설정할 수 있도록 하기 위함"입니다.
이 숫자를 제공하는 배경에 있는 논리는 하나의 원칙으로 명시되어 있습니다. "인간이든 기계든 지능형 시스템이 정직한 불확실성을 표현할 수 없다면, 그 시스템은 신뢰할 수 없다."
이를 통해 얻을 수 있는 것은 더 나은 답변이라기보다는 라우팅 규칙입니다. 신뢰도가 높으면 바로 통과됩니다. 신뢰도가 낮으면 사람에게 전달됩니다. 문서에서는 이를 "언제 조치를 취하고 언제 사람이나 추론 모델로 에스컬레이션할지" 결정하는 것으로 설명합니다.
분류 파이프라인을 배포해 본 사람이라면 이것이 왜 중요한지 알 것입니다. 실제 데이터와 접촉했을 때 시스템이 살아남을 수 있을지를 결정하는 것은 정확도 수치가 아니라 에스컬레이션 경로입니다.
개발사가 밝힌 단점
TypeSafe는 2026-09-17에 검토된 '모델의 불균형성(model jaggedness)'이라는 페이지를 게시했습니다. 여기에는 회사에서 파악하고 있는 실패 모드들이 나열되어 있습니다. 출시와 동시에 이러한 정보를 공개하는 것은 드문 일이며, 덕분에 모두가 추측하는 수고를 덜 수 있습니다.
요약 문구는 솔직합니다. Jev 1.13은 "빠르고, 조정되어 있으며, 상식적인 판단에 능숙하지만 완벽하지는 않습니다."
세 가지 약점이 직접 언급되었습니다. 이 모델은 "추가적인 수준의 간접화가 필요한 작업에서 어려움을 겪을 수 있습니다." 또한 "이해 방식이 상당히 문자 그대로일 수 있습니다." 그리고 "수치적 정밀도가 필요한 작업에서 어려움을 겪습니다."
실패 모드 표에는 각각의 해결책이 함께 제시되어 있습니다. 파일럿 프로젝트를 준비하는 분들을 위해 두 가지를 소개합니다.
- 수학 및 숫자의 경우, 문서에 명시된 권장 사항은 "산술 연산은 코드에 유지할 것"입니다.
- 관련 없는 세부 정보가 가득한 대규모 상태의 경우, "먼저 필터링하여 질문에 필요한 내용만 보낼 것"입니다.
두 가지 모두 동일한 설계 가정을 가리킵니다. 이것은 계산기나 검색 인덱스가 아닌 판단 엔진입니다. 주변 시스템이 이미 질문의 범위를 좁혀 놓았을 때 가장 잘 작동합니다.
기존 작업과 비교했을 때 이 모델의 위치
개발사가 제시한 예시에는 명확한 역할 분담이 숨어 있습니다. 이를 파악하는 것이 이번 출시가 여러분과 관련이 있는지 여부를 결정합니다.
문서화된 환불 워크플로는 상태를 빌드하고 여러 독립적인 질문을 동시에 던집니다. 그런 다음 "코드의 결정론적 검사"를 통해 답변을 결합하고 "조치 또는 검토를 위해" 케이스를 라우팅합니다.
이 모든 단계는 개발자, 애플리케이션, 그리고 높은 요청 볼륨을 전제로 합니다. 이 모든 것이 비용 대비 효과를 내려면 토큰당 비용이 실제 예산 항목으로 고려되어야 합니다.
대부분의 보고서 작성 작업은 다른 형태를 띱니다. 요청 스트림이 아니라 파일이 주어집니다. 판단은 제품이라기보다는 수단입니다. 결국 마지막에 존재해야 하는 것은 누군가가 읽을 문서입니다.
4,000행의 고객 피드백을 분류하는 것은 그 작업의 중간 단계일 뿐입니다. 최종 결과물은 세 가지 주제를 명시하고 예외 사항을 표시하는 요약본입니다.
이 후반부 작업이 바로 파일 우선 워크스페이스가 처리하는 일입니다. 내보낸 파일을 업로드하고 자연어로 카테고리를 설명합니다. 그러면 행들이 라벨링되어 반환되고, 이를 설명하는 보고서가 동시에 제공됩니다. Powerdrill Bloom이 이 방식으로 작동하며, 무료 티어에서도 기본적인 슬라이드, 문서, 스프레드시트 및 이미지를 이미 지원합니다.
두 가지는 동일한 자리를 두고 경쟁하지 않습니다. 하나는 제품에 연결하는 API입니다. 다른 하나는 목요일까지 답변이 필요한 사람이 스프레드시트를 가져가는 곳입니다. 이 문제의 해결책이 파일 형태로 필요하다면, Powerdrill Bloom을 사용해 보세요.
스프레드시트 측면의 라벨링 작업에 대해서는 Excel 데이터 분류하기 가이드를 참조하세요. 주제 찾기 작업에 대해서는 고객 피드백 분석을 위한 최고의 AI 도구 모음을 확인해 보세요.
비교해 볼 만한 대안들
세 가지 접근 방식이 동일한 영역을 다룹니다. 적절한 방식은 주로 처리량에 따라 달라집니다.
구조화된 출력을 지원하는 범용 모델. 이제 모든 주요 제공업체가 스키마에 맞게 응답을 제한합니다. 판단과 생성에 하나의 모델을 사용하게 됩니다. 단점은 판단 작업에 생성 비용을 지불해야 하고, 직접 조정을 수행해야 한다는 점입니다.
기존의 분류기. 미세 조정된 소형 모델이나 그래디언트 부스팅 트리는 비용이 훨씬 더 저렴하고 완전히 예측 가능합니다. 이는 라벨링된 데이터와 안정적인 라벨 세트가 있는 경우에 유효합니다. 다만 줄글로 작성된 정책은 이해하지 못합니다.
파일 우선 분석 워크스페이스. 이는 산출물을 생성하는 과정의 한 단계로 판단을 처리합니다. API도, 스키마도, 토큰당 예산 책정도 필요하지 않습니다. 또한 요청 경로 내에 위치할 수도 없습니다.
| 상황이 다음과 같은 경우 | 고려해 볼 대안 |
|---|---|
| 제품 내에서 수백만 건의 판단이 필요한 경우 | 의사 결정 전용 모델 |
| 판단과 초안 작성이 혼합되어 있고 처리량이 적은 경우 | 구조화된 출력을 지원하는 범용 모델 |
| 안정적인 라벨과 풍부한 학습 데이터가 있는 경우 | 기존의 분류기 |
| 파일이 보고서가 되어야 하는 경우 | 파일 우선 워크스페이스 |
마지막 항목을 다루는 보고서 생성을 위한 도구에 대한 관련 모음 글이 있습니다.
지금 관심을 가져야 할 대상
제품 내에서 대량의 판단 작업을 실행하는 팀이 Jev를 도입할 가장 확실한 명분을 가집니다. 티켓 라우팅, 모더레이션 대기열, 리드 자격 검증, 자격 사전 확인 등이 모두 이에 해당합니다. 하루에 수천 번씩 던져지는 좁은 범위의 질문이 코드의 분기점으로 이어지는 패턴입니다.
분석의 일부로 가끔 분류 작업을 수행하는 팀은 도입 명분이 가장 약합니다. 대규모 환경에서 Jev를 매력적으로 만드는 경제적 이점은 몇 천 행 수준에서는 체감하기 어렵습니다. 게다가 분류 작업 이후에 요약본을 작성할 도구가 여전히 필요합니다.
그 외의 모든 이들에게는 도입할 도구라기보다는 참고할 만한 개념에 가깝습니다. 빠른 판단과 느린 종합을 분리하는 것은 자체 파이프라인을 바라보는 유용한 관점이 됩니다. 이 API에 요청을 보낼 일이 없더라도 이 관점은 여전히 유용합니다.
도입을 검토 중인 분들을 위한 실용적인 팁을 하나 더 드리자면, 가격 책정 페이지를 보기 전에 불균형성(jaggedness) 페이지를 먼저 읽어보세요. 모델의 약점을 아는 것이 비용을 아는 것보다 파일럿 프로젝트를 설계하는 데 훨씬 더 큰 도움이 됩니다.
자주 묻는 질문
System One 모델이란 무엇인가요?
소프트웨어가 직접 사용할 수 있는 빠르고 구조화된 결정을 내리도록 구축된 모델 클래스입니다. 상태를 평가하고 타입이 지정된 답변과 확률을 반환합니다. 이 이름은 빠르고 직관적인 사고 모드인 Kahneman의 System 1에서 유래했습니다. 채팅 모델과 달리 답변을 작성하거나, 코드를 생성하거나, 추론 과정을 설명하지 않습니다.
Jev의 비용은 얼마인가요?
공표된 jev-1.13.0의 가격은 10억 토큰당 $42, 즉 100만 토큰당 $0.042입니다. 요금은 입력 토큰에 대해서만 부과되며, 출력 토큰은 무료입니다.
Jev는 어떤 입력을 받을 수 있나요?
문자열, JSON 객체 또는 텍스트 배열 형태의 텍스트만 가능합니다. 문서에 따르면 이미지, 오디오, 비디오는 아직 지원되지 않습니다. 컨텍스트는 요청당 64k 토큰이며, 상태와 가장 긴 질문을 위해 32k가 제공됩니다.
LLM에 JSON을 요청하는 것과 어떻게 다른가요?
둘 다 자연어 입력을 이해합니다. 차이점은 반환되는 결과와 학습 방식에 있습니다. Jev는 확률 분포 및 신뢰도 값과 함께 타입이 지정된 결정을 반환합니다. 조정(calibration)은 예측 그룹 전체에 걸쳐 측정되므로, 개별 답변이 모두 정확하다는 것을 보장하지는 않습니다.
Jev가 잘하지 못하는 것은 무엇인가요?
개발사의 불균형성(jaggedness) 페이지에는 문자 그대로의 해석, 수학 및 숫자, 날짜 및 시간 비교가 나열되어 있습니다. 또한 간접화, 관련 없는 세부 정보가 가득한 대규모 상태, 적대적 콘텐츠, 모순되는 기준 등도 포함되어 있습니다. 산술 연산의 경우 산술 연산을 코드에 유지하라는 것이 문서에 명시된 권장 사항입니다.
출처: TypeSafe AI 문서 — Introduction, System One, Models, Confidence 및 Jev 1.13 jaggedness, docs.typesafe.ai, 2026년 9월 18일 기준.