Super Sale WeekClaude Skills — DISKON 20%
News

Jev oleh TypeSafe AI: Apa yang Baru, Cara Kerjanya, dan Alternatifnya (2026)

Powerdrill Bloom·
Jev oleh TypeSafe AI: Apa yang Baru, Cara Kerjanya, dan Alternatifnya (2026)

Sebagian besar peluncuran model tahun ini adalah tentang melakukan lebih banyak hal. Peluncuran yang satu ini sengaja dirancang untuk melakukan lebih sedikit hal.

TypeSafe AI telah merilis model yang tidak mengobrol, tidak menulis, dan tidak menjelaskan dirinya sendiri. Model ini menjawab pertanyaan dengan nilai bertipe data (typed values) dan probabilitas. Itulah keseluruhan cakupan produknya.

Panduan ini membahas apa itu model tersebut dan bagaimana cara kerja ketiga jenis pertanyaannya. Panduan ini juga membahas harga, apa saja kelemahannya menurut vendor, dan posisinya di samping pekerjaan yang sebenarnya dihadapi oleh sebagian besar tim.

Apa yang dirilis

Jev adalah model unggulan dari TypeSafe. Menurut dokumentasi resmi vendor tersebut, model ini juga merupakan "model System One pertama."

Kerangka berpikir ini berawal dari keluhan tentang cara kerja kategori model lainnya. Model bahasa besar (LLM), menurut dokumentasi tersebut, "dirancang untuk menghasilkan teks yang dibaca oleh manusia." Ketika Anda membutuhkan keputusan yang akan diproses oleh kode Anda, "hal itu menimbulkan ketidakcocokan."

Dokumentasi tersebut menjelaskan ketidakcocokan ini secara terperinci. Anda sedang "memaksa sistem pembuat teks untuk menghasilkan keputusan terstruktur, lalu mengurai kembali hasilnya menjadi sesuatu yang dapat diandalkan oleh kode Anda."

Alternatif yang ditawarkan menghilangkan proses bolak-balik tersebut. Jev "mengevaluasi pertanyaan bertipe terhadap suatu status (state) dan langsung mengembalikan hasil yang terstruktur. Tanpa pembuatan teks, tanpa penguraian."

Situs web perusahaan itu sendiri menempatkan Jev di akhir silsilah perkembangan. Mulai dari model bahasa awal, lalu LLM pra-latih, kemudian model obrolan RLHF, lalu model penalaran RLVR. Sekarang RLCD, yang merupakan singkatan dari "reinforcement learning for calibrated decisions" (pembelajaran penguatan untuk keputusan terkalibrasi).

Apa itu model System One

Nama ini dipinjam dari konsep lain, dan dokumentasinya menyatakan hal itu secara langsung. Nama tersebut "berasal dari konsep yang dipopulerkan oleh Daniel Kahneman dalam bukunya yang berjudul Thinking, Fast and Slow."

System 1 cepat dan intuitif. System 2 lebih lambat dan penuh pertimbangan. Di sini "penekanannya adalah pada penilaian yang cepat dan terfokus."

Definisi fungsionalnya lebih sempit daripada metaforanya. Ini adalah "sebuah kelas model AI yang dibuat untuk mengambil keputusan cepat dan terstruktur yang dapat digunakan langsung oleh perangkat lunak." Model seperti ini "mengevaluasi suatu status (state) dan mengembalikan jawaban bertipe serta probabilitas."

Satu hal yang membedakan Jev dari model lain di pasar. "Seperti LLM, model System One memahami masukan bahasa alami. Model ini mengembalikan keputusan bertipe dan probabilitas, alih-alih teks yang dihasilkan."

Batasan apa yang tidak bisa dilakukannya juga dinyatakan dengan jelas oleh vendor. Model System One "tidak menulis balasan, menghasilkan kode, atau membuat penjelasan tentang penalaran mereka."

Tiga jenis pertanyaan

Anda tidak memberikan prompt kepada Jev. Anda menentukan ruang jawaban, dan model ini akan memilih di dalamnya.

Ada tiga tipe primitif. Dokumentasi memberikan contoh untuk masing-masing tipe tersebut.

PrimitifPertanyaanRuang jawabanOutput
ChoiceTim mana yang harus menangani tiket ini?billing, technical, atau accountchoice: "billing"
ScoreSeberapa frustrasi pelanggan ini?0 = tenang, 1 = frustrasi, 2 = sangat frustrasiscore: 1.4
NoulApakah pesan ini meminta pengembalian dana?Benar atau salahnoul: 0.95

Choice memilih satu opsi dari kumpulan yang telah ditentukan. Score memberikan penilaian terhadap tingkat deskriptif yang berurutan. Noul mengembalikan probabilitas bahwa pertanyaan ya/tidak bernilai benar.

Contoh Score patut dicermati kembali. Jawabannya adalah 1.4, bukan 1. Jev menempatkan kasus tersebut di antara dua tingkat yang ditentukan, alih-alih langsung memilih tingkat terdekat. Itu adalah bentuk output yang berbeda dari apa pun yang dikembalikan oleh model teks.

Biaya dan apa yang diterimanya

Halaman harga sangat mudah dipahami secara tidak biasa. Itu bukan sesuatu yang sering ditulis orang tentang peluncuran sebuah model.

Model saat ini adalah jev-1.13.0. Harganya adalah $42 per miliar token, atau $0.042 per juta. Dokumentasi tersebut secara eksplisit menyatakan bahwa biaya dikenakan "per token masukan" dan bahwa "Token keluaran gratis."

Batas kuota (rate limits) yang dipublikasikan adalah 250,000 token per detik dan 1,200 permintaan per menit. Panjang konteks adalah 64k token per permintaan. Dari jumlah tersebut, 32k tersedia untuk status (state) ditambah pertanyaan terpanjang.

Masukan hanya berupa teks. Dokumentasi mencatat bahwa Jev "mengevaluasi string, objek JSON, dan array teks." Ditambahkan pula bahwa "Gambar, audio, dan video belum didukung."

Semuanya berjalan melalui satu endpoint tunggal, POST /v1/systemone. Bidang model memilih model mana yang menangani panggilan tersebut.

PropertiNilai
Modeljev-1.13.0
Harga$42 per miliar token / $0.042 per juta token, hanya masukan
Token keluaranGratis
Batas kuota250,000 token per detik; 1,200 permintaan per menit
Konteks64k per permintaan; 32k untuk status (state) ditambah pertanyaan terpanjang
Jenis masukanHanya teks

Tingkat keyakinan (confidence) adalah bagian yang perlu diperhatikan

Harga memang menjadi sorotan utama. Namun, penanganan tingkat keyakinan (confidence) adalah keputusan desain yang lebih menarik.

Setiap jawaban Choice dan Score membawa properti probabilities di seluruh opsi atau tingkatannya. Dokumentasi menjelaskan cara membacanya. Distribusi yang "terkonsentrasi pada satu hasil berarti jawaban yang meyakinkan, sedangkan yang tersebar berarti jawaban yang tidak pasti."

Properti confidence yang terpisah menyederhanakan bentuk tersebut menjadi satu angka dari 0 hingga 1. Tujuan yang didokumentasikan adalah "agar Anda dapat menentukan ambang batas (threshold) tanpa harus melakukan perhitungan matematika sendiri."

Alasan di balik penyediaan angka tersebut dinyatakan sebagai sebuah prinsip. "Jika sebuah sistem cerdas, baik manusia maupun mesin, tidak dapat mengekspresikan ketidakpastian secara jujur, maka sistem tersebut tidak dapat dipercaya."

Apa yang Anda dapatkan dari hal ini adalah aturan perutean (routing), alih-alih jawaban yang lebih baik. Keyakinan tinggi langsung diproses. Keyakinan rendah dialihkan ke manusia. Dokumentasi menggambarkannya sebagai keputusan tentang "kapan harus bertindak dan kapan harus meneruskannya ke manusia atau ke model penalaran."

Siapa pun yang pernah menerapkan alur klasifikasi (classification pipeline) pasti menyadari mengapa hal ini penting. Jalur eskalasi, bukan angka akurasi, yang menentukan apakah sistem tersebut dapat bertahan saat berhadapan dengan data nyata.

Apa saja kelemahannya menurut vendor

TypeSafe menerbitkan halaman bernama model jaggedness, yang ditinjau pada 2026-09-17. Halaman ini mencantumkan mode kegagalan yang diketahui oleh perusahaan tersebut. Merilis informasi seperti ini bersamaan dengan peluncuran adalah hal yang langka, dan ini menghindarkan semua orang dari menebak-nebak.

Kalimat ringkasannya sangat jujur. Jev 1.13 "cepat, terkalibrasi, dan baik dalam penilaian berdasarkan akal sehat, tetapi tidak sempurna."

Tiga kelemahan disebutkan secara langsung. Model ini "mungkin kesulitan dengan tugas-tugas yang memerlukan tingkat ketidaklangsungan (indirection) tambahan." Model ini "bisa sangat harfiah dalam pemahamannya." Dan model ini "kesulitan dengan tugas-tugas yang memerlukan presisi numerik."

Tabel mode kegagalan memasangkan setiap masalah dengan solusinya. Dua di antaranya patut diulang bagi siapa saja yang sedang mempertimbangkan proyek uji coba.

  • Untuk matematika dan angka, saran yang didokumentasikan adalah "Biarkan aritmetika tetap berada di dalam kode."
  • Untuk status (state) besar yang penuh dengan detail tidak relevan, sarannya adalah "Saring terlebih dahulu; kirimkan hanya apa yang dibutuhkan oleh pertanyaan."

Keduanya merujuk pada asumsi desain yang sama. Ini adalah mesin penilaian, bukan kalkulator dan bukan indeks pencarian. Model ini bekerja paling baik ketika sistem di sekitarnya telah mempersempit pertanyaan tersebut.

Di mana posisi model ini di samping pekerjaan yang sudah Anda miliki

Ada pembagian kerja yang jelas yang tersembunyi dalam contoh dari vendor itu sendiri. Menentukannya akan menentukan apakah peluncuran ini relevan bagi Anda atau tidak sama sekali.

Alur kerja pengembalian dana yang didokumentasikan membangun suatu status (state) dan mengajukan beberapa pertanyaan indeks sekaligus. Alur tersebut kemudian menggabungkan jawaban-jawaban tersebut "dengan pemeriksaan deterministik di dalam kode" dan merutekan kasus tersebut "untuk tindakan atau peninjauan."

Setiap langkah di sana mengasumsikan adanya pengembang, aplikasi, dan volume permintaan yang tinggi. Biaya per token harus menjadi pos pengeluaran yang nyata sebelum semua ini memberikan timbal balik yang sepadan.

Sebagian besar pekerjaan pelaporan memiliki bentuk yang berbeda. Anda memiliki sebuah file, alih-alih aliran permintaan (request stream). Penilaian tersebut merupakan sarana, bukan produk akhir. Apa yang harus ada di bagian akhir adalah dokumen yang dibaca oleh seseorang.

Mengklasifikasikan empat ribu baris umpan balik pelanggan adalah bagian tengah dari pekerjaan tersebut. Bagian akhirnya adalah ringkasan yang menyebutkan tiga tema utama dan menandai pengecualian yang ada.

Bagian kedua itulah yang ditangani oleh ruang kerja berbasis file (file-first workspace). Anda mengunggah hasil ekspor dan mendeskripsikan kategori dalam bahasa alami. Baris-baris data akan dikembalikan dalam keadaan terlabeli, dan laporan yang menjelaskannya akan tiba dalam proses yang sama. Powerdrill Bloom bekerja dengan cara ini, dan paket gratisnya sudah mencakup slide, dokumen, spreadsheet, dan gambar dasar.

Keduanya tidak bersaing untuk slot yang sama. Yang satu adalah API yang Anda hubungkan ke dalam produk. Yang lainnya adalah tempat spreadsheet dikirim ketika seseorang membutuhkan jawaban sebelum hari Kamis. Jika versi masalah Anda ini datang dalam bentuk file, Coba Powerdrill Bloom.

Untuk tugas pelabelan versi spreadsheet, ada panduan tentang mengkategorikan data Excel. Untuk versi pencarian tema, ada rangkuman tentang alat bantu untuk analisis umpan balik pelanggan.

Alternatif yang layak dibandingkan

Tiga pendekatan mencakup bidang yang sama. Pendekatan yang tepat sebagian besar bergantung pada volume.

Model serbaguna dengan output terstruktur. Setiap penyedia utama kini membatasi respons ke dalam sebuah skema. Anda mendapatkan satu model untuk menilai dan menghasilkan teks. Biayanya adalah membayar harga pembuatan teks (generation) untuk pekerjaan penilaian, serta melakukan kalibrasi Anda sendiri.

Klasifikasi klasik. Model kecil yang disesuaikan (fine-tuned) atau pohon keputusan yang ditingkatkan gradiennya (gradient-boosted tree) bahkan lebih murah dan sepenuhnya dapat diprediksi. Hal ini berlaku asalkan Anda memiliki data terlabeli dan kumpulan label yang stabil. Model ini tidak akan memahami kebijakan yang ditulis dalam bentuk prosa.

Ruang kerja analisis berbasis file. Ruang kerja ini menangani penilaian sebagai salah satu langkah di dalam menghasilkan hasil kerja (deliverable). Tanpa API, tanpa skema, tanpa penganggaran per token. Juga tidak memiliki kemampuan untuk berada di dalam jalur permintaan (request path).

Jika situasi Anda adalahLihatlah
Jutaan penilaian di dalam suatu produkModel khusus keputusan
Campuran penilaian dan penyusunan draf, volume rendahModel umum dengan output terstruktur
Label yang stabil dan banyak data pelatihanKlasifikasi klasik
File yang harus diubah menjadi laporanRuang kerja berbasis file

Ada rangkuman terkait tentang alat bantu untuk pembuatan laporan yang membahas poin terakhir tersebut.

Siapa yang harus peduli sekarang

Tim yang menjalankan penilaian bervolume tinggi di dalam suatu produk memiliki alasan paling jelas untuk menggunakan Jev. Perutean tiket, antrean moderasi, kualifikasi prospek, dan pemeriksaan awal kelayakan semuanya sangat cocok. Polanya adalah pertanyaan sempit yang diajukan ribuan kali sehari, yang mengalirkan data ke percabangan dalam kode.

Tim yang sesekali melakukan klasifikasi sebagai bagian dari analisis memiliki alasan paling lemah. Nilai ekonomis yang membuat Jev menarik pada skala besar tidak akan terasa pada beberapa ribu baris saja. Anda masih memerlukan sesuatu untuk menulis ringkasan setelahnya.

Semua orang selain itu memiliki kosakata untuk dipinjam, alih-alih alat untuk diadopsi. Memisahkan penilaian cepat dari sintesis lambat adalah sudut pandang yang berguna untuk alur kerja Anda sendiri. Hal ini tetap berguna terlepas dari apakah Anda pernah mengirimkan permintaan ke API ini atau tidak.

Satu lagi catatan praktis bagi siapa saja yang melakukan evaluasi. Bacalah halaman jaggedness sebelum halaman harga. Mengetahui di mana kelemahan suatu model akan membentuk proyek uji coba jauh lebih baik daripada mengetahui berapa biayanya.

Pertanyaan yang sering diajukan

Apa itu model System One?

Ini adalah kelas model yang dibuat untuk mengambil keputusan cepat dan terstruktur yang dapat digunakan langsung oleh perangkat lunak. Model ini mengevaluasi suatu status (state) dan mengembalikan jawaban bertipe serta probabilitas. Nama ini merujuk pada System 1 milik Kahneman, yaitu mode berpikir yang cepat dan intuitif. Berbeda dengan model obrolan, model ini tidak menulis balasan, menghasilkan kode, atau menjelaskan penalarannya.

Berapa biaya Jev?

Harga yang dipublikasikan untuk jev-1.13.0 adalah $42 per miliar token, atau $0.042 per juta. Biaya hanya dikenakan pada token masukan, dan token keluaran gratis.

Apa saja yang dapat diterima Jev sebagai masukan?

Hanya teks, berupa string, objek JSON, atau array teks. Dokumentasi menyatakan bahwa gambar, audio, dan video belum didukung. Konteksnya adalah 64k token per permintaan, dengan 32k untuk status (state) ditambah pertanyaan terpanjang.

Apa bedanya dengan meminta JSON dari LLM?

Keduanya memahami masukan bahasa alami. Perbedaannya terletak pada apa yang dikembalikan dan bagaimana model tersebut dilatih. Jev mengembalikan keputusan bertipe dengan distribusi probabilitas dan nilai keyakinan (confidence). Kalibrasi diukur di seluruh kelompok prediksi, sehingga tidak menjamin setiap jawaban individu adalah benar.

Apa saja kelemahan Jev?

Halaman jaggedness dari vendor mencantumkan pembacaan harfiah, matematika dan angka, serta perbandingan tanggal dan waktu. Halaman tersebut juga mencantumkan ketidaklangsungan (indirection), status (state) besar yang penuh dengan detail tidak relevan, konten permusuhan (adversarial), dan kriteria yang kontradiktif. Saran yang didokumentasikan untuk kasus aritmetika adalah membiarkan aritmetika tetap berada di dalam kode.

Sumber: Dokumentasi TypeSafe AI — Introduction, System One, Models, Confidence, dan Jev 1.13 jaggedness, docs.typesafe.ai, per 18 September 2026.