Tuần siêu khuyến mãiClaude Skills — GIẢM 20%
News

Jev bởi TypeSafe AI: Có gì mới, Cách hoạt động và Các giải pháp thay thế (2026)

Powerdrill Bloom·
Jev bởi TypeSafe AI: Có gì mới, Cách hoạt động và Các giải pháp thay thế (2026)

Hầu hết các đợt ra mắt mô hình trong năm nay đều xoay quanh việc làm được nhiều hơn. Đợt ra mắt này lại hướng đến việc làm ít đi, một cách có chủ đích.

TypeSafe AI đã phát hành một mô hình không trò chuyện, không viết lách và không tự giải thích. Nó trả lời các câu hỏi bằng các giá trị được định kiểu và xác suất. Đó là toàn bộ bề mặt sản phẩm.

Hướng dẫn này sẽ trình bày về mô hình này là gì và cách hoạt động của ba loại câu hỏi của nó. Hướng dẫn cũng đề cập đến giá cả, những điểm mà nhà cung cấp thừa nhận là mô hình còn yếu, và vị trí của nó so với công việc thực tế của hầu hết các đội ngũ hiện nay.

Những gì đã được ra mắt

Jev là mô hình hàng đầu của TypeSafe. Theo tài liệu chính thức của nhà cung cấp, đây cũng là "mô hình System One đầu tiên."

Cách tiếp cận này bắt đầu từ một lời phàn nàn về cách hoạt động của phần còn lại trong phân khúc này. Tài liệu cho biết, các mô hình ngôn ngữ lớn "được thiết kế để tạo ra văn bản cho con người đọc." Khi bạn cần một đánh giá để mã nguồn của mình xử lý, "điều đó sẽ tạo ra sự bất tương thích."

Tài liệu giải thích rõ sự bất tương thích này. Bạn đang "ép buộc một hệ thống tạo văn bản phải đưa ra các quyết định có cấu trúc, sau đó phân tích cú pháp kết quả trả về thành một thứ mà mã nguồn của bạn có thể tin cậy được."

Giải pháp thay thế được cung cấp sẽ loại bỏ quy trình vòng lặp này. Jev "đánh giá các câu hỏi được định kiểu dựa trên một trạng thái và trả về trực tiếp các kết quả có cấu trúc. Không tạo văn bản, không phân tích cú pháp."

Trang web của chính công ty đặt Jev ở cuối một dòng tiến hóa. Các mô hình ngôn ngữ ban đầu, sau đó là các LLM được huấn luyện trước, tiếp theo là các mô hình trò chuyện RLHF, rồi đến các mô hình suy luận RLVR. Giờ đây là RLCD, được viết tắt từ "reinforcement learning for calibrated decisions" (học tăng cường cho các quyết định được hiệu chuẩn).

Mô hình System One là gì

Tên gọi này được mượn từ nơi khác, và tài liệu cũng nói thẳng như vậy. Nó "bắt nguồn từ khái niệm mà Daniel Kahneman đã phổ biến trong cuốn sách Thinking, Fast and Slow (Tư duy nhanh và chậm) của ông."

System 1 nhanh và trực quan. System 2 chậm hơn và có tính toán kỹ lưỡng. Ở đây, "sự tập trung được đặt vào các đánh giá nhanh chóng và có trọng tâm."

Định nghĩa về mặt chức năng thì hẹp hơn so với phép ẩn dụ. Đây là "một nhóm các mô hình AI được xây dựng để đưa ra các quyết định nhanh chóng, có cấu trúc mà phần mềm có thể sử dụng trực tiếp." Một mô hình như vậy "đánh giá một trạng thái và trả về các câu trả lời được định kiểu cùng với xác suất."

Có một ranh giới phân chia Jev với mọi thứ khác trên thị trường. "Giống như một LLM, mô hình System One hiểu đầu vào bằng ngôn ngữ tự nhiên. Nó trả về các quyết định được định kiểu và xác suất thay vì văn bản được tạo ra."

Những gì mô hình không làm cũng được nhà cung cấp nêu rõ. Các mô hình System One "không viết câu trả lời, không tạo mã nguồn, hoặc không tạo ra các lời giải thích cho lập luận của chúng."

Ba loại câu hỏi

Bạn không viết prompt cho Jev. Bạn định nghĩa một không gian câu trả lời, và nó sẽ lựa chọn bên trong đó.

Có ba kiểu nguyên bản (primitive). Tài liệu cung cấp một ví dụ cho mỗi kiểu.

Kiểu nguyên bảnCâu hỏiKhông gian câu trả lờiĐầu ra
ChoiceĐội ngũ nào nên xử lý yêu cầu hỗ trợ này?billing, technical, hoặc accountchoice: "billing"
ScoreKhách hàng này đang bực bội ở mức độ nào?0 = bình tĩnh, 1 = bực bội, 2 = rất bực bộiscore: 1.4
NoulTin nhắn này có yêu cầu hoàn tiền không?Đúng hoặc sainoul: 0.95

Choice chọn một tùy chọn từ một tập hợp đã xác định. Score đánh giá dựa trên các mức độ có thứ tự và mang tính mô tả. Noul trả về xác suất để một câu hỏi có/không là đúng.

Ví dụ về Score rất đáng để xem xét kỹ hơn. Câu trả lời là 1.4, chứ không phải 1. Jev đang đặt trường hợp này vào giữa hai mức độ được đặt tên thay vì làm tròn về mức gần nhất. Đó là một dạng đầu ra khác biệt so với bất kỳ thứ gì mà một mô hình văn bản trả về.

Chi phí và những gì mô hình chấp nhận

Trang bảng giá dễ hiểu một cách bất ngờ. Đó không phải là điều người ta thường viết về một đợt ra mắt mô hình.

Mô hình hiện tại là jev-1.13.0. Giá là $42 cho mỗi tỷ token, hoặc $0.042 cho mỗi triệu token. Tài liệu nêu rõ rằng phí được tính "trên mỗi token đầu vào" và "các token đầu ra là miễn phí."

Giới hạn tốc độ được công bố là 250,000 token mỗi giây và 1,200 yêu cầu mỗi phút. Độ dài ngữ cảnh là 64k token cho mỗi yêu cầu. Trong đó, 32k khả dụng cho trạng thái cộng với câu hỏi dài nhất.

Đầu vào chỉ là văn bản. Tài liệu lưu ý rằng Jev "đánh giá các chuỗi, đối tượng JSON và mảng văn bản." Tài liệu cho biết thêm rằng "Hình ảnh, âm thanh và video (chưa) được hỗ trợ."

Mọi thứ đều chạy qua một endpoint duy nhất, POST /v1/systemone. Trường model sẽ chọn mô hình nào xử lý cuộc gọi.

Thuộc tínhGiá trị
Modeljev-1.13.0
Giá$42 mỗi tỷ token / $0.042 mỗi triệu token, chỉ tính đầu vào
Token đầu raMiễn phí
Giới hạn tốc độ250,000 token mỗi giây; 1,200 yêu cầu mỗi phút
Ngữ cảnh64k mỗi yêu cầu; 32k cho trạng thái cộng với câu hỏi dài nhất
Các loại đầu vàoChỉ văn bản

Độ tin cậy là phần cần chú ý

Giá cả là tiêu đề nổi bật. Nhưng cách xử lý độ tin cậy mới là quyết định thiết kế thú vị hơn.

Mỗi câu trả lời Choice và Score đều mang một thuộc tính probabilities (xác suất) trên các tùy chọn hoặc mức độ. Tài liệu giải thích cách đọc thuộc tính này. Một phân phối "tập trung vào một kết quả có nghĩa là câu trả lời tự tin, phân tán có nghĩa là câu trả lời không chắc chắn."

Một thuộc tính confidence (độ tin cậy) riêng biệt sẽ thu gọn hình thái đó thành một con số duy nhất từ 0 đến 1. Mục đích được ghi trong tài liệu là "để bạn có thể đặt ngưỡng cho nó mà không cần tự mình thực hiện các phép tính."

Lý do đằng sau việc cung cấp con số đó được tuyên bố như một nguyên tắc. "Nếu một hệ thống thông minh, dù là con người hay máy móc, không thể thể hiện sự không chắc chắn một cách trung thực, thì hệ thống đó không thể đáng tin cậy."

Những gì điều này mang lại cho bạn là một quy tắc định tuyến chứ không phải là một câu trả lời tốt hơn. Độ tin cậy cao sẽ được xử lý thẳng. Độ tin cậy thấp sẽ được chuyển đến con người. Tài liệu định nghĩa điều này là việc quyết định "khi nào nên hành động và khi nào nên chuyển tiếp lên con người hoặc một mô hình suy luận."

Bất kỳ ai từng triển khai một quy trình phân loại (classification pipeline) đều nhận ra lý do tại sao điều đó lại quan trọng. Đường dẫn chuyển tiếp (escalation path), chứ không phải con số độ chính xác, mới là yếu tố quyết định liệu hệ thống có tồn tại được khi tiếp xúc với dữ liệu thực tế hay không.

Những điểm nhà cung cấp thừa nhận mô hình còn yếu

TypeSafe công bố một trang có tên là sự không đồng đều của mô hình (model jaggedness), được đánh giá vào ngày 17-09-2026. Trang này liệt kê các lỗi vận hành mà công ty đã biết. Việc công bố điều này cùng với đợt ra mắt là rất hiếm, và nó giúp mọi người đỡ phải đoán già đoán non.

Dòng tóm tắt rất thẳng thắn. Jev 1.13 "nhanh, được hiệu chuẩn tốt và giỏi đưa ra các đánh giá thông thường nhưng nó không hoàn hảo."

Ba điểm yếu được nêu tên trực tiếp. Nó "có thể gặp khó khăn với các tác vụ đòi hỏi thêm các mức độ gián tiếp." Nó "có thể hiểu nghĩa một cách quá thô/quá đen (literal)." Và nó "gặp khó khăn với các tác vụ đòi hỏi độ chính xác về số học."

Bảng thống kê các lỗi vận hành ghép đôi mỗi lỗi với một biện pháp khắc phục. Có hai điểm đáng để nhắc lại cho bất kỳ ai đang đánh giá một dự án thử nghiệm.

  • Đối với toán học và các con số, lời khuyên trong tài liệu là "Hãy giữ phần tính toán số học trong mã nguồn."
  • Đối với một trạng thái lớn chứa đầy các chi tiết không liên quan, lời khuyên là "Hãy lọc trước; chỉ gửi những gì câu hỏi cần."

Cả hai đều chỉ ra cùng một giả định thiết kế. Đây là một công cụ đánh giá, không phải là một máy tính và không phải là một chỉ mục tìm kiếm. Nó hoạt động tốt nhất khi hệ thống xung quanh đã thu hẹp phạm vi câu hỏi.

Vị trí của mô hình này so với công việc hiện tại của bạn

Có một sự phân công lao động rõ ràng ẩn giấu trong ví dụ của chính nhà cung cấp. Việc gọi tên nó sẽ quyết định liệu đợt ra mắt này có liên quan gì đến bạn hay không.

Quy trình hoàn tiền được ghi trong tài liệu sẽ xây dựng một trạng thái và hỏi nhiều câu hỏi độc lập cùng một lúc. Sau đó, nó kết hợp các câu trả lời "bằng các kiểm tra mang tính xác định trong mã nguồn" và định tuyến trường hợp đó "để xử lý hoặc xem xét."

Mỗi bước ở đó đều giả định có một nhà phát triển, một ứng dụng và khối lượng yêu cầu lớn. Chi phí trên mỗi token phải là một khoản chi thực tế trước khi bất kỳ điều nào trong số này mang lại lợi nhuận.

Hầu hết công việc báo cáo lại có dạng khác. Bạn có một tệp tin thay vì một luồng yêu cầu. Các đánh giá là một phương tiện chứ không phải là sản phẩm. Thứ cần phải tồn tại ở cuối cùng là một tài liệu mà ai đó sẽ đọc.

Phân loại bốn nghìn dòng phản hồi của khách hàng là phần giữa của công việc đó. Phần cuối là một bản tóm tắt nêu tên ba chủ đề chính và gắn cờ các trường hợp ngoại lệ.

Nửa sau đó chính là những gì một không gian làm việc ưu tiên tệp tin (file-first workspace) xử lý. Bạn tải tệp xuất lên và mô tả các danh mục bằng ngôn ngữ tự nhiên. Các dòng dữ liệu được trả về kèm theo nhãn dán, và báo cáo giải thích chúng cũng được gửi về trong cùng một lượt xử lý. Powerdrill Bloom hoạt động theo cách này, và gói miễn phí đã hỗ trợ các trang trình bày, tài liệu, bảng tính và hình ảnh cơ bản.

Cả hai không cạnh tranh cho cùng một vị trí. Một bên là một API bạn tích hợp vào sản phẩm. Bên còn lại là nơi một bảng tính được gửi đến khi một người cần câu trả lời trước thứ Năm. Nếu phiên bản vấn đề này của bạn xuất hiện dưới dạng một tệp tin, Hãy dùng thử Powerdrill Bloom.

Đối với phiên bản dán nhãn trên bảng tính, có một bài hướng dẫn chi tiết về phân loại dữ liệu Excel. Đối với phiên bản tìm kiếm chủ đề, có một bài tổng hợp về các công cụ phân tích phản hồi của khách hàng.

Các giải pháp thay thế đáng so sánh

Ba cách tiếp cận cùng giải quyết một vấn đề. Lựa chọn đúng đắn phụ thuộc chủ yếu vào khối lượng công việc.

Các mô hình đa dụng với đầu ra có cấu trúc. Mọi nhà cung cấp lớn hiện nay đều giới hạn câu trả lời theo một schema. Bạn có một mô hình duy nhất cho cả việc đánh giá và tạo nội dung. Chi phí phải trả là mức giá tạo nội dung cho công việc đánh giá, và bạn phải tự thực hiện hiệu chuẩn.

Các bộ phân loại cổ điển. Một mô hình nhỏ được tinh chỉnh (fine-tuned) hoặc một cây tăng cường gradient (gradient-boosted tree) thậm chí còn rẻ hơn và hoàn toàn có thể dự đoán được. Điều đó đúng với điều kiện là bạn có dữ liệu đã được dán nhãn và một tập hợp nhãn ổn định. Nó sẽ không hiểu được một chính sách được viết bằng văn xuôi thông thường.

Các không gian làm việc phân tích ưu tiên tệp tin. Những không gian này xử lý việc đánh giá như một bước bên trong quá trình tạo ra sản phẩm bàn giao. Không cần API, không cần schema, không cần lập ngân sách trên mỗi token. Nhưng cũng không có khả năng nằm trong một đường dẫn yêu cầu (request path).

Nếu tình huống của bạn làHãy xem xét
Hàng triệu đánh giá bên trong một sản phẩmMột mô hình chỉ đưa ra quyết định
Kết hợp đánh giá và soạn thảo, khối lượng thấpMột mô hình tổng quát với đầu ra có cấu trúc
Các nhãn ổn định và nhiều dữ liệu huấn luyệnMột bộ phân loại cổ điển
Một tệp tin cần phải trở thành một báo cáoMột không gian làm việc ưu tiên tệp tin

Có một bài tổng hợp liên quan về các công cụ tạo báo cáo đề cập đến trường hợp cuối cùng trong số đó.

Ai nên quan tâm vào lúc này

Các đội ngũ đang vận hành việc đánh giá với khối lượng lớn bên trong một sản phẩm là những đối tượng phù hợp nhất với Jev. Định tuyến yêu cầu hỗ trợ, hàng đợi kiểm duyệt, đánh giá chất lượng khách hàng tiềm năng và kiểm tra trước điều kiện tham gia đều rất phù hợp. Mô hình hoạt động ở đây là một câu hỏi hẹp được hỏi hàng nghìn lần mỗi ngày, cung cấp dữ liệu cho một nhánh rẽ trong mã nguồn.

Các đội ngũ thỉnh thoảng mới thực hiện phân loại như một phần của quá trình phân tích là những đối tượng ít phù hợp nhất. Lợi ích kinh tế giúp Jev trở nên hấp dẫn ở quy mô lớn sẽ không rõ rệt khi chỉ xử lý vài nghìn dòng dữ liệu. Bạn vẫn cần một công cụ nào đó để viết bản tóm tắt sau đó.

Những người khác có thể mượn thuật ngữ này hơn là áp dụng công cụ này. Việc tách biệt giữa đánh giá nhanh và tổng hợp chậm là một lăng kính hữu ích để nhìn nhận quy trình của chính bạn. Nó vẫn hữu ích cho dù bạn có bao giờ gửi yêu cầu đến API này hay không.

Thêm một lưu ý thực tế cho bất kỳ ai đang đánh giá. Hãy đọc trang về sự không đồng đều (jaggedness) trước khi đọc trang bảng giá. Việc biết được điểm yếu của mô hình sẽ định hình dự án thử nghiệm nhiều hơn là việc biết chi phí của nó.

Các câu hỏi thường gặp

Mô hình System One là gì?

Đây là một nhóm các mô hình được xây dựng để đưa ra các quyết định nhanh chóng, có cấu trúc mà phần mềm có thể sử dụng trực tiếp. Nó đánh giá một trạng thái và trả về các câu trả lời được định kiểu cùng với xác suất. Tên gọi này tham chiếu đến System 1 của Kahneman, chế độ tư duy nhanh và trực quan. Không giống như mô hình trò chuyện, nó không viết câu trả lời, không tạo mã nguồn, hoặc không giải thích lập luận của mình.

Jev có giá bao nhiêu?

Mức giá được công bố cho jev-1.13.0 là $42 cho mỗi tỷ token, hoặc $0.042 cho mỗi triệu token. Việc tính phí chỉ áp dụng cho token đầu vào, và các token đầu ra là miễn phí.

Jev có thể nhận đầu vào là gì?

Chỉ văn bản, dưới dạng chuỗi, đối tượng JSON hoặc mảng văn bản. Tài liệu nêu rõ rằng hình ảnh, âm thanh và video chưa được hỗ trợ. Ngữ cảnh là 64k token cho mỗi yêu cầu, với 32k cho trạng thái cộng với câu hỏi dài nhất.

Nó khác gì so với việc yêu cầu một LLM trả về JSON?

Cả hai đều hiểu đầu vào bằng ngôn ngữ tự nhiên. Sự khác biệt nằm ở kết quả trả về và cách nó được huấn luyện. Jev trả về các quyết định được định kiểu cùng với một phân phối xác suất và một giá trị độ tin cậy. Việc hiệu chuẩn được đo lường trên các nhóm dự đoán, vì vậy nó không đảm bảo bất kỳ câu trả lời riêng lẻ nào là chính xác.

Jev không giỏi ở những điểm nào?

Trang về sự không đồng đều (jaggedness) của nhà cung cấp liệt kê việc hiểu nghĩa đen, toán học và các con số, cũng như so sánh ngày và giờ. Nó cũng liệt kê tính gián tiếp, các trạng thái lớn chứa đầy chi tiết không liên quan, nội dung đối nghịch và các tiêu chí mâu thuẫn. Lời khuyên trong tài liệu cho trường hợp số học là hãy giữ phần tính toán số học trong mã nguồn.

Nguồn: Tài liệu TypeSafe AI — Giới thiệu, System One, Các mô hình, Độ tin cậy, và sự không đồng đều của Jev 1.13, docs.typesafe.ai, tính đến ngày 18 tháng 9 năm 2026.