Về trang News AI

Startup chấm điểm AI gọi 40 triệu USD — vì benchmark cũ đã bị qua mặt từ lâu

Cenix · 20.09.2026 · 2 phút đọc

Điểm benchmark đẹp gần như luôn đồng nghĩa với PR đẹp. Vals muốn biến phép đo đó thành thứ không ai học tủ được.

Startup chấm điểm AI gọi 40 triệu USD — vì benchmark cũ đã bị qua mặt từ lâu

Có một vấn đề mà ai làm sản phẩm AI cũng ngầm hiểu: bảng benchmark đã trở thành công cụ marketing nhiều hơn là công cụ đo lường. Nhiều bộ test đã cũ, công khai, và các công ty hoàn toàn có thể huấn luyện model bám sát chính những bài test đó — nói nôm na là học tủ trước kỳ thi.

Vals, startup thành lập năm 2024, đang bán lời giải cho chuyện này. Sau vòng seed do 8VC và Bloomberg Beta dẫn dắt, tháng trước công ty gọi thêm 40 triệu USD vòng Series A do Andreessen Horowitz dẫn đầu.

Không công bố đề thi

Điểm khác biệt của Vals nằm ở chỗ họ không công khai bộ tài liệu kiểm tra. Thay vì đo kiến thức tổng quát kiểu “model có đủ chữ để thi lấy bằng luật sư không”, Vals chấm khả năng hoàn thành các tác vụ phức tạp theo từng ngành: luật, tài chính, lập trình.

Nhà đồng sáng lập Rayan Krishnan, 25 tuổi, từng thực tập ở Palantir và làm việc cho Microsoft cùng phòng lab AI của Stanford thời đại học. Anh nói mục tiêu là trả lời câu hỏi thực tế hơn: model có làm ra sản phẩm chất lượng ngang một con người trong lĩnh vực đó không, và nếu chúng “chạy loạn ngoài đời” thì hậu quả tiêu cực sẽ tới đâu. Danh mục bài đo của Vals giờ trải từ tự cải thiện đệ quy, an ninh mạng, an toàn sinh học cho tới việc áp dụng Công ước Geneva.

Mô hình doanh thu nghe hơi ngược đời: chính các công ty AI trả tiền để được chấm. Krishnan so sánh nó với việc học sinh trả tiền cho College Board để thi SAT. Có vẻ hiệu quả — doanh thu hiện gấp 8 lần năm ngoái, nhân sự từ 8 người đầu năm lên 25 người, và đang tuyển thêm 10–15 chỗ nữa.

Mấy fen có còn tin vào điểm benchmark trên slide ra mắt model không, hay đã chuyển hẳn sang tự test bằng use case của mình? Cenix muốn nghe cách anh em đánh giá.

Nguồn: TechCrunch

Nguồn: TechCrunch