Cuộc chiến AI không phải xem "ai to hơn" ✨

91dc0cf35e2be712d93d.webp


Lý do bảng xếp hạng AI bị lật như bánh tráng. Một startup Hàn Quốc vừa "flex" ngược dòng trước các ông lớn!

Một mô hình AI do startup Motif Technologies phát triển vừa có màn "comeback" cực gắt, vượt mặt luôn các mô hình AI khủng của LG AI Research và SK Telecom trong đợt đánh giá hiệu năng toàn cầu.

Plot twist là những kết quả này không phải kiểu tự "phông bạt" để PR đâu nhé! Đây là các chỉ số thực sự được ghi nhận trong giai đoạn hai của dự án "Mô hình nền tảng AI độc lập" (Dokpamo) - một sáng kiến nhằm chọn ra "tuyển thủ quốc gia" AI của Hàn Quốc có thể đấu ngang hàng với các cao thủ từ Mỹ và Trung Quốc ⚔️

Vòng đánh giá thứ hai của chương trình "Dokpamo" được chấm trên thang điểm tối đa 100. Trong đó, benchmark (các bài test chuẩn) đo lường hiệu suất chiếm 40 điểm, đánh giá chuyên gia 35 điểm và đánh giá người dùng 25 điểm. Riêng 40 điểm benchmark thì 15 điểm do NIA (Cơ quan Xã hội Thông tin Quốc gia) chấm, còn 25 điểm dựa trên "Chỉ số Trí tuệ (AAII)" của Artificial Analysis - một công ty đánh giá AI toàn cầu.

Chính phủ Hàn đã để Artificial Analysis thực hiện đánh giá riêng cho vòng này và kết quả vừa được thả thính. Quá trình này bao gồm các mô hình mới nhất từ bốn đội đang "chiến" tại Dokpamo: SK Telecom, LG AI Research, Upstage và Motif Technologies.

c88d271eed0d97a05192.jpg


Startup "nhỏ mà có võ" vượt mặt các ông lớn

Kết quả khiến ai cũng "ơ thật hả trời"! Mô hình "Motif 3" của Motif Technologies đạt điểm cao nhất với 47 điểm xịn xò Tiếp theo là "Solar Open 2" của Upstage (37 điểm), "A.X K2" của SK Telecom (35 điểm) và "K-Exaone 2.0" của LG AI Research (31 điểm).

Sự thay đổi này cho thấy "luật chơi" trên thị trường AI đang đổi game hoàn toàn. Trước kia, giải được bài toán khó hay có kho kiến thức "khủng" là xịn, nhưng bây giờ thì yếu tố quyết định lại là khả năng xử lý công việc thực tế của AI. Trọng tâm đã chuyển từ việc chỉ soạn email hay bài báo sang năng lực của "AI agent" (tác nhân AI): tìm kiếm data, chạy chương trình, chọn công cụ phù hợp và hoàn thành các quy trình nhiều bước một cách mượt mà

Không phải cuộc đua "to bằng mặt trăng" (số lượng tham số)

Đợt đánh giá thứ hai của Dokpamo đã phản ánh xu hướng này rõ rệt. K-Exaone 2.0 là mô hình "khổng lồ" với khoảng 750 tỷ (750B) tham số, A.X K2 cũng "cực khủng" với 688 tỷ tham số. Trong khi đó Motif 3 và Solar Open 2 chỉ có 314 tỷ và 250 tỷ tham số thôi.

Giải thích cho dễ hiểu thì tham số giống như vô số giá trị số mà AI tự "điều chỉnh" trong quá trình học. Thường thì số tham số càng nhiều thì mô hình càng "nhồi" được nhiều thông tin và xử lý vấn đề phức tạp ngon hơn. Trong quá trình phát triển, LG AI Research đã đổ nguồn lực "khủng" để "phình to" mô hình. Họ nghĩ rằng để đấu với các AI đỉnh cao thế giới về lâu dài, trước tiên cần xây một "cỗ máy" đủ to. Tuy nhiên, vì quá chú tâm vào việc "phình to" và ổn định mô hình trong thời gian ngắn, nên có vẻ họ còn ít thời gian cho giai đoạn hậu huấn luyện (post-training) và tối ưu hiệu suất AI agent

Hậu huấn luyện là quá trình "tinh chỉnh" mô hình sau khi học xong kiến thức cơ bản, để phù hợp với các trường hợp sử dụng thực tế. Nếu tiền huấn luyện (pre-training) giống như học đủ các môn ở trường, thì hậu huấn luyện là "mài giũa" phong cách trả lời và luyện chuyên sâu về suy luận, lập trình, sử dụng công cụ để triển khai dịch vụ thật sự.

Dĩ nhiên, chỉ số này không quyết định hết năng lực cạnh tranh cuối cùng của một mô hình đâu nhé. Đây chỉ là một trong nhiều thước đo, và điểm cao không bảo đảm hiệu suất tổng thể. Hiệu suất còn phụ thuộc nhiều yếu tố như trình độ tiếng Hàn, trải nghiệm người dùng thực tế, chi phí, hiệu quả, độ an toàn và chuyên môn đặc thù từng ngành - những thứ không thể đo hết chỉ qua một chỉ số

10795be9a554a807284a.jpg

8cca203e0b9810aee92a.webp

ce67777cab25ce86d112.jpg

71d332a29db5cbad8db9.jpg

30010a361b28a051f53f.jpg

27fab93f13456c4356ca.jpg


Nguồn: svvn.tienphong.vn
 
Back
Top