Qwen 3.8 có thể sánh ngang với Claude Opus? Kết quả thử nghiệm với GPU chơi game!

Thế hệ mới nhất của các mô hình ngôn ngữ lớn (LLM) trọng số mở thực sự gây kinh ngạc. Chúng ta đang chứng kiến ​​sự xuất hiện của những gì mà người ta bắt đầu gọi là các mô hình "đẳng cấp Mythos": Những mô hình khổng lồ, cực kỳ mạnh mẽ và ngày càng khó phân biệt với các mô hình tiên tiến nhất trong quá trình sử dụng thực tế.

Moonshot AI đã tung ra các mô hình Kimi mới nhất với kết quả kiểm thử (benchmark) tuyệt vời (tốt đến mức Anthropic phải hoảng hốt và tặng mỗi người dùng 100 USD credit miễn phí cho Fable), sau đó là sự xuất hiện của DeepSeek với V4 Pro và Alibaba với Qwen 3.8.

Tuy nhiên, Qwen 3.8 là mô hình khiến nhiều người hào hứng nhất, bởi vì không giống như các mô hình "đẳng cấp Mythos" mới khác, nó có phiên bản chính thức với 27 tỷ tham số (27B). Kích thước này đủ nhỏ để chạy thoải mái trên các card đồ họa (GPU) phổ thông dành cho người dùng cá nhân như RTX 3090.

Các mô hình ngôn ngữ lớn (LLM) cục bộ không còn chỉ là thứ gì đó "ồ, hay đấy" nữa. Chúng đang trở nên đủ tốt và hiệu quả để bạn thực sự có thể giao phó các công việc thực tế cho chúng. Nhiều người chủ yếu sử dụng hệ thống AI cục bộ cho các tác vụ đơn giản nhưng có khối lượng lớn, thường là những tác vụ yêu cầu định dạng đầu ra JSON nghiêm ngặt.

Nhưng mọi thứ đã thay đổi rồi! Qwen 3.8 27B thực sự gây kinh ngạc.

So sánh Qwen 3.8 với Claude và GPT

Với chênh lệch lớn về số lượng tham số, kết quả sẽ ra sao?

Qwen tạo hình ảnh một chú bồ nông đang đạp xe.
Qwen tạo hình ảnh một chú bồ nông đang đạp xe.

Điều đầu tiên nên làm khi có trong tay một mô hình mới hiện nay là thực hiện "bài kiểm tra bồ nông". Hãy thử dùng cùng một câu lệnh (prompt) đơn giản đó với Qwen 3.8. Bạn có thể thấy kết quả ở trên. Thật sự quá ấn tượng phải không? Nhiều người đã chuẩn bị sẵn tâm lý để biện minh cho những thiếu sót của nó vì đây là mô hình nhỏ hơn nhiều, v.v... Nhưng rốt cuộc, chẳng tìm thấy thiếu sót nào cả. Chuyện gì đang xảy ra vậy? Hãy thử so sánh nó với các mô hình khác ở bên dưới mà xem. Qwen 3.8 còn tốt hơn cả Opus 5! Tất nhiên, đó chỉ là kết quả của riêng bài kiểm tra này thôi. Có lẽ Alibaba đã biết và huấn luyện riêng Qwen 3.8 để nó vẽ hình chim bồ nông bằng định dạng SVG tốt hơn.

Qwen 3.8 27B là một mô hình Dense. Điều này có nghĩa là toàn bộ 27 tỷ tham số của nó đều hoạt động. Mặc dù vậy - và bất chấp việc nó đã vẽ ra một chú chim bồ nông tuyệt đẹp - tốc độ xử lý của nó vẫn rất nhanh. Ngay cả trên chiếc card RTX 3090 khiêm tốn, nó vẫn đạt tốc độ 75 token mỗi giây; đây thực sự là một con số rất ấn tượng.

Thiết kế toàn bộ một trang blog

Tiếp theo, hãy thực hiện một bài kiểm tra có phần tẻ nhạt hơn: Yêu cầu Qwen 3.8 xây dựng một trang blog. Và một lần nữa, kết quả thật tuyệt vời. Giao diện trông rất đẹp mắt! Mô hình này có gu thẩm mỹ tốt và đã thực hiện công việc một cách kỹ lưỡng, chỉn chu. Các trang khác nhau, những phần nội dung mẫu hợp lý, mọi thứ đều vừa đẹp vừa hoạt động hiệu quả.

Có vẻ như nó học hỏi một số ý tưởng thiết kế từ phong cách của Anthropic, nhưng phải công nhận là trông nó rất tuyệt! Cần phải nhắc lại rằng đây là một mô hình 27 tỷ tham số đang chạy trên chính máy tính hoàn toàn cục bộ.

Qwen đã (gần như) hoàn thành xuất sắc bài kiểm tra lập trình khó nhất 

Nhiệm vụ là xây dựng một trình mô phỏng vật lý chất lưu hoàn chỉnh. Yêu cầu đặt ra là agent không được phép chỉ sử dụng thư viện có sẵn rồi gắn giao diện người dùng (UI) vào đó. Nó phải tự xây dựng trình mô phỏng từ con số không.

Lưu ý rằng bài viết dùng từ "agent" thay vì "mô hình" (model). Đây là một nhiệm vụ khá tham vọng, và cần phải có một hệ thống hỗ trợ (harness) để thực hiện nó. Hệ thống được chọn là DeepSeek Harness. Kết quả là Qwen 3.8 đã không thất bại. Nó hoàn thành xuất sắc nhiệm vụ.

Qwen mất gần 3 tiếng đồng hồ để đưa ra kết quả này, và đó là khi được can thiệp để rút ngắn quy trình. Ở một giai đoạn trong quá trình kiểm thử hiệu năng, nó được cho biết đang tốn quá nhiều thời gian và nên chuyển sang giải pháp tốt nhất thay vì tiếp tục thử nghiệm. Nhờ vậy mà có được kết quả như bạn thấy hiện nay.

Điểm yếu duy nhất thực sự nằm ở hiệu năng. Khi vượt quá 1.000 phân tử, trình mô phỏng bắt đầu bị sụt khung hình, và trên 3.000 phân tử thì không thể sử dụng được nữa. Dù vậy, kết quả này vẫn rất ấn tượng, xét đến việc hầu hết các agent khác đều đặt giới hạn cứng là 2.000 phân tử cho trình mô phỏng của chúng.

Ở đây, một mô hình chạy cục bộ, sử dụng công cụ kiểm thử cục bộ, chạy hoàn toàn trên máy tính cá nhân lại đạt được kết quả mà một số mô hình tiên tiến nhất lại thất bại.

Mô hình Qwen cục bộ khá khiêm tốn so với các mô hình tiên tiến nhất

Qwen yêu cầu hình ảnh nhận diện đặc trưng của blog
Qwen yêu cầu hình ảnh nhận diện đặc trưng của blog

Công bằng mà nói, đây không phải là một sự so sánh công bằng. Nếu muốn công bằng, phải dùng phiên bản Qwen 3.8 đầy đủ (full-size). Hơn nữa, Qwen đang được chạy trên phần cứng của cá nhân.

27B là mô hình nhỏ nhất trong dòng Qwen 3.8. Phiên bản còn lại – bản đầy đủ – là mô hình khổng lồ Qwen3.8-2.4T-A95B. Nó sở hữu tới 2,4 nghìn tỷ tham số.

Công thức tính toán nhu cầu VRAM có thể được đơn giản hóa thành: (số tham số × số bit trên mỗi trọng số / 8) + KV cache + các tính năng bổ sung hoặc mô hình phụ (ví dụ: khả năng xử lý hình ảnh).

Trường hợp này đã sử dụng lượng tử hóa Q4_K_M. Với định dạng này, riêng mô hình đã chiếm 17,8GB; cộng thêm ngữ cảnh 100.000 token sử dụng KV cache chuẩn Q8, tổng lượng VRAM tiêu thụ là 22GB trên tổng số 24GB hiện có. 

Để dễ hình dung, nếu chạy phiên bản Qwen 3.8 hàng đầu với 2,4 nghìn tỷ tham số – ngay cả khi dùng cùng định dạng nén Q4_K_M – bạn sẽ cần khoảng 1,5 terabyte VRAM chỉ để chạy duy nhất mô hình đó.

Điều này được đề cập để đặt sự so sánh vào đúng bối cảnh. ChatGPT và Claude thuộc cùng đẳng cấp mô hình đó. Chúng là những hệ thống khổng lồ với quy mô hàng nghìn tỷ tham số. Như vậy, cuộc so kè ở đây là 24 GB VRAM đối đấu với hàng terabyte - và kết quả không hề tệ chút nào.

Vậy đâu là lợi thế thực sự còn lại của các công ty AI lớn?

Ở thời điểm hiện tại, ưu thế chính mà các mô hình đám mây lớn có được so với hệ thống chạy cục bộ chính là cửa sổ ngữ cảnh. Bạn không thể vượt quá mức 100.000 token nếu không muốn làm quá tải card đồ họa, trong khi các mô hình tiên tiến nhất hiện nay cung cấp cửa sổ ngữ cảnh lên tới 2 triệu token hoặc hơn.

Ngữ cảnh rất nhanh bị tiêu tốn, đặc biệt là với một mô hình có xu hướng "suy luận" nhiều và chi tiết như Qwen 3.8, nhưng vẫn có những công cụ để giải quyết vấn đề này. Ví dụ, bạn có thể sử dụng một mô hình nhỏ gọn hơn chạy song song để nén ngữ cảnh và chỉ giữ lại những thông tin quan trọng, hoặc chủ động loại bỏ các lệnh gọi công cụ cũ nhằm giải phóng bộ nhớ. Tuy nhiên, giải pháp này vẫn chưa hoàn hảo.

Một lợi thế lớn khác khi sử dụng các mô hình AI quy mô lớn chính là hệ thống công cụ hỗ trợ đi kèm. Claude có Claude Code và Cowork; ChatGPT có Codex và Work. Thế nhưng, lợi thế này không còn quá nổi trội nữa nhờ sự phát triển của các hệ thống hỗ trợ mã nguồn mở như Qwen Code và DeepSeek Harness.

Thật trớ trêu. OpenAI, Anthropic, Meta và Google vẫn luôn rao giảng rằng AI không nên bị độc quyền và mọi người đều cần được tiếp cận các mô hình chất lượng cao. Alibaba chưa từng nói những lời sáo rỗng tương tự, vậy mà thực tế lại cho thấy điều ngược lại.

Qwen 3.8 chính là mô hình chạy cục bộ chất lượng cao mà chúng ta hằng mong đợi. Và nó sẽ còn tiếp tục hoàn thiện hơn nữa trong tương lai.

Thứ Bảy, 29/08/2026 10:28
31 👨 11
Xác thực tài khoản!

Theo Nghị định 147/2024/ND-CP, bạn cần xác thực tài khoản trước khi sử dụng tính năng này. Chúng tôi sẽ gửi mã xác thực qua SMS hoặc Zalo tới số điện thoại mà bạn nhập dưới đây:

Số điện thoại chưa đúng định dạng!
Số điện thoại này đã được xác thực!
Bạn có thể dùng Sđt này đăng nhập tại đây!
Lỗi gửi SMS, liên hệ Admin
0 Bình luận
Sắp xếp theo
❖ AI cho người mới