So sánh và test 5 mô hình AI mới tháng 7 năm 2026
5 mô hình AI tiên tiến đã được ra mắt trong vòng chín ngày. Grok 4.5 vào ngày 8 tháng 7, GPT-5.6 và Muse Spark 1.1 vào ngày 9 tháng 7, Inkling vào ngày 15 tháng 7 và Kimi K3 vào ngày 16 tháng 7. Chưa bao giờ có tháng nào phát hành dày đặc như vậy trong lịch sử AI, và chênh lệch giá giữa mô hình rẻ nhất và đắt nhất lên đến hơn 12 lần.
Cả 5 mô hình đã được test thông qua API, playground và các tác vụ thực tế kể từ khi ra mắt. Bản so sánh này cung cấp cho bạn thông số kỹ thuật, benchmark đã được xác minh, những gì mỗi mô hình thực sự đã làm trong các bài kiểm tra thực tế và tùy chọn chiến thắng rõ ràng về lập trình, agent, ngân sách, đầu vào đa phương thức và khả năng tùy chỉnh.
Cuộc chạy đua 9 ngày: Những gì đã được ra mắt và khi nào?
Từ ngày 8 đến ngày 16 tháng 7 năm 2026, 5 phòng thí nghiệm trên 3 lục địa đã cho ra mắt các mô hình tiên phong, và hai trong số đó hứa hẹn sẽ cung cấp trọng số mở. Sự tập trung này không phải là ngẫu nhiên. Một khi OpenAI ấn định ngày 9 tháng 7 cho bản phát hành chung GPT-5.6, mọi đối thủ cạnh tranh đều có lý do để xuất hiện trong cùng một chu kỳ tin tức.
Hai câu chuyện quan trọng hơn cả các lần ra mắt riêng lẻ. Thứ nhất, phân khúc trọng số mở đã bắt kịp: Inkling đã cho ra mắt một mô hình tiên phong Apache 2.0 thực sự, và Kimi K3 hứa hẹn sẽ cung cấp trọng số trong vòng 11 ngày kể từ khi ra mắt. Thứ hai, giá cả đã phân hóa hoàn toàn. Muse Spark 1.1 có giá 1,25 USD cho mỗi triệu token đầu vào trong khi Claude Fable 5 tính phí 10 USD, và khoảng cách về khả năng giữa chúng không hề gần gấp 8 lần.
Nhận định: Tháng 7 năm 2026 là tháng mà khả năng không còn là yếu tố khác biệt nữa. Mỗi mô hình ở đây đều đủ tốt cho hầu hết các công việc sản xuất, vì vậy các quyết định thực sự bây giờ là về giá cả, giấy phép và nhiệm vụ cụ thể nào bạn đang tối ưu hóa.
So sánh tổng quan 5 mô hình
Đây là bảng so sánh thông số kỹ thuật đầy đủ. Hãy đọc cột giá cùng với cột ngữ cảnh, vì sự kết hợp đó giải thích hầu hết các quyết định kiến trúc mà mỗi phòng thí nghiệm đã đưa ra.
GPT-5.6 cũng cung cấp Terra với giá $2.50 / $15.00 và Luna với giá $1.00 / $6.00. Đầu vào được lưu vào cache của Kimi K3 là $0.30.
Kimi K3 là mô hình lớn nhất mà bất kỳ ai đã công bố với 2,8 nghìn tỷ tham số. Inkling là mô hình duy nhất tiết lộ các tham số hoạt động với 41 tỷ, đây là con số thực sự quyết định chi phí phục vụ. Và Muse Spark 1.1 có ngăn xếp đầu vào rộng nhất so với bất kỳ mô hình nào trên thị trường, xử lý video, âm thanh và PDF một cách tự nhiên thông qua một endpoint duy nhất.
Xét về vị trí của 5 mô hình này so với toàn bộ các mô hình khác, bao gồm cả Claude và Gemini, bảng xếp hạng những mô hình AI tốt nhất tháng 7 năm 2026 này tiếp tục duy trì vị trí dẫn đầu giữa các nhà cung cấp.
Đánh giá Kimi K3
Kimi K3 là mô hình agentic mạnh nhất trong số các mô hình ra mắt tháng 7, lập kỷ lục mọi thời đại với 91,2% trên BrowseComp dành cho các web agent và đạt điểm GPQA Diamond cao nhất ở mức 93,5%. Moonshot đã cung cấp 2,8 nghìn tỷ tham số, cửa sổ ngữ cảnh 1M và đầu vào video gốc, sau đó định giá đầu vào là 3 USD và đầu ra là 15 USD, gấp 5 lần so với dòng K2 của chính nó.
Những gì đã thử nghiệm: K3 được giao một nhiệm vụ nghiên cứu yêu cầu 12 sự kiện đã được xác minh từ lịch sử giá của 4 mô hình. Nó đã trả lời đúng 11 sự kiện với các trích dẫn, kiểm tra chéo những nguồn mâu thuẫn và tự động đánh dấu hai con số là chưa được xác minh. Thất bại duy nhất là tuyên bố một tin đồn đã được xác nhận. Trong một bài toán gỡ lỗi bất đồng bộ khó, nó đã tìm ra nguyên nhân gốc rễ chỉ trong một lần chạy, trong khi Kimi K2.7 Code cần đến ba gợi ý.
Đánh giá: 9/10 cho các agent: agent duyệt web tốt nhất hiện có, dù là mã nguồn mở hay đóng. Bị trừ điểm do tự tin khẳng định các thông tin chưa được xác minh, vì vậy hãy kết nối nó với chức năng tìm kiếm và giữ lại phần trích dẫn do con người thực hiện. Việc tăng giá đồng nghĩa với việc nó không còn là lựa chọn tối ưu về giá trị nữa.
Nếu bạn sử dụng các agent để lập trình khối lượng lớn thay vì nghiên cứu, Kimi K2.7 Code vẫn có giá chỉ bằng khoảng một phần tư và không bị ngừng hỗ trợ.
Đánh giá Inkling
Inkling là mô hình mã nguồn mở tốt nhất để xây dựng, được phát hành theo giấy phép Apache 2.0 với tổng cộng 975 tỷ tham số, 41 tỷ tham số hoạt động và một nút điều chỉnh mức độ nỗ lực tư duy mà bạn có thể thiết lập từ 0,2 đến 0,99. Thinking Machines công khai tuyên bố rằng đây không phải là mô hình mạnh nhất hiện có, điều này cho bạn biết chính xác mục đích của nó: một nền tảng tùy chỉnh, chứ không phải là một mục tiêu cạnh tranh trên bảng xếp hạng.
Tất cả các số liệu đều từ báo cáo đánh giá đã được Thinking Machines công bố ở mức nỗ lực 0,99.
Những gì đã thử nghiệm: Nút điều chỉnh mức độ nỗ lực là điểm nổi bật. Trong một bài toán tái cấu trúc có độ khó trung bình ở mức nỗ lực 0,3, nó đã tạo ra một kết quả hoạt động nhưng hơi nông với khoảng 4.000 token suy luận. Ở mức 0,99, nó đã phát hiện ra một lỗi làm tròn tiền tệ mà thiết lập thấp đã bỏ sót, nhưng đã tiêu tốn gần 19.000 token. Mức nỗ lực 0,6 mang lại khoảng 95% chất lượng cao nhất với một nửa chi phí. Hệ thống xử lý âm thanh gốc đã ghi âm toàn bộ cuộc họp dài 25 phút mà không cần đường dẫn xử lý giọng nói riêng biệt.
Đánh giá: 9/10 cho nền tảng cơ bản, 7/10 cho trợ lý ảo. Khả năng tùy chỉnh vượt trội với Apache 2.0 cùng công cụ tinh chỉnh Tinker và các công thức có sẵn ngay từ đầu. Điểm SimpleQA 43,9% có nghĩa là bạn cần phải kết nối nó để tìm kiếm bất kỳ thông tin nào mang tính thực tế.
Đánh giá GPT-5.6
GPT-5.6 là agent nhanh nhất trong nhóm, đạt 88,8% trên Terminal-Bench 2.1 và chạy với tốc độ lên đến 750 token mỗi giây trên phần cứng Cerebras. OpenAI đã phát hành 3 phiên bản vào ngày 9 tháng 7: Sol với giá $5 / $30, Terra với giá $2,50 / $15 và Luna với giá $1 / $6, tất cả đều có cửa sổ ngữ cảnh 1 triệu và thời hạn cập nhật kiến thức vào tháng 2 năm 2026.
OpenAI đã công bố một bài phê bình cho rằng khoảng 30% tác vụ SWE-bench Pro bị lỗi, trên một bài kiểm tra mà nó thua.
Những gì đã thử nghiệm: Sol đã thực hiện thành công việc di chuyển dữ liệu bất đồng bộ SQLAlchemy trên dịch vụ FastAPI 6.000 dòng, trong khi GPT-5.5 phải mất ba lần thử vào tháng Tư, và hoàn thành trong vòng chưa đầy 9 phút trên Cerebras endpoint. Trong một tình huống tranh chấp dữ liệu websocket phức tạp hơn, nó đã tự tin vá lỗi triệu chứng hai lần trong khi Claude Fable 5 tìm ra nguyên nhân thực sự. Luna đã xử lý 1.000 bản tóm tắt tin tức với tổng chi phí 3,80 USD mà không có JSON nào bị lỗi.
Kết luận: 9/10 cho Sol, 9/10 cho Luna xét về giá cả: Khả năng thực thi multi-file tốt nhất và hiệu quả kinh tế xử lý hàng loạt mạnh nhất trong cùng loại. Trừ điểm vì báo cáo METR tìm thấy tỷ lệ đánh giá hiệu năng cao nhất mà nó đã đo được, điều mà chính tài liệu của OpenAI cũng thừa nhận.
Đánh giá Grok 4.5
Grok 4.5 là lựa chọn đáng giá nhất trong số các phần mềm được ra mắt tháng 7, xếp thứ tư trên bảng xếp hạng Artificial Analysis Intelligence Index độc lập ở vị trí 54, với phí đầu vào là 2 USD và phí đầu ra là 6 USD. xAI đã ra mắt phần mềm này vào ngày 8 tháng 7 với cửa sổ ngữ cảnh 500K, tính năng tìm kiếm web và X tích hợp sẵn, cùng với bộ công cụ phân phối sâu rộng nhất so với bất kỳ phần mềm nào khác.
Artificial Analysis là một công cụ theo dõi độc lập, điều này khiến đây là điểm số được xác thực bên ngoài nhiều nhất trong nhóm.
Những gì đã thử nghiệm: Trong thử thách tạo nhà 3D, Grok 4.5 đã viết nhiều code nhất so với bất kỳ phần mềm nào khác với 1.431 dòng nhưng chỉ tốn 17 xu, điều này chứng minh đúng nghĩa đen của tỷ lệ trí tuệ trên mỗi USD. Tính năng tìm kiếm X tích hợp sẵn của nó đã hiển thị các cuộc thảo luận theo thời gian thực mà không phần mềm nào khác có thể đạt được. Ngữ cảnh 500K thực sự là một hạn chế đối với các tác vụ xử lý toàn bộ kho lưu trữ, nơi những phần mềm khác có thể lưu trữ đến 1 triệu dòng.
Đánh giá: 8.5/10 về giá trị: Đây là mô hình nên được ưu tiên sử dụng cho các dự án sản xuất nhạy cảm về chi phí. Nó sẽ không vượt trội hơn Fable 5 về khả năng lập trình hay hiệu năng, nhưng đối với phần lớn công việc thực tế, nó không cần phải làm vậy.
Đánh giá Muse Spark 1.1
Muse Spark 1.1 là bộ não agent mạnh mẽ và rẻ nhất, dẫn đầu về hiệu quả sử dụng, vượt trội hơn MCP Atlas với 88.1 điểm trong khi chỉ tốn 1,25 USD cho đầu vào và 4,25 USD cho đầu ra. Phiên bản phát hành ngày 9 tháng 7 của Meta có phạm vi đầu vào rộng nhất so với bất kỳ mô hình nào khác ở đây, chấp nhận văn bản, hình ảnh, video, âm thanh và PDF một cách tự nhiên thông qua một endpoint duy nhất.
Meta cũng bao gồm 20 USD tín dụng miễn phí khi đăng ký, bản dùng thử hào phóng nhất trong nhóm.
Những gì đã thử nghiệm: Trên cùng một thử thách nhà 3D, Muse Spark đã tạo ra một ngôi nhà kính hiện đại, sạch sẽ chỉ với 627 dòng code với giá 4 xu, kết quả rẻ và hiệu quả nhất về token so với bất kỳ mô hình nào khác. Nó có thể khái quát hóa cho các MCP server mới mà không cần ví dụ và báo cáo các lỗi của công cụ một cách trung thực thay vì tạo ra thành công. Khả năng truy xuất ngữ cảnh dài là điểm yếu của nó, bỏ sót hai tham chiếu vượt quá mốc 500K, trong khi Sol và Kimi K3 vẫn làm tốt.
Đánh giá: 8.5/10 cho các agent có ngân sách hạn chế: Bộ não agent có giá trị tốt nhất hiện có. Điều kỳ lạ về mặt chiến lược là Meta phát hành phiên bản đóng sau khi Llama định nghĩa trọng số mở, sai lầm lớn nhất trong lĩnh vực AI năm nay.
So sánh benchmark
Trên các benchmark chung, Kimi K3 dẫn đầu về suy luận và duyệt, GPT-5.6 Sol dẫn đầu về thực thi terminal, Muse Spark 1.1 dẫn đầu về sử dụng công cụ, và Claude Fable 5 vẫn dẫn đầu về kỹ thuật phần mềm được xác thực với khoảng cách khá lớn. Không một mô hình nào trong số các mô hình tháng 7 thu hẹp được khoảng cách SWE-bench Verified.
Phiên bản đáng trích dẫn: Khi 5 phòng thí nghiệm không thể thống nhất về chuẩn mực nào để công bố, bảng xếp hạng chuẩn mực đã ngừng là một bảng xếp hạng và bắt đầu trở thành một lựa chọn tiếp thị.
Mô hình đáng ghi nhớ: Trên các tác vụ có thể kiểm chứng, có thể huấn luyện bằng học tăng cường như làm việc trên terminal và duyệt web, thế hệ tháng Bảy đã bắt kịp hoặc vượt qua thế hệ trước. Trên các lĩnh vực kỹ thuật phần mềm khó nhất, nơi chất lượng phụ thuộc vào dữ liệu hậu huấn luyện độc quyền khổng lồ, chuẩn mực SWE-bench Verified 95% của Claude Fable 5 vẫn là vị trí dẫn đầu có thể bảo vệ được nhất trong AI. Đó chỉ là một chuẩn mực, không phải là một bức tường, nhưng không ai vượt qua được nó trong tháng này.
So sánh giá cả và chi phí thực tế
Lớp sản phẩm tháng 7 có phạm vi giá hơn 12 lần, từ Muse Spark 1.1 với giá đầu vào $1.25 đến Claude Fable 5 với giá $10. Tuy nhiên, giá niêm yết chỉ là một nửa câu chuyện, vì hiệu quả sử dụng token khác nhau giữa các mô hình đủ để đảo ngược thứ hạng về chi phí cho mỗi nhiệm vụ hoàn thành.
Grok 4.5 với đầu vào được lưu cache ở mức $0.50 và Kimi K3 ở mức $0.30 giúp giảm đáng kể các con số này đối với khối lượng công việc của agent.
CON SỐ THỰC SỰ QUAN TRỌNG
Chi phí cho mỗi nhiệm vụ hoàn thành, không phải chi phí cho mỗi token. Một mô hình có chi phí gấp đôi cho mỗi token nhưng hoàn thành trong một nửa số token thì có giá bằng nhau nhưng chất lượng lại tốt hơn. Trong bài kiểm tra mô hình nhà 3D, Muse Spark hoàn thành với giá 0,04 USD trong khi Fable 5 tiêu tốn 1,82 USD cho kết quả tương đương, một khoảng cách gấp 45 lần mà không bảng tính theo từng token nào có thể dự đoán được.
Quan điểm trái chiều: Hầu hết các nhóm đều trả quá nhiều tiền bằng cách mặc định sử dụng phần mềm hàng đầu cho những tác vụ thông thường. Hãy chuyển 80% tác vụ dễ dàng sang Muse Spark, Luna hoặc Grok 4.5 và dành Sol hoặc Fable 5 cho 20% tác vụ khó hơn, và hóa đơn của bạn sẽ giảm hơn một nửa mà không làm giảm chất lượng đến mức người dùng có thể nhận thấy.
Mô hình nào phù hợp với tác vụ nào?
Đây là điều mà hầu hết người đọc đều quan tâm. Tùy chọn chiến thắng được chọn ra dựa trên kết quả thực tế trước, mô hình về nhì có thể làm phương án dự phòng khi vấn đề bản quyền hoặc ngân sách loại trừ lựa chọn hàng đầu.
Claude Fable 5 được đưa vào làm tham chiếu mặc dù nó được ra mắt vào tháng 6, bởi vì nó vẫn chiến thắng tuyệt đối ở một hạng mục.
Bảng điểm và kết luận cuối cùng
Tính trung bình trên các bài kiểm tra thực tế, Kimi K3 và GPT-5.6 Sol cùng dẫn đầu về khả năng, Muse Spark 1.1 và Grok 4.5 cùng về giá trị, và Inkling thắng ở một hạng mục mà các phần mềm khác không cạnh tranh. Không có tùy chọn chiến thắng duy nhất, đó là kết quả trung thực.
Điểm số về tính mở thể hiện giấy phép và khả năng cung cấp trọng lượng. Kimi K3 đạt 7.5 điểm dựa trên lời hứa phát hành ngày 27 tháng 7, chứ không phải ngày phát hành thực tế.
Điểm số 8.5, bằng điểm nhau giữa 4 phần mềm, là điều đáng chú ý. 5 phòng thí nghiệm đã đạt được hiệu quả tổng thể gần như giống hệt nhau thông qua các chiến lược hoàn toàn khác nhau: Moonshot đạt được khả năng với quy mô, OpenAI đạt được tốc độ với chip tùy chỉnh, Meta và xAI đạt được thị phần với giá cả, và Thinking Machines đạt được lòng trung thành của nhà phát triển với giấy phép. Hãy chọn chiến lược phù hợp với hạn chế của bạn.
Khuyến nghị: Sử dụng kiến trúc 3 tầng. Hãy sử dụng Muse Spark 1.1 hoặc Grok 4.5 cho khối lượng công việc thường ngày, GPT-5.6 Terra hoặc Kimi K3 cho công việc hàng ngày, và dành Sol hoặc Fable 5 cho 20% công việc khó khăn. Thêm Inkling khi bạn có một tác vụ lặp đi lặp lại cần tinh chỉnh, vì sở hữu một mô hình tốt hơn là thuê.
Hướng dẫn AI
AI Tools
Học IT
Hàm Excel