Đáng chú ý, mô hình mới tập trung mạnh vào lập trình, xử lý các nhiệm vụ kéo dài nhiều giờ, hiệu quả sử dụng tài nguyên và các cơ chế bảo vệ an toàn.
Bước tiến mới về hiệu quả của AI
Ngày 22/9, Anthropic chính thức giới thiệu Claude Opus 5.5, phiên bản mới nhất trong dòng mô hình AI cao cấp của hãng. Theo Anthropic, Opus 5.5 đạt mức hiệu năng tương đương Claude Fable 5.1 trong phần lớn công việc, nhưng cần ít tài nguyên tính toán hơn đáng kể. Chi phí vận hành theo các bài kiểm thử của công ty giảm khoảng 40% so với Opus 5.
Mô hình mới có giá 4 USD cho mỗi triệu token đầu vào và 20 USD cho mỗi triệu token đầu ra, thấp hơn lần lượt 20% so với Opus 5. Chi phí đọc bộ nhớ đệm cũng giảm 60%, xuống 0,20 USD cho mỗi triệu token. Anthropic cho biết Opus 5.5 đồng thời tạo kết quả nhanh hơn hơn 30% so với thế hệ trước.
Điều này phản ánh một thay đổi đáng chú ý trong cuộc đua AI. Khi các mô hình ngày càng lớn và những tác vụ AI ngày càng phức tạp, chi phí để hoàn thành một công việc thực tế đang trở thành một chỉ số quan trọng không kém năng lực của mô hình.
Tập trung vào những công việc AI có thể tự thực hiện trong thời gian dài
Một trong những thế mạnh được Anthropic nhấn mạnh ở Opus 5.5 là khả năng xử lý các nhiệm vụ phức tạp, kéo dài và đòi hỏi nhiều bước liên tiếp.
Trong một thử nghiệm với khách hàng, Opus 5.5 có thể hỗ trợ di chuyển một cơ sở mã nguồn gồm khoảng 680.000 dòng trong chưa đầy một ngày. Một thử nghiệm khác cho thấy mô hình có thể kiểm tra và sửa một cơ sở mã 200.000 dòng trong chưa đầy ba giờ, trong khi Opus 5 cần hơn 20 giờ và sử dụng lượng token nhiều hơn 2,5 lần. Đây là các kết quả do Anthropic và khách hàng của hãng báo cáo, không phải đánh giá độc lập.
Ở một thử nghiệm chuyển đổi phần mềm HAProxy từ ngôn ngữ C sang Rust, Anthropic cho biết Opus 5.5 hoàn thành công việc trong khoảng 9,5 giờ, so với 12 giờ của Fable 5.1, đồng thời chi phí thấp hơn 51%.
Những kết quả này cho thấy trọng tâm đang dịch chuyển từ chatbot trả lời câu hỏi sang “tác nhân AI” có khả năng lập kế hoạch, sử dụng công cụ, kiểm tra kết quả và thực hiện một chuỗi công việc tương đối dài với mức giám sát của con người thấp hơn.
Cuộc đua AI chuyển sang “năng lực trên mỗi USD”
Anthropic cũng công bố các kết quả so sánh Opus 5.5 với một số mô hình khác trên các bài kiểm thử lập trình và tác vụ chuyên môn. Công ty cho biết Opus 5.5 có thể đạt kết quả tương đương hoặc cao hơn một số mô hình cạnh tranh trong một số bài kiểm thử, nhưng với chi phí cho mỗi tác vụ thấp hơn đáng kể.
Đáng chú ý, Anthropic cho biết trên Terminal-Bench 4.0, Opus 5.5 đạt kết quả tương đương GPT-6 Astra với khoảng 40% chi phí; trên một số bài kiểm thử lập trình tác nhân khác, mô hình đạt kết quả cao hơn GPT-5.6 Sol với khoảng một phần ba chi phí.
Tuy nhiên, các số liệu này cần được nhìn nhận trong bối cảnh Anthropic công bố và thiết lập phần lớn các phép thử của mình, trong khi kết quả có thể thay đổi tùy cách thiết lập, mức độ suy luận và công cụ được phép sử dụng. Vì vậy, không nên xem đây là bằng chứng cho thấy một mô hình luôn vượt trội trong mọi tác vụ.
An toàn trở thành một phần của năng lực mô hình
Opus 5.5 được Anthropic giới thiệu trong bối cảnh ngành AI ngày càng quan tâm đến khả năng kiểm soát các mô hình có mức độ tự chủ cao.
Theo Anthropic, Opus 5.5 được đánh giá bởi các tổ chức bên ngoài, trong đó có Frontier Design và METR, trước khi phát hành. Trong hệ thống đánh giá hành vi tự động của Anthropic với gần 2.000 kịch bản, công ty cho biết Opus 5.5 đạt kết quả tốt nhất trong số các mô hình Claude gần đây ở hầu hết các chỉ số về hành vi không phù hợp.
Mô hình cũng được trang bị các cơ chế chống tấn công prompt injection, trong đó hệ thống có thể phát hiện và ngăn chặn những chỉ dẫn độc hại tìm cách khiến tác nhân AI thực hiện hành động ngoài phạm vi cho phép.
Anthropic cho biết Opus 5.5 còn sử dụng bộ phân loại để kiểm tra hành động trước khi thực thi, kết hợp môi trường cô lập và cơ chế rà soát mã nhằm phát hiện lỗ hổng trước khi mã được đưa vào sử dụng.
AI tiến sâu hơn vào lập trình và công việc tri thức
Nếu các thế hệ AI trước chủ yếu được đánh giá qua khả năng tạo văn bản, trả lời câu hỏi hoặc viết những đoạn mã riêng lẻ, Opus 5.5 cho thấy hướng phát triển mới tập trung vào hoàn thành cả quy trình công việc.
Trong lập trình, AI có thể đọc một lượng lớn mã nguồn, xác định các vấn đề, thực hiện thay đổi trên nhiều tệp, chạy kiểm thử rồi tiếp tục sửa lỗi. Trong nghiên cứu và công việc tri thức, AI có thể thu thập dữ liệu, kiểm tra nguồn, tổng hợp thông tin và tạo báo cáo.
Anthropic cho biết trong một bài kiểm thử nghiên cứu doanh nghiệp, Opus 5.5 đạt kết quả cao hơn Opus 5 và GPT-5.6 Sol ở mọi mức độ nỗ lực được thử nghiệm. Tuy nhiên, đây cũng là kết quả do Anthropic công bố và cần được đánh giá độc lập khi có thêm dữ liệu.
Mở rộng sang khoa học sự sống và an ninh mạng
Một điểm đáng chú ý khác là Anthropic không mở hoàn toàn mọi năng lực của Opus 5.5 cho tất cả người dùng.
Do mô hình đạt năng lực cao trong một số lĩnh vực nhạy cảm như sinh học và an ninh mạng, Anthropic áp dụng các cơ chế bảo vệ tương tự những mô hình cao cấp hơn. Các tổ chức đáp ứng điều kiện có thể đăng ký chương trình xác minh để sử dụng Opus 5.5 cho nghiên cứu khoa học sự sống; quyền truy cập dành cho các chuyên gia an ninh mạng đã được xác minh cũng sẽ được mở rộng.
Cách tiếp cận này phản ánh một xu hướng ngày càng rõ: khi AI có khả năng thực hiện những công việc phức tạp hơn, năng lực của mô hình và cơ chế kiểm soát phải được phát triển song song.
Claude 5.5 mở thêm một mặt trận trong cuộc đua AI
Opus 5.5 hiện đã được cung cấp trên nền tảng Claude và các nền tảng điện toán đám mây lớn như Amazon Web Services, Google Cloud và Microsoft Azure. Anthropic cho biết các phiên bản Claude Sonnet 5.5 và Claude Haiku 5.5 sẽ tiếp tục được phát hành trong những tuần tới.
Việc Anthropic giảm đáng kể chi phí trong khi tăng năng lực cho thấy cuộc cạnh tranh AI đang bước sang một giai đoạn mới. Các hãng không chỉ cạnh tranh về việc xây dựng mô hình có khả năng suy luận mạnh hơn mà còn phải giải quyết bài toán chi phí, tốc độ, khả năng vận hành liên tục và mức độ an toàn khi AI được trao quyền thực hiện công việc thực tế.
Đối với doanh nghiệp, đây có thể là thay đổi quan trọng. Khi chi phí sử dụng AI giảm, những tác vụ trước đây cần nhiều giờ làm việc của kỹ sư, nhà phân tích hoặc nhân viên tri thức có thể ngày càng được chuyển sang mô hình tác nhân AI. Điều này đồng thời đặt ra yêu cầu mới về quản trị dữ liệu, an ninh mạng, kiểm soát quyền truy cập và kỹ năng của người lao động.
Với ngành công nghiệp điện tử và công nghệ Việt Nam, sự phát triển của các mô hình AI hiệu năng cao với chi phí ngày càng thấp có thể thúc đẩy nhanh hơn việc đưa AI vào thiết kế sản phẩm, lập trình, kiểm tra chất lượng, bảo trì dự báo, tối ưu dây chuyền và quản trị chuỗi cung ứng. Khi AI trở thành một công cụ sản xuất thay vì chỉ là công cụ hỗ trợ văn phòng, năng lực khai thác dữ liệu và tích hợp AI vào quy trình sản xuất sẽ ngày càng trở thành một yếu tố quan trọng trong năng lực cạnh tranh của doanh nghiệp.