Sự cố được phát hiện sau cuộc rà soát hơn 141.000 phiên thử nghiệm, làm dấy lên những lo ngại mới về khả năng các AI agent có thể vượt khỏi phạm vi kiểm soát nếu được cấp quyền truy cập Internet.
Anthropic vừa công bố kết quả một cuộc điều tra nội bộ cho thấy ba mô hình AI của hãng đã truy cập trái phép vào hệ thống của ba doanh nghiệp trong các bài kiểm thử an ninh mạng diễn ra hồi tháng 7.
Theo công ty, đây không phải là hành vi có chủ đích của mô hình mà bắt nguồn từ lỗi trong môi trường thử nghiệm, khiến các AI được cấp quyền truy cập Internet ngoài phạm vi dự kiến. Anthropic gọi đây là một "thất bại trong vận hành" (operational failure) thay vì lỗi về khả năng căn chỉnh (alignment) của mô hình.
Ba mô hình Claude liên quan đến sự cố
Cuộc rà soát được Anthropic tiến hành sau khi xuất hiện một vụ việc tương tự liên quan đến OpenAI.
Hãng đã xem xét 141.006 phiên đánh giá an ninh mạng và phát hiện ba trường hợp các mô hình Claude Opus 4.7, Claude Mythos 5 cùng một mô hình nghiên cứu nội bộ đã truy cập vào hệ thống của các doanh nghiệp thật thay vì chỉ tương tác với môi trường mô phỏng.
Anthropic cho biết hai trong số ba doanh nghiệp hoàn toàn không biết hệ thống của họ từng bị AI truy cập cho đến khi công ty chủ động thông báo. Công ty vẫn đang liên hệ với doanh nghiệp còn lại.
AI khai thác những lỗ hổng bảo mật đơn giản
Theo Anthropic, các mô hình Claude không sử dụng kỹ thuật tấn công tinh vi mà chủ yếu khai thác những điểm yếu phổ biến như mật khẩu yếu hoặc các giao diện truy cập không yêu cầu xác thực.
Trong một trường hợp, mô hình AI nhầm lẫn một doanh nghiệp thật với mục tiêu giả lập trong bài kiểm thử và sử dụng thông tin đăng nhập để truy cập hệ thống. Ở một trường hợp khác, mô hình nhận ra mục tiêu là hệ thống thật và tự dừng quá trình xâm nhập.
Những sự cố này cho thấy ngay cả các lỗ hổng bảo mật cơ bản cũng có thể bị AI agent khai thác nếu được trao quyền hành động tự động.
Anthropic tạm dừng các bài kiểm thử
Sau khi phát hiện sự cố, Anthropic đã dừng toàn bộ các bài đánh giá năng lực tấn công mạng từ ngày 23/7 để điều tra và siết chặt quy trình kiểm thử.
Công ty đang phối hợp với các chuyên gia độc lập để đánh giá nguyên nhân, đồng thời xem xét lại cơ chế cấp quyền truy cập Internet, phạm vi hoạt động và các biện pháp giám sát đối với AI agent.
AI agent bước sang giai đoạn rủi ro mới
Sự việc của Anthropic diễn ra chỉ ít ngày sau khi OpenAI cũng thừa nhận một AI agent trong quá trình thử nghiệm đã xâm nhập vào hệ thống của doanh nghiệp bên ngoài, làm dấy lên tranh luận về mức độ an toàn của các mô hình AI thế hệ mới.
Theo Reuters, các vụ việc liên tiếp đã thúc đẩy các nhà hoạch định chính sách Mỹ xem xét tăng cường các biện pháp đánh giá rủi ro trước khi những mô hình AI có khả năng tự hành động được triển khai rộng rãi.
Các chuyên gia nhận định nguy cơ không nằm ở việc AI "muốn" tấn công hệ thống, mà ở khả năng mô hình thực hiện mục tiêu được giao bằng những cách vượt ngoài dự kiến của con người nếu thiếu các giới hạn kỹ thuật và cơ chế giám sát phù hợp.
|
AI agent là gì?
AI agent là các hệ thống AI không chỉ trả lời câu hỏi mà còn có thể tự lập kế hoạch và thực hiện chuỗi hành động để hoàn thành một mục tiêu, chẳng hạn:
-
Tìm kiếm và tổng hợp thông tin.
-
Viết và chạy mã nguồn.
-
Truy cập website hoặc dịch vụ trực tuyến.
-
Tương tác với phần mềm và hệ thống CNTT.
Khả năng này giúp AI trở nên hữu ích hơn trong tự động hóa, nhưng cũng làm gia tăng rủi ro nếu mô hình được cấp quyền truy cập Internet hoặc các hệ thống quan trọng mà thiếu cơ chế kiểm soát.
Góc nhìn
Hai sự cố liên tiếp liên quan đến OpenAI và Anthropic cho thấy ngành AI đang bước sang một giai đoạn mới: bài toán không còn là mô hình trả lời đúng hay sai, mà là quản trị quyền hành động của AI. Khi các AI agent có thể tự thực hiện tác vụ trên Internet, an toàn hệ thống sẽ phụ thuộc không chỉ vào năng lực của mô hình mà còn vào cách các doanh nghiệp thiết kế môi trường thử nghiệm, phân quyền truy cập và giám sát hoạt động của AI.
|