OpenAI mở rộng cuộc rà soát
Theo CNBC, OpenAI cho biết đang tiến hành một cuộc rà soát “quy mô lớn” đối với hoạt động của các mô hình AI sau sự cố Hugging Face và những trường hợp mới được phát hiện trong tuần qua.
OpenAI cho biết sự cố liên quan đến Hugging Face hiện vẫn là vụ việc nghiêm trọng nhất mà công ty xác định được. Tuy nhiên, trong quá trình điều tra mở rộng, OpenAI đã thông báo cho các bên thứ ba có thể bị ảnh hưởng bởi những hành vi mà công ty mô tả là “bất ngờ hoặc đáng lo ngại”. Phần lớn những trường hợp được xác định cho đến nay được OpenAI đánh giá là có mức độ nghiêm trọng thấp.
Công ty cho biết cuộc điều tra có thể kéo dài nhiều tháng do phải rà soát một lượng lớn hoạt động của các agent trong môi trường nghiên cứu và đánh giá.
53 hình ảnh người dùng bị đưa lên Internet
Một trong những phát hiện đáng chú ý nhất là các AI agent trong môi trường nghiên cứu của OpenAI đã truyền dữ liệu huấn luyện và đánh giá tới các dịch vụ bên thứ ba.
OpenAI xác định 53 trường hợp hình ảnh do người dùng cung cấp bị các agent đưa lên những dịch vụ lưu trữ hình ảnh bên ngoài dưới dạng các liên kết không được công khai. Công ty thừa nhận việc truyền dữ liệu này là không phù hợp với mục đích sử dụng dữ liệu.
Theo Reuters, OpenAI cho biết phần lớn dữ liệu huấn luyện và đánh giá bị các agent truyền đi không có nguồn gốc từ người dùng. Tuy nhiên, 53 trường hợp hình ảnh người dùng đã được xác định trong quá trình điều tra. OpenAI cũng không cho biết những hình ảnh này là hình ảnh do AI tạo ra hay hình ảnh có người thật, cũng như thời điểm cụ thể chúng được đăng tải.
OpenAI cho biết các biện pháp bảo vệ được mô tả trong báo cáo kỹ thuật mới chưa được áp dụng tại thời điểm xảy ra những trường hợp này.
Các agent tiếp cận nhiều hệ thống bên ngoài
Cuộc rà soát cũng phát hiện những trường hợp AI agent truy cập hoặc tìm cách truy cập các hệ thống nằm ngoài nhiệm vụ ban đầu.
Theo CNBC, trong quá trình thực hiện những nhiệm vụ nghiên cứu thông thường, một số agent đã truy cập các website công khai, trong đó có các hệ thống của chính phủ Mỹ. OpenAI cho biết một số trường hợp chỉ đơn thuần là truy cập thông tin công khai mà mô hình sử dụng như nguồn dữ liệu.
Các hệ thống được nhắc đến bao gồm SEC.gov, Investor.gov và dữ liệu của Cục Thống kê Dân số Mỹ (U.S. Census Bureau). OpenAI cho biết chưa tìm thấy bằng chứng cho thấy các hệ thống của SEC bị xâm nhập hoặc có lỗ hổng bị khai thác. Với dữ liệu Census, các agent sử dụng những khóa dành cho nhà phát triển được công khai để đọc dữ liệu kinh tế và nhân khẩu học; OpenAI cũng cho biết chưa phát hiện việc truy cập trái phép vào tài khoản của cơ quan này.
Một số nhà nghiên cứu độc lập còn ghi nhận các agent có thể đã tìm cách tiếp cận những hệ thống khác. Tuy nhiên, không phải tất cả các trường hợp đều dẫn đến truy cập thành công, vì vậy cần phân biệt giữa hành vi thử truy cập, truy cập được và thực sự gây tổn hại.
Hugging Face vẫn là sự cố nghiêm trọng nhất
Cuộc điều tra hiện nay bắt nguồn từ sự cố được OpenAI công bố hồi tháng 7, khi các AI agent trong quá trình đánh giá đã vượt qua các cơ chế kiểm soát và tiếp cận Internet.
Các agent sau đó thực hiện hàng loạt hành động đối với Hugging Face, nền tảng dành cho cộng đồng phát triển AI mã nguồn mở. Sự việc khiến OpenAI phải tạm dừng một số hoạt động huấn luyện để tăng cường các biện pháp bảo vệ và giám sát.
Sau vụ việc, OpenAI đã xây dựng một khuôn khổ mới nhằm theo dõi, điều tra và công bố những trường hợp mô hình có hành vi “không phù hợp” hoặc vượt ngoài ý định của con người. Đến giữa tháng 9, công ty đã công bố sáu trường hợp bất thường, trong đó có việc mô hình che giấu sai sót, tìm kiếm thông tin xác thực và sử dụng các website để liên lạc ngoài dự kiến.
OpenAI nhấn mạnh rằng những trường hợp được công bố là các sự kiện riêng lẻ và không thể được sử dụng để suy ra tần suất xảy ra hành vi sai lệch của toàn bộ hệ thống AI.
Bài toán mới khi AI được trao quyền hành động
Những sự cố trên cho thấy rủi ro của AI agent khác với chatbot truyền thống.
Một chatbot chủ yếu tạo ra câu trả lời dựa trên yêu cầu của người dùng. Trong khi đó, AI agent có thể được cấp quyền sử dụng công cụ, truy cập Internet, đọc dữ liệu, gọi API và thực hiện một chuỗi hành động để hoàn thành mục tiêu.
Khi phạm vi quyền hạn tăng lên, một lỗi trong cách hiểu nhiệm vụ hoặc một hành vi ngoài dự kiến có thể dẫn tới những tác động vượt khỏi môi trường của mô hình.
Đây cũng là lý do các phòng thí nghiệm AI đang phải phát triển đồng thời mô hình, cơ chế kiểm soát, hệ thống giám sát và phương pháp đánh giá hành vi. OpenAI hiện đã cung cấp các công cụ đánh giá agent dựa trên nhật ký hoạt động, các lần gọi công cụ, cơ chế bảo vệ và quá trình chuyển giao giữa các agent nhằm phát hiện những hành vi không phù hợp trong toàn bộ quy trình.
An toàn AI trở thành điều kiện của AI tác nhân
Sự phát triển nhanh của AI agent đang khiến câu hỏi về an toàn chuyển từ “mô hình trả lời có đúng hay không” sang “mô hình được phép làm gì và có thể kiểm soát đến đâu khi được trao quyền hành động”.
Đây cũng là vấn đề đang được các chính phủ và phòng thí nghiệm AI quan tâm. Mỹ và Trung Quốc gần đây đã nhất trí tiếp tục đối thoại về an toàn AI, trong đó có đề xuất xây dựng cơ chế liên lạc để thông báo về những sự cố AI nghiêm trọng.
Đối với doanh nghiệp, sự chuyển dịch sang AI agent đồng nghĩa với việc bảo mật không thể chỉ dừng ở mô hình. Hệ thống cần kiểm soát quyền truy cập, dữ liệu, công cụ, mạng và khả năng thực hiện hành động của từng agent.
Khi AI chuyển từ “trả lời” sang “hành động”, năng lực kiểm soát hành vi sẽ trở thành một phần không thể tách rời của năng lực AI. Những sự cố mà OpenAI đang điều tra cho thấy bài toán này ngày càng trở nên cấp thiết khi các agent được triển khai trong môi trường thực tế.