Phân tích - Bình luận

OpenAI đẩy nhanh khung an toàn AI sau 6 sự cố mới

Nam Trần 21/09/2026 03:06

OpenAI công bố 6 trường hợp mô hình có hành vi ngoài dự kiến, đồng thời thiết lập cơ chế báo cáo tự nguyện trong bối cảnh vấn đề an toàn trí tuệ nhân tạo (AI) ngày càng được quan tâm.

Ngày 16/9, OpenAI công bố 6 sự cố mới liên quan đến các mô hình AI có hành vi đi chệch mục tiêu trong quá trình huấn luyện và đánh giá. Các trường hợp được ghi nhận gồm che giấu lỗi, tìm cách lấy thông tin đăng nhập khi không được phép, tải tập tin lên internet công cộng và trao đổi thông tin giữa những môi trường thử nghiệm vốn được thiết kế để tách biệt.

pexels-tara-winstead-8386440.jpg
Ngày càng nhiều lo ngại liên quan tới an toàn AI khiến nhiều hãng AI lớn phải nhanh chóng xây dựng các biện pháp phòng vệ (Ảnh minh họa: Pexels)

Cùng với việc công bố các sự cố, OpenAI giới thiệu một khung báo cáo tự nguyện nhằm xử lý và công khai những trường hợp tương tự trong tương lai. Đây là lần thứ hai công ty công bố các sự cố dạng này, sau khi trước đó xác nhận một số mô hình từng truy cập trái phép vào hệ thống của nền tảng Hugging Face.

Hành vi đi chệch mục tiêu

Theo OpenAI, 6 sự cố được ghi nhận trong khoảng 6 tháng qua và đều liên quan đến những hành vi khác với mục tiêu mà nhà phát triển đặt ra cho mô hình.

Bên cạnh việc che giấu thông tin và tìm cách lấy thông tin đăng nhập trái phép, một số mô hình đã tạo dữ liệu không chính xác hoặc trao đổi ngầm giữa các môi trường thử nghiệm tách biệt. Trong một trường hợp đáng chú ý, mô hình tự lưu vào bộ nhớ những chỉ dẫn dành cho các phiên bản hoạt động sau đó, trong đó thể hiện ý định không tuân theo một số yêu cầu được đặt ra.

OpenAI cho rằng các sự cố xuất phát từ hai nguyên nhân chính: hệ thống kiểm soát an ninh chưa đủ khả năng phát hiện sớm một số hành vi bất thường, trong khi năng lực của các mô hình phát triển nhanh hơn dự kiến.

Ông Kai Chen, phụ trách nghiên cứu tại nhóm căn chỉnh của OpenAI, nói với Axios rằng cả hai yếu tố đều đóng vai trò và các biện pháp bảo đảm an toàn cần theo kịp tốc độ phát triển của công nghệ AI.

Thiết lập cơ chế công bố sự cố

Điểm đáng chú ý trong lần công bố này là OpenAI đồng thời đưa ra một quy trình báo cáo nội bộ và công khai sự cố.

Theo đó, bất kỳ nhân viên nào cũng có thể gắn cờ một trường hợp nghi ngờ để nhóm phụ trách an toàn và căn chỉnh xem xét. Các trường hợp sau đó được phân thành ba nhóm: có thể công bố ngay, cần điều tra ở quy mô nhỏ hoặc cần điều tra chuyên sâu.

Những trường hợp đủ điều kiện công bố dự kiến được thông tin ra bên ngoài trong vòng sáu ngày làm việc. Các vụ việc cần điều tra thêm có thể mất tới 12 ngày, trong khi OpenAI chưa đặt thời hạn cố định đối với những trường hợp phức tạp nhất.

Theo ông Chen, ngành AI hiện chưa có một tiêu chuẩn chung về công bố các sự cố liên quan đến hành vi mô hình. OpenAI lựa chọn triển khai cơ chế trên theo hướng tự nguyện, với kỳ vọng việc chia sẻ kinh nghiệm có thể góp phần hình thành các chuẩn mực chung.

Công ty cũng cho rằng những sự cố nghiêm trọng liên quan đến an toàn, an ninh hoặc hành vi lệch chuẩn cần được chia sẻ với Chính phủ liên bang Mỹ. Cơ chế mới được xác định là phần bổ sung cho các nghĩa vụ pháp lý hiện hành, thay vì thay thế các yêu cầu bắt buộc.

Bài toán quản trị AI

Việc OpenAI tiếp tục công bố các trường hợp mới cho thấy sự cố liên quan đến Hugging Face trước đó không phải trường hợp duy nhất. Khi khả năng lập kế hoạch và thực hiện nhiệm vụ của các mô hình ngày càng tăng, việc bảo đảm chúng hoạt động trong phạm vi được thiết kế đang trở thành một vấn đề quản trị đáng chú ý đối với các doanh nghiệp phát triển AI.

Vấn đề này cũng xuất hiện trong một số đánh giá độc lập gần đây. Viện An toàn AI của Anh công bố kết quả thử nghiệm, trong đó có hai mô hình của Anthropic và OpenAI thực hiện 19 hành động không được cho phép qua 122 lượt thử. Trong một trường hợp, mô hình đã tạo danh tính giả và tìm cách tác động tới người quản trị một kho mã thực tế.

Các nhà nghiên cứu sau đó xác định một số kết quả bất thường liên quan đến lỗi cấu hình tại đơn vị đánh giá độc lập được sử dụng chung. Điều này đặt ra một vấn đề rộng hơn: độ tin cậy của chính các quy trình và hạ tầng đang được sử dụng để đánh giá mức độ an toàn của AI.

Với thị trường, việc OpenAI chủ động công bố sự cố có thể được nhìn nhận như một bước nhằm tăng tính minh bạch trong quản trị rủi ro, thay vì một sự kiện riêng lẻ tác động trực tiếp đến hoạt động kinh doanh.

Điểm đáng lưu ý hơn là ngành AI hiện chưa có chuẩn công bố sự cố thống nhất. Nếu các doanh nghiệp không hình thành được thông lệ chung, yêu cầu báo cáo bắt buộc từ cơ quan quản lý có thể trở thành bước tiếp theo. Vì vậy, phản ứng của các doanh nghiệp AI lớn khác và khả năng xuất hiện những cơ chế tương tự sẽ là vấn đề cần theo dõi.

Giải pháp nào đối với Việt Nam?

Đối với Việt Nam, những sự cố trên đặt ra thêm một lớp rủi ro cần được tính đến khi AI ngày càng được tích hợp sâu vào hoạt động của doanh nghiệp, cơ quan Nhà nước và các hệ thống hạ tầng số.

Rủi ro không chỉ nằm ở các cuộc tấn công từ bên ngoài. Một mô hình có quyền truy cập vào dữ liệu, mã nguồn, tài khoản hoặc các công cụ thực thi cũng có thể tạo ra sự cố nếu hành vi thực tế vượt khỏi phạm vi mà nhà phát triển dự kiến.

Điều này đặt ra yêu cầu về cơ chế kiểm soát quyền truy cập, giám sát hoạt động của mô hình, kiểm thử độc lập và quy trình xử lý khi xảy ra sự cố. Với những hệ thống AI được sử dụng trong các lĩnh vực nhạy cảm, khả năng truy vết và nghĩa vụ báo cáo sự cố cũng cần được tính đến ngay từ khâu thiết kế.

Trong quá trình hoàn thiện khung pháp lý về AI và an ninh mạng, kinh nghiệm từ OpenAI cho thấy Việt Nam cần quan tâm tới một vấn đề ngày càng cụ thể: ai phải báo cáo khi mô hình có hành vi ngoài dự kiến, báo cáo trong trường hợp nào và cơ quan nào có trách nhiệm tiếp nhận, đánh giá và phối hợp xử lý?

Việc xây dựng năng lực giám sát kỹ thuật, cơ chế công bố sự cố phù hợp và tăng cường phối hợp quốc tế sẽ là những thành tố quan trọng khi AI được triển khai ở quy mô ngày càng lớn.

(0) Bình luận
Nổi bật
Mới nhất
OpenAI đẩy nhanh khung an toàn AI sau 6 sự cố mới
POWERED BY ONECMS - A PRODUCT OF NEKO