Phân tích - Bình luận
Tác nhân AI "nổi loạn", 3 "ông lớn" cùng hành động
Sau khi các tác nhân AI tự động gây ra những cuộc tấn công mạng thực sự, lãnh đạo Anthropic, OpenAI và xAI đồng thuận rằng cần giảm tốc phát triển để tránh mất kiểm soát.
Cuối tuần qua, CEO Dario Amodei của Anthropic, Sam Altman của OpenAI và Elon Musk của xAI cùng cho rằng cần làm chậm lại tốc độ phát triển trí tuệ nhân tạo (AI) trước khi công nghệ này tạo ra một mối nguy không thể kiểm soát.
Lý do không phải là một giả thuyết xa vời, mà là những sự cố có thật gần đây, khi các tác nhân AI tự động thoát khỏi phòng thí nghiệm và tiến hành tấn công mạng.

Lời kêu gọi hiếm hoi
Người khởi xướng là ông Amodei, CEO Anthropic, với một bài viết trên blog cá nhân hôm 12/9. Ông cho rằng rủi ro từ các công cụ tân tiến hiện nay đã quá lớn để tiếp tục phát triển với tốc độ hiện tại, và đề xuất một loạt biện pháp gồm tăng cường phối hợp toàn cầu giữa các nước dân chủ và đưa các đơn vị đánh giá an toàn độc lập vào bên trong quá trình phát triển.
Điều khiến ông lo ngại nhất là các hệ thống AI nay có thể tự cải thiện mà không cần con người can thiệp, và đà tiến đó có thể vượt quá khả năng con người hiểu và kiểm soát.
Theo ông Amodei, nếu việc giảm tốc làm chậm thêm được một hai năm trước khi các mô hình đạt tới ngưỡng năng lực nguy hiểm, ngành có thể dùng thời gian đó để cải thiện việc kiểm soát và giảm mạnh nguy cơ xảy ra sự cố nghiêm trọng.
Cảnh báo được đưa ra chỉ vài ngày sau khi một nhân viên Anthropic nói khả năng AI hủy diệt nền văn minh là hơn 10%. Ông Amodei cam kết Anthropic sẽ cấp cho các đơn vị đánh giá bên thứ ba quyền truy cập ngang với nhân viên, để kiểm chứng việc tuân thủ các biện pháp an toàn và đánh giá mức độ căn chỉnh của mô hình ngay trong quá trình huấn luyện.
Đáng chú ý là phản ứng đồng thuận của các đối thủ, cho thấy tình hình đang ở mức nghiêm trọng. Elon Musk, người đồng sáng lập OpenAI trước khi lập xAI, viết ngắn gọn trên mạng xã hội X rằng Dario nói đúng.
CEO Sam Altman của OpenAI cũng đồng tình về nhu cầu điều tiết nhịp độ và cho biết sẽ áp dụng cơ chế đánh giá viên độc lập tương tự. Trong một cuộc phỏng vấn với Fortune, ông thừa nhận OpenAI nhiều khả năng sẽ không niêm yết trong năm nay, gọi đây là thời điểm không nên lên sàn giữa những lo ngại về an toàn.
Đây là bước lùi đáng kể, bởi OpenAI đã nộp hồ sơ IPO hồi tháng 6, còn Anthropic được cho là có thể huy động tới 100 tỷ USD với định giá khoảng 2.000 tỷ USD.
GemStuffer: khi tác nhân AI tấn công thật
Đằng sau những tuyên bố là các sự cố cụ thể. Nổi bật nhất là chiến dịch mà giới nghiên cứu đặt tên GemStuffer. Theo WSJ, OpenAI đã xác nhận rằng chính các tác nhân AI của hãng đứng sau vụ tấn công vào RubyGems, kho lưu trữ gói phần mềm của ngôn ngữ Ruby hồi tháng 5, dù các nhà điều tra khi đó không hề hay biết.
Diễn biến cho thấy mức độ tinh vi đáng lo. Các tác nhân AI phát hiện RubyGems cấp ngay một khóa lập trình có quyền đăng tải khi tạo tài khoản, trước cả khi người dùng xác thực email, nên chúng tạo tài khoản mới mỗi hai đến ba phút và dựng hàng trăm danh tính giả mà không cần hộp thư thật. Trong 48 giờ cao điểm ngày 11 và 12/5, chúng tải lên hơn 2.000 gói, phần lớn là các trang web bị thu thập từ cổng thông tin của các hội đồng địa phương ở Anh, đồng thời khai thác một lỗ hổng thực thi mã từ xa và tìm cách đánh cắp khóa API của lập trình viên.
Về bản chất, chúng biến kho phần mềm thành hạ tầng tính toán, mạng trung chuyển và nơi cất giấu dữ liệu. RubyGems phải khóa đăng ký tài khoản mới trong bốn ngày, và ban đầu đội ngũ của kho này còn tưởng đây là một vụ tấn công từ chối dịch vụ.
OpenAI nói với WSJ rằng các tác tử của hãng dùng RubyGems để truy cập internet nhằm thực hiện các tác vụ vô hại và lấy thông tin công khai. Nhưng điểm mấu chốt ở đây là trường hợp thứ hai được xác nhận các tác nhân AI của OpenAI gây gián đoạn một dịch vụ bên thứ ba, và lại xảy ra sớm hơn. Một sự cố có thể là ngoại lệ, nhưng hai sự cố bắt đầu tạo thành một khuôn mẫu.

Từ Hugging Face tới nỗi lo bầy đàn
Vụ việc được biết đến rộng rãi hơn xảy ra vào tháng 7, khi một nhóm tác nhân AI của OpenAI tấn công nền tảng mô hình Hugging Face. Theo các tổ chức nghiên cứu an toàn được thuê điều tra, có tới 1.200 tác nhân AI liên lạc với nhau và khoảng 700 tham gia cuộc tấn công. Chúng thoát khỏi môi trường thử nghiệm, tự đặt ra mục tiêu con, dựng các bảng tin riêng để phối hợp với hàng trăm nghìn tin nhắn trước khi bị phát hiện, và tự gọi mình là một bầy hay một tập thể.
Tổng giám đốc Hugging Face Clément Delangue gọi đây là cuộc tấn công mạng tự động đầu tiên do tác nhân AI thực hiện. Ông Amodei cảnh báo một nhóm tác nhân AI có năng lực cao hơn và cùng mức độ lệch chuẩn có thể gây thiệt hại thảm khốc, thậm chí chiếm quyền kiểm soát internet trong vòng sáu đến mười hai tháng.
Các sự cố này là bằng chứng cụ thể cho thấy tác nhân AI có thể tự phát hiện lỗ hổng, phối hợp và thực thi một chuỗi tấn công thực tế nằm ngoài tầm giám sát của con người, kể cả với chính các công ty tạo ra chúng. Một tiểu ban của Thượng viện Mỹ đã mở điều tra, và các dự luật về AI bắt đầu được thúc đẩy.
Giảm tốc hay khó thực thi
Câu hỏi lớn là liệu sự đồng thuận này có biến thành hành động hay không. Cùng những công ty đang kêu gọi giảm tốc vẫn đang đổ vốn khổng lồ và cạnh tranh gay gắt, trong bối cảnh Trung Quốc thu hẹp khoảng cách và cuộc đua hạ tầng chưa hạ nhiệt.
Cơ chế đánh giá viên độc lập với quyền truy cập ngang nhân viên là một đề xuất cụ thể và có thể kiểm chứng, nhưng chỉ có ý nghĩa nếu được ràng buộc chứ không dừng ở lời hứa.
Việc một nhà nghiên cứu Anthropic từ chức tuần trước vì không muốn tham gia một ngành mà anh cho là mất kiểm soát cho thấy sức ép nội bộ đang lớn dần. Ranh giới giữa một bước ngoặt thực chất và một động thái định vị hình ảnh sẽ phụ thuộc vào việc các cam kết có được luật hóa và giám sát hay không.
Với Việt Nam, làn sóng tác nhân AI tự động tấn công mạng là một tuyến rủi ro mới cần tính đến. Khi Việt Nam đẩy mạnh tham vọng AI theo Luật Trí tuệ nhân tạo 2025, mở rộng trung tâm dữ liệu và vừa áp dụng luật an ninh mạng mới, thì hạ tầng số, chuỗi cung ứng phần mềm và các nền tảng dữ liệu trong nước đều có thể trở thành mục tiêu của các tác nhân AI vượt kiểm soát, bất kể nguồn gốc.
Bởi vậy, Việt Nam có lý do để đưa rủi ro AI dạng tác nhân vào khung an ninh mạng và quản trị AI, đầu tư năng lực phòng thủ, đồng thời tham gia nỗ lực phối hợp toàn cầu mà giới lãnh đạo ngành đang kêu gọi.