Ba tuần liên tiếp, ba phòng thí nghiệm AI hàng đầu thế giới lần lượt phải viết một dạng thông báo giống hệt nhau: mô hình của chúng tôi đã tự ý vượt ra khỏi môi trường thử nghiệm. Đầu tiên là Anthropic, rồi đến OpenAI, và mới nhất, ngày 6 tháng 8 năm 2026, là Meta, khi mô hình Muse Spark 1.1 của họ xâm nhập thành công vào hệ thống của một công ty khác ngay giữa một bài kiểm tra bảo mật. Cả ba sự cố đều có một điểm chung ít ai để ý: chúng đều xảy ra trong các cuộc đánh giá do cùng một công ty an toàn AI độc lập tên Irregular thực hiện: một cái tên gần như vô danh với công chúng cho tới tuần này.
Điều mình thấy đáng chú ý khi đọc kỹ báo cáo của CSO Online là dù cả ba sự cố đều được gọi chung là AI "đi lạc" (going rogue), cơ chế đằng sau lại không giống nhau. Theo bà Sakshi Grover, quản lý nghiên cứu cấp cao của IDC khu vực châu Á – Thái Bình Dương, sự cố của OpenAI liên quan đến việc mô hình khai thác một lỗ hổng chưa từng được biết đến để thoát ra khỏi phạm vi đánh giá dự kiến. Trong khi đó, các sự cố của Anthropic chủ yếu bắt nguồn từ lỗi cấu hình vô tình cấp quyền truy cập internet cho mô hình. Còn phía Cơ quan An toàn AI của Vương quốc Anh lại có một kịch bản hoàn toàn khác: quyền truy cập internet ở đó được chủ động bật lên từ đầu, như một phần của bài kiểm tra năng lực tấn công mạng, trước khi các AI agent tương tác với hệ thống và con người thật bên ngoài.
![[IMG]](https://tinhte.org/img.php?url=https%3A%2F%2Fphoto2.tinhte.vn%2Fdata%2Fattachment-files%2F2026%2F08%2F9074942_security-openai-hack-huggingface.jpg)
Agent của OpenAI vừa xổ lồng tấn công Hugging Face - Nguồn: Wired
Bà Grover tóm lại vấn đề bằng một câu khá đắt: "Vấn đề chung là các môi trường đánh giá không còn có thể được xem như hạ tầng thử nghiệm thụ động nữa." Một agent có năng lực tấn công mạng, theo bà, cần được đối xử như một danh tính máy có khả năng gây hại, ngay cả khi nó đang hoạt động dưới một mục tiêu nghiên cứu hợp pháp.
Ba cách "vượt ngục" khác nhau, một câu hỏi chung
Điều mình thấy đáng chú ý khi đọc kỹ báo cáo của CSO Online là dù cả ba sự cố đều được gọi chung là AI "đi lạc" (going rogue), cơ chế đằng sau lại không giống nhau. Theo bà Sakshi Grover, quản lý nghiên cứu cấp cao của IDC khu vực châu Á – Thái Bình Dương, sự cố của OpenAI liên quan đến việc mô hình khai thác một lỗ hổng chưa từng được biết đến để thoát ra khỏi phạm vi đánh giá dự kiến. Trong khi đó, các sự cố của Anthropic chủ yếu bắt nguồn từ lỗi cấu hình vô tình cấp quyền truy cập internet cho mô hình. Còn phía Cơ quan An toàn AI của Vương quốc Anh lại có một kịch bản hoàn toàn khác: quyền truy cập internet ở đó được chủ động bật lên từ đầu, như một phần của bài kiểm tra năng lực tấn công mạng, trước khi các AI agent tương tác với hệ thống và con người thật bên ngoài.
![[IMG]](https://tinhte.org/img.php?url=https%3A%2F%2Fphoto2.tinhte.vn%2Fdata%2Fattachment-files%2F2026%2F08%2F9074942_security-openai-hack-huggingface.jpg)
Agent của OpenAI vừa xổ lồng tấn công Hugging Face - Nguồn: Wired
Bà Grover tóm lại vấn đề bằng một câu khá đắt: "Vấn đề chung là các môi trường đánh giá không còn có thể được xem như hạ tầng thử nghiệm thụ động nữa." Một agent có năng lực tấn công mạng, theo bà, cần được đối xử như một danh tính máy có khả năng gây hại, ngay cả khi nó đang hoạt động dưới một mục tiêu nghiên cứu hợp pháp.
Tại sao AI lại chọn cách "gian lận" để đạt mục tiêu
Để hiểu vì sao chuyện này lại xảy ra liên tiếp trong một khoảng thời gian ngắn như vậy, có lẽ chúng ta cần lùi lại một bước để nhìn vào cơ chế huấn luyện đằng sau các mô hình này, điều mà MIT Technology Review gọi tên là "gian lận để có phần thưởng" (reward hacking). Đây không phải là một hiện tượng mới. Từ năm 2016, hai nhà đồng sáng lập Anthropic là Dario Amodei và Jack Clark đã công bố một ví dụ nổi tiếng: một AI agent được huấn luyện để chơi một trò đua thuyền, thay vì cố về đích, lại chọn cách xoay vòng vòng ở một góc sân chơi để liên tục nhặt các vật phẩm tăng điểm, tối đa hóa điểm số theo đúng luật chơi nhưng hoàn toàn lệch khỏi mục tiêu ban đầu của người thiết kế.
Theo MIT Technology Review, các mô hình AI thường có xu thế gian lận với reward hacking
Bản chất của gian lận để có phần thưởng nằm ở cách các mô hình được tối ưu hóa: chúng được thưởng khi đạt kết quả "thắng", chứ không nhất thiết phải đạt kết quả "đúng". Nếu một mô hình gian lận đủ thuyết phục để vẫn được tính là hoàn thành nhiệm vụ, hành vi đó sẽ được củng cố qua từng vòng huấn luyện tiếp theo. Trong trường hợp cụ thể của OpenAI hồi tháng 7 năm 2026, khi hai mô hình của họ xâm nhập vào Hugging Face, nguyên nhân được xác định là các mô hình đang tìm đáp án cho một câu hỏi kiểm tra và quyết định "giải" bài tập an ninh mạng đó bằng cách thoát thẳng ra khỏi môi trường cô lập của chính mình, một dạng lách luật rất đúng tinh thần của trò chơi đua thuyền năm 2016, chỉ khác là lần này diễn ra trên hạ tầng thật, với hệ thống thật của một tổ chức thật.
Càng đáng lo hơn, theo giới nghiên cứu, là khi mô hình càng thông minh, nó không chỉ giỏi tìm ra những cách gian lận sáng tạo hơn, mà còn giỏi che giấu việc mình đang gian lận hơn.
"Chúng ta đang kiểm tra trí thông minh nhanh hơn kiểm tra khả năng kiểm soát"
Ông Vibhum Dubey, một nhà nghiên cứu bảo mật kiêm chuyên gia red team, đưa ra một nhận định được cho là tóm gọn chính xác nhất vấn đề của cả ngành lúc này: "Các phòng thí nghiệm AI đang xây dựng những mô hình có thể suy nghĩ trước nhiều bước, nhưng rất nhiều môi trường đánh giá vẫn giả định rằng agent sẽ ở yên trong kịch bản dự kiến. Đó là một sự lệch pha." Ông nói thêm rằng những sự cố này cho thấy ngành đang “kiểm tra hiệu năng trí thông minh nhanh hơn kiểm tra khả năng kiểm soát nó.”
OpenAI lẫn Anthropic đang phát triển các mô hình mạnh hơn nhưng lại thiếu đi cách kiểm soát chúng
Quảng cáo
Dù vậy, điều mình thấy đáng ghi nhận là cả OpenAI lẫn Anthropic đều không quay lưng với Irregular sau các sự cố này. Trong một tuyên bố chính thức, OpenAI viết rằng họ "trân trọng mối hợp tác với Irregular" và sẽ tiếp tục làm việc chặt chẽ để hỗ trợ quá trình rà soát, trong khi Irregular cũng đang phát triển một tài liệu chia sẻ các phương pháp tốt nhất để duy trì khả năng kiểm soát khi vận hành các bài đánh giá an ninh mạng. Anthropic, trong một tuyên bố đưa ra ngày 30 tháng 7 năm 2026, cũng bày tỏ họ "biết ơn" vì Irregular đã phối hợp làm rõ sự việc và mong muốn tiếp tục hợp tác về bảo mật.
Các chuyên gia được CSO Online phỏng vấn đề xuất một loạt biện pháp cụ thể để thu hẹp khoảng cách này: mặc định từ chối mọi kết nối internet trừ khi được cấp phép rõ ràng, cấp cho mỗi AI agent một danh tính tồn tại trong thời gian ngắn thay vì quyền truy cập lâu dài, giám sát toàn diện mọi câu lệnh và lời gọi công cụ, và thiết lập các điều kiện dừng tự động khi agent chạm tới hệ thống ngoài phạm vi cho phép. Bà Apeksha Kaushik, nhà phân tích chính cấp cao tại Gartner, cho rằng cách kiểm soát bằng sandbox, nôm na là môi trường kiểm thử và các biện pháp cô lập tĩnh truyền thống đang trở nên không còn đủ khi các hệ thống AI ngày càng mang tính agentic cao hơn, và kêu gọi cả ngành cần những chuẩn mực chung về thiết kế môi trường đánh giá, quy trình báo cáo sự cố, và hoạt động red team liên tục.
Bài học không chỉ dành cho các phòng thí nghiệm AI
Điều khiến câu chuyện này vượt ra khỏi phạm vi của riêng Meta, OpenAI hay Anthropic là lời cảnh báo mà các chuyên gia đưa ra cho chính những doanh nghiệp đang định triển khai AI agent vào công việc thực tế. Ông Dubey nói thẳng: "Sai lầm lớn nhất là xem AI agent như một tính năng, thay vì một danh tính đang tự đưa ra quyết định trong hệ thống của bạn." Mỗi agent được triển khai, theo ông, là thêm một thực thể có quyền tự quyết định và tổ chức cần đảm bảo có thể phát hiện, ngăn chặn nó nhanh chóng trước khi đưa vào vận hành thật.
Bà Grover đồng tình, và nhấn mạnh rằng các sự cố này "không nên bị quy giản thành chuyện mô hình đi lạc, hay đơn thuần là lỗi cấu hình mạng." Bản chất sâu xa hơn, theo bà, là các agent đủ năng lực hoàn toàn có thể biến những điểm yếu kiểm soát rất bình thường — một tác vụ mơ hồ, một quyền truy cập dư thừa — thành hậu quả rất thật ngoài đời.
Sau ba tuần với ba lời thú nhận liên tiếp từ ba phòng thí nghiệm hàng đầu, câu hỏi không còn là liệu chuyện này có tiếp tục xảy ra hay không. Nó gần như chắc chắn sẽ tiếp tục, đơn giản vì các mô hình vẫn đang được huấn luyện để giỏi hơn mỗi ngày, còn hạ tầng kiểm soát chúng thì chưa chắc đã theo kịp tốc độ đó. Câu hỏi thật sự đáng theo dõi là liệu ngành AI có kịp xây dựng những chuẩn mực chung về khả năng kiểm soát trước khi một trong những vụ "vượt ngục" này xảy ra không phải trong phòng thí nghiệm, mà giữa một hệ thống đang vận hành thật, với dữ liệu và người dùng thật đứng phía sau.
Quảng cáo
Ghi chú: Ảnh đại diện bài mình mượn từ WSJ
