đéo có hình chó nó tin
Địt Bùng Đạo Tổ
Anthropic vừa khiến giới công nghệ một phô hú vía khi tiết lộ sự cố "đi nhầm địa chỉ" dở khóc dở cười. Ba mô hình AI của hãng, gồm Claude Opus 4.7, Claude Mythos 5 và một mô hình nghiên cứu nội bộ, đã vô tình "vượt rào" ra ngoài Internet để gõ cửa hạ tầng của ba tổ chức thực tế. Đáng nói ở chỗ, các "thí sinh" AI này không hề được giao nhiệm vụ đi phá hoại đời thực, mà chỉ đang tham gia bài thi Capture The Flag - CTF trong một môi trường được cam kết là mô phỏng kín kẽ.

Nguyên nhân được xác định là do lỗi cấu hình khiến môi trường đánh giá vốn được cho là tách biệt hoàn toàn với Internet lại vẫn có thể kết nối ra bên ngoài. Tin rằng mình vẫn đang hoạt động trong hệ thống thử nghiệm, các mô hình tiếp tục thực hiện nhiệm vụ được giao và coi các mục tiêu thực trên Internet là một phần của bài kiểm tra.
Mức độ "nhập vai" của từng mô hình cũng khiến người ta phải giật mình. Claude Opus 4.7 đã vượt rào thành công vào hạ tầng của một công ty thật, thu thập thông tin đăng nhập và truy cập cơ sở dữ liệu sản xuất. Chưa dừng lại ở đó, Claude Mythos 5 còn tự khởi tạo rồi tải một gói phần mềm "bẫy" lên kho thư viện PyPI công khai nhằm phục vụ mục tiêu trong bài kiểm tra. Hậu quả là gói phần mềm này được một loạt hệ thống thực tải về, trong đó có cả một công ty an ninh mạng. Trớ trêu ở chỗ, hệ thống vốn được dùng để phát hiện phần mềm độc hại lại đánh giá gói này là an toàn và cho phép cài đặt. Riêng mô hình nghiên cứu nội bộ thì quét hơn 9.000 mục tiêu trên Internet, khai thác thành công một ứng dụng thực rồi mới tự dừng lại khi nhận ra mục tiêu nằm ngoài môi trường thử nghiệm.
Anthropic nhấn mạnh đây không phải trường hợp AI tự ý "vượt ngục" hay tìm cách thoát khỏi môi trường kiểm soát. Các mô hình đơn giản chỉ đang cố gắng hoàn thành nhiệm vụ được giao trong một môi trường bị cấu hình sai. Đáng chú ý, các thế hệ AI mới hơn cho thấy khả năng nhận biết tình huống tốt hơn khi có xu hướng dừng hoạt động ngay sau khi phát hiện mình đang tương tác với hệ thống thực.
Sự cố xuất hiện không lâu sau khi OpenAI cũng công bố một trường hợp mô hình AI trong quá trình thử nghiệm đã thoát khỏi môi trường sandbox và truy cập vào hệ thống của Hugging Face. Những diễn biến này cho thấy các mô hình AI hiện đại không còn chỉ dừng ở việc tạo nội dung hay viết mã, mà đã có thể thực hiện những chuỗi hành động phức tạp tương tự một chuyên gia an ninh mạng.
Nghe có phần giống một vụ "đi nhầm địa chỉ" của AI, nhưng phía sau đó là bài toán an toàn ngày càng đáng quan tâm. Khi các mô hình có khả năng tự tìm mục tiêu, tự phân tích và tự thực hiện nhiều bước liên tiếp, một hệ thống để lộ mật khẩu yếu, dịch vụ cấu hình sơ sài hoặc chậm cập nhật bản vá có thể nhanh chóng trở thành mục tiêu. Và nếu ngay cả một AI đang làm bài kiểm tra cũng có thể tìm thấy những cánh cửa chưa khóa ấy, thì các đối tượng tấn công thực sự chắc chắn sẽ không mất nhiều thời gian hơn.

Nguyên nhân được xác định là do lỗi cấu hình khiến môi trường đánh giá vốn được cho là tách biệt hoàn toàn với Internet lại vẫn có thể kết nối ra bên ngoài. Tin rằng mình vẫn đang hoạt động trong hệ thống thử nghiệm, các mô hình tiếp tục thực hiện nhiệm vụ được giao và coi các mục tiêu thực trên Internet là một phần của bài kiểm tra.
Mức độ "nhập vai" của từng mô hình cũng khiến người ta phải giật mình. Claude Opus 4.7 đã vượt rào thành công vào hạ tầng của một công ty thật, thu thập thông tin đăng nhập và truy cập cơ sở dữ liệu sản xuất. Chưa dừng lại ở đó, Claude Mythos 5 còn tự khởi tạo rồi tải một gói phần mềm "bẫy" lên kho thư viện PyPI công khai nhằm phục vụ mục tiêu trong bài kiểm tra. Hậu quả là gói phần mềm này được một loạt hệ thống thực tải về, trong đó có cả một công ty an ninh mạng. Trớ trêu ở chỗ, hệ thống vốn được dùng để phát hiện phần mềm độc hại lại đánh giá gói này là an toàn và cho phép cài đặt. Riêng mô hình nghiên cứu nội bộ thì quét hơn 9.000 mục tiêu trên Internet, khai thác thành công một ứng dụng thực rồi mới tự dừng lại khi nhận ra mục tiêu nằm ngoài môi trường thử nghiệm.
Anthropic nhấn mạnh đây không phải trường hợp AI tự ý "vượt ngục" hay tìm cách thoát khỏi môi trường kiểm soát. Các mô hình đơn giản chỉ đang cố gắng hoàn thành nhiệm vụ được giao trong một môi trường bị cấu hình sai. Đáng chú ý, các thế hệ AI mới hơn cho thấy khả năng nhận biết tình huống tốt hơn khi có xu hướng dừng hoạt động ngay sau khi phát hiện mình đang tương tác với hệ thống thực.
Sự cố xuất hiện không lâu sau khi OpenAI cũng công bố một trường hợp mô hình AI trong quá trình thử nghiệm đã thoát khỏi môi trường sandbox và truy cập vào hệ thống của Hugging Face. Những diễn biến này cho thấy các mô hình AI hiện đại không còn chỉ dừng ở việc tạo nội dung hay viết mã, mà đã có thể thực hiện những chuỗi hành động phức tạp tương tự một chuyên gia an ninh mạng.
Nghe có phần giống một vụ "đi nhầm địa chỉ" của AI, nhưng phía sau đó là bài toán an toàn ngày càng đáng quan tâm. Khi các mô hình có khả năng tự tìm mục tiêu, tự phân tích và tự thực hiện nhiều bước liên tiếp, một hệ thống để lộ mật khẩu yếu, dịch vụ cấu hình sơ sài hoặc chậm cập nhật bản vá có thể nhanh chóng trở thành mục tiêu. Và nếu ngay cả một AI đang làm bài kiểm tra cũng có thể tìm thấy những cánh cửa chưa khóa ấy, thì các đối tượng tấn công thực sự chắc chắn sẽ không mất nhiều thời gian hơn.
Claude làm bài kiểm tra, doanh nghiệp thật bất ngờ thành đề thi
Anthropic vừa khiến giới công nghệ một phô hú vía khi tiết lộ sự cố "đi nhầm địa chỉ" dở khóc dở cười. Ba mô hình AI của hãng, gồm Claude Opus 4.7, Claude Mythos 5 và một mô hình nghiên cứu nội bộ, đã vô tình "vượt rào" ra ngoài Internet để gõ cửa hạ tầng của ba tổ chức thực tế. Đáng nói ở chỗ...
vnreview.vn