Trang chủ / Cập nhật công nghệ

Microsoft: 8 bài học từ Red Teaming để bảo vệ AI tạo sinh cho doanh nghiệp

Trong bối cảnh AI tạo sinh đang thay đổi mọi ngành công nghiệp, việc đảm bảo an toàn và bảo mật cho công nghệ này là ưu tiên hàng đầu. Dựa trên kinh nghiệm tấn công giả lập (red team) hơn 100 sản phẩm AI tạo sinh từ năm 2018, Microsoft đã đúc kết những bài học quan trọng giúp các nhà lãnh đạo doanh nghiệp xác định và giảm thiểu rủi ro một cách hiệu quả.

Bài viết này tóm tắt những kinh nghiệm chính từ sách trắng của Microsoft, cung cấp các lời khuyên thực tế về AI red teaming và cách những nỗ lực này cải thiện sự an toàn và độ tin cậy của các ứng dụng AI như Microsoft Copilot.

AI red teaming là gì?

AI red teaming là hoạt động tấn công thử nghiệm vào các hệ thống AI để tìm kiếm các lỗ hổng bảo mật và rủi ro an toàn có thể gây hại cho người dùng. Khác với việc đo lường an toàn (safety benchmarking) truyền thống, red teaming tập trung vào việc kiểm tra toàn bộ hệ thống end-to-end — không chỉ các mô hình riêng lẻ. Cách tiếp cận toàn diện này cho phép các tổ chức giải quyết các rủi ro phát sinh từ sự tương tác giữa mô hình AI, dữ liệu đầu vào của người dùng và các hệ thống bên ngoài.

8 bài học từ kinh nghiệm thực tiễn của Microsoft

Từ kinh nghiệm của mình, đội ngũ AI Red Team (AIRT) của Microsoft đã xác định tám bài học chính có thể giúp các nhà lãnh đạo doanh nghiệp điều chỉnh các nỗ lực AI red teaming phù hợp với các rủi ro trong thế giới thực.

1. Hiểu rõ năng lực và ứng dụng của hệ thống

AI red teaming nên bắt đầu bằng việc hiểu cách một hệ thống AI có thể bị lạm dụng hoặc gây hại trong các kịch bản thực tế. Điều này có nghĩa là tập trung vào năng lực của hệ thống và nơi nó có thể được áp dụng, vì các hệ thống khác nhau có những lỗ hổng khác nhau dựa trên thiết kế và trường hợp sử dụng. Bằng cách xác định các rủi ro tiềm ẩn ngay từ đầu, các đội red team có thể ưu tiên các nỗ lực kiểm thử để phát hiện ra những điểm yếu phù hợp và có tác động nhất.

2. Các cuộc tấn công phức tạp không phải lúc nào cũng cần thiết

Tin tặc thường sử dụng các phương pháp đơn giản và thực tế, như tạo prompt thủ công và fuzzing (thử nghiệm với dữ liệu ngẫu nhiên), để khai thác điểm yếu trong hệ thống AI. Theo kinh nghiệm của Microsoft, các cuộc tấn công tương đối đơn giản nhắm vào điểm yếu trong hệ thống end-to-end có nhiều khả năng thành công hơn các thuật toán phức tạp chỉ nhắm vào mô hình AI cơ bản.

Ví dụ về kỹ thuật jailbreak bằng hình ảnh để lừa mô hình AI tạo ra nội dung độc hại.

3. AI red teaming không phải là đo lường an toàn (safety benchmarking)

Các rủi ro do hệ thống AI gây ra liên tục phát triển, với các vector tấn công và tác hại mới xuất hiện khi công nghệ tiến bộ. Các tiêu chuẩn đo lường an toàn hiện có thường không nắm bắt được những rủi ro mới này, vì vậy các đội red team phải xác định các loại tác hại mới và xem xét cách chúng có thể biểu hiện trong các ứng dụng thực tế.

4. Tận dụng tự động hóa để mở rộng quy mô

Tự động hóa đóng vai trò quan trọng trong việc mở rộng quy mô các nỗ lực AI red teaming bằng cách cho phép kiểm tra lỗ hổng nhanh hơn và toàn diện hơn. Ví dụ, các công cụ tự động (có thể được hỗ trợ bởi chính AI) có thể mô phỏng các cuộc tấn công tinh vi và phân tích phản hồi của hệ thống AI. Microsoft đã phát hành mã nguồn mở Python Risk Identification Tool (PyRIT) để tự động hóa các cuộc tấn công và đánh giá phản hồi của AI, giúp giảm công sức thủ công và tăng hiệu quả.

5. Yếu tố con người vẫn đóng vai trò then chốt

Mặc dù có lợi ích từ tự động hóa, sự phán đoán của con người vẫn rất cần thiết cho nhiều khía cạnh của AI red teaming, bao gồm ưu tiên rủi ro, thiết kế các cuộc tấn công cấp hệ thống và đánh giá các tác hại tinh vi. Nhiều rủi ro đòi hỏi chuyên môn sâu, hiểu biết văn hóa và trí tuệ cảm xúc để đánh giá.

6. Rủi ro về AI có trách nhiệm (Responsible AI) rất phổ biến nhưng phức tạp

Các tác hại như thiên vị (bias), độc hại (toxicity) và tạo ra nội dung bất hợp pháp thường chủ quan và khó đo lường hơn các rủi ro bảo mật truyền thống. Bằng cách kết hợp các công cụ tự động với sự giám sát của con người, các đội red team có thể xác định và giải quyết tốt hơn những rủi ro tinh vi này trong các ứng dụng thực tế.

Ví dụ về mô hình text-to-image củng cố định kiến giới, chỉ mô tả phụ nữ là thư ký trong khi sếp là nam giới.

7. LLM khuếch đại rủi ro bảo mật hiện có và tạo ra rủi ro mới

Hầu hết các đội AI red team đều quen thuộc với các cuộc tấn công nhắm vào lỗ hổng do mô hình AI gây ra, chẳng hạn như prompt injection (chèn mã độc vào câu lệnh) và jailbreak (bẻ khóa mô hình). Tuy nhiên, điều quan trọng không kém là phải xem xét các rủi ro bảo mật hiện có và cách chúng có thể biểu hiện trong các hệ thống AI, bao gồm các thư viện phụ thuộc lỗi thời, xử lý lỗi không đúng cách, và nhiều lỗ hổng đã biết khác như server-side request forgery (SSRF).

Sơ đồ minh họa lỗ hổng SSRF trong một ứng dụng AI tạo sinh xử lý video.

8. Công cuộc bảo mật hệ thống AI sẽ không bao giờ kết thúc

An toàn AI không chỉ là một vấn đề kỹ thuật; nó đòi hỏi kiểm thử mạnh mẽ, cập nhật liên tục và các quy định chặt chẽ để ngăn chặn các cuộc tấn công và củng cố hệ thống phòng thủ. Mặc dù không có hệ thống nào hoàn toàn không có rủi ro, việc kết hợp các tiến bộ kỹ thuật với các biện pháp chính sách và quy định có thể giảm đáng kể các lỗ hổng.

Xây dựng một tương lai AI an toàn hơn

AI red teaming là hoạt động thiết yếu để đảm bảo các hệ thống AI tạo sinh an toàn, bảo mật và có trách nhiệm hơn. Khi việc áp dụng AI ngày càng tăng, các tổ chức phải chủ động đánh giá rủi ro dựa trên các mối đe dọa trong thế giới thực. Bằng cách áp dụng các bài học quan trọng—như cân bằng giữa tự động hóa và giám sát của con người, giải quyết các tác hại về AI có trách nhiệm và ưu tiên các cân nhắc về đạo đức—red teaming giúp xây dựng các hệ thống không chỉ linh hoạt mà còn phù hợp với các giá trị xã hội.

👋 Hi! Bạn cần tư vấn gì về dịch vụ Microsoft?