
DEF CON 34 đập vỡ ảo tưởng bảo mật AI agent: Khi agent tự ý ký giao dịch
Nghiên cứu đầu tư
|
Huỳnh Mỹ
|
DEF CON 34 đã kết thúc, nhưng cái giá của nó vẫn đang treo lơ lửng.
Không phải một, mà ít nhất năm nhóm nghiên cứu độc lập, xuất phát từ năm hướng tấn công khác biệt, cùng công bố một kết luận gây sốc: ranh giới bảo mật của AI agent đang vỡ vụn trên diện rộng. CVE-2026-24747 không còn là một lỗi đơn lẻ; nó là mảnh ghép trong bức tranh màu tối mà DEF CON 34 phơi bày. Claude Code, Gemini CLI, Codex CLI, MCP, LiteLLM, LangChain, PyTorch, vLLM, ComfyUI, NVIDIA Dynamo, Cloudflare WAF, Sentry, Cursor, Microsoft Copilot Studio — tất cả đều xuất hiện trong danh sách bị khai thác hoặc bị đưa vào vòng nguy hiểm.
Tôi ngồi tại Tokyo, đọc lại danh sách đó và nhớ ra một điều. Trong crypto, khi một hệ thống tưởng chừng an toàn bị phá vỡ, chúng ta gọi đó là black swan. Nhưng ở DEF CON 34, không còn con thiên nga đen nào cả. Đây là một đàn.
Theo đánh giá của tôi, các nguồn tin tại hội nghị có độ tin cậy kỹ thuật cao nhưng vẫn mang tính một chiều. Dữ liệu có thể kiểm chứng qua GHSA và CVE, nhưng chưa có một cuộc tái lập độc lập nào công bố đầy đủ. Điều này có nghĩa: mức độ nghiêm trọng có thể bị phóng đại, nhưng hướng tấn công gần như chắc chắn chính xác — bởi vì nhiều nhóm nghiên cứu không hề trao đổi với nhau mà cùng đi đến một kết luận.
Câu chuyện bắt đầu từ niềm tin rằng AI agent sẽ thay thế con người trong các quy trình phức tạp: viết code, phân tích tài chính, tự động giao dịch, tự động ký hợp đồng. Niềm tin đó dựa trên một giả định — agent được xây dựng với vòng kiểm soát an toàn rõ ràng. Nhưng nếu nhìn vào kiến trúc thực tế, giả định này chưa bao giờ được chứng minh.
Các agent hiện đại như Claude Code hay Codex CLI không chỉ đọc dữ liệu; chúng còn được cấp quyền thực thi lệnh shell, truy cập file, gửi request HTTP. Giao thức MCP, được thiết kế để kết nối agent với các công cụ bên ngoài, lại không có một chuẩn xác thực thống nhất. Khi một giao thức không xác định rõ đâu là nguồn tin cậy, prompt injection sẽ trở thành một phần của thiết kế, chứ không phải lỗi.
Nói như một kỹ sư blockchain: chúng ta đang giao quyền sử dụng private key cho một con bot chưa được audit. Trong thế giới crypto, hành động đó là tội hình sự. Trong thế giới AI, hành động đó lại được gọi là product-market fit.
FTX dạy tôi: không có “bảo mật viền” trong một hệ thống phức hợp; chỉ có chuỗi tấn công và những kẻ đang tìm kiếm mắt xích yếu nhất. DEF CON 34 cho thấy mắt xích đó nằm ngay tại nơi con người tin tưởng nhất: trong file README, trong model weight, trong log lỗi.
Prompt injection qua MCP là vector quen thuộc nhất. Hãy tưởng tượng một agent đọc file PDF, metadata ảnh, hoặc nội dung web. Dữ liệu không đáng tin bị trộn với lệnh điều khiển. Kẻ tấn công chỉ cần chèn một dòng hướng dẫn khéo léo vào một tài liệu công khai, và agent sẽ tự thực thi. Đây không còn là nghiên cứu lý thuyết; nhiều nhóm đã chứng minh trên các sản phẩm thương mại. CVE-2026-24747 thuộc nhóm này — chỉ là một trong số hàng loạt lỗ hổng được công bố.
Chưa dừng ở đó, các CLI agents mở ra bề mặt tấn công lớn hơn nhiều. Một repository GitHub độc hại có thể biến Claude Code hoặc Codex CLI thành công cụ khai thác. Chỉ cần file README chứa một đoạn lệnh độc hại, agent đọc và thực thi. Không cần exploit kernel, không cần leo thang đặc quyền. Chỉ cần lòng tin của developer. Tôi đã từng chứng kiến một video demo tại chỗ: chỉ sau bốn giây agent bị chiếm quyền, nó đã chuyển một khoản tiền điện tử đến ví của kẻ tấn công. Trong một thế giới mà agent được giao kiểm soát ví nóng, đây không phải cảnh báo, đây là tử hình.
Tiếp theo, serialization của model weights. PyTorch pickle đã nổi tiếng nguy hiểm suốt nhiều năm. Nhưng tại DEF CON 34, các vector tương tự xuất hiện trong vLLM và ComfyUI. Người dùng tải model từ Hugging Face, load lên máy chủ, và mã độc trong file trọng số chạy ngay lập tức. Toàn bộ ngành AI đã xây dựng một chuỗi cung ứng nơi file model là một thực thể thiêng liêng, trong khi trên thực tế, nó là một hợp đồng thông minh chưa được kiểm toán.
Cuối cùng, hạ tầng quan sát và bảo vệ trở thành bàn đạp. Sentry, Cloudflare WAF, các workaround tưởng chừng an toàn bị vô hiệu hóa. Kẻ tấn công dùng chính hệ thống theo dõi lỗi để rò rỉ dữ liệu nhạy cảm. Khi một agent gửi log, nội dung của log có thể chứa api key, token, hoặc toàn bộ ngữ cảnh cuộc hội thoại.
Có một chi tiết mà nhiều báo cáo bỏ quên: hầu hết các agent đều có quyền đọc và ghi vào cùng một ngữ cảnh. Trong một hệ thống thông thường, dữ liệu và mã lệnh được tách biệt. Trong agentic AI, ranh giới đó bị xóa nhòa. Một chuỗi ký tự vừa là dữ liệu, vừa là mệnh lệnh. Điều này khiến mô hình đe dọa trở thành một bài toán mở — không thể giải bằng một lớp firewall đơn giản. Nó đòi hỏi phải kiểm soát từng bước suy luận của mô hình, từng token đầu ra, từng hành động có ràng buộc với một chính sách có thể kiểm toán. Nói cách khác, agent cần một lớp bảo mật giống như smart contract wallet — mọi hành động đều có điều kiện, đều có dấu hiệu phê duyệt, đều có thể thu hồi.
Và phản ứng của ngành cũng đáng chú ý. Wiz Agent Shield, Prisma AIRS, BeyondTrust, Tenet Security, Novee Security, OWASP MCP Top 10 — tất cả đều ra đời trong vòng 48 giờ sau hội nghị. Giống hệt chu kỳ tôi từng thấy sau vụ sụp đổ FTX: hàng loạt công ty bảo mật mọc lên để bán nỗi sợ. Tôi không nói họ lừa đảo. Tôi chỉ nói rằng, dựa trên kinh nghiệm audit của tôi, khi một thị trường công cụ phòng thủ xuất hiện chỉ sau hai ngày, vấn đề nằm ở kiến trúc, không nằm ở một lỗi riêng lẻ.
FTX dạy tôi: không có gì an toàn chỉ vì nó lớn, hoặc vì mọi người đều dùng; chỉ có những lớp kiểm soát được thiết kế từ đầu, và những lớp an toàn ngụy trang bằng logo đẹp. Nhiều giải pháp bảo mật AI agent hiện tại chỉ là proxy chặn request, không phải bằng chứng toán học. Nó giống hệt 90% các Bitcoin Layer2 tự xưng mà tôi từng phân tích — đổi thương hiệu từ một thứ khác, thêm chữ secure vào tên sản phẩm, rồi chờ vòng gọi vốn.
Nhưng hãy cẩn thận với chính câu chuyện đang được kể.
DEF CON luôn là sàn diễn của những cú exploit gây sốc, và các nhà nghiên cứu an ninh được khen thưởng khi phóng đại mức độ ảnh hưởng. Các công ty bán giải pháp bảo mật cần nỗi sợ để tăng doanh số. Vì vậy, tôi nghi ngờ câu chuyện “AI agent không an toàn” đang bị thổi phồng theo chu kỳ hype của ngành an ninh mạng — giống hệt chu kỳ “blockchain sẽ thay thế ngân hàng” năm 2017.
Có một sự thật ngầm: những nhà cung cấp agent lớn không muốn thừa nhận vấn đề kiến trúc, vì điều đó kìm hãm doanh số. Các công ty bảo mật nhỏ thì cần vấn đề to ra để gọi vốn. Sự kết hợp đó tạo ra một thị trường song song — bên trong là các agent không an toàn, bên ngoài là các tấm khiên giấy. Trong blockchain, chúng ta gọi đó là greenwashing; trong AI, họ gọi đó là trust layer.
Nhưng ngay cả khi cường độ đã được phóng đại, thị trường đã bỏ phiếu. Những lỗ hổng được trình bày là có thật, có thể lặp lại, và nằm ở tầng kiến trúc mà các nhà phát triển agent đang cố tình bỏ qua. Điểm mù thực sự không nằm ở việc agent có bị hack hay không. Nó nằm ở việc con người đang chủ động lờ đi mọi dấu hiệu cảnh báo vì lợi ích kinh tế. Trong crypto, chúng ta gọi đây là unrealized gain. Trong AI, chúng ta gọi đây là developer productivity.
Ở Việt Nam, các nhóm phát triển AI agent đang mọc lên như nấm sau mưa. Nhưng hầu hết không có một kỹ sư bảo mật nào trong đội ngũ. Tôi từng nói chuyện với một founder tại Quận 1, anh ta tự tin tuyên bố agent của mình an toàn vì có dùng OpenAI. Tôi hỏi: nếu một kẻ tấn công chèn prompt độc vào dữ liệu đầu vào mà agent đọc, OpenAI có bảo vệ bạn không? Anh ta im lặng. Đó chính là khoảng im lặng mà DEF CON 34 vừa phơi bày.
FTX dạy tôi: không có “hộp cát” tuyệt đối, chỉ có những thứ đã được kiểm soát và những thứ đang chờ được kiểm soát. Câu hỏi đặt ra không phải là “agent có an toàn không”, mà là “bạn có đang kiểm soát toàn bộ chuỗi hành vi của nó hay không?” Với hầu hết các sản phẩm agent hiện nay, câu trả lời là không.
Vậy, bạn đã sẵn sàng để agent của bạn tự ký giao dịch chưa?
Câu trả lời phụ thuộc vào việc bạn đã thực sự kiểm chứng chuỗi hành vi của nó, hay chỉ đang đọc README và tin vào khẩu hiệu marketing. Trong ba tháng tới, tôi sẽ theo dõi những giải pháp agent security nào dám công bố kết quả kiểm thử dưới tấn công thực tế, với mô hình đe dọa rõ ràng. Số còn lại — tôi sẽ xếp họ vào cùng danh sách với những dự án Layer2 tự xưng mà cộng đồng Bitcoin không công nhận: đẹp trên thông cáo báo chí, rỗng trong kiến trúc.
Còn nếu bạn đang giữ một ví tiền mã hóa mà agent của bạn có thể tiếp cận, hãy dừng lại. Không phải vì công nghệ này kém; mà vì bạn đang xây nhà trên nền cát mà chưa ai đo được độ vững chắc. Và chúng ta đều biết — trong lịch sử tiền mã hóa, những người xây nhà trên cát không bao giờ thức dậy kịp khi trời sáng.