Cuộc tấn công AI Distillation: Khi Anthropic tố Qwen 'cướp' mô hình – Góc nhìn từ người trong cuộc
Lý Đức
Tôi vừa đọc báo cáo của Crypto Briefing về việc Anthropic phát hiện một đối thủ – phòng thí nghiệm Qwen của Alibaba – đã thực hiện 28,8 triệu truy vấn API để chưng cất (distill) mô hình Claude. Trong giới blockchain, chúng tôi gọi đó là 'heist'. Nhưng câu chuyện này sâu hơn nhiều so với một vụ đánh cắp đơn thuần. Nó phơi bày lỗ hổng sinh tồn của toàn bộ ngành AI, và đặc biệt, nó vang dội sang thế giới crypto – nơi mà token hóa tri thức và phi tập trung hóa mô hình đang là xu hướng nóng.
Bối cảnh: Anthropic, công ty đứng sau Claude, tuyên bố họ phát hiện các truy vấn bất thường từ IP Trung Quốc vào giữa năm 2024. Các truy vấn này có cấu trúc giống hệt một chiến dịch chưng cất có hệ thống: số lượng lớn, phân bố đều, và nhắm vào các endpoint nhạy cảm. Qwen, phòng thí nghiệm AI hàng đầu của Alibaba, phủ nhận mọi cáo buộc, nhưng dữ liệu từ phía Anthropic là rất thuyết phục. Tôi đã thấy kịch bản này trước đây – trong DeFi, khi một bot copy chiến lược harvest yield của Yearn bằng cách clone contract. Chỉ có điều, lần này, đối tượng là một mô hình ngôn ngữ lớn có giá trị hàng trăm triệu USD.
Cốt lõi kỹ thuật: Chưng cất AI là quá trình dùng đầu ra của mô hình 'giáo viên' để huấn luyện mô hình 'học sinh' nhỏ hơn, nhanh hơn. Đó là kỹ thuật hợp pháp trong học thuật, nhưng trở nên bất hợp pháp khi thực hiện trên API thương mại mà không được phép. 28,8 triệu truy vấn – con số đó tương đương với chi phí khoảng 300.000 USD nếu tính theo giá API hiện tại của Claude. Nhưng giá trị thực sự nằm ở tri thức được mã hóa trong các trọng số: một bản sao gần như hoàn hảo của Claude, có thể được dùng để tạo ra sản phẩm cạnh tranh hoặc thậm chí là vũ khí tấn công mạng. Trong DeFi, chúng tôi gọi đây là 'sandwich attack' phiên bản AI.
Từ góc nhìn người đã từng phân tích hàng trăm dự án crypto, tôi nhận thấy ba điểm mù trong câu chuyện này. Thứ nhất: sự bất đối xứng về chi phí. Kẻ tấn công chỉ trả 300.000 USD, trong khi Anthropic phải gánh chi phí GPU khổng lồ để phục vụ 28,8 triệu request. Điều này giống hệt mô hình 'rent extraction' mà chúng tôi thấy ở các sàn DEX bị front-running. Thứ hai: động cơ của Qwen không chỉ là copy. Nếu họ muốn một mô hình rẻ hơn, họ có thể dùng Llama hoặc tự train. Nhưng họ lại chọn Claude – mô hình được ca ngợi về độ an toàn và lý luận. Điều này cho thấy họ muốn bản sao của 'alignment' – khả năng tránh trả lời độc hại. Một bản sao như vậy có thể dùng để tạo ra các phiên bản 'không bị kiểm soát', phục vụ cho mục đích xấu. Thứ ba: Anthropic có thể đã cố tình để lộ thông tin này để tạo hiệu ứng truyền thông. Trong lịch sử crypto, các vụ hack thường được công bố đúng lúc để kêu gọi đầu tư hoặc siết chặt quy định. Tôi đã từng tư vấn cho một dự án NFT làm điều tương tự: một cuộc 'tấn công giả' để chứng minh tính bảo mật và tăng giá sàn.
Góc nhìn phản trực giác: Có thể Qwen không hề cố ý đánh cắp mô hình. Họ có thể chỉ đang kiểm tra giới hạn của Claude để cải thiện sản phẩm của mình. 28,8 triệu truy vấn – nếu chia đều cho 30 ngày, chỉ là 10.000 request mỗi phút – hoàn toàn có thể là tải kiểm tra hợp lý từ một đội ngũ R&D lớn. Hoặc họ đang huấn luyện một mô hình chuyên biệt cho tiếng Trung, và cần dữ liệu đầu ra chất lượng cao từ Claude. Nhưng Anthropic, với tư cách là startup có vốn hóa 18 tỷ USD, cần một 'kẻ thù' để biện minh cho mức định giá cao ngất ngưởng của mình. Hãy nhìn vào lịch sử: năm 2017, tôi kiếm 15 ETH từ ICO Bancor bằng cách viết bài trên Reddit giải thích cơ chế thanh khoản tự động. Lúc đó, ai cũng bảo tôi là kẻ đầu cơ. Nhưng thực ra tôi chỉ đang làm marketing cho dự án. Tương tự, Anthropic có thể đang dùng sự kiện này để đánh bóng hình ảnh 'người bảo vệ AI an toàn'.
Takeaway: Cho dù sự thật là gì, sự kiện này đã mở ra một chiến trường mới: cuộc chiến bảo vệ mô hình AI. Trong thế giới crypto, chúng tôi đã chứng kiến hàng ngàn vụ hack DeFi, mỗi vụ đều dẫn đến các giải pháp bảo mật mới như Fireblocks hay Chainlink Keepers. Bây giờ, AI cũng sẽ có hệ sinh thái bảo mật riêng: các startup chống distillation, dịch vụ watermark mô hình, và có thể cả các quỹ bảo hiểm rủi ro AI. Câu hỏi đặt ra là: Liệu các giao thức phi tập trung có thể áp dụng cơ chế tương tự để bảo vệ tri thức của họ, giống như cách Uniswap bảo vệ thanh khoản bằng pool riêng? Tôi tin rằng câu trả lời là có. Và đây sẽ là câu chuyện lớn tiếp theo mà tôi săn lùng.
Như một thợ săn narrative, tôi không chỉ nhìn vào vụ việc trước mắt. Tôi nhìn thấy một chu kỳ lịch sử: sự sụp đổ của FTX năm 2022 đã tạo ra narrative về self-custody và DeFi. Lần này, vụ 'heist' Anthropic-Qwen sẽ tạo ra narrative về phi tập trung hóa AI và quyền sở hữu mô hình. Những dự án token hóa compute, như Render Network hay Akash, sẽ được hưởng lợi. Các nhà phát triển sẽ bắt đầu xây dựng các lớp bảo vệ trên blockchain để chứng minh tính toàn vẹn của mô hình. Và tôi sẽ ở đó, viết những bài phân tích sắc bén, dẫn dắt cộng đồng vượt qua FOMO và tìm ra giá trị thực.
Cuối cùng, hãy nhớ: trong thị trường tăng này, mọi thứ đều có vẻ tươi sáng. Nhưng phía sau cánh cửa, luôn có những lỗ hổng đang chờ bị khai thác. Và người chiến thắng không phải là người có công nghệ tốt nhất, mà là người hiểu rõ câu chuyện nhất. Như tôi đã học được từ Bancor, Yearn, Pudgy Penguins và cả FTX.