
Nguồn: Đặng Duật Văn (Deng Yuwen), “Are Chinese Firms Handing the United States Data?”, Foreign Policy, 15/09/2026
Biên dịch: Nguyễn Thị Kim Phụng
Cuộc đua AI có thể vô tình trở thành một điểm yếu của Bắc Kinh.
Một báo cáo gần đây của Anthropic, công ty trí tuệ nhân tạo của Mỹ, cáo buộc một số công ty AI hàng đầu Trung Quốc, trong đó có Moonshot AI và DeepSeek, đã tiến hành chắt lọc năng lực (distillation) từ mô hình Claude trên quy mô lớn. Anthropic cho biết một số công ty không chỉ sử dụng Claude để tạo dữ liệu huấn luyện mà, trong ít nhất một trường hợp, còn âm thầm chuyển hướng hơn 300.000 yêu cầu của người dùng thực qua mô hình này chỉ trong vòng 10 ngày.
Những dữ liệu được cho là đã gửi tới Claude bao gồm các tài liệu giám sát do một người dùng mà Anthropic nghi ngờ có liên hệ với Quân Giải phóng Nhân dân Trung Quốc cung cấp; mã nguồn nội bộ và thông tin đăng nhập hợp lệ của các kỹ sư tại những doanh nghiệp nhà nước lớn của Trung Quốc; dữ liệu từ hệ thống quản lý vụ án của cảnh sát; cùng thông tin chi tiết về các dự án AI nội bộ tại các công ty công nghệ Trung Quốc.
Việc thông tin nhạy cảm bị rò rỉ đương nhiên sẽ gióng lên hồi chuông cảnh báo đối với Bắc Kinh. Nhưng so với việc một vài tài liệu nhạy cảm lọt vào tay Mỹ, mối lo lớn hơn có thể nằm ở chỗ: trong quá trình chắt lọc năng lực từ những mô hình tiên tiến nhất của Mỹ, các công ty AI Trung Quốc đồng thời có thể đang chuyển một lượng lớn dữ liệu thực tế của người dùng Trung Quốc sang Mỹ.
Cuộc đua AI không chỉ là cuộc đua về sức mạnh tính toán mà còn là cuộc đua về dữ liệu. Ngày nay, dữ liệu trên không gian mạng mở ngày càng dễ thu thập. Thứ thực sự khan hiếm là dữ liệu chất lượng cao phát sinh từ những tác vụ thực tế: vì sao người dùng tìm đến AI, họ đang cố giải quyết vấn đề gì, họ cung cấp những tài liệu nền nào, công việc viết mã đang tiến triển tới đâu, doanh nghiệp đang gặp những nút thắt kỹ thuật nào, và họ muốn AI giúp hoàn thành nhiệm vụ gì. Những dữ liệu như vậy có giá trị vượt xa các mẩu thông tin rời rạc thường thấy trên web.
Xét riêng lẻ, từng mẩu dữ liệu có thể không mang nhiều ý nghĩa hay giá trị. Nhưng khi hàng trăm nghìn, hàng triệu, thậm chí hàng chục triệu mẩu như vậy được tập hợp lại, bản chất của chúng thay đổi hoàn toàn. Việc một lập trình viên Trung Quốc hỏi vì sao một đoạn mã bị lỗi có thể gần như không mang giá trị tình báo. Nhưng nếu hàng nghìn kỹ sư Trung Quốc liên tục gặp phải và đặt câu hỏi về những vấn đề tương tự, tập hợp dữ liệu đó có thể phơi bày một nút thắt chung trong hệ thống công nghệ của Trung Quốc.
Tương tự, việc một nhân viên hỏi cách cải tiến một thiết bị hay phần mềm cụ thể khó có thể được xem là đáng lo ngại, càng chưa chắc là bí mật. Nhưng nếu một lượng lớn kỹ sư trong các ngành như bán dẫn, robot, hàng không vũ trụ, viễn thông, điện lực và ô tô liên tục chia sẻ công việc của mình với các mô hình AI, thì theo thời gian, những tương tác này có thể giúp người ngoài dựng nên một bản đồ động về năng lực công nghiệp và công nghệ của Trung Quốc.
Loại dữ liệu này tiết lộ nhiều hơn rất nhiều so với các truy vấn tìm kiếm thông thường. Một lượt tìm kiếm thường chỉ cho thấy người dùng muốn biết điều gì; trong khi tương tác với AI thường cho thấy họ thực sự đang làm gì. Người dùng chủ động cung cấp bối cảnh công việc, tải lên mã nguồn và tài liệu, mô tả dự án, giải thích những gì họ đã thử, xác định vấn đề đang gặp phải và nêu rõ bước tiếp theo họ dự định thực hiện.
Đây là một loại dữ liệu rất đặc thù. Có thể gọi nó là “dữ liệu ý định” (intent data): loại dữ liệu cho người ngoài biết không chỉ Trung Quốc đang sở hữu những gì, mà còn cho thấy nước này đang làm gì.
Trong thời bình, những dữ liệu như vậy chủ yếu có giá trị thương mại và công nghệ. Nhưng khi căng thẳng giữa hai siêu cường gia tăng, giá trị chiến lược của một kho dữ liệu như vậy cũng sẽ tăng theo.
Hãy hình dung một kịch bản trong đó nguy cơ chiến tranh ngày càng cận kề. Các cơ quan tình báo Mỹ sẽ cần biết không chỉ Trung Quốc sở hữu bao nhiêu tên lửa hay tàu chiến, mà còn cần biết hệ thống công nghiệp quốc phòng nước này có đang tăng tốc sản xuất hay không; các nút thắt đang xuất hiện ở đâu; những doanh nghiệp dân sự nào đang bắt đầu chuyển sang sản xuất thời chiến; những điểm yếu nào đang tồn tại trong các lĩnh vực bán dẫn, máy bay không người lái, viễn thông, điện lực và giao thông; cũng như những viện nghiên cứu nào đột nhiên tập trung vào các vấn đề cụ thể. Khối lượng lớn các tương tác với AI có thể cung cấp chính xác loại thông tin này.
Khi tên các tổ chức, thiết bị, phần mềm, nhà cung cấp và lỗi kỹ thuật xuất hiện trong các cuộc trò chuyện với AI được kết hợp với ảnh vệ tinh, hồ sơ hải quan, dữ liệu đấu thầu, bằng sáng chế, tài liệu học thuật, thông tin doanh nghiệp, dữ liệu mạng và những nguồn tình báo khác mà Mỹ đã có sẵn, một truy vấn tưởng chừng rất bình thường có thể trở thành một mắt xích trong một mạng lưới lớn hơn rất nhiều. Hàng trăm nghìn hay hàng triệu mắt xích như vậy, khi được kết hợp, có thể mang lại giá trị vượt xa một vài tài liệu mật theo nghĩa truyền thống.
Điều này đặt ra một câu hỏi gần như chưa từng được chú ý: Liệu Bắc Kinh trước đây có biết rằng các công ty AI Trung Quốc, trong quá trình chắt lọc các mô hình của Mỹ, đã và đang chuyển dữ liệu thực của người dùng sang Mỹ hay không?
Trung Quốc có một hệ thống quy định dày đặc về bảo mật dữ liệu. Trong những năm gần đây, Bắc Kinh liên tục siết chặt giám sát đối với việc chuyển dữ liệu xuyên biên giới. Các Quy định về Thúc đẩy và Quản lý Luồng Dữ liệu Xuyên Biên giới đặt ra yêu cầu đánh giá an ninh và nhiều hạn chế khác đối với việc chuyển dữ liệu quan trọng ra nước ngoài — tức những dữ liệu có thể đe dọa an ninh quốc gia, nền kinh tế hoặc ổn định xã hội — cũng như đối với việc chuyển một lượng lớn thông tin cá nhân. Các quy định của Trung Quốc đối với dịch vụ AI tạo sinh cũng yêu cầu nhà cung cấp phải bảo vệ thông tin cá nhân của người dùng, bí mật thương mại và an ninh dữ liệu.
Vấn đề là liệu hệ thống quản lý hiện nay có nhận diện được một hình thức chuyển dữ liệu xuyên biên giới mới hay không. Thay vì một công ty Trung Quốc chính thức xuất khẩu một cơ sở dữ liệu cho doanh nghiệp nước ngoài, một công ty AI muốn huấn luyện mô hình của mình có thể sử dụng tài khoản ủy quyền (proxy) và các dịch vụ trung gian để âm thầm chuyển hàng loạt yêu cầu của người dùng thực vào một mô hình nền tảng của Mỹ.
Nếu Bắc Kinh không biết điều này đang xảy ra, báo cáo của Anthropic đã phơi bày một điểm mù lớn trong hệ thống quản lý AI của Trung Quốc. Nước này có thể từ lâu vẫn giám sát rất chặt việc các tập đoàn đa quốc gia chuyển cơ sở dữ liệu sang Mỹ, nhưng lại không nhận ra rằng chính các công ty AI hàng đầu trong nước đang liên tục đưa công việc, mã nguồn, những khó khăn kỹ thuật của người dùng, thậm chí cả tài liệu nhạy cảm, vào các mô hình của Mỹ thông qua các lệnh gọi mô hình.
Nhưng ngay cả khi Trung Quốc đã nhận ra vấn đề, việc xử lý cũng không hề đơn giản.
Một mặt, Bắc Kinh có thể yêu cầu các công ty AI trong nước chấm dứt những hoạt động như vậy, hoặc ít nhất cấm họ gửi dữ liệu người dùng thực chưa qua xử lý vào các mô hình của Mỹ. Với hệ thống luật về an ninh dữ liệu và năng lực quản lý hiện nay của Trung Quốc, điều này về mặt hành chính không quá khó thực hiện.
Mặt khác, tại sao Alibaba, Moonshot, DeepSeek, Xiaomi và những công ty khác lại chấp nhận rủi ro lớn như vậy để truy cập và chắt lọc Claude trên quy mô lớn? Câu trả lời dường như rất rõ ràng: năng lực của các mô hình tiên phong của Mỹ vẫn mang lại giá trị rất lớn cho các công ty Trung Quốc.
Theo Anthropic, hoạt động có liên quan đến chắt lọc của Alibaba đã vượt 151 triệu lượt trao đổi trong giai đoạn từ tháng 5 đến tháng 7; Moonshot vượt 23 triệu lượt; còn DeepSeek thực hiện hơn 12,1 triệu lượt chỉ trong vòng 14 ngày vào tháng 7. Đây thực chất là quá trình hấp thụ năng lực công nghệ ở quy mô công nghiệp. Moonshot và DeepSeek thậm chí còn bị cáo buộc xây dựng các hệ thống kỹ thuật chuyên dụng nhằm trích xuất quá trình suy luận của Claude để phục vụ việc huấn luyện các mô hình của riêng họ.
Điều này phơi bày tình thế lưỡng nan mà Trung Quốc đang phải đối mặt. Việc chắt lọc các mô hình tiên tiến nhất của Mỹ đã trở thành một phương thức quan trọng giúp một số công ty Trung Quốc thu hẹp khoảng cách công nghệ. Bắc Kinh có kỹ sư, sức mạnh tính toán, các mô hình ngôn ngữ lớn của riêng mình và một ngành công nghiệp AI quy mô lớn. Nhưng nếu các công ty Trung Quốc bị cắt đứt hoàn toàn khỏi khả năng chắt lọc năng lực từ những mô hình hàng đầu của Mỹ, việc tự tạo ra dữ liệu huấn luyện và năng lực suy luận có chất lượng tương đương sẽ đòi hỏi nhiều thời gian, sức mạnh tính toán và quá trình thử nghiệm – sửa sai hơn. Trong ngắn hạn, điều đó có thể làm chậm tốc độ Trung Quốc bắt kịp các mô hình tiên phong của Mỹ.
Nếu các công ty AI Trung Quốc tiếp tục được phép chắt lọc các mô hình của Mỹ trên quy mô lớn, Bắc Kinh sẽ phải chấp nhận nguy cơ dữ liệu Trung Quốc tiếp tục chảy vào các hệ thống của Mỹ. Nhưng nếu con đường này bị đóng lại vì lý do an ninh dữ liệu, chi phí bắt kịp sẽ tăng lên và khoảng cách công nghệ có thể tiếp tục bị nới rộng.
Trong bối cảnh cuộc đua AI ngày càng phụ thuộc vào hoạt động chắt lọc, dữ liệu và việc trao đổi năng lực giữa các mô hình, Trung Quốc đang phải đối mặt với một câu hỏi nan giải: Làm thế nào để tận dụng những năng lực AI tiên tiến nhất của Mỹ mà không biến chính dữ liệu của Trung Quốc thành một tài sản chiến lược của Mỹ?
Đặng Duật Văn là một nhà văn và học giả người Trung Quốc.