Trong 7 ngày qua, không giao thức nào trên mạng Arbitrum mất 40% thanh khoản, nhưng một thông cáo từ Alibaba đã âm thầm tái định giá toàn bộ nhóm token AI trên thị trường tiền mã hóa. Qwen Max, mô hình ngôn ngữ lớn với 2,6 nghìn tỷ tham số, vừa được công bố miễn phí với tuyên bố "hiệu năng tiệm cận Claude và ChatGPT". Giới đầu tư lập tức nhảy vào các dự án AI phi tập trung như Bittensor, Fetch.ai, Render. Tuy nhiên, dưới con mắt của một người dành mười bảy năm đọc mã nguồn giao thức và định lượng chi phí vận hành, đây không phải là tín hiệu tăng giá đồng loạt. Đây là một cú dịch chuyển cấu trúc, và một phần của hệ sinh thái sẽ chịu mất giá. Hãy để tôi chứng minh điều đó bằng số liệu và logic, thay vì cảm xúc.
Để hiểu vì sao sự kiện này chạm đến giới crypto, cần nắm bối cảnh. Alibaba Cloud, mảng điện toán đám mây của tập đoàn Trung Quốc, đang vận hành hệ sinh thái Qwen với hai nhánh: dòng mã nguồn mở Qwen2.5, trọng số từ 7 tỷ đến 72 tỷ tham số, và dòng thương mại Qwen2.5-Max. Mô hình Max được xây dựng theo kiến trúc Mixture-of-Experts: tổng cộng 2,6 nghìn tỷ tham số, nhưng chỉ kích hoạt khoảng 63 tỷ tham số cho mỗi token đầu vào. Con số này không chỉ là thông số kỹ thuật — nó quyết định mô hình kinh doanh. Một mô hình dense 2,6 nghìn tỷ sẽ có chi phí suy luận khủng khiếp. Một mô hình MoE với cơ chế sparse activation có thể phục vụ hàng nghìn request trên cùng một cụm GPU với chi phí biên rất thấp. Nếu kết hợp với việc sở hữu trung tâm dữ liệu riêng, bạn sẽ hiểu vì sao Alibaba có thể theo đuổi chiến lược "free", trong khi các đối thủ nhỏ hơn thì không.
Crypto Briefing, nguồn tin gốc, là một trang báo chuyên về tài sản số. Việc họ đưa tin về Qwen Max không phải sự tình cờ. Kể từ năm 2024, dòng vốn vào token AI đã tăng mạnh khi các quỹ tiền mã hóa tìm kiếm câu chuyện tăng trưởng ngoài DeFi. Một mô hình AI miễn phí cấp độ toàn cầu, được xem là chạm đến sản phẩm hàng đầu của Mỹ, trở thành chất xúc tác cho kỳ vọng rằng Trung Quốc đang dẫn đầu làn sóng tiếp theo. Nhưng trên thực tế, thị trường token AI thường hành xử ngược với lẽ thường: tin tốt về một mô hình tập trung có thể là tin xấu cho một mạng lưới phi tập trung. Sự đánh tráo giữa "AI phát triển" và "AI token tăng giá" là một lỗi nhận thức phổ biến.
Trước hết, cần giải mã hàm ý từ "free" trong thông cáo của Alibaba. Qwen2.5-Max, theo những gì công khai, không phải mô hình mở hoàn toàn. Thứ được tặng là quyền sử dụng API, tức bạn gửi một số lượng request nhất định, không phải tải trọng số về tự chạy. Sự khác biệt này là nền tảng. Một mô hình mở weight có thể được xác minh, sao chép, đưa lên IPFS và tự do triển khai trên hạ tầng của bạn. Một API miễn phí là một cái vòi nước do Alibaba kiểm soát: họ có thể đóng bất cứ lúc nào, thấy dữ liệu bạn gửi, và thay đổi điều khoản mà không cần xin phép. Trong ngôn ngữ blockchain, đó là custodial risk. Bạn không sở hữu mô hình; bạn chỉ đang thuê nó với giá tạm thời bằng không. Miễn phí trong AI cũng giống như gas fee bằng 0 trong blockchain: nó luôn được trả ở đâu đó — nếu không bằng tiền, thì bằng dữ liệu, quyền riêng tư, hoặc sự phụ thuộc.
Sau đó là câu hỏi kỹ thuật cốt lõi: vì sao Alibaba có thể tặng một mô hình được huấn luyện trên 15 nghìn tỷ token với chi phí ước tính hàng chục triệu USD mà không sụp đổ tài chính? Câu trả lời nằm trong phép toán sparse activation. Với 2,6 nghìn tỷ tham số, một mô hình dense định dạng BF16 cần khoảng 5,2 terabyte bộ nhớ chỉ để lưu trọng số. Mỗi lần suy luận, bạn phải nạp toàn bộ dung lượng đó qua bus bộ nhớ, một nút thắt cổ chai vật lý không thể vượt qua nếu muốn đạt độ trễ thấp. Qwen2.5-Max chỉ kích hoạt 63 tỷ tham số, tức khoảng 2,4 phần trăm tổng thể. Về lý thuyết, để sinh ra một token, hệ thống chỉ cần nạp các chuyên gia được chọn, giảm đến hàng chục lần yêu cầu băng thông so với mô hình dense tương đương. Chi phí suy luận vì thế giảm mạnh, kéo theo khả năng định giá bằng 0 trong một phạm vi sử dụng nhất định. Kiến trúc MoE ở đây không phải một phát minh mới — nó là một quyết định kinh tế học được mã hóa.
Điều quan trọng là phải hiểu: MoE không phải là công nghệ để tạo ra mô hình tốt hơn; nó là công nghệ để tạo ra mô hình có thể miễn phí hơn. Các kiến trúc dense như GPT-4o hoặc Claude vẫn chiếm ưu thế ở các tác vụ suy luận phức tạp, sáng tạo. Qwen2.5-Max chọn MoE vì nó tối ưu cho chi phí vận hành, không nhất thiết cho chất lượng tối đa. Khi một sản phẩm miễn phí, chất lượng của nó không cần phải tốt nhất — nó chỉ cần đủ tốt để giữ chân người dùng.
Trong các cuộc đánh giá bảo mật mà tôi từng thực hiện cho các giao thức DeFi, tôi nhận ra một lỗi lặp lại: các nhóm xây dựng "phi tập trung" nhưng đặt toàn bộ giả định vận hành vào một hạ tầng tập trung. Với AI cũng vậy. Nhiều dự án gọi là "AI crypto" hiện nay chỉ gọi API từ OpenAI, Anthropic hoặc các nhà cung cấp lớn rồi gắn thêm một lớp token. Khi Alibaba tuyên bố miễn phí, những dự án này không mất gì — thậm chí còn lợi, vì chi phí vận hành của chúng giảm. Nhưng chính điều đó phơi bày một sự thật khó chịu: chúng không tạo ra giá trị trên blockchain; chúng chỉ là một lớp ủy quyền API. Trong khi đó, các nhóm xây dựng hạ tầng ngang hàng thực sự — như Akash, Render, Gensyn — sẽ phải đối đầu với một gã khổng lồ có khả năng tài trợ chéo từ mảng cloud. Một mạng lưới GPU phi tập trung có thể tính phí 0,8 USD mỗi giờ cho một GPU H100. Alibaba, với chi phí điện và vận hành quy mô lớn, có thể đưa ra mức giá thấp hơn từ 30 đến 40 phần trăm, hoặc miễn phí trong một giai đoạn nhất định để thu hút khách hàng. Trong giới đầu tư, chiến thuật này gọi là đốt tiền mua thị phần. Big Tech chịu lỗ được nhiều quý; một giao thức phi tập trung dựa vào token sẽ sụp đổ khi giá token sụt giảm.
Tuy nhiên, câu chuyện không kết thúc ở chi phí. Giá trị của một mạng lưới phi tập trung không nằm ở việc rẻ hơn — nó nằm ở việc không cần tin tưởng. Khi bạn gửi một prompt vào Qwen Max, bạn không có cách nào biết mô hình thực sự chạy là gì, trên dữ liệu nào, và output có bị can thiệp không. Bạn cũng không thể chứng minh điều đó cho bên thứ ba. Ngược lại, một hệ thống zero-knowledge machine learning như Modulus Labs có thể đưa ra bằng chứng mật mã rằng một mô hình cụ thể đã tạo ra một output cụ thể. Trong một thế giới mà deepfake và thông tin sai lệch tràn lan, khả năng xác minh là một tài sản, không phải tính năng phụ. Các tổ chức tài chính, bệnh viện, hoặc hệ thống bỏ phiếu sẽ không chấp nhận một hộp đen miễn phí. Họ cần kiểm toán.
Điều đó dẫn tới một nghịch lý lịch sử. Khi DeFi bắt đầu, chúng ta không cạnh tranh với ngân hàng bằng cách tặng lãi suất cao; chúng ta cạnh tranh bằng một đảm bảo mật mã về quyền tự quản. Aave không tặng tiền — Aave cho phép người dùng giữ tiền trong ví của chính họ. Tương tự, AI phi tập trung không nên cạnh tranh bằng cách tặng inference. Nó nên cạnh tranh bằng cách tặng bằng chứng: rằng mô hình, với tham số cụ thể, đã tạo ra output kia, và không ai có thể sửa đổi. Đó là lợi thế mà Alibaba, dù chi bao nhiêu tiền, cũng không thể mua được, bởi vì nó đòi hỏi từ bỏ quyền kiểm soát — thứ mà một công ty niêm yết không bao giờ có. Miễn phí trong AI là một chiến lược; còn bằng chứng tính toán là một cam kết cấu trúc.
Một phép tính nhanh để lượng hóa sự cạnh tranh. Giả sử Alibaba triển khai Qwen2.5-Max trên một cụm một nghìn GPU H100. Với mức giá thị trường từ hai đến ba USD cho một giờ H100, chi phí hạ tầng một ngày vào khoảng 60.000 USD. Cụm này có thể xử lý hàng trăm triệu request mỗi ngày, nhưng nếu chỉ có 5 phần trăm công suất được dùng trong giai đoạn đầu, chi phí cho mỗi request thành công là rất cao. Đó là lý do các mô hình "free" thường đi kèm giới hạn request mỗi phút hoặc mỗi ngày. Khi vượt ngưỡng, phí sẽ được áp dụng. Freemium, theo thuật ngữ của giới công nghệ. Điều này không khác gì một sàn DEX miễn phí gas trong ba ngày ra mắt rồi đưa ra mức phí nền sau đó. Nhà đầu tư cần tỉnh táo: không có cơ chế khuyến khích nào bền vững nếu không có doanh thu. Trong hệ thống mở, miễn phí chỉ là cách trì hoãn thanh toán.
Ngoài ra, hãy xem xét cơ chế phí của các giao thức AI phi tập trung. Nhiều token AI sử dụng mô hình trả phí bằng token để tạo nhu cầu. Nếu giá của dịch vụ suy luận rơi về 0, nhu cầu token cũng bốc hơi. Ngược lại, các giao thức tập trung vào bằng chứng — nơi người dùng trả một khoản phí nhỏ để nhận một bằng chứng mật mã — vẫn giữ được nhu cầu, bởi vì họ bán sự bảo đảm, không bán điện toán. Về bản chất, họ giống một mạng ZK-Rollup hơn là một dịch vụ cloud: giá trị nằm ở sự xác minh, không phải ở lượng tài nguyên tiêu thụ.
Tôi thường nói với các nhóm phát triển trong lĩnh vực Layer2: đừng tự lừa mình rằng khác biệt công nghệ là yếu tố quyết định. Yếu tố quyết định là chiến lược thuyết phục các dự án triển khai trên chain của bạn. Sự kiện Qwen Max cho thấy bài toán tương tự trong AI: không phải ai có kiến trúc đẹp hơn sẽ thắng, mà là ai có khả năng tài trợ chéo cho hệ sinh thái trong thời gian dài hơn. OP Stack và ZK Stack có khác biệt kỹ thuật, nhưng cuộc chiến thực sự nằm ở việc ai có thể cung cấp trải nghiệm phát triển miễn phí trong nhiều quý liên tiếp. Alibaba vừa làm đúng điều đó trong AI: dùng lợi nhuận từ cloud để tài trợ cho cuộc chiến model. Các giao thức phi tập trung không có cấu trúc tài trợ chéo như vậy — và họ không cần có. Họ cần một lợi thế không thể tài trợ, đó là sự phi tập trung. Nhưng để bán được sự phi tập trung, họ phải định lượng nó. Không ai trả phí cho một khái niệm trừu tượng.
Hãy nhìn vào bảng vốn hóa để thấy sự phân hóa. Tính đến giữa năm 2025, tổng vốn hóa nhóm token AI ước tính hàng chục tỷ USD. Bittensor, giao thức khuyến khích các miner vận hành mô hình, từng đạt khoảng bốn đến năm tỷ USD ở đỉnh chu kỳ. Fetch.ai, nền tảng điều phối tác tử tự động, đạt khoảng ba tỷ. Render, mạng lưới GPU kết xuất, cũng ở mức tương tự. Nhưng điều quan trọng không phải con số, mà là nguồn gốc giá trị. Một phần lớn định giá này đến từ kỳ vọng rằng các mô hình AI sẽ cần một lớp thanh toán hoặc một lớp compute phi tập trung. Nếu một mô hình mạnh ngang GPT-4o có thể gọi miễn phí thông qua API Big Tech, thì nhu cầu thanh toán cho AI giảm mạnh, kéo theo giá trị của các token đóng vai trò phương tiện thanh toán. Nhưng nhu cầu xác minh AI lại tăng. Đây là điểm mù của thị trường: hầu hết token AI đang được định giá như cổ phiếu công nghệ, không phải như giao thức xác minh.
Hãy áp dụng bài toán này với một nhà phát triển ứng dụng. Cô ấy đang xây một chatbot tư vấn pháp lý. Nếu dùng Qwen Max miễn phí, chi phí vận hành gần bằng 0, nhưng cô ấy không thể đảm bảo với khách hàng rằng câu trả lời không bị kiểm duyệt theo quy định nội dung của Trung Quốc. Nếu dùng một mạng lưới phi tập trung chạy mô hình mở, cô ấy phải trả phí 0,02 USD cho một nghìn token, nhưng có thể ký một bằng chứng mật mã xác nhận nguồn gốc output. Trong thị trường doanh nghiệp, nơi tuân thủ và kiểm toán là bắt buộc, lựa chọn thứ hai thắng. Với người dùng cá nhân, lựa chọn thứ nhất thắng. Đó là sự phân tầng: Big Tech chiếm phần tiêu dùng cá nhân, hạ tầng mở chiếm phần thể chế. Trong lịch sử blockchain, điều tương tự đã xảy ra với sàn giao dịch: sàn tập trung chiếm nhà đầu tư cá nhân, DEX chiếm nhà đầu tư tổ chức cần tự quản lý tài sản.
Vậy thị trường nên đọc các token AI trong bối cảnh giá giảm ra sao? Hãy phân biệt hai nhóm. Nhóm thứ nhất, các token hưởng lợi từ câu chuyện AI, sẽ pump theo tin tức, nhưng không có mối liên hệ kỹ thuật nào với Alibaba. Nhóm thứ hai, các giao thức xây lớp xác minh, sẽ chịu áp lực ngắn hạn, nhưng nắm giữ giá trị không được phản ánh trên bảng cân đối kế toán: khả năng kiểm toán. Nhà đầu tư nên nhìn vào số lượng bằng chứng được tạo ra mỗi ngày, số node chạy mô hình mở, và mức độ tập trung của người vận hành. Đó là những dữ liệu on-chain có thể xác minh. Còn tin tức từ một tờ Crypto Briefing chỉ là nhiễu.
Điểm mù mà hầu hết bài bình luận bỏ qua: sự kiện này không chỉ về AI, mà về địa chính trị của điện toán. Qwen Max là một mô hình Trung Quốc, phải tuân thủ các quy định kiểm duyệt nội dung. "Miễn phí" có thể là một công cụ để Alibaba thu thập dữ liệu và mở rộng tầm ảnh hưởng sang Đông Nam Á, Trung Đông, châu Âu. Nếu bạn là startup dùng Qwen Max, bạn đang đặt cược vào một cơ sở hạ tầng chính trị. Rủi ro này không xuất hiện trên bảng giá API, nhưng nó hiện diện trong từng điều khoản sử dụng. Chính vì vậy, một lớp AI phi tập trung không phụ thuộc quốc gia — nơi các miner chạy mô hình mở, được xác minh bởi giao thức, không ai có thể tắt — càng trở nên cần thiết. Thế nhưng, ở một góc nhìn phản trực giác, sự kiện Alibaba free có thể khiến sự phát triển đó chậm lại trong ngắn hạn. Các lập trình viên sẽ bị cuốn theo sự tiện lợi và giá 0. Lịch sử DeFi cho thấy các cuộc di cư khỏi hạ tầng tập trung thường xảy ra sau một cú sốc niềm tin — như sự sụp đổ của FTX. Chúng ta chưa có một "FTX của AI", một sự kiện cho thấy API đóng có thể bị khóa, bị kiểm duyệt, hoặc bị thao túng. Khi điều đó xảy ra, các dự án xây dựng lớp xác minh sẽ trở thành nơi trú ẩn. Bạn không thể xác minh một lời hứa; bạn chỉ có thể xác minh một bằng chứng.
Nhìn xa hơn, trò chơi này không kết thúc ở Qwen Max. OpenAI, Google, Anthropic đều sẽ có chiến lược free tương tự để bảo vệ thị phần. Cuộc chiến giá trong AI sẽ đốt cháy hàng tỷ USD và kéo theo sự giảm giá của tất cả dịch vụ inference. Đối với crypto, điều đó có nghĩa: các dự án xây dựng thị trường tính toán thuần túy sẽ chết. Các dự án xây dựng thị trường sự thật — nơi bạn có thể chứng minh một tuyên bố là do mô hình nào sinh ra, chạy trên dữ liệu gì — sẽ sống. Càng miễn phí, càng nhiều output được tạo ra, càng cần xác minh. Alibaba không giải quyết bài toán này; họ làm cho nó trở nên trầm trọng hơn.
Alibaba vừa dạy thị trường một bài học về định giá: khi kiểm soát tập trung, "miễn phí" chỉ là công cụ chiếm thị phần, không bao giờ là món quà. Còn với hệ sinh thái tiền mã hóa, miễn phí không phải mô hình kinh doanh — nó chỉ là một sự trì hoãn. Sẽ có một ngày vòi nước bị khóa, điều khoản bị đổi, hoặc dữ liệu của bạn bị dùng theo cách bạn không mong muốn. Câu hỏi dành cho nhà đầu tư không phải "AI nào miễn phí hôm nay", mà là "nền tảng nào có thể chứng minh sự thật mà không cần xin phép". Trong một thị trường đi xuống, tài sản trú ẩn không nằm ở những token hưởng tin tức nhất thời, mà nằm ở những giao thức tạo ra bằng chứng mỗi ngày. Hãy tìm những dự án có thể chứng minh, không phải hứa hẹn. Bởi vì on-chain mới là thật.


