Madimas
BTC $77,392.5 +0.15%
ETH $2,536.59 +3.00%
SOL $102.79 +2.65%
BNB $726.9 +1.59%
XRP $1.36 +0.63%
DOGE $0.0846 +0.42%
ADA $0.2064 -1.39%
AVAX $7.49 -1.66%
DOT $1.05 -5.23%
LINK $11.61 +0.04%
⛽ ETH Gas 28 Gwei
Sợ&Tham
56

AWS nói AI chuyển từ training sang inference: những chiếc GPU của miner sắp thành gánh nặng?

Đánh giá | Trần Vĩnh |
Đầu tháng 3/2025, AWS CEO Matt Garman phát biểu rằng nhu cầu AI đang chuyển từ training sang inference, và điều này đòi hỏi một chiến lược phần cứng mới. Với giới crypto, câu nói đó trôi qua như một dòng tin thị trường không tên. Với tôi, nó là dữ liệu tham chiếu quan trọng nhất kể từ khi Ethereum chuyển sang Proof of Stake. Khi một trong những nhà bán hạ tầng AI lớn nhất hành tinh tuyên bố giai đoạn 'đốt tiền để huấn luyện model' đang nhường chỗ cho giai đoạn 'kiếm tiền từ suy luận', thì toàn bộ các giả định đang nâng đỡ giá trị GPU của miner và token DePIN bắt đầu lung lay. Hãy cùng trace execution path của tuyên bố này từ trung tâm dữ liệu AWS tới một trang trại đào coin đang treo hàng trăm card H100. Nó không đi theo hướng mà hầu hết mọi người đang vẽ. Cần nói rõ bối cảnh cho những ai chưa theo dõi. Training là giai đoạn huấn luyện mô hình AI: nó cần hàng nghìn GPU hoạt động song song trong nhiều tuần, xử lý hàng tỷ tham số để cập nhật trọng số. Inference là giai đoạn suy luận: mô hình sau khi được huấn luyện sẽ phục vụ các yêu cầu thực tế như chatbot trả lời câu hỏi, sinh mã, phân tích hình ảnh. Khác biệt cơ bản không nằm ở khối lượng tính toán — mà nằm ở vị trí và thời gian. Training có thể diễn ra trong một nhà kho khổng lồ ở vùng sa mạc, nơi điện rẻ và không ai quan tâm tới độ trễ. Inference bắt buộc phải ở gần người dùng cuối. Một cuộc gọi API từ một công ty ở Singapore không thể chờ GPU ở Montana phản hồi trong vài giây. Chính sự khác biệt vật lý đó định hình toàn bộ những gì tôi phân tích dưới đây. Trong 18 tháng qua, ngành công nghiệp GPU đã chứng kiến một nghịch lý. Các công ty cloud vẫn khoe doanh thu AI tăng trưởng ba chữ số, nhưng giá cho thuê GPU H100 trên thị trường thứ cấp đã bắt đầu chững lại. H100 là con chip từng làm nên cơn sốt đào GPU thời hậu Ethereum. Khi merge xảy ra, hàng triệu card đồ họa tràn ra thị trường, và chính làn sóng AI training đã hút bớt nguồn cung đó. Nhưng bây giờ AWS nói rõ rằng nhu cầu training đạt đỉnh. Nếu bạn mua H100 ở đỉnh giá 40.000 USD để phục vụ câu chuyện 'miner trở thành nhà cung cấp AI', bạn đang nắm một tài sản có chi phí khấu hao khoảng 0,5 USD mỗi giờ chỉ riêng phần vốn, chưa tính điện, làm mát và vận hành. Khi nhu cầu training dịch chuyển sang inference, giá cho thuê GPU thô sẽ bị siết về chi phí vận hành của các quỹ đầu tư lớn đã khấu hao hết thiết bị. Đó là lý do vì sao AWS đồng thời đẩy mạnh chip nội bộ Inferentia và Trainium: họ muốn kiểm soát chi phí inference từng đồng một. Điều mà các dev không nói với bạn: inference không phải là 'đưa GPU vào chạy model'. Nó là một hệ thống phần mềm hoàn chỉnh. Một hệ thống inference production cần có bộ quản lý model, bộ điều phối luồng, cơ chế load balancing, bộ đệm kết quả, công cụ giám sát độ trễ, và khả năng mở rộng đàn hồi khi tải tăng đột biến. Một miner có thể sở hữu 500 card H100, nhưng nếu không có lớp phần mềm này, số GPU đó chỉ là một kho sắt vụn trước mắt khách hàng doanh nghiệp. Trong các đợt audit của tôi cho những dự án cho thuê GPU phi tập trung, tôi nhận ra rằng gần như toàn bộ đội ngũ tập trung vào hợp đồng thông minh, staking và thanh toán tự động. Không ai nói về việc làm sao để một request inference thực sự hoàn thành trong 200 mili giây. Đó là lỗ hổng kiến trúc: họ xây dựng một phiên chợ cho phần cứng thô trong khi khách hàng đang tìm mua một dịch vụ hoàn chỉnh. Tôi muốn nói rõ hơn về phép toán sống còn. Giả sử bạn là một miner có chi phí điện 0,05 USD/kWh, vận hành một trại 500 card H100. Với mức tiêu thụ 700W mỗi card, riêng tiền điện đã là 8.400 USD mỗi ngày. Nếu giá cho thuê H100 duy trì ở mức 2,5 USD/giờ, tổng doanh thu một card là 60 USD mỗi ngày, trừ điện còn khoảng 43 USD mỗi ngày. Nghe có vẻ tốt. Nhưng nếu bạn phải trả góp phần cứng hoặc phải cạnh tranh với những quỹ đã khấu hao máy móc, biên lợi nhuận sẽ co lại gần như bằng không khi giá thuê giảm xuống còn 1 USD/giờ. Trong khi đó, một khách hàng inference không quan tâm bạn sở hữu bao nhiêu GPU. Họ trả tiền cho mỗi lần gọi API thành công, và họ yêu cầu độ trễ dưới 100 mili giây. Nếu mạng của bạn không đáp ứng SLA đó, bạn không thể gọi được API — doanh thu của bạn bằng không. Giả định tin cậy họ đang đặt ra khi xây dựng các mạng DePIN là: người dùng sẽ chấp nhận đánh đổi độ trễ và SLA để lấy chi phí rẻ hơn và quyền kiểm soát phi tập trung. Giả định này đúng với một nhóm tác vụ không nhạy cảm thời gian — render video, train model, xử lý dữ liệu hàng loạt. Nhưng nó sai với inference thời gian thực. Một doanh nghiệp đang chạy chatbot chăm sóc khách hàng không thể chấp nhận phản hồi chậm hai giây vì GPU nằm ở một trang trại xa xôi. Họ cũng không thể chấp nhận dữ liệu khách hàng đi qua các node không rõ danh tính. Inference doanh nghiệp đi kèm yêu cầu tuân thủ dữ liệu, và một mạng lưới không có danh tính rõ ràng gần như không thể ký hợp đồng với tập đoàn lớn. Đây chính là điểm mà các nhà phân tích thị trường thường bỏ qua khi họ gộp tất cả câu chuyện AI vào một giỏ. Điều tinh tế (và đáng sợ) trong thiết kế này là sự dịch chuyển từ training sang inference không làm cho Web3 mạnh hơn; nó làm cho các gã khổng lồ tập trung mạnh hơn. AWS, Google Cloud và Azure đều có trung tâm dữ liệu đặt gần các thành phố lớn — nơi có người dùng cuối. Họ có chip chuyên dụng, có đội ngũ kỹ sư ML hàng nghìn người, và có hệ sinh thái phần mềm mà doanh nghiệp đã tin dùng. Một mạng DePIN với GPU nằm rải rác ở những nơi điện rẻ — thường là vùng nông thôn hoặc sa mạc — về địa lý đã không thể phục vụ inference yêu cầu độ trễ thấp. Bạn có thể tối ưu chi phí đến mức nào đi nữa, một gói tin từ một trang trại ở Texas đến người dùng ở New York vẫn mất hàng chục mili giây, chưa kể thời gian xếp hàng và xử lý model. Trong khi đó, AWS đặt một cụm inference ngay tại khu vực khách hàng vận hành. Đây không phải bài toán phần cứng, đây là bài toán vật lý mạng. Và vật lý thì không thể bị token hóa. Nhưng hãy nói công bằng một chút. Không phải tất cả các mạng DePIN đều giống nhau. Akash, io.net và Render có những vị thế khác nhau trước cú sốc này. Render phục vụ render đồ họa, một tác vụ chấp nhận độ trễ cao và theo batch — nó ít bị ảnh hưởng nhất. Akash cung cấp compute marketplace, có thể chuyển sang phục vụ các workload không nhạy cảm thời gian. io.net có tham vọng lớn về AI, nhưng nếu không có lớp inference serving thực sự, nó vẫn chỉ là một bãi đỗ GPU có giao diện token. Khách hàng của DePIN không phải OpenAI, cũng không phải các tập đoàn lớn. Khách hàng thực tế là những nhà phát triển muốn truy cập GPU mà không cần KYC, muốn thanh toán bằng crypto, chấp nhận chất lượng không ổn định để đổi lấy chi phí rẻ hơn. Phân khúc đó tồn tại, nhưng nó không đủ lớn để hấp thụ hàng trăm nghìn GPU mà các miner đang muốn nhét vào. Và khi thị trường giảm, doanh thu ít ỏi đó sẽ không cứu được giá token. Phần lớn phân tích sai về mối quan hệ giữa miner và AI vì họ nhìn vào phần cứng thay vì nhìn vào dòng tiền. Họ thấy một trang trại GPU và nghĩ rằng nó có thể tạo ra AI. Nhưng AI là một ngành công nghiệp phần mềm và vận hành, không phải ngành công nghiệp kim loại. Khả năng cung cấp điện giá rẻ không đồng nghĩa với khả năng vận hành một dịch vụ inference có thể mở rộng. Tôi từng thấy những dự án DePIN tự hào về số lượng GPU ký kết, nhưng khi tôi hỏi về vLLM, TensorRT-LLM, hoặc cách họ xử lý model warming, họ nhìn tôi như thể tôi nói tiếng nước ngoài. Nếu đội ngũ không có nền tảng machine learning, thì việc sở hữu GPU càng nhiều chỉ tạo thêm gánh nặng chi phí. Trước đây tôi từng lập luận rằng Ordinals và làn sóng inscription đã cứu mô hình bảo mật của Bitcoin bằng cách tạo ra doanh thu phí khi block reward giảm. Nhưng AI sẽ không làm điều tương tự cho GPU miners. Vì sao? Vì Ordinals là một giao thức phi tập trung chạy trên chính Bitcoin — nó sử dụng không gian khối mà Bitcoin kiểm soát. Còn AI inference là một dịch vụ tập trung ở các trung tâm dữ liệu lớn, nơi độ trễ và phần mềm quyết định sự sống còn. Miner không thể tạo ra một 'giao thức inference' trên blockchain để thu hút khách hàng từ AWS, bởi vì khách hàng doanh nghiệp không cần tính phi tập trung — họ cần tốc độ, sự ổn định và cam kết hợp đồng. Đây là lý do vì sao tôi cho rằng câu chuyện 'miners are the backbone of AI' là một trong những narrative nguy hiểm nhất trong thị trường hiện tại: nó khiến người nắm giữ token tin rằng một tài sản đang mất giá thực chất là tài sản chiến lược. Câu chuyện này không chỉ ảnh hưởng đến miner. Nó ảnh hưởng đến toàn bộ hệ sinh thái DePIN. Khi các quỹ đầu tư nhìn thấy AWS CEO xác nhận hướng đi của thị trường, họ sẽ rút dần vốn khỏi những dự án không có năng lực inference. Token của các mạng compute phi tập trung có thể giảm giá trị ngay cả khi tổng số GPU được kết nối vẫn tăng — bởi vì giá trị nằm ở doanh thu thực, không nằm ở nguồn cung phần cứng. Trong bối cảnh thị trường giảm, câu hỏi 'tài sản của tôi có an toàn không' phải được trả lời bằng dữ liệu doanh thu, không phải bằng số lượng GPU trong kho. Nếu một dự án không công bố doanh thu từ inference service, hãy coi đó là một dấu hiệu cảnh báo. Tôi không phản đối việc miner tham gia AI. Tôi phản đối việc họ tham gia bằng tư duy cũ: mua GPU, cắm điện, bật máy, chờ token tăng giá. Thế giới inference vận hành theo những quy tắc hoàn toàn khác: phần mềm quyết định phần cứng, độ trễ quyết định hợp đồng, và uy tín vận hành quyết định khả năng ký kết. Miner muốn tồn tại phải trở thành nhà vận hành hạ tầng chuyên nghiệp, phải học cách triển khai Kubernetes, Docker, tự động mở rộng, giám sát 24/7. Họ phải chấp nhận rằng biên lợi nhuận của hạ tầng AI không còn là câu chuyện 'điện rẻ' mà là câu chuyện 'độ tin cậy'. Nếu không làm được điều đó, những chiếc GPU của họ sẽ chỉ còn giá trị như những chiếc máy đào cũ sau merge: đẹp trên giấy, vô dụng trong thực tế. Câu hỏi cuối cùng dành cho mọi nhà đầu tư đang nắm giữ token DePIN không phải là 'AWS nói đúng hay sai'. Câu hỏi thực sự là: đội ngũ bạn đặt niềm tin có hiểu inference là gì hay họ chỉ biết mua GPU và phát hành token? Khi mùa tăng trưởng kết thúc, sự khác biệt giữa hai nhóm đó sẽ phơi bày hoàn toàn. Trong một thị trường giảm, người không thay đổi kịp sẽ không chỉ mất lợi nhuận — họ sẽ mất toàn bộ tài sản. Và nếu bạn đang đứng trước quyết định đầu tư vào một dự án AI + crypto, hãy hỏi họ một câu duy nhất: bạn có biết vLLM là gì không? Câu trả lời sẽ nói cho bạn biết mọi thứ bạn cần biết.

Giá thị trường

BTC Bitcoin
$77,392.5 +0.15%
ETH Ethereum
$2,536.59 +3.00%
SOL Solana
$102.79 +2.65%
BNB BNB Chain
$726.9 +1.59%
XRP XRP Ledger
$1.36 +0.63%
DOGE Dogecoin
$0.0846 +0.42%
ADA Cardano
$0.2064 -1.39%
AVAX Avalanche
$7.49 -1.66%
DOT Polkadot
$1.05 -5.23%
LINK Chainlink
$11.61 +0.04%

Sợ & Tham

56

Tham lam

Tâm lý thị trường

Lịch sự kiện blockchain

{{年份}}
22
03
unlock Mở khóa Optimism

Lượng cung lưu hành tăng khoảng 2%

08
04
upgrade Solana Firedancer

Trình xác thực độc lập ra mắt trên mainnet

10
05
upgrade Nâng cấp Ethereum Pectra

Tăng giới hạn validator và trừu tượng hóa tài khoản

30
04
upgrade Nâng cấp Celestia Mainnet

Cải thiện hiệu quả lấy mẫu tính khả dụng dữ liệu

28
03
unlock Mở khóa token Arbitrum

Giải phóng 92 triệu ARB

18
03
unlock Mở khóa token Sui

Phần đội ngũ và nhà đầu tư sớm được giải phóng

12
05
halving BCH Halving

Sự kiện giảm một nửa phần thưởng khối

15
04
halving Bitcoin Halving

Phần thưởng khối giảm xuống 3,125 BTC

🧮 Công cụ

Tất cả →

Chỉ số mùa altcoin

42

Mùa Bitcoin

Sự thống trị BTC Mùa altcoin

Theo dõi phí Gas

Ethereum 28 Gwei
BNB Chain 3 Gwei
Polygon 42 Gwei
Arbitrum 0.5 Gwei
Optimism 0.3 Gwei

Vốn hóa thị trường

Tất cả →
1
Bitcoin
BTC
$77,392.5
1
Ethereum
ETH
$2,536.59
1
Solana
SOL
$102.79
1
BNB Chain
BNB
$726.9
1
XRP Ledger
XRP
$1.36
1
Dogecoin
DOGE
$0.0846
1
Cardano
ADA
$0.2064
1
Avalanche
AVAX
$7.49
1
Polkadot
DOT
$1.05
1
Chainlink
LINK
$11.61

🐋 Theo dõi cá voi

🔴
0xc7b2...9e9e
12 phút trước
Chuyển ra
2,032,534 USDC
🔴
0x7e04...fb5e
2 phút trước
Chuyển ra
3,558 ETH
🔵
0xfc0d...001f
30 phút trước
Stake
9,929,717 DOGE

💡 Smart Money

0x87c6...06e2
Nhà giao dịch on-chain dày dặn
+$3.3M
89%
0xb2a8...29e8
Thợ đào DeFi hàng đầu
+$5.0M
77%
0x561b...b2e9
Nhà đầu tư sớm
+$3.2M
79%