BTC $63,127.5 -0.98%
ETH $1,868.4 -0.64%
SOL $72.93 -0.73%
BNB $580.2 -1.96%
XRP $1.06 -0.71%
DOGE $0.0699 +0.65%
ADA $0.1733 +2.24%
AVAX $6.34 -1.48%
DOT $0.7681 +1.33%
LINK $8.09 -1.96%
⛽ ETH Gas 28 Gwei
Sợ&Tham
27

Giá thị trường

BTC Bitcoin
$63,127.5 -0.98%
ETH Ethereum
$1,868.4 -0.64%
SOL Solana
$72.93 -0.73%
BNB BNB Chain
$580.2 -1.96%
XRP XRP Ledger
$1.06 -0.71%
DOGE Dogecoin
$0.0699 +0.65%
ADA Cardano
$0.1733 +2.24%
AVAX Avalanche
$6.34 -1.48%
DOT Polkadot
$0.7681 +1.33%
LINK Chainlink
$8.09 -1.96%

Lịch sự kiện blockchain

{{年份}}
12
05
halving BCH Halving

Sự kiện giảm một nửa phần thưởng khối

22
03
unlock Mở khóa Optimism

Lượng cung lưu hành tăng khoảng 2%

15
04
halving Bitcoin Halving

Phần thưởng khối giảm xuống 3,125 BTC

08
04
upgrade Solana Firedancer

Trình xác thực độc lập ra mắt trên mainnet

10
05
upgrade Nâng cấp Ethereum Pectra

Tăng giới hạn validator và trừu tượng hóa tài khoản

28
03
unlock Mở khóa token Arbitrum

Giải phóng 92 triệu ARB

30
04
upgrade Nâng cấp Celestia Mainnet

Cải thiện hiệu quả lấy mẫu tính khả dụng dữ liệu

18
03
unlock Mở khóa token Sui

Phần đội ngũ và nhà đầu tư sớm được giải phóng

Theo dõi phí Gas

Ethereum 28 Gwei
BNB Chain 3 Gwei
Polygon 42 Gwei
Arbitrum 0.5 Gwei
Optimism 0.3 Gwei

💡 Smart Money

0x4552...e394
Ví lưu ký tổ chức
+$2.8M
94%
0xd4d6...19f4
Thợ đào DeFi hàng đầu
+$4.1M
74%
0x86aa...f567
Nhà đầu tư sớm
+$0.1M
82%

Công cụ

Tất cả →
Tạp chí

Seedance 2.5: Bài toán 30 giây và những ẩn số ByteDance chưa trả lời

Phạm Dũng

Có bao giờ bạn tự hỏi, khi một mô hình tạo video tuyên bố có thể "tạo 30 giây liền mạch, tiếp nhận tối đa 30 hình ảnh, 10 video và 10 đoạn âm thanh làm tài sản tham chiếu, điều khiển nội dung theo từng mốc thời gian, rồi tiếp tục viết từ chính kết quả trước đó" — điều đó thực sự có nghĩa gì ở tầng hệ thống? Không phải tầng marketing. Tầng mà các kỹ sư phải vật lộn từng ngày để biến những dòng chữ trên slide thành một sản phẩm chạy ổn định.

ByteDance vừa công bố Seedance 2.5, đặt nó ngay cạnh MiniMax H3 như một đòn cạnh tranh trực tiếp trong cuộc đua AI tạo video. Các con số rất đẹp. Nhưng từ góc nhìn của một người đã dành bốn tháng liên tục để so sánh kiến trúc các hệ thống phân tán, tôi nhìn thấy ở đây một câu chuyện quen thuộc: tham số hào nhoáng thường che giấu những câu hỏi quan trọng hơn. Và câu hỏi quan trọng nhất không nằm ở việc "có tạo được không", mà nằm ở việc "tạo với giá nào, đáng tin đến đâu, và bền vững ra sao".


Thị trường AI tạo video đang bước vào giai đoạn mà tôi gọi là "tuần là đơn vị cạnh tranh". Sora của OpenAI mở đường, sau đó là một làn sóng sản phẩm từ Runway, Pika, Luma, Kling, Hailuo của MiniMax, và giờ là Seedance. Không còn ai dám nghỉ ngơi, vì một bản cập nhật tính năng có thể thay đổi cục diện chỉ trong vài ngày. Trong bối cảnh đó, Seedance 2.5 không chỉ là một phiên bản nâng cấp thông thường; nó là một tuyên bố chiến lược.

Hãy nhìn vào cách ByteDance phân phối sản phẩm này. Seedance 2.5 được tích hợp vào Jimeng AI, ứng dụng hướng tới người dùng phổ thông; vào Doubao Pro, nền tảng chatbot chuyên nghiệp; và API sẽ sớm được mở trên Volcano Engine Ark, dịch vụ đám mây của ByteDance. Ba kênh phân phối song song. Điều đó cho thấy ByteDance không chỉ muốn cạnh tranh bằng một mô hình đơn lẻ — họ muốn xây dựng một hệ sinh thái khép kín, nơi mô hình, ứng dụng, dịch vụ đám mây và kho nội dung khổng lồ từ các nền tảng video ngắn có thể bổ trợ lẫn nhau.

Nhưng điều khiến tôi chú ý nhất nằm trong danh sách tính năng. Seedance 2.5 cho phép tạo video dài 30 giây trong một lần, với nhiều cảnh và một cốt truyện hoàn chỉnh; hỗ trợ tối đa 50 tài sản tham chiếu; cho phép điều khiển theo mốc thời gian; và cho phép người dùng tiếp tục viết từ kết quả hiện có, giữ nguyên nhân vật, bối cảnh, giọng nói và nhịp điệu kể chuyện. Đây không còn là "gõ prompt, nhận video" một lần rồi thôi. Đây là một quy trình làm việc hoàn chỉnh.

Với một nhà phân tích hạ tầng như tôi, danh sách tính năng này ngay lập tức phát sinh một loạt câu hỏi: chi phí tính toán là bao nhiêu? Bộ nhớ cần thế nào? Cơ chế duy trì nhất quán giữa các cảnh hoạt động ra sao? Độ trễ của một lần tạo là bao lâu? Và trên hết: chất lượng thực tế có khớp với tham số quảng cáo hay không? Điều đáng nói là hầu hết các bài viết về Seedance 2.5 đều chỉ lặp lại danh sách tính năng mà không ai đặt ra những câu hỏi này.


Bắt đầu từ con số 30.

Tạo video 30 giây, nếu mô hình phải tạo từng khung hình một, ở 24 khung hình mỗi giây, nghĩa là hệ thống phải sinh ra 720 khung hình. Ở 30 khung hình mỗi giây, con số là 900. So với các phiên bản tạo 15 giây trước đó, khối lượng tính toán không chỉ tăng gấp đôi — nó có thể tăng nhiều hơn thế, vì các khung hình càng xa nhau về mặt thời gian càng đòi hỏi cơ chế duy trì nhất quán bối cảnh phức tạp hơn. Trong một video 5 giây, các khung hình gần như liên tục, và sự khác biệt giữa chúng rất nhỏ. Trong một video 30 giây với nhiều cảnh, mối quan hệ giữa khung hình thứ 5 và khung hình thứ 300 gần như là một bài toán truy hồi chuỗi dài — và đó chính là nơi khiến nhiều mô hình sụp đổ.

Kinh nghiệm từ việc tối ưu hóa chi phí gas trong hợp đồng thông minh dạy tôi một nguyên tắc quan trọng: khi một hệ thống công bố tăng gấp đôi công suất đầu ra, chi phí biên của việc duy trì trạng thái nhất quán thường tăng theo cấp số nhân, không phải cấp số cộng. Những người từng vận hành node hoặc viết smart contract hiểu rõ điều này: trạng thái càng lớn, việc xác thực càng đắt. Mô hình video cũng vậy.

Sau đó là con số 50 tài sản tham chiếu.

Nghe có vẻ ấn tượng: bạn có thể cung cấp 30 bức ảnh để xác định nhân vật, 10 đoạn video để xác định chuyển động, 10 đoạn âm thanh để xác định giọng nói. Nhưng hãy nghĩ về điều này ở tầng kỹ thuật. Mỗi tài sản tham chiếu phải được mã hóa thành một biểu diễn vector, sau đó được đưa vào cơ chế chú ý chéo để điều khiển quá trình sinh. Với 50 nguồn đầu vào, tầng mã hóa đa phương thức phải xử lý một khối lượng thông tin khổng lồ. Chi phí tính toán tăng gần như tuyến tính theo số lượng đầu vào. Nhưng quan trọng hơn, khi có quá nhiều điều kiện điều khiển, mô hình phải học cách cân bằng tín hiệu: 50 tài sản tham chiếu không thể tác động đến quá trình sinh với cùng một trọng số — cái gì được ưu tiên, cái gì bị bỏ qua?

Câu trả lời quyết định chất lượng sản phẩm thực tế. Trong nhiều bài toán học máy, một mô hình có thể đạt điểm cao trên các bộ đánh giá chuẩn, nhưng khi được đưa vào các tình huống thực tế với đầu vào lộn xộn, không nhất quán, hiệu năng sẽ tụt dốc không phanh. Tôi đã thấy hiện tượng này nhiều lần: một hệ thống "thông minh" trong bản demo nhưng lại trở nên vụng về trong tay người dùng thực thụ. Các tham số ấn tượng trên slide không bao giờ kể đầy đủ câu chuyện.

Tiếp theo là khả năng điều khiển theo mốc thời gian.

Đây là một tham số khiến tôi phải đọc lại nhiều lần. Nó có nghĩa là người dùng có thể ra lệnh: "tại giây thứ 12, nhân vật quay đầu lại; tại giây thứ 20, cắt cảnh; tại giây thứ 27, trời bắt đầu mưa." Để làm được điều này, mô hình phải xây dựng một biểu diễn thời gian nội tại — nơi từng khoảnh khắc trong chuỗi khung hình có thể được đánh dấu và liên kết với một điều kiện văn bản cụ thể. Đây là một bài toán điều khiển tinh vi.

Nếu mô hình được huấn luyện theo phương pháp tự hồi quy, sinh từng khung hình một, việc ép một sự kiện xảy ra tại một mốc thời gian cụ thể có thể phá vỡ phân phối xác suất tự nhiên. Nếu mô hình sử dụng diffusion trên toàn bộ chuỗi video, việc điều khiển theo thời gian còn khó hơn, vì toàn bộ video được xử lý như một khối không gian-thời gian thống nhất, và việc chèn một điều kiện cục bộ vào một vùng cụ thể đòi hỏi các kỹ thuật điều chỉnh đặc biệt. Tôi không biết Seedance 2.5 sử dụng phương pháp nào, vì ByteDance không công bố chi tiết kiến trúc. Nhưng tôi biết một điều: nếu khả năng này hoạt động tốt trong thực tế, nó sẽ là một bước tiến lớn. Nếu nó hoạt động trục trặc, người dùng sẽ nhanh chóng bỏ rơi sản phẩm, bất kể con số trên quảng cáo có đẹp đến đâu.

Rồi đến câu hỏi về chi phí.

Một mô hình tạo video dài 30 giây có nhu cầu năng lượng tính toán khổng lồ. Ngay cả với hạ tầng đám mây lớn của ByteDance, việc vận hành một API công khai với giá hợp lý là một bài toán kinh tế đơn vị đầy thách thức. Nếu mỗi lần tạo video 30 giây tiêu tốn một lượng tính toán tương đương hàng nghìn lần tạo ảnh, và chi phí GPU trên thị trường vẫn neo ở mức cao, ByteDance phải lựa chọn: hoặc tính phí cao — làm khách hàng doanh nghiệp do dự — hoặc trợ giá — biến mỗi yêu cầu thành một khoản lỗ. Có một ranh giới mảnh giữa đổi mới và sự lãng phí, và ranh giới đó thường được vẽ bằng chi phí biên của từng lần tạo.

Sự im lặng hoàn toàn của bài viết gốc về giá cả, hạn mức miễn phí và tốc độ phản hồi là một tín hiệu đáng chú ý. Trong ngành công nghệ, khi một sản phẩm cơ sở hạ tầng đã sẵn sàng cho quy mô lớn, nhà cung cấp thường công bố giá một cách tự tin. Khi họ giữ im lặng, rất có thể họ vẫn đang loay hoay với bài toán chi phí.

Một câu hỏi kỹ thuật cuối cùng: 30 giây được tạo ra trong một lần suy luận hay qua nhiều giai đoạn nối tiếp?

Hai phương án này có ý nghĩa vô cùng khác nhau. Nếu là sinh trong một lần, mô hình phải duy trì một không gian tiềm ẩn khổng lồ, đòi hỏi bộ nhớ GPU vượt xa các mô hình hiện tại. Thời gian tạo có thể kéo dài đến hàng chục phút cho một video. Nếu là sinh theo từng phân đoạn rồi ghép nối, chi phí sẽ thấp hơn, nhưng vấn đề nhất quán giữa các phân đoạn trở thành thách thức lớn: làm sao để ánh sáng, góc máy, âm sắc giọng nói và ngoại hình nhân vật không "nhảy cóc" khi chuyển cảnh? Cách tiếp cận sinh toàn bộ có chất lượng cao hơn nhưng chi phí không tưởng. Cách tiếp cận sinh rồi ghép rẻ hơn nhưng thường tạo ra những đường nối mà người xem có thể nhận ra ngay lập tức. Hãy nhìn vào những video tạo bằng các công cụ ghép nối hiện có — chúng thường có cảm giác rời rạc khó tả, như thể từng cảnh được chụp dưới ánh sáng khác nhau. Tôi rất muốn biết Seedance 2.5 nằm ở phía nào. Nhưng bài viết gốc — vốn chỉ có một đoạn duy nhất mô tả tính năng — không cho tôi câu trả lời.

Bây giờ, hãy nói về điều mà không ai trong cuộc đua này muốn nhắc đến: điểm mù bảo mật.

Seedance 2.5 cho phép tiếp nhận tối đa 50 tài sản tham chiếu, bao gồm ảnh chụp khuôn mặt và giọng nói của người thật. Kết hợp với khả năng tạo video 30 giây nhiều cảnh và điều khiển theo mốc thời gian, đây là một bộ công cụ có độ chính xác cao để tạo video giả mạo. Bạn có thể tạo một video một người nào đó nói những điều họ chưa từng nói, trong một bối cảnh họ chưa từng xuất hiện, với giọng nói được tái tạo từ một đoạn audio vài giây. Và vì video dài 30 giây có cấu trúc câu chuyện hoàn chỉnh, việc đánh giá tính xác thực dựa trên bối cảnh rộng sẽ khó hơn nhiều so với một video ngắn 5 giây.

Nhưng trong toàn bộ bài viết gốc, không có một từ nào về an toàn. Không nhắc đến hình mờ ẩn hay hiện, không nhắc đến chính sách hạn chế sử dụng khuôn mặt người thật, không nhắc đến chứng chỉ nội dung. Sự tinh vi không phải là sự phức tạp; đó là sự rõ ràng trong bóng tối. Ở đây, bóng tối không phải là kiến trúc mô hình — mà là hệ thống trách nhiệm đi kèm với một công cụ có sức mạnh tổng hợp nội dung khủng khiếp.

Tôi liên tưởng đến thế giới blockchain — nơi một dự án có thể công bố tổng giá trị khóa lên tới hàng tỷ đô la, nhưng khi kiểm toán hợp đồng thông minh, người ta phát hiện ra những lỗ hổng có thể khiến toàn bộ số tiền đó bốc hơi trong một giao dịch. Cộng đồng thường bị mê hoặc bởi những con số lớn và quên mất cơ chế thực sự chi phối chúng. Ở đây, câu chuyện cũng vậy: chúng ta quá phấn khích vì 30 giây, 50 tài sản, và bỏ qua câu hỏi ai chịu trách nhiệm khi một video được tạo ra từ công cụ này gây ra thiệt hại thực tế.


Khi cuộc đua AI video chuyển từ bài toán "tạo được một đoạn clip đẹp" thành bài toán "tạo được một công cụ kể chuyện có thể chỉnh sửa, tiếp nối, và tin dùng", các tiêu chí đánh giá cũng phải thay đổi. Không còn đủ nếu chỉ hỏi "mô hình có tạo được không". Phải hỏi thêm: tạo với giá bao nhiêu, trong thời gian bao lâu, có nhất quán không, và nếu xảy ra lạm dụng thì trách nhiệm thuộc về ai? ByteDance đã đặt những quân cờ đúng vị trí — ứng dụng, API, hệ sinh thái nội dung. Nhưng trò chơi này không kết thúc ở tham số ấn tượng. Nó chỉ thực sự bắt đầu khi những câu hỏi khó được trả lời một cách trung thực. Người dùng thông minh sẽ chờ đợi thứ gì đó bền vững hơn cả một slide marketing: một hệ thống đáng tin cậy.

Sợ & Tham

27

Sợ hãi

Tâm lý thị trường

Chỉ số mùa altcoin

44

Mùa Bitcoin

Sự thống trị BTC Mùa altcoin

Vốn hóa thị trường

Tất cả →
# Tiền điện tử Giá
1
Bitcoin BTC
$63,127.5
1
Ethereum ETH
$1,868.4
1
Solana SOL
$72.93
1
BNB Chain BNB
$580.2
1
XRP Ledger XRP
$1.06
1
Dogecoin DOGE
$0.0699
1
Cardano ADA
$0.1733
1
Avalanche AVAX
$6.34
1
Polkadot DOT
$0.7681
1
Chainlink LINK
$8.09

🐋 Theo dõi cá voi

🔴
0xe6db...c7e2
1 ngày trước
Chuyển ra
4,042 ETH
🔵
0x376d...ecdb
12 giờ trước
Stake
18,552 BNB
🔵
0xb171...f206
1 ngày trước
Stake
869,067 USDC