Tôi đọc blog của Z.AI về GLM-5.3, dòng đầu tiên: “Calling It the Top Open-Source Code Model.” Ấn tượng đầu tiên? Một câu claim mạnh. Nhưng ngay khi scroll xuống, tôi thấy một bảng benchmark. Trong bảng đó, GLM-5.3 thua một mô hình đối thủ không tên. Khoảng cách không lớn, nhưng đủ để phá vỡ câu chuyện “top”.
Tôi là Đặng Trang, 29 tuổi, Tiến sĩ Mật mã học, hiện làm Layer2 Research Lead tại Chicago. Tôi đã dành 13 năm quan sát ngành, từng audit Uniswap v2, phát hiện lỗi gas optimization, và viết phân tích whitepaper EOS bị cộng đồng phớt lờ vì tôi là nữ. Nhưng tôi vẫn đào sâu. Và với GLM-5.3, tôi thấy một pattern quen thuộc: một team phát hành model, tự xưng là số một, nhưng dữ liệu của chính họ lại nói khác.
Context: Vì sao GLM-5.3 đáng xem xét từ góc nhìn blockchain?
Code model không chỉ viết code Python hay JavaScript. Nó có thể viết smart contract. Nó có thể audit code Solidity. Nó có thể tạo ra exploit. Vì vậy, bất kỳ mô hình ngôn ngữ nào tuyên bố “top open-source code” đều có tác động trực tiếp đến hệ sinh thái blockchain. Nếu model đó thực sự giỏi, nó sẽ giúp dev viết contract an toàn hơn, nhanh hơn. Nếu nó chỉ là marketing, thì dev sẽ mất thời gian, thậm chí có thể gặp lỗ hổng do model sinh ra.
Z.AI là một phòng thí nghiệm Trung Quốc, phát hành GLM-5.3 với trọng số mở (open-weight). Họ không công bố dataset, không công bố kiến trúc chi tiết, chỉ có một blog và vài benchmark. Tôi đã từng audit các dự án DeFi, nơi team chỉ đưa ra whitepaper đẹp, nhưng code thì đầy lỗi. GLM-5.3 có vẻ giống vậy: lời nói mạnh, bằng chứng yếu.
Core: Phân tích code và trade-offs
Tôi đã đọc blog của Z.AI. Họ đưa ra bảng so sánh trên HumanEval, SWE-bench, và một số benchmark khác. GLM-5.3 đạt 85.2% trên HumanEval, thấp hơn model đối thủ (không nêu tên) 86.8%. Khoảng cách 1.6% không phải là lớn, nhưng nó đủ để phá vỡ claim “top”.
Nhưng điều thú vị hơn là: Z.AI không nói rõ đối thủ là ai. Tôi nghi ngờ đó là DeepSeek-Coder-V2 hoặc Qwen3-Coder. Cả hai đều là model Trung Quốc, và cả hai đều open-source. Nếu Z.AI không dám nêu tên, có nghĩa là họ đang cố tình che giấu sự thật.
Tôi đã từng gặp tình huống tương tự khi audit EOS. Whitepaper của họ nói về “decentralized governance”, nhưng tôi phát hiện ra rằng cơ chế DPoS thực tế tập trung quyền lực vào 21 block producer. Tôi viết bài phân tích, bị cộng đồng phớt lờ. Sau đó, EOS thất bại.
Với GLM-5.3, tôi nhìn thấy cùng một pattern: - Một tuyên bố mạnh mẽ - Bằng chứng yếu ớt - Cố tình che giấu thông tin bất lợi
Từ góc nhìn kỹ thuật, tôi muốn đào sâu vào ba khía cạnh:
- Kiến trúc: Z.AI không tiết lộ kiến trúc. Nhưng dựa trên GLM-4, nó dùng Transformer với RoPE và attention mask. GLM-5.3 có thể là fine-tune trên code dataset, plus RLHF. Nhưng nếu không có kiến trúc mới, thì không thể gọi là “top”.
- Dữ liệu: Họ không công bố dataset. Một model code tốt cần có dataset chất lượng cao, bao gồm code từ GitHub, Stack Overflow, và đặc biệt là smart contract. Nếu không có smart contract data, model sẽ không hiểu được các pattern bảo mật như reentrancy hay access control.
- Benchmark: HumanEval và SWE-bench là benchmark phổ biến, nhưng chúng không đo lường khả năng viết smart contract an toàn. Có benchmark dành riêng cho code blockchain như SmartBugs hay SolidityBench? Tôi không thấy Z.AI đề cập.
Dựa trên kinh nghiệm audit của tôi, một model code nếu không được đánh giá trên các tác vụ blockchain cụ thể thì không thể tin tưởng để sử dụng trong hệ sinh thái. Tôi đã từng thấy một dự án DeFi sử dụng model AI để generate contract, và kết quả là một lỗ hổng reentrancy nghiêm trọng.
Contrarian: Điểm mù bảo mật
Cộng đồng thường nghĩ rằng open-weight model là an toàn hơn vì có thể kiểm tra. Nhưng thực tế, open-weight cho phép kẻ tấn công tải model về, loại bỏ alignment, và sử dụng nó để tạo ra exploit. GLM-5.3 là open-weight, vậy ai cũng có thể download và jailbreak.
Z.AI không công bố bất kỳ red team report nào. Họ không nói về harmful code generation rate. Điều này có nghĩa là họ chưa đánh giá rủi ro bảo mật một cách nghiêm túc.
Một điểm mù khác: Z.AI là công ty Trung Quốc, phải tuân thủ luật AI của Trung Quốc. Điều này có thể áp dụng cho API, nhưng với open-weight, model có thể được sử dụng ở bất kỳ đâu. Nếu model sinh ra code độc hại, ai chịu trách nhiệm?
Tôi nhớ lại khi audit Uniswap v2, tôi phát hiện lỗi gas optimization có thể tiết kiệm 15-20% phí. Đó là một lỗi nhỏ, nhưng nếu không sửa, nó có thể gây tổn thất hàng triệu USD. Với GLM-5.3, nếu nó sinh ra smart contract có lỗi, thiệt hại có thể lớn hơn nhiều.
Takeaway: Dự báo lỗ hổng
Tôi dự đoán rằng trong vòng 6 tháng tới, sẽ có ít nhất một lỗ hổng bảo mật được phát hiện trong code do GLM-5.3 tạo ra. Lý do: model không được đánh giá trên các tác vụ blockchain, và team không minh bạch về dữ liệu huấn luyện.

Nếu bạn là developer blockchain, đừng vội sử dụng GLM-5.3 để viết smart contract. Hãy đợi các audit độc lập từ cộng đồng. Nếu bạn là investor, hãy coi chừng những dự án tự xưng “top” mà không có bằng chứng.
Tôi kết thúc bài viết này bằng một câu hỏi: Khi nào thì cộng đồng blockchain sẽ học được rằng một tuyên bố mạnh mẽ không thay thế được một audit code?