Zhipu ra mắt mô hình đa phương thức gốc GLM-5.3-Flash với 320 tỷ tham số, trong đó 18 tỷ tham số được kích hoạt. Mô hình được giới thiệu là vượt GLM-5.2 về khả năng lập trình và tác vụ tác nhân, đồng thời tiến gần Claude Opus 4.8.
GLM-5.3-Flash sử dụng kiến trúc kết hợp giữa sparse attention và linear attention, cùng kỹ thuật Manifold-Constrained Hyper-Connections. Chi phí của mô hình được giảm xuống còn khoảng một phần mười so với trước.
Mô hình được huấn luyện trên kho dữ liệu đa phương thức gồm 30 nghìn tỷ đơn vị dữ liệu. Zhipu cho biết chi phí suy luận trong các tác vụ ngữ cảnh dài chỉ còn khoảng một phần ba so với GLM-5.3.
Trên Artificial Analysis Intelligence Index v4.1.1, GLM-5.3-Flash đạt 57 điểm với chi phí khoảng 0,045 USD mỗi tác vụ. Trong giai đoạn thử nghiệm ẩn danh dưới tên ox-alpha trên OpenCode và OpenRouter, mô hình được giới thiệu là nhanh chóng trở thành một trong những mô hình được sử dụng nhiều nhất trong vòng một tuần.
Zhipu cũng cho biết hiệu suất suy luận của GLM-5.3-Flash trên các cụm chip AI sản xuất trong nước đã tiến gần mức của GPU NVIDIA.