익명 모델 Ox Alpha, 지푸가 GLM-5.3-Flash로 공개했습니다

Ox Alpha는 지푸(Z.ai)가 정식 공개 전 OpenRouter·OpenCode에 올린 익명 모델이며, 2026년 8월 26일 GLM-5.3-Flash로 정체를 밝혔습니다. GLM-5 시리즈 첫 네이티브 멀티모달이며, 전체 파라미터 320B, 활성 18B, 컨텍스트 약 100만 토큰입니다.

사실: 정식 공개 전 Ox Alpha로 익명 테스트했습니다

서버실 랙과 표시등

8월 20일경, 개발사를 밝히지 않은 무료 스텔스 모델이 OpenRouter와 OpenCode에 등장했습니다. 중국 커뮤니티에서는 牛来(소 래)라는 별칭으로 불렀습니다. SiliconANGLE은 8월 26일자에서, OpenRouter가 개발사를 비공개로 두고 Ox Alpha를 무료 호스팅했으며 사용자들이 Z.ai를 추정했다고 전했습니다.

지푸 공식 블로그는 공개 전 ox-alpha로 OpenCode와 OpenRouter에서 사용자 피드백을 수집했다고 적었습니다. 그주 두 플랫폼에서 가장 인기 있는 모델이 되었고, 이 트래픽은 중국산 AI 칩으로 서빙했다고 했습니다. 8월 26일 GLM-5.3-Flash가 정식 상선되었고, 웨이트는 Hugging Face에 공개되었습니다.

출처: 지푸 공식 블로그(2026-08-26), 지푸 리서치 공지, SiliconANGLE, IT之家

사실: GLM-5.3-Flash는 320B-A18B이고, 웨이트는 MIT입니다

코드 작업대와 모니터

공식 블로그와 Hugging Face 카드 기준, GLM-5.3-Flash는 전체 파라미터 320B, 활성 파라미터 18B입니다. GLM-5 시리즈의 첫 네이티브 멀티모달 모델입니다. 희소 어텐션과 선형 어텐션을 섞은 혼합 구조를 쓰고, mHC(Manifold-Constrained Hyper-Connections)를 채택했으며, 30T 토큰 다모달 미리훈련을 했다고 회사는 적었습니다.

GLM-4.5 대비 수치는 공식 블로그에 이렇게 나옵니다. 전체 파라미터 355B에서 320B, 활성 파라미터 32B에서 18B, 층 수 92에서 45입니다. 어텐션 계산과 KV 캐시 감소는 비교 대상이 다릅니다. 회사는 GLM-5.3 대비 어텐션 계산 약 3배, KV 캐시 약 4.4배 감소라고 적었습니다. 공식 문서는 각각 3.01배, 4.44배로도 표기합니다. 파라미터·층 수 대조(GLM-4.5)와 어텐션·KV 대조(GLM-5.3)를 한 줄로 섞으면 안 됩니다.

컨텍스트는 약 100만 토큰입니다. SiliconANGLE은 입력으로 텍스트·이미지·비디오를 받고, 응답은 최대 131,072 토큰이라고 적었습니다. 공식 문서는 컨텍스트 1M, 최대 출력 128K로 안내합니다.

Hugging Face 모델 카드의 라이선스는 MIT입니다. 공개된 것은 웨이트입니다. 학습 코드와 학습 데이터 공개는 확인되지 않았습니다. SiliconANGLE이 “released the code”라고 쓴 대목을 학습 코드 공개로 읽지는 않습니다.

배포 프레임워크는 공식 안내 기준 SGLang, vLLM, TokenSpeed입니다. GLM Coding Plan과 API도 열렸습니다. 회사는 중국 칩 클러스터에서 Encode–Prefill–Decode(EPD) 분리 구조로 서빙했고, 같은 하드웨어의 초기 기선 대비 서빙 성능이 약 3배라고 자체 주장했습니다.

공식 벤치 표에서 이 글이 인용하는 숫자는 다음뿐입니다. Artificial Analysis Intelligence Index 57점, 할인 기준 작업당 0.045달러입니다. DeepSWE는 63.4로 GLM-5.2의 46.2를 웃돕니다. AutomationBench는 48.8로 GLM-5.2의 26.2를 웃돕니다. Z.ai Code Bench max는 29.0으로 Claude Opus 4.8의 29.5에 가깝습니다. 표의 다른 점수는 여기서 보태지 않습니다.

IT之家는 정가를 GLM-5.3의 1/10, 할인 가를 1/20, Opus 4.8의 1/40이라고 전했습니다. 망이과학은 1/40이 같은 작업을 끝내는 비용 주장이지, 토큰 단가의 직접 비는 아닐 수 있다고 적었습니다. GLM-5.3 본체(API 플래그십)와 Flash는 다른 모델입니다.

출처: 지푸 공식 블로그, Hugging Face GLM-5.3-Flash, Z.ai 문서, BigModel 문서, 지푸 리서치 공지, SiliconANGLE, IT之家, 망이과학

해석: 호출량 숫자는 출처를 합치면 안 됩니다

라벨 없는 웨이퍼와 칩

호출량 숫자는 출처를 나눠 읽어야 합니다. 지푸 공식 블로그는 그주 인기 1위라고만 적었고, 토큰 수는 공식 블로그에 없습니다.

매체·분석 글은 OpenRouter 6일 약 20조 토큰이라고 적었습니다. 이는 2차 보도이며, 지푸 공식 숫자가 아닙니다. OpenRouter 1차 집계 URL은 이 글에서 확인하지 못했습니다.

OpenCode 6일 42조 토큰은 OpenCode 자체 집계를 망이과학이 전한 숫자입니다. 같은 글은 OpenCode가 말한 “매일 100조 토큰”이 서빙 용량이고, 6일 누적 호출량과 구경이 다르다고 구분했습니다. 20조와 42조를 더해 한 플랫폼의 총량처럼 쓰면 안 됩니다.

익명 테스트 인기는 후기 지표가 아닙니다. 중국 칩 서빙은 회사 공식 설명입니다. 오픈웨이트는 MIT 가중치 공개를 뜻하고, 학습 레시피 공개는 아닙니다. 토크나이저 포렌식이나 루머 추정은 이 글에 넣지 않습니다.

출처: 지푸 공식 블로그, 망이과학


🛒 오늘의 추천 상품

로컬에서 모델을 돌리거나 긴 컨텍스트 작업을 할 때 자주 찾는 기기입니다.

노트북

코딩과 문서 작업을 이어서 하는 노트북입니다.

🛒 노트북 상품 확인하기

SSD

체크포인트와 웨이트를 올려 두는 SSD입니다.

🛒 SSD 상품 확인하기

태블릿

문서와 코드를 나눠 보는 태블릿입니다.

🛒 태블릿 상품 확인하기

이 포스팅은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.


한줄 정리

Ox Alpha는 지푸가 8월 26일 GLM-5.3-Flash로 공개한 익명 테스트 모델입니다. 320B-A18B, MIT 웨이트이며 호출량 숫자는 출처를 합치면 안 됩니다.