Z.ai GLM-5.3 출시: 743B 베이스 유지, 코딩 벤치마크 대폭 향상
Z.ai가 GLM-5.3을 발표했다. GLM-5.2와 동일한 743B 베이스 모델을 재사용하고 대규모 포스트 트레이닝만으로 코딩·사이버보안 벤치마크를 크게 끌어올렸다. 가중치는 약 2주 후 공개 예정이다.
Z.ai가 GLM-5.3을 발표했다. GLM-5.2와 동일한 743B 베이스 모델을 재사용하고 대규모 포스트 트레이닝만으로 코딩·사이버보안 벤치마크를 크게 끌어올렸다. 가중치는 약 2주 후 공개 예정이다.
핵심 요약
Z.ai(Zhipu AI)가 2026년 8월 14일 GLM-5.3을 공식 발표했다. GLM-5.2와 동일한 7,430억(743B) 파라미터 베이스 모델을 그대로 재사용했다. 베이스 모델 재훈련 없이 대규모 포스트 트레이닝만으로 코딩·사이버보안 벤치마크 성능을 끌어올린 점이 핵심이다. Z.ai API를 통해 즉시 이용 가능하며, GLM Coding Plan 기존 구독자 전원에게 롤아웃이 완료됐다.
주요 기능: 대규모 포스트 트레이닝 전략
1. 베이스 모델 재사용, 포스트 트레이닝만 확장
GLM-5.3은 GLM-5.2의 743B 파라미터 베이스 모델을 그대로 가져왔다. 새로운 베이스 모델을 처음부터 학습시키지 않았다. 대신 포스트 트레이닝 단계를 대규모로 확장했다. Z.ai에 따르면 더 많은 태스크 환경, 더 다양한 환경 유형, 더 긴 훈련 시간을 투입해 성능을 끌어올렸다. 이는 베이스 모델 재훈련 없이도 포스트 트레이닝만으로 상당한 성능 향상이 가능함을 보여주는 사례다.
2. 장시간 코딩 작업 및 사이버보안 특화
GLM-5.3은 장시간 이어지는 복잡한 코딩 작업(long-horizon coding)과 사이버보안 응용에 최적화됐다. 단발성 코드 생성이 아니라 여러 단계에 걸친 문제 해결 능력에 집중한 것이 특징이다.
3. 비공개 내부 벤치마크: Code Bench
Z.ai는 퍼블릭 테스트셋 오염을 방지하기 위해 자체 비공개 평가 체계인 Code Bench를 운영한다. MarkTechPost 보도에 따르면 GLM-5.3은 Code Bench에서 약 5만 출력 토큰을 사용해 31.4%를 기록했다. 같은 보도는 비교 대상으로 언급된 Anthropic Claude Opus 4.8이 동일 테스트에서 12만 출력 토큰을 사용해 29.5%를 기록했다고 전했다. 더 적은 출력 토큰으로 더 높은 점수를 기록했다는 의미다.
벤치마크 성능 (GLM-5.2 대비, 공식 발표 기준)
| 벤치마크 | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% |
| DeepSWE v1.1 | 46.2% | 66.9% |
| CyberGym | 77.2% | 84.5% |
| ExploitBench | 24.4% | 54.4% |
Terminal-Bench 3.0에서 4.6%에서 28.3%로, DeepSWE v1.1에서 46.2%에서 66.9%로 오른 수치가 눈에 띈다. CyberGym에서는 Unite.AI 보도에 따르면 GLM-5.3이 GPT-5.6 Sol을 근소하게 상회했다고 전해졌다. 다만 같은 보도는 ExploitBench 등 심층 익스플로잇 과제에서는 최상위 비공개 모델과의 격차가 여전히 남아있다고 지적했다.
가중치 공개 계획
743B 파라미터 수치는 GLM-5.2와 동일하게 유지됐다. 모델 가중치는 발표 시점에 즉시 공개되지 않았다. Z.ai는 안전성 평가를 완료한 뒤 약 2주 후 오픈소스로 공개할 예정이라고 밝혔다. 가격은 공식 발표에서 명시되지 않았다.
사용성 분석
GLM-5.3은 현재 Z.ai API를 통해 즉시 이용할 수 있다. 별도 신청 절차 없이 GLM Coding Plan 기존 구독자 전원에게 롤아웃이 완료된 상태다. 베이스 모델이 GLM-5.2와 동일하므로 기존에 GLM-5.2 기반 워크플로우를 구축한 개발자라면 API 엔드포인트 전환만으로 성능 향상을 체감할 수 있는 구조다. 다만 가중치가 아직 공개되지 않아 로컬 배포나 자체 인프라 운용을 원하는 연구자·기업은 약 2주간 대기해야 한다.
장점
- 베이스 모델 재훈련 없이 성능 향상: 포스트 트레이닝 확장만으로 Terminal-Bench 3.0 등에서 큰 폭 상승
- 장시간 코딩·사이버보안 특화: DeepSWE v1.1, CyberGym, ExploitBench 등에서 실질적 개선
- 즉시 API 이용 가능: GLM Coding Plan 구독자 전원 롤아웃 완료
- 효율적 토큰 사용: Code Bench에서 상대적으로 적은 출력 토큰으로 높은 점수 기록 (MarkTechPost 보도)
단점 및 한계
- 가중치 미공개: 발표 시점 기준 오픈소스 공개까지 약 2주 대기 필요
- 가격 미공개: 공식 발표에서 구체적 요금 정보 제공되지 않음
- 심층 익스플로잇 과제 격차: ExploitBench 등에서 최상위 비공개 모델과의 격차 존재 (Unite.AI 보도)
- 비공개 내부 벤치마크 의존: Code Bench 결과는 제3자 검증이 어려운 비공개 평가 체계
경쟁 모델 비교
| 항목 | GLM-5.2 | GLM-5.3 |
|---|---|---|
| 베이스 파라미터 | 743B | 743B (동일) |
| Terminal-Bench 3.0 | 4.6% | 28.3% |
| DeepSWE v1.1 | 46.2% | 66.9% |
| CyberGym | 77.2% | 84.5% |
| ExploitBench | 24.4% | 54.4% |
Code Bench 비공개 평가에서는 MarkTechPost 보도에 따르면 GLM-5.3이 31.4%(약 5만 출력 토큰)를, 비교 대상으로 언급된 Claude Opus 4.8이 29.5%(12만 출력 토큰)를 기록했다고 전해졌다. CyberGym에서는 Unite.AI 보도에 따르면 GPT-5.6 Sol을 근소하게 상회했다고 전해졌다.
결론
GLM-5.3은 베이스 모델을 새로 훈련하지 않고도 대규모 포스트 트레이닝만으로 코딩·사이버보안 벤치마크를 크게 끌어올린 사례다. 장시간 코딩 작업과 사이버보안 응용을 다루는 개발자·보안 연구자에게 특히 주목할 만하다. 다만 가중치와 가격이 아직 공개되지 않은 만큼, 로컬 배포를 고려하는 기업은 2주 후 공개될 오픈소스 버전을 지켜볼 필요가 있다.
장점
- 베이스 모델 재훈련 없이 대규모 포스트 트레이닝만으로 코딩 벤치마크 대폭 향상
- Terminal-Bench 3.0, DeepSWE v1.1, CyberGym 등 다수 벤치마크에서 GLM-5.2 대비 뚜렷한 개선
- Z.ai API를 통해 즉시 이용 가능, GLM Coding Plan 구독자 전원 롤아웃 완료
- Code Bench 비공개 평가에서 상대적으로 적은 출력 토큰으로 높은 점수 기록 (MarkTechPost 보도)
단점/한계
- 모델 가중치가 즉시 공개되지 않고 안전성 평가 후 약 2주 뒤 공개 예정
- 공식 발표에서 API 가격 정보가 구체적으로 제공되지 않음
- ExploitBench 등 심층 익스플로잇 과제에서는 최상위 비공개 모델과 격차 존재 (Unite.AI 보도)
참고 자료
댓글0개
주요 기능/특징
1. GLM-5.2와 동일한 743B 베이스 모델 재사용, 재훈련 없음 2. 대규모 포스트 트레이닝으로 Terminal-Bench 3.0 4.6%→28.3% 향상 3. DeepSWE v1.1 46.2%→66.9%, CyberGym 77.2%→84.5% 개선 4. 장시간 코딩(long-horizon) 및 사이버보안 응용 최적화 5. 가중치는 안전성 평가 후 약 2주 뒤 오픈소스 공개 예정
핵심 인사이트
- 베이스 모델 재훈련 없이 포스트 트레이닝만으로 성능을 끌어올린 것은 비용 효율적인 모델 개선 전략을 보여준다
- Terminal-Bench 3.0에서 4.6%→28.3%로 상승한 수치는 장시간 작업 수행 능력이 크게 개선됐음을 시사한다
- CyberGym과 ExploitBench 향상은 GLM-5.3이 사이버보안 응용 분야를 명확한 타깃으로 설정했음을 보여준다
- MarkTechPost 보도에 따르면 Code Bench에서 더 적은 출력 토큰으로 Claude Opus 4.8과 유사하거나 더 높은 점수를 기록해 토큰 효율성이 부각된다
- 가중치가 즉시 공개되지 않고 약 2주 후로 예정된 점은 안전성 검토를 우선하는 방식을 택했음을 의미한다
- ExploitBench 등 심층 익스플로잇 과제에서 격차가 남아있다는 보도는 최상위 비공개 모델과의 차이가 완전히 해소되지 않았음을 보여준다
- GLM Coding Plan 기존 구독자 전원에게 즉시 롤아웃된 점은 Z.ai가 코딩 에이전트 시장 확대에 집중하고 있음을 시사한다
이 리뷰가 유용했나요?
공유하기
관련 AI 리뷰
DeepSeek, 주말 API 피크 요금 전격 폐지... 도입 8일 만
DeepSeek가 8월 23일부터 API 주말 사용량 전체를 저가 오프피크 요금으로 통일했다. 8월 16일 피크제 도입 8일 만의 조정으로, 개발자 비용 부담이 줄었다.
DeepSeek-V4-Flash-Vision-Exp 공개: 자체 벤치마크로 Opus 4.8과 경합
DeepSeek가 2026년 8월 21일 실험적 비전 모델 DeepSeek-V4-Flash-Vision-Exp를 공개했다. 자체 벤치마크에서 Anthropic Opus 4.8과 경합하는 결과를 발표했으나 제3자 검증은 없다.
xAI Grok 4.6 출시: 에이전틱 코딩 강화, 자기검증으로 신뢰성 개선
xAI가 8월 12일 Grok 4.6을 출시했다. 장시간 에이전틱 코딩과 자기검증에 초점을 맞춰 DeepSWE·APEX-Agents 점수가 크게 올랐다. 컨텍스트는 경쟁 모델보다 좁다.
xAI Grok Bot 베타 출시: 24시간 일하는 자율 AI 에이전트 팀원
xAI가 8월 11일 발표한 Grok Bot 퍼블릭 베타. 전용 클라우드 컴퓨터로 앱을 조작해 업무를 끝까지 처리하는 상시 가동 에이전트다. SuperGrok Heavy·Cursor 상위 요금제 사용자에게 번들 제공된다.
