2026.08.14
2.2천
0
0
기타 LLM

Z.ai GLM-5.3 출시: 743B 베이스 유지, 코딩 벤치마크 대폭 향상

Z.ai가 GLM-5.3을 발표했다. GLM-5.2와 동일한 743B 베이스 모델을 재사용하고 대규모 포스트 트레이닝만으로 코딩·사이버보안 벤치마크를 크게 끌어올렸다. 가중치는 약 2주 후 공개 예정이다.

#GLM-5.3#Z.ai#Zhipu AI#오픈소스#LLM
Z.ai GLM-5.3 출시: 743B 베이스 유지, 코딩 벤치마크 대폭 향상
AI 핵심 요약

Z.ai가 GLM-5.3을 발표했다. GLM-5.2와 동일한 743B 베이스 모델을 재사용하고 대규모 포스트 트레이닝만으로 코딩·사이버보안 벤치마크를 크게 끌어올렸다. 가중치는 약 2주 후 공개 예정이다.

핵심 요약

Z.ai(Zhipu AI)가 2026년 8월 14일 GLM-5.3을 공식 발표했다. GLM-5.2와 동일한 7,430억(743B) 파라미터 베이스 모델을 그대로 재사용했다. 베이스 모델 재훈련 없이 대규모 포스트 트레이닝만으로 코딩·사이버보안 벤치마크 성능을 끌어올린 점이 핵심이다. Z.ai API를 통해 즉시 이용 가능하며, GLM Coding Plan 기존 구독자 전원에게 롤아웃이 완료됐다.

주요 기능: 대규모 포스트 트레이닝 전략

1. 베이스 모델 재사용, 포스트 트레이닝만 확장

GLM-5.3은 GLM-5.2의 743B 파라미터 베이스 모델을 그대로 가져왔다. 새로운 베이스 모델을 처음부터 학습시키지 않았다. 대신 포스트 트레이닝 단계를 대규모로 확장했다. Z.ai에 따르면 더 많은 태스크 환경, 더 다양한 환경 유형, 더 긴 훈련 시간을 투입해 성능을 끌어올렸다. 이는 베이스 모델 재훈련 없이도 포스트 트레이닝만으로 상당한 성능 향상이 가능함을 보여주는 사례다.

2. 장시간 코딩 작업 및 사이버보안 특화

GLM-5.3은 장시간 이어지는 복잡한 코딩 작업(long-horizon coding)과 사이버보안 응용에 최적화됐다. 단발성 코드 생성이 아니라 여러 단계에 걸친 문제 해결 능력에 집중한 것이 특징이다.

3. 비공개 내부 벤치마크: Code Bench

Z.ai는 퍼블릭 테스트셋 오염을 방지하기 위해 자체 비공개 평가 체계인 Code Bench를 운영한다. MarkTechPost 보도에 따르면 GLM-5.3은 Code Bench에서 약 5만 출력 토큰을 사용해 31.4%를 기록했다. 같은 보도는 비교 대상으로 언급된 Anthropic Claude Opus 4.8이 동일 테스트에서 12만 출력 토큰을 사용해 29.5%를 기록했다고 전했다. 더 적은 출력 토큰으로 더 높은 점수를 기록했다는 의미다.

벤치마크 성능 (GLM-5.2 대비, 공식 발표 기준)

벤치마크GLM-5.2GLM-5.3
Terminal-Bench 3.04.6%28.3%
DeepSWE v1.146.2%66.9%
CyberGym77.2%84.5%
ExploitBench24.4%54.4%

Terminal-Bench 3.0에서 4.6%에서 28.3%로, DeepSWE v1.1에서 46.2%에서 66.9%로 오른 수치가 눈에 띈다. CyberGym에서는 Unite.AI 보도에 따르면 GLM-5.3이 GPT-5.6 Sol을 근소하게 상회했다고 전해졌다. 다만 같은 보도는 ExploitBench 등 심층 익스플로잇 과제에서는 최상위 비공개 모델과의 격차가 여전히 남아있다고 지적했다.

가중치 공개 계획

743B 파라미터 수치는 GLM-5.2와 동일하게 유지됐다. 모델 가중치는 발표 시점에 즉시 공개되지 않았다. Z.ai는 안전성 평가를 완료한 뒤 약 2주 후 오픈소스로 공개할 예정이라고 밝혔다. 가격은 공식 발표에서 명시되지 않았다.

사용성 분석

GLM-5.3은 현재 Z.ai API를 통해 즉시 이용할 수 있다. 별도 신청 절차 없이 GLM Coding Plan 기존 구독자 전원에게 롤아웃이 완료된 상태다. 베이스 모델이 GLM-5.2와 동일하므로 기존에 GLM-5.2 기반 워크플로우를 구축한 개발자라면 API 엔드포인트 전환만으로 성능 향상을 체감할 수 있는 구조다. 다만 가중치가 아직 공개되지 않아 로컬 배포나 자체 인프라 운용을 원하는 연구자·기업은 약 2주간 대기해야 한다.

장점

  1. 베이스 모델 재훈련 없이 성능 향상: 포스트 트레이닝 확장만으로 Terminal-Bench 3.0 등에서 큰 폭 상승
  2. 장시간 코딩·사이버보안 특화: DeepSWE v1.1, CyberGym, ExploitBench 등에서 실질적 개선
  3. 즉시 API 이용 가능: GLM Coding Plan 구독자 전원 롤아웃 완료
  4. 효율적 토큰 사용: Code Bench에서 상대적으로 적은 출력 토큰으로 높은 점수 기록 (MarkTechPost 보도)

단점 및 한계

  1. 가중치 미공개: 발표 시점 기준 오픈소스 공개까지 약 2주 대기 필요
  2. 가격 미공개: 공식 발표에서 구체적 요금 정보 제공되지 않음
  3. 심층 익스플로잇 과제 격차: ExploitBench 등에서 최상위 비공개 모델과의 격차 존재 (Unite.AI 보도)
  4. 비공개 내부 벤치마크 의존: Code Bench 결과는 제3자 검증이 어려운 비공개 평가 체계

경쟁 모델 비교

항목GLM-5.2GLM-5.3
베이스 파라미터743B743B (동일)
Terminal-Bench 3.04.6%28.3%
DeepSWE v1.146.2%66.9%
CyberGym77.2%84.5%
ExploitBench24.4%54.4%

Code Bench 비공개 평가에서는 MarkTechPost 보도에 따르면 GLM-5.3이 31.4%(약 5만 출력 토큰)를, 비교 대상으로 언급된 Claude Opus 4.8이 29.5%(12만 출력 토큰)를 기록했다고 전해졌다. CyberGym에서는 Unite.AI 보도에 따르면 GPT-5.6 Sol을 근소하게 상회했다고 전해졌다.

결론

GLM-5.3은 베이스 모델을 새로 훈련하지 않고도 대규모 포스트 트레이닝만으로 코딩·사이버보안 벤치마크를 크게 끌어올린 사례다. 장시간 코딩 작업과 사이버보안 응용을 다루는 개발자·보안 연구자에게 특히 주목할 만하다. 다만 가중치와 가격이 아직 공개되지 않은 만큼, 로컬 배포를 고려하는 기업은 2주 후 공개될 오픈소스 버전을 지켜볼 필요가 있다.

장점

  • 베이스 모델 재훈련 없이 대규모 포스트 트레이닝만으로 코딩 벤치마크 대폭 향상
  • Terminal-Bench 3.0, DeepSWE v1.1, CyberGym 등 다수 벤치마크에서 GLM-5.2 대비 뚜렷한 개선
  • Z.ai API를 통해 즉시 이용 가능, GLM Coding Plan 구독자 전원 롤아웃 완료
  • Code Bench 비공개 평가에서 상대적으로 적은 출력 토큰으로 높은 점수 기록 (MarkTechPost 보도)

단점/한계

  • 모델 가중치가 즉시 공개되지 않고 안전성 평가 후 약 2주 뒤 공개 예정
  • 공식 발표에서 API 가격 정보가 구체적으로 제공되지 않음
  • ExploitBench 등 심층 익스플로잇 과제에서는 최상위 비공개 모델과 격차 존재 (Unite.AI 보도)

댓글0

주요 기능/특징

1. GLM-5.2와 동일한 743B 베이스 모델 재사용, 재훈련 없음 2. 대규모 포스트 트레이닝으로 Terminal-Bench 3.0 4.6%→28.3% 향상 3. DeepSWE v1.1 46.2%→66.9%, CyberGym 77.2%→84.5% 개선 4. 장시간 코딩(long-horizon) 및 사이버보안 응용 최적화 5. 가중치는 안전성 평가 후 약 2주 뒤 오픈소스 공개 예정

핵심 인사이트

  • 베이스 모델 재훈련 없이 포스트 트레이닝만으로 성능을 끌어올린 것은 비용 효율적인 모델 개선 전략을 보여준다
  • Terminal-Bench 3.0에서 4.6%→28.3%로 상승한 수치는 장시간 작업 수행 능력이 크게 개선됐음을 시사한다
  • CyberGym과 ExploitBench 향상은 GLM-5.3이 사이버보안 응용 분야를 명확한 타깃으로 설정했음을 보여준다
  • MarkTechPost 보도에 따르면 Code Bench에서 더 적은 출력 토큰으로 Claude Opus 4.8과 유사하거나 더 높은 점수를 기록해 토큰 효율성이 부각된다
  • 가중치가 즉시 공개되지 않고 약 2주 후로 예정된 점은 안전성 검토를 우선하는 방식을 택했음을 의미한다
  • ExploitBench 등 심층 익스플로잇 과제에서 격차가 남아있다는 보도는 최상위 비공개 모델과의 차이가 완전히 해소되지 않았음을 보여준다
  • GLM Coding Plan 기존 구독자 전원에게 즉시 롤아웃된 점은 Z.ai가 코딩 에이전트 시장 확대에 집중하고 있음을 시사한다

이 리뷰가 유용했나요?

공유하기