Inkling-Small 출시: 276B 오픈웨이트 멀티모달 MoE 모델 분석
Thinking Machines Lab이 276B 파라미터 오픈웨이트 모델 Inkling-Small을 공개했다. 상위 모델 Inkling보다 코딩·추론 벤치마크는 앞섰지만 사실성 벤치마크는 하락했다.
Thinking Machines Lab이 276B 파라미터 오픈웨이트 모델 Inkling-Small을 공개했다. 상위 모델 Inkling보다 코딩·추론 벤치마크는 앞섰지만 사실성 벤치마크는 하락했다.
핵심 요약
Thinking Machines Lab이 2026년 8월 2일 새로운 오픈웨이트 모델 Inkling-Small을 공개했다. Mira Murati 전 OpenAI CTO가 설립한 이 회사는 지난 7월 15일 975B 파라미터의 첫 모델 Inkling을 오픈웨이트로 선보인 데 이어, 약 보름 만에 더 작은 크기의 후속 모델을 내놓았다.
Inkling-Small은 총 276B 파라미터에 활성 파라미터는 12B로, 상위 모델의 약 4분의 1 크기다. 그런데도 일부 벤치마크에서 상위 모델을 오히려 앞서는 결과를 보여 주목받고 있다.
아키텍처와 멀티모달 지원
Inkling-Small은 42층 디코더 전용 트랜스포머 구조를 기반으로 한 sparse Mixture-of-Experts(MoE) 모델이다. 토큰마다 256개 전문가 중 6개와 공유 전문가 2개가 라우팅되며, 로컬·글로벌 하이브리드 어텐션 레이어를 사용한다. 컨텍스트 윈도우는 최대 100만 토큰까지 지원하고, 'thinking effort' 파라미터로 추론 강도를 조절할 수 있다.
멀티모달 입력도 지원한다. 텍스트 외에 이미지(40x40 픽셀 패치, 4레이어 hMLP 처리)와 오디오(WAV 16kHz, 2분 이내 권장)를 입력으로 받을 수 있다. 다만 출력은 텍스트로만 제한된다.
사후학습 과정에서는 상위 모델 Inkling을 teacher로 삼은 on-policy distillation 기법을 적용했고, 이후 2주간 에이전틱 코딩 강화학습(RL)을 추가로 진행했다. Inkling-Small은 Inkling보다 나중에 학습을 시작해 더 정제된 사전학습 데이터와 레시피를 적용했다는 설명이다.
벤치마크 성능
| 벤치마크 | Inkling-Small | Inkling |
|---|---|---|
| Humanity's Last Exam | 31.6% | 29.7% |
| SWE-bench Verified | 80.2% | 77.6% |
| GPQA Diamond | 89.5% | 87.2% |
| AIME 2026 | 95.5% | 97.1% |
| SimpleQA Verified | 20.6% | 43.9% |
Humanity's Last Exam과 SWE-bench Verified에서는 Inkling-Small이 오히려 상위 모델 Inkling을 앞섰다. 반면 SimpleQA Verified는 20.6%로 Inkling의 43.9%에 크게 못 미쳐, 사실성(factuality) 측면에서는 뚜렷한 약점을 드러냈다.
배포 요구사항과 Tinker 플랫폼
배포 요구사항은 체크포인트 형식에 따라 다르다. BF16 체크포인트는 총 600GB VRAM이 필요해 NVIDIA B300 4장 또는 H200 8장 구성이 요구된다. 반면 NVFP4 체크포인트는 최소 180GB로, 단일 B300 GPU에서 W4A4 양자화 방식으로 구동할 수 있다. SGLang, vLLM, TokenSpeed, Unsloth, Hugging Face 등 주요 런타임을 지원해 기존 인프라에 통합하기 수월하다.
Inkling-Small은 Thinking Machines의 자체 파인튜닝 플랫폼 Tinker에서도 기간 한정 할인가로 제공되며, Tinker Playground에서는 텍스트·이미지·오디오 채팅을 바로 테스트해 볼 수 있다. 모델 학습은 NVIDIA GB300 NVL72 시스템에서 이뤄졌다.
장점과 한계
장점은 명확하다. 활성 파라미터가 12B에 불과함에도 SWE-bench와 HLE에서 4배 큰 상위 모델을 앞섰고, NVFP4 양자화로 단일 GPU 구동도 가능해 접근성이 높다. Apache 2.0 라이선스로 상업적 활용에도 제약이 없다.
한계도 뚜렷하다. SimpleQA Verified 20.6%는 사실성 측면에서 명백한 약점이며, BF16 기준으로는 여전히 600GB VRAM급 고사양 인프라가 필요하다. 출력이 텍스트로만 제한되는 점도 아쉽다.
전망
Thinking Machines는 Inkling-Small을 범용 프론티어 모델 경쟁 제품으로 포지셔닝하지 않는다. 회사는 공식적으로 "오늘날 가장 강력한 모델(오픈이든 클로즈드든)은 아니다"라고 밝히며, 대신 자사 파인튜닝 플랫폼 Tinker를 통해 기업이 자체 데이터로 특화 학습을 하면 범용 챗봇보다 특정 업무에서 더 나은 성능을 낼 수 있다는 전략을 강조한다. 이는 초거대 모델 성능 경쟁 대신 파인튜닝 생태계 구축에 집중하는 방향으로 읽힌다.
결론
Inkling-Small은 크기 대비 효율이 높은 오픈웨이트 MoE 모델로, 일부 코딩·추론 벤치마크에서 상위 모델을 능가하는 결과를 보였다. 다만 사실성 벤치마크 하락은 분명한 한계다. 자체 인프라에서 모델을 파인튜닝하려는 개발자와 기업에게 적합한 선택지다.
장점
- SWE-bench, HLE 등 일부 벤치마크에서 4배 큰 상위 모델(Inkling)을 능가하는 효율
- 활성 파라미터 12B로 대형 모델 대비 낮은 추론 비용
- 텍스트·이미지·오디오 멀티모달 입력 지원
- Apache 2.0 오픈웨이트로 상업적 활용이 자유로움
- NVFP4 양자화로 단일 GPU(B300) 구동 가능
단점/한계
- SimpleQA Verified 20.6%로 사실성(factuality) 측면에서 뚜렷한 약점
- BF16 기준 600GB VRAM 요구로 고사양 인프라 필요
- 출력은 텍스트로만 제한되어 멀티모달 생성은 불가능
- 제작사 스스로 '가장 강력한 모델은 아니다'라고 명시할 만큼 프론티어 성능과는 거리
참고 자료
댓글0개
주요 기능/특징
1. 총 276B 파라미터, 활성 파라미터 12B의 sparse MoE 아키텍처 (256개 전문가 중 6개+공유 2개 라우팅) 2. 텍스트·이미지·오디오 멀티모달 입력 지원 (출력은 텍스트만) 3. 최대 100만 토큰 컨텍스트 윈도우, 'thinking effort' 파라미터로 추론 강도 조절 4. NVFP4 양자화 체크포인트로 단일 B300 GPU 구동 가능 (최소 180GB) 5. Apache 2.0 오픈웨이트, SGLang/vLLM/TokenSpeed/Unsloth/Hugging Face 등 주요 런타임 지원
핵심 인사이트
- Inkling-Small은 276B 총 파라미터 중 12B만 활성화하는 sparse MoE 구조로, 상위 모델 Inkling(975B) 대비 훨씬 가벼운 추론 비용을 갖는다
- SWE-bench Verified 80.2%, Humanity's Last Exam 31.6%로 두 벤치마크에서 4배 큰 상위 모델 Inkling을 앞섰다
- SimpleQA Verified는 20.6%로 Inkling의 43.9% 대비 절반 이하로, 사실성(factuality) 측면의 뚜렷한 약점을 드러냈다
- 텍스트, 이미지(40x40 패치), 오디오(WAV 16kHz)를 입력으로 받는 멀티모달 모델이지만 출력은 텍스트로만 제한된다
- NVFP4 양자화 체크포인트는 최소 180GB로 단일 B300 GPU에서 구동 가능해 배포 접근성을 높였다
- 사후학습은 Inkling을 teacher로 한 on-policy distillation과 2주간의 에이전틱 코딩 RL로 이뤄졌다
- Thinking Machines는 이 모델이 최강 모델이 아니라고 공식적으로 밝히며, Tinker 플랫폼을 통한 기업 맞춤 파인튜닝 전략을 강조한다
- Apache 2.0 라이선스로 Hugging Face에서 자유롭게 다운로드 및 상업적 활용이 가능하다
이 리뷰가 유용했나요?
공유하기
관련 AI 리뷰
MCP 새 스펙 2026-07-28 발표: Stateful에서 Stateless 코어로 전환
MCP의 다섯 번째 스펙 2026-07-28이 공개됐다. 양방향 stateful 구조를 버리고 stateless 코어로 전환해 서버리스·엣지 배포를 지원하지만 하위 호환은 깨진다.
VIDraft Aether-7B-5Attn 리뷰: 데이터·코드까지 공개한 국산 오픈소스 LLM
한국 스타트업 VIDraft가 5종 이종 어텐션을 결합한 Aether-7B-5Attn을 공개했다. 학습 데이터·코드·체크포인트까지 전부 오픈해 재현 가능성을 극대화했다.
알리바바 T-Head, AI칩 스택 SAIL 오픈소스 공개…탈CUDA 시동
알리바바 칩 설계 자회사 T-Head가 자사 Zhenwu AI칩용 소프트웨어 스택 SAIL을 WAIC 2026에서 오픈소스로 공개했다. 엔비디아 CUDA 의존 탈피가 목표다.
Robbyant LingBot-VA 2.0 오픈소스 공개: 로봇 제어 추론 6.5배 가속
Ant Group 산하 Robbyant가 로봇 조작용 인과적 비디오-액션 모델 LingBot-VA 2.0을 오픈소스로 공개했다. RoboTwin 2.0에서 평균 93.6% 성공률, 추론 속도는 6.5배 향상됐다(공식 발표).
