2026.08.11
2.5천
0
0
오픈소스

엔비디아 Nemotron 3.5 Lightning 출시: 30B 경량모델+NeMo Switchyard

엔비디아가 30B(활성 3B) 파라미터 경량 오픈모델 Nemotron 3.5 Lightning과 자동 모델 라우팅 라이브러리 NeMo Switchyard를 공개했다. 단일 GPU로 구동 가능한 에이전트용 모델이다.

#Nvidia#Nemotron 3.5 Lightning#NeMo Switchyard#오픈소스 LLM#MoE
엔비디아 Nemotron 3.5 Lightning 출시: 30B 경량모델+NeMo Switchyard
AI 핵심 요약

엔비디아가 30B(활성 3B) 파라미터 경량 오픈모델 Nemotron 3.5 Lightning과 자동 모델 라우팅 라이브러리 NeMo Switchyard를 공개했다. 단일 GPU로 구동 가능한 에이전트용 모델이다.

핵심 요약

2026년 8월 11일, Nvidia가 경량 오픈모델 "Nemotron 3.5 Lightning"과 모델 라우팅 라이브러리 "NeMo Switchyard"를 함께 공개했다. Nemotron 3.5 Lightning은 300억(30B) 파라미터 규모의 Mixture-of-Experts(MoE) 구조 모델로, 추론 시 실제 활성화되는 파라미터는 30억(3B)에 불과하다. 단일 PC급 GPU에서 구동 가능하도록 설계됐으며, Hugging Face, ModelScope, OpenRouter, build.nvidia.com(NIM 마이크로서비스)을 통해 즉시 사용할 수 있다. 함께 공개된 NeMo Switchyard는 작업 특성에 따라 오픈소스·독점·Nvidia 모델을 자동으로 골라 연결하는 오픈소스 라이브러리로 GitHub에 공개됐다.

주요 기능

1. MoE 구조 기반 경량 설계

Nemotron 3.5 Lightning은 전체 300억 파라미터 중 추론 시 30억 파라미터만 활성화하는 MoE 구조를 채택했다. 이를 통해 대형 모델급 표현력에 근접하면서도 연산량과 메모리 요구량을 낮췄다.

2. 단일 GPU 구동과 속도 향상

Nvidia 공식 발표에 따르면 동급 모델 대비 최대 4배 빠른 출력 속도, 30% 빠른 에이전트 작업 완료 속도를 제공한다. 단일 PC급 GPU 한 대로 구동할 수 있어 대규모 인프라 없이도 배포가 가능하다.

3. 즉시 사용 가능한 4개 배포 경로

공개 즉시 아래 네 개 채널에서 모델을 내려받거나 API 형태로 호출할 수 있다.

배포 경로이용 형태
Hugging Face모델 가중치 다운로드
ModelScope모델 가중치 다운로드
OpenRouterAPI 호출
build.nvidia.comNIM 마이크로서비스

4. NeMo Switchyard: 작업별 자동 모델 라우팅

NeMo Switchyard는 들어오는 작업의 성격을 판단해 오픈소스, 독점, Nvidia 모델 중 가장 적합한 모델로 자동 연결하는 오픈소스 라이브러리다. GitHub에 공개돼 누구나 코드를 확인하고 기여할 수 있다. Boomi, Cognition, Kong, LangChain, Siemens 등이 파트너로 참여했다.

5. 비용 효율화 (Nvidia 자체 테스트)

Nvidia 자체 테스트에 따르면 Opus 4.8 단독 실행 대비 작업 완료 비용을 약 3분의 1 수준으로 낮추면서도 프론티어급 정확도를 유지했다고 밝혔다. 다만 이는 Nvidia가 자체 진행한 벤치마크 결과이며, 제3자의 독립적인 검증은 아직 이뤄지지 않았다.

사용성 분석

Nemotron 3.5 Lightning의 강점은 무거운 인프라 없이 단일 GPU에서 에이전트 워크플로우를 구동할 수 있다는 점이다. 30B 규모지만 3B만 활성화되는 MoE 구조 덕분에, 대형 모델 특유의 응답 품질과 경량 모델의 속도를 동시에 노릴 수 있다. NeMo Switchyard와 결합하면 하나의 모델에만 의존하지 않고 상황에 맞는 모델로 자동 전환할 수 있어, 장시간 실행되는 에이전트 시스템에 특히 유용할 것으로 보인다. Boomi, Cognition, Kong, LangChain, Siemens 등 다양한 분야의 파트너가 이미 참여하고 있다는 점은 실제 엔터프라이즈 워크플로우 통합 가능성을 시사한다. 다만 4배·30% 등 속도 지표와 3분의 1 비용 절감 수치가 모두 Nvidia 자체 발표 자료에 근거한 만큼, 실사용 환경에서의 체감 성능은 별도 검증이 필요하다.

장단점

장점으로는 단일 GPU로 구동 가능한 낮은 인프라 진입장벽, MoE 구조를 통한 연산 효율성, Hugging Face·ModelScope·OpenRouter·NIM 등 다양한 배포 경로, 오픈소스로 공개된 NeMo Switchyard의 라우팅 유연성을 꼽을 수 있다. 단점으로는 속도·비용 개선 수치가 모두 Nvidia 자체 테스트 결과로 제3자 독립 검증이 아직 없다는 점, NeMo Switchyard의 비용 절감 효과가 Opus 4.8 같은 독점 모델과의 혼합 사용을 전제로 한다는 점이 있다.

전망

Nvidia는 대형 프론티어 모델 하나에 의존하는 대신, 경량 오픈모델과 라우팅 레이어를 조합하는 방향을 제시했다. Boomi, Cognition, Kong, LangChain, Siemens 등 초기 파트너십은 이 접근이 엔터프라이즈 에이전트 구축 방식에 실질적으로 반영될 수 있음을 보여준다. NeMo Switchyard가 GitHub에서 커뮤니티 기여를 받으며 어떻게 확장되는지, 그리고 독립 벤치마크에서 4배 속도·3분의 1 비용 수치가 재현되는지가 향후 시장 반응을 가늠할 기준이 될 것이다.

결론

Nemotron 3.5 Lightning과 NeMo Switchyard는 단일 GPU로 구동 가능한 경량 모델과, 작업별 최적 모델을 자동 선택하는 라우팅 레이어를 결합한 조합이다. 인프라 비용을 낮추면서 에이전트 워크플로우를 구축하려는 개발자와 기업에 유용한 선택지가 될 수 있다. 다만 핵심 성능·비용 지표가 아직 Nvidia 자체 발표에 머물러 있는 만큼, 독립 검증 결과를 지켜볼 필요가 있다.

장점

  • 단일 GPU로 구동 가능한 낮은 인프라 진입장벽
  • MoE 구조를 통한 연산 및 메모리 효율성
  • Hugging Face·ModelScope·OpenRouter·NIM 등 다양한 배포 경로
  • 오픈소스로 공개된 NeMo Switchyard의 라우팅 유연성
  • Boomi, Cognition, Kong, LangChain, Siemens 등 실사용 파트너 확보

단점/한계

  • 속도·비용 개선 수치가 Nvidia 자체 테스트 결과로 제3자 독립 검증이 아직 없음
  • NeMo Switchyard의 비용 절감 효과는 Opus 4.8 등 독점 모델과의 혼합 사용을 전제로 함
  • 완전한 오픈소스 스택만으로는 발표된 성능·비용 수치를 그대로 재현하기 어려울 수 있음

댓글0

주요 기능/특징

1. 300억(30B) 파라미터 MoE 구조, 추론 시 활성 파라미터는 30억(3B) 2. 단일 PC급 GPU에서 구동 가능한 경량 설계 3. Hugging Face, ModelScope, OpenRouter, build.nvidia.com(NIM)에서 즉시 사용 가능 4. NeMo Switchyard: 작업별 최적 모델(오픈소스·독점·Nvidia 혼합)을 자동 라우팅하는 오픈소스 라이브러리 5. Boomi, Cognition, Kong, LangChain, Siemens 등이 참여한 초기 파트너 생태계 6. Nvidia 자체 테스트 기준 동급 모델 대비 최대 4배 빠른 출력, 30% 빠른 에이전트 작업 완료

핵심 인사이트

  • MoE 구조로 30B 파라미터 중 3B만 활성화해 단일 GPU 구동이 가능해졌다
  • Hugging Face, ModelScope, OpenRouter, NIM 등 4개 채널 동시 공개로 접근성을 높였다
  • NeMo Switchyard는 하나의 모델에 의존하지 않고 작업별로 최적 모델을 선택하는 라우팅 전략을 제시한다
  • Boomi, Cognition, Kong, LangChain, Siemens 등 엔터프라이즈 파트너 참여는 실제 워크플로우 적용 가능성을 뒷받침한다
  • Nvidia 자체 테스트에 따르면 Opus 4.8 단독 실행 대비 비용을 약 3분의 1로 낮췄다고 밝혔으나 제3자 검증은 아직 없다
  • 동급 모델 대비 4배 빠른 출력, 30% 빠른 에이전트 작업 완료라는 수치도 Nvidia 공식 발표에 근거한다
  • NeMo Switchyard가 GitHub에 공개돼 커뮤니티 기여로 라우팅 로직이 확장될 여지가 있다
  • 경량 모델과 라우팅 레이어의 조합은 대형 프론티어 모델 단독 의존 구조에 대한 대안으로 제시됐다

이 리뷰가 유용했나요?

공유하기