RTX 5090 한 대서 초당 131토큰 로컬 추론 지원

오픈 모델·클러스터 관리 도구로 로컬 AI 활용 범위 확대

핵심 요약

  • NVIDIA는 8월 14일 Qwen3.8-27B를 RTX GPU에서 출시 당일부터 지원한다고 밝혔다.
  • Qwen3.8-27B는 MTP를 적용한 GeForce RTX 5090 한 대에서 초당 131토큰을 처리한다.
  • Meta는 8월 11일 120K 이상 문맥 창을 갖춘 300억 매개변수 Muse Glimmer를 공개했다.

NVIDIA는 8월 14일 Qwen3.8-27B를 NVIDIA RTX GPU에서 출시 당일부터 지원한다고 밝혔다. 270억 매개변수 규모의 이 오픈 모델은 단일 GPU용 로컬 코딩 에이전트로, MTP를 적용한 GeForce RTX 5090 한 대에서 초당 131토큰의 추론 성능을 낸다.

Qwen3.8-27B는 Qwen3.8-Max의 로컬용 모델이다. 개발자는 코드와 독점 데이터, 프로젝트 문맥을 자체 시스템에 둔 채 로컬 파일과 도구를 활용하는 코딩 작업을 수행할 수 있다. 성능 수치는 Intel Core Ultra 9 285K, 64GB RAM, Windows 11, NVIDIA 드라이버 610.43 환경에서 llama.cpp의 Q4_K_M 체크포인트와 speedbench 벤치마크, MTP n_max=3 조건으로 측정했다.

llama.cpp와 Ollama, Unsloth, LM Studio Bionic은 NVIDIA RTX GPU에서 Qwen3.8-27B를 지원한다. DGX Spark와 DGX Station에서도 구동할 수 있으며, 모든 NVIDIA 로컬 AI 기기를 위한 NVFP4 지원 등 추가 최적화는 추후 제공할 예정이다. NVIDIA Jetson도 출시 당일부터 엣지 구동을 지원한다.

NVIDIA가 8월 11일 소개한 다른 오픈 모델도 로컬 AI의 적용 범위를 넓혔다. Cosmos 3 Edge는 로보틱스와 자율주행차, 비전 AI용 40억 매개변수 오픈 월드 모델로, Cosmos 3 Nano의 4분의 1 크기이며 DGX Spark와 NVIDIA Jetson에서 기기 내 구동이 가능하다.

MiniMax-H3는 텍스트·이미지·비디오·오디오 또는 이들 입력의 조합으로 비디오와 동기화된 스테레오 오디오를 생성하는 330억 매개변수 오픈 웨이트 모델이다. Poolside AI의 Laguna S 2.1은 수 시간짜리 작업을 처리하는 1180억 매개변수 에이전틱 코딩 모델이며, NVFP4 체크포인트를 이용하면 정확도를 희생하지 않고 DGX Spark 한 대에서 실행할 수 있다고 NVIDIA는 설명했다.

DeepSeek-V4-Flash는 활성 매개변수 130억 개와 100만 토큰 문맥 창을 갖춘 2840억 매개변수 MoE 모델이다. 개발자는 현재 제공되는 커뮤니티 제작 GGUF 버전으로 DGX Station에서 로컬 실행할 수 있다.

Thinking Machines Lab의 Inkling-Small은 텍스트·이미지·오디오 추론과 사고량 조절을 지원하는 2760억 매개변수 멀티모달 오픈 웨이트 모델이다. 토큰당 120억 매개변수를 활성화하며 DGX Station 한 대 또는 DGX Spark 두 대에서 구동한다. NVIDIA GB300 NVL72로 학습했고 NVIDIA Blackwell용 NVFP4 체크포인트는 Hugging Face에서 제공한다.

Unsloth는 8월 10일 Unsloth Desktop을 출시했다. 로컬 모델 추론, 이미지·비디오 확산, 미세조정, 에이전트 연동, 웹 조사와 코드 실행을 하나의 완전한 오픈 소스 데스크톱 앱에 담았으며, 회사에 따르면 AI 모델의 로컬 학습과 실행을 모두 지원하는 첫 데스크톱 앱이다.

Alibaba의 140억 매개변수 모델 Wan-Animate-2는 구동 비디오의 움직임과 표정을 사람·만화·로봇·동물의 정지 캐릭터 이미지에 옮긴다. ComfyUI가 출시 당일부터 지원하며, Apple M3 Ultra와 비교해 NVIDIA RTX PRO 6000 Blackwell에서 최대 26배, NVIDIA RTX 5090에서 22배 빠르게 생성한다고 NVIDIA는 밝혔다.

LTX가 8월 11일 공개한 LTX-2.5는 미디어·엔터테인먼트와 로보틱스, 실시간 생성용 오픈 월드 비디오 생성 모델이다. 여러 컷의 연속성을 유지하는 멀티숏, 기존 영상의 생성형 편집, Gemma4 E2B와 맞춤형 Gemma4 12B 텍스트 인코더 기반 프롬프트 향상 기능을 지원한다. 확산 비디오 디코더를 추가해 최종 렌더링을 위한 두 번째 디코딩 경로도 제공한다.

LTX-2.5는 NVIDIA RTX GPU와 DGX Spark, DGX Station에 최적화됐다. NVIDIA RTX 6000 PRO GPU에서는 성능이 최대 20% 빨라지고 메모리 사용량은 40% 줄며, NVFP4·FastVideo·ComfyUI 개선 기능은 텍스트·이미지·비디오 투 비디오 생성용 ComfyUI 워크플로로 로컬에서 이용할 수 있다.

Meta는 8월 11일 코딩과 로컬 에이전틱 AI용 Muse Glimmer를 공개했다. 이 모델은 120K 이상 문맥 창을 갖춘 300억 매개변수 밀집형 오픈 웨이트 모델로, RTX 5090에서 초당 200토큰 이상을 처리한다. 단일 소비자용 GPU가 장착된 PC에서도 구동하도록 설계했다.

Muse Glimmer는 로컬 에이전트와 함수 호출, 코딩, LLM 심사 평가에 활용할 수 있다. NemoClaw로 에이전트를 만들고 NVIDIA NeMo Automodel로 자체 시스템에서 미세조정할 수 있으며, vLLM과 llama.cpp를 지원한다. llama.cpp는 BF16·양자화 GGUF 체크포인트와 DFlash 추측 디코딩도 제공한다.

NVIDIA Sync는 여러 DGX Spark를 클러스터로 묶어 대형 모델의 메모리 용량과 추론·학습 성능을 확보하는 도구다. Windows와 macOS에서 연결된 시스템을 자동으로 찾고 Tailscale을 통한 비공개 원격 접속과 복수 시스템의 애플리케이션 실행을 지원한다. Cluster Assistant는 두 대 이상의 DGX Spark를 ConnectX-7 포트로 연결하면 네트워크 설정, 노드 간 작업 분배와 상태 감시를 자동화한다.

NVIDIA는 8월 후반 DGX Spark에 ARM64 Linux 네이티브 Google Chrome과 NVIDIA Sync Resource Monitor를 추가할 예정이다. Resource Monitor는 별도 모니터링 소프트웨어 없이 개별 DGX Spark나 전체 클러스터의 CPU·GPU 사용량을 실시간 및 과거 시점별로 보여준다.

인공지능(AI)과 스타트업 분야의 주요 소식을 전합니다.