Oossa

NVIDIA, 오픈소스 멀티모달 모델 Nemotron 3 Nano Omni 30B 공개

매개변수 300억 개를 갖춘 모델로, 현재 텍스트와 이미지를 처리하며 동영상과 오디오 지원도 예정돼 있다.

작성: Oossa 게시일: 1 분 읽기

National Cancer Institute · Unsplash

NVIDIA가 Nemotron 3 Nano Omni라는 새로운 오픈소스 AI 모델을 공개했다. 전체 매개변수는 300억 개지만, 전문가 혼합(Mixture-of-Experts) 설계 덕분에 한 번에 활성화되는 매개변수는 30억 개뿐이다. 현재 텍스트와 이미지를 추론할 수 있다. 동영상이나 오디오를 입력하려면 특수 플래그를 사용해 사고 모드를 꺼야 한다.

모델의 기능

이 모델은 여러 종류의 데이터를 처리하는 멀티모달 모델이다. 출시 시점에는 텍스트 입력을 텍스트로 출력하는 작업과 텍스트를 이미지로 변환하는 작업을 지원한다. 예를 들어 사진에 관한 질문에 답하거나 이미지를 설명할 수 있다. NVIDIA는 동영상과 오디오 입력도 기술적으로는 가능하지만, 오류를 방지하려면 요청에 `enable_thinking: false`를 설정해야 한다고 밝혔다.

중요한 이유

개발자와 연구자는 Nemotron 3 Nano Omni를 무료로 이용하고, 언어와 시각 정보를 모두 이해해야 하는 앱에 맞게 미세 조정할 수 있다. 300억 개 매개변수 가운데 일부만 활성화되므로, 전체 300억 개 매개변수를 사용하는 모델보다 빠르고 저렴하게 실행할 수 있다. 이에 따라 멀티모달 제품 개발 비용을 낮출 수 있다.

왜 중요한가

개발자는 이제 상용 API 비용을 내지 않고도 대규모 멀티모달 모델을 시험해 볼 수 있다. 전문가 일부만 활성화하는 설계로 연산 비용을 낮춰, 소규모 팀도 텍스트와 이미지를 함께 이해하는 앱을 개발하기 쉬워진다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.