NVIDIA Cosmos 3 공부 정리 | 통합 모델이라는 게 뭘 바꾸는 건지
물리 AI를 위한 통합 모델 Cosmos 3 발표를 읽고 정리한 것. 여러 모델을 하나로 합친 아키텍처가 어떤 의미인지.
Hugging Face 블로그에 NVIDIA Cosmos 3 발표 글이 올라왔다. 물리 AI(Physical AI)를 위한 “첫 오픈 옴니 모델”이라는 표현이 눈에 걸려서 읽어봤다.
처음에는 로봇공학이나 자율주행 쪽 얘기라 나랑은 거리가 있을 것 같았다. 그런데 아키텍처 자체가 바뀌었다는 부분에서 멈추게 됐다. 단순한 성능 향상이 아니라 구조 자체가 달라졌다는 인상이 들어서 조금 더 정리해봤다.
1️⃣ 이게 뭐냐?
이전 Cosmos 버전들은 역할별로 분리된 모델들로 구성된 파이프라인이었다고 한다. 세계를 이해하는 모델, 행동을 예측하는 모델, 비디오를 생성하는 모델이 각각 따로 존재했다.
Cosmos 3는 이 구조를 하나의 모델로 합쳤다. Mixture-of-Transformers(MoT)라는 아키텍처인데, AR(Autoregressive)과 DM(Diffusion) 두 방식이 같은 Transformer 레이어 안에서 함께 돌아간다. AR은 이해와 추론을 담당하고, DM은 비디오나 이미지 생성을 맡는다. 이 둘이 분리된 게 아니라 하나의 레이어에서 상호작용한다는 게 이번 구조의 핵심인 것 같다.
지원하는 입출력 조합이 꽤 넓다. 텍스트로 비디오를 만들거나, 비디오를 텍스트로 이해하거나, 로봇의 행동(Action) 데이터를 입력해 다음 움직임을 예측하거나 — 같은 모델 위에서 전부 돌아간다. 물리 AI 작업에 필요한 여러 역할을 하나로 묶은 구조다.
모델과 함께 오픈 데이터셋도 공개됐다. 로봇 시뮬레이션, 자율주행, 창고 환경 같은 도메인별로 나뉘어 있어서, 특정 분야에 맞게 파인튜닝할 수 있도록 설계된 것 같았다.
코드는 diffusers 라이브러리와 통합되어 있어서, 기존에 diffusers를 써본 적 있다면 구조가 익숙하게 느껴질 것 같다.
1
2
from diffusers import Cosmos3OmniPipeline
pipe = Cosmos3OmniPipeline.from_pretrained("nvidia/Cosmos3-Nano", ...)
모델 크기는 Nano(8B + 8B)와 Super(32B + 32B) 두 가지로 오픈 웨이트로 공개됐다.
2️⃣ 내가 든 생각
“물리 AI”라는 개념이 처음에 좀 낯설었다. 읽다 보니 핵심은 “실세계의 물리 법칙을 이해하고, 그 안에서 행동이 어떤 결과를 낳는지 예측하는 것”에 있는 것 같았다. 단순히 이미지나 텍스트를 생성하는 모델들과는 목적이 다른 것 같다는 느낌이었다.
특히 흥미로웠던 건 입력 방식이다. 발표 글에 나온 프롬프트 예시를 보면 이런 식이다.
“Put the pot to the left of the purple item. First-person perspective.”
텍스트-to-이미지 모델에서 보던 서술형 묘사와는 결이 다르다. 공간 위치, 시점, 행동 지시가 구체적으로 들어가야 모델이 제대로 동작한다는 인상이었다. 공간을 이해하고 행동을 예측하는 모델이니, 입력도 그에 맞는 형식이 따로 있다는 게 새삼 자연스럽게 느껴졌다.
👉🏻 모델이 처리하는 것이 달라지면 사용자한테 요청하는 입력 형식도 달라진다. 그게 다시 인터페이스 설계에 영향을 준다. 어떤 모델을 쓰느냐에 따라 “사용자가 뭘 어떻게 입력해야 하는가”가 바뀌고, 그걸 어떻게 안내할지가 UI의 몫이 된다는 걸 이번에 다시 생각해봤다.
💡 여기서 드는 질문? 텍스트·이미지·비디오·액션까지 받을 수 있는 모델을 위한 인터페이스는 어떻게 설계해야 할까? 입력 모달이 많아질수록 선택지도 늘어나는데, 그게 오히려 사용자 진입을 어렵게 만드는 건 아닐지 생각이 걸렸다.
⭐️ 마지막으로, 배우면서 남은 인상
이런 통합 모델 발표를 보다 보면 자꾸 같은 질문이 걸린다 — 여러 역할을 하나의 모델이 다 처리하면, 쓰는 사람한테는 더 단순해지는 건지 더 복잡해지는 건지. 기능이 많아질수록 인터페이스가 오히려 까다로워지는 것처럼, 통합이 곧 단순함을 뜻하지는 않는다는 인상이 남았다.
참고 원문: Welcome NVIDIA Cosmos 3: The First Open Omni-model for Physical AI Reasoning and Action