Workflows

비디오를 3D 모델로 변환하는 AI: 실제 작동 원리

비디오를 3D 모델로 변환하는 것과 비디오를 3D로 재생하는 것은 서로 다른 일입니다. 포토그래메트리, NeRF, 가우시안 스플래팅이 작동하는 방식을 알아봅니다.

Zoey
게시 날짜: 2026년 7월 27일

TL;DR 오늘날 임의의 비디오를 처음부터 끝까지 3D 모델로 변환해 주는 주류 AI 도구는 없습니다. "비디오를 3D로" 변환한다고 광고하는 플랫폼들은 거의 대부분 몇 장의 정지 프레임을 추출한 뒤, 사진 업로드에 사용하는 것과 동일한 멀티뷰 또는 단일 이미지 재구성 파이프라인에 그 프레임들을 통과시킬 뿐입니다. "비디오를 3D로" 변환하는 실제 기술은 전통적인 Structure-from-Motion(밀집 프레임, 카메라 캘리브레이션, 메시 생성), NeRF와 3D 가우시안 스플래팅(신경망 또는 포인트 기반 장면 표현), 그리고 360도 궤도 클립을 멀티뷰 이미지 세트로 취급하는 최신 비디오 디퓨전 기법에 걸쳐 있습니다. 오늘날 정적인 객체에 대해 가장 신뢰할 수 있는 방법은 비디오 전체를 업로드하는 것이 아니라, 비디오에서 서로 다른 각도를 명확히 보여주는 3~4개의 프레임을 추출해 멀티 이미지 재구성 도구에 넣는 것입니다.

"video to 3D model"을 검색하면 서로 매우 다른 두 종류의 결과를 마주하게 됩니다. 어떤 도구는 휴대폰으로 찍은 비디오를 Blender나 Unity에 바로 가져올 수 있는 3D 에셋으로 변환해 주겠다고 약속합니다. 다른 도구들은 그보다는 3D 비디오에 가까운 무언가, 즉 일시 정지하고 내부를 걸어 다니며 볼 수 있는 녹화된 장면을 약속하는데, 이는 내보낼 수 있는 모델이라기보다 홀로그램 녹화에 가깝습니다. 이 둘은 서로 다른 제품이며, 이를 혼동하는 것이야말로 잘못된 도구를 구매하는 가장 빠른 지름길입니다.

이 글에서는 이 둘의 근본 기술이 실제로 어디서 비롯되었는지부터 짚어가며 둘을 명확히 구분합니다. 애초에 비디오 기반 3D 재구성을 가능하게 만든 전통적인 컴퓨터 비전 파이프라인, 이 문제의 경제성을 바꾼 AI 기법들, 그리고 오늘날 실제로 사용 가능한 것의 솔직한 한계를 살펴봅니다. 아래의 모든 기술적 주장은 마케팅 문구가 아니라 실제로 발표된 논문에서 근거를 찾을 수 있습니다. 끝까지 읽고 나면 로드맵상의 약속이 아니라 실제로 사용할 수 있는 워크플로를 얻게 될 것입니다.

"비디오를 3D로" 변환한다는 것이 실제로 의미하는 것

비디오그래메트리(Videogrammetry)는 개별적으로 촬영한 정지 사진들의 집합이 아니라 연속된 비디오 프레임으로부터 3차원 형상을 재구성하는 기법입니다. 이는 대부분의 사람들이 검색창에 "video to 3D model"을 입력할 때 실제로 의미하는 바를 가리키는 정식 명칭입니다.

실제로 "비디오를 3D로"는 하나의 알고리즘이 아니라 검색하기 좋게 만들어진 합성어에 가깝습니다. 비디오란 사실 일정한 속도, 보통 초당 24~60프레임으로 샘플링된 정지 이미지들의 밀집된 시퀀스일 뿐입니다. 시스템이 실제로 중요한 프레임을 골라내고 나면, 비디오를 3D로 변환하는 문제는 이미지를 3D로 변환하는 것과 동일한 핵심 문제로 귀결됩니다. 즉, 2D 이미지 집합이 3D 장면과 어떤 관계를 갖는지 파악한 뒤, 그 이미지들을 만들어낸 형상을 재구성하는 것입니다. 도구마다 이 문제를 서로 다른 수학적 방법으로 풀며, 어떤 수학을 선택하느냐에 따라 결과물이 정적인 객체 모델인지, 전체 장면인지, 아니면 재생 가능한 한 순간인지가 결정됩니다. 이 글의 나머지 부분에서는 실제 기술들을 하나씩 살펴봄으로써, 특정 도구가 실제로 어떤 방식을 쓰고 있는지 판단할 수 있도록 돕습니다.

고전적 기반: 포토그래메트리와 Structure-from-Motion

**포토그래메트리(Photogrammetry)**는 사진으로부터 측정값을 얻고 3D 형상을 재구성하는 과학이며, **Structure-from-Motion(SfM)**은 일련의 2D 이미지로부터 장면의 3D 구조와 카메라의 움직임을 동시에 복원하는 구체적인 계산 기법입니다. 이 둘 중 어느 것도 새로운 기술이 아닙니다. AI가 등장하기 훨씬 전부터, 연구자들은 이미 원본 비디오 시퀀스를 입력받아 텍스처가 입혀진 3D 메시를 만들어내는 완전한 시스템을 구축해 두었습니다.

가장 명확한 예시 중 하나는 Pollefeys et al.이 말 그대로 "Video-to-3D"라는 제목의 논문에서 설명한 시스템으로, K.U. Leuven과 University of North Carolina에서 개발되었습니다. 이 시스템은 캘리브레이션되지 않은 핸드헬드 비디오를 네 단계로 처리합니다. 첫 번째 단계인 **이미지 연관 짓기(relating images)**에서는 시스템이 프레임 전반에 걸쳐 특징점을 추적하고, 통계적 검정을 이용해 두 시점 사이의 움직임이 평면(호모그래피)으로 더 잘 설명되는지, 아니면 실제 3D 시차(에피폴라 기하)로 더 잘 설명되는지를 판단합니다. 이 판단에 따라 어떤 프레임이 재구성에 사용할 가치가 있는 "키프레임"으로 승격될지가 결정됩니다. 두 번째 단계인 **구조 및 움직임 복원(structure and motion recovery)**에서는 추적된 점들을 삼각측량하여 희소한 3D 포인트 클라우드로 만들고, 각 카메라의 자세를 계산합니다. 처음에는 캘리브레이션되지 않은 투영적 형태로 계산한 뒤, 셀프 캘리브레이션 단계를 거쳐 실제 세계 크기로 스케일링된 계량적 재구성으로 업그레이드하고, 전체 과정에 걸쳐 모든 재투영 오차에 대한 전역 최소제곱 최적화인 번들 조정(bundle adjustment)으로 다듬어 갑니다.

세 번째 단계인 **밀집 매칭(dense matching)**에서는 이미지 쌍을 워핑하여 에피폴라 선이 수평 스캔라인과 일치하도록 만든 뒤, 스캔라인 스테레오 매처를 실행해 거의 모든 픽셀에 대한 깊이 값을 추정합니다. 바로 이 지점에서, 여러 개의 겹치는 시점에 걸쳐 픽셀을 매칭함으로써 밀집된 깊이를 추정하는 일반적인 기법인 **멀티뷰 스테레오(Multi-View Stereo)**가 작동합니다. 네 번째 단계인 **3D 모델 구축(3D model building)**에서는 개별 깊이 맵들을 하나의 일관된 표면, 보통은 삼각형 메시로 융합하고, 원본 비디오 프레임에서 직접 텍스처를 입힙니다. 이 논문은 조각된 석재 부조를 대상으로 이 과정을 처음부터 끝까지 시연하며, 평범한 비디오 영상만으로 텍스처가 입혀진 완전한 메시를 재구성해 냅니다.

이 파이프라인은 진정으로 인상적이며, 오늘날에도 여러 전문가급 3D 스캐닝 소프트웨어의 근간을 이루고 있습니다. 하지만 여기에는 구조적인 비용이 내재되어 있습니다. 충분한 시차를 지닌 다수의 겹치는 프레임, 신중한 프레임 선택, 그리고 각 단계마다의 반복적인 최적화가 필요하다는 점입니다. 바로 이러한 양과 정밀도에 대한 의존이야말로 AI 기반 기법들이 우회하고자 했던 병목입니다.

AI로의 전환: NeRF, 가우시안 스플래팅, 그리고 비디오 디퓨전

바로 이 지점에서 "AI로 비디오를 3D로 변환한다"는 표현은 단순한 마케팅 문구를 넘어 구체적으로 발표된 연구를 가리키기 시작합니다. 여기서 대부분의 역할을 하는 것은 세 가지 기법입니다. NeRF와 가우시안 스플래팅은 결과로 나온 3D 장면이 표현되는 방식을 바꾸고, 비디오 디퓨전은 애초에 무엇을 유효한 입력으로 볼 것인지를 바꿉니다.

**Neural Radiance Fields(NeRF)**는 3D 위치와 시점 방향을 입력받아 색상과 밀도를 출력하는 신경망으로 3D 장면을 표현하는 방식으로, 이 출력값을 카메라 광선을 따라 샘플링하면 어떤 시점에서든 사실적인 이미지를 렌더링할 수 있습니다. 정점과 면으로 이루어진 명시적인 메시 대신, NeRF는 무언가를 보려면 반드시 쿼리하고 적분해야 하는 암시적 함수이며, 이 때문에 사실적인 렌더링에는 탁월하지만 게임 엔진에 그대로 가져다 쓰기는 까다롭습니다.

**3D 가우시안 스플래팅(3D Gaussian Splatting)**은 각각 고유한 위치, 크기, 방향, 색상을 지닌 수천 개의 작고 반투명한 3D 가우시안 "덩어리"로 이루어진 장면 표현 방식으로, 이를 화면에 투영하고 블렌딩함으로써 실시간으로 렌더링할 수 있습니다. 이 방식은 암시적인 신경망 함수를 명시적이고 스플랫 가능한 점 형태의 표현으로 대체함으로써, NeRF의 가장 큰 실용적 불만이었던 지독하게 느린 렌더링 속도 문제를 해결합니다.

하지만 "비디오를 3D로" 변환하는 데 있어 더 흥미로운 전환은 문제의 입력 측면을 재구성한 데서 비롯됩니다. Chen et al.은 2024년 논문 "V3D: Video Diffusion Models are Effective 3D Generators"에서, 객체 주위를 도는 카메라로 촬영한 비디오가 구조화된 멀티뷰 이미지 세트와 기능적으로 동일하다는 점을 발견했습니다. 이들의 방법은 짧은 AI 비디오 클립을 생성하는 데 사용되는 것과 같은 부류의 생성 모델인 비디오 디퓨전 모델을 파인튜닝하여, 객체 주위를 도는 매끄럽고 일관된 프레임 시퀀스를 합성한 뒤, 그렇게 생성된 시퀀스를 3D 가우시안 또는 메시 재구성 단계에 입력합니다. 핵심 통찰은 일관된 멀티뷰 시퀀스를 생성하는 것과 짧은 비디오를 생성하는 것이 수학적으로 동일한 작업이라는 점입니다. 이는 고전적인 SfM과는 의미 있게 다른 접근 방식입니다. 실제로 겹치는 수십 장의 사진을 요구하는 대신, 부족한 시점들을 생성해 내고 그로부터 재구성을 수행합니다.

이것이 무엇을 증명하고 무엇을 증명하지 않는지 유의할 필요가 있습니다. 이는 "다수의 일관된 시점"을 비디오 생성 문제로 다루는 것이 타당하고 생산적인 기술적 접근임을 보여줍니다. 그러나 "비디오를 업로드하라"고 말하는 모든 도구가 정확히 이 파이프라인을 실행하고 있다는 의미는 아니며, 고전적인 SfM이 하는 것처럼 임의의 실제 영상을 재구성하는 데까지 확장되지도 않습니다.

빠른 참고: 핵심 용어

  • 포토그래메트리(Photogrammetry): 사진으로부터 측정 가능한 3D 형상을 재구성하는 것.
  • Structure-from-Motion(SfM): 2D 이미지로부터 장면의 3D 구조와 카메라 자세를 함께 복원하는 것.
  • 멀티뷰 스테레오(Multi-View Stereo): 여러 개의 겹치는 시점에 걸쳐 픽셀을 매칭함으로써 픽셀 단위의 밀집된 깊이를 추정하는 것.
  • NeRF: 임의의 3D 지점과 시점 방향에 대해 색상과 밀도를 출력하는 신경망으로, 광선 샘플링을 통해 렌더링됨.
  • 3D 가우시안 스플래팅(3D Gaussian Splatting): 다수의 작은 3D 가우시안으로 표현되는 장면으로, 투영과 블렌딩을 통해 실시간으로 렌더링됨.
  • 비디오그래메트리(Videogrammetry): 개별적으로 촬영된 사진이 아니라 비디오에서 추출한 프레임을 대상으로 수행하는 포토그래메트리.

정적인 객체 vs. 동적인 장면: 서로 다른 두 가지 문제

지금까지 다룬 내용은 모두 의자, 조각상, 제품처럼 하나의 정적인 객체나 장면을 한 번 만들어지면 더 이상 변하지 않는 모델로 재구성하는 것에 관한 것이었습니다. 이는 사람이 움직이거나, 액체가 쏟아지거나, 불꽃이 일렁이는 동적인 장면을 새로운 시점에서 재생할 수 있는 형태로 담아내는 것과는 다른 문제입니다. 이 둘을 혼동하는 데서 "비디오를 3D로" 변환한다는 개념에 대한 많은 혼란이 비롯되며, 이는 "how to make 3D video"라는 검색어 이면에 있는 구분이기도 합니다. 이 검색어는 묻는 사람에 따라 실제로 서로 다른 두 가지를 의미합니다.

Li et al.의 CVPR 2022 논문 "Neural 3D Video Synthesis from Multi-view Video"는 흔히 DyNeRF라고 불리며, 두 번째 문제를 직접 다룹니다. 이 방식은 고정된 위치에서 동일한 움직이는 장면을 동시에 촬영하는 18~21대의 동기화된 GoPro 카메라로 구성된 리그를 사용합니다. DyNeRF는 프레임마다 하나씩 학습된 시간 인덱스 잠재 코드 집합을 추가하여 NeRF의 개념을 확장함으로써, 동일한 신경망이 클립 길이에 걸쳐 장면의 외형과 형상이 어떻게 변하는지를 표현할 수 있도록 합니다. 그 결과물은 카메라 리그가 담아낸 범위 내에서 임의의 시점과 임의의 시각에 대해 쿼리할 수 있는 모델이며, 슬로우 모션이나 "불릿 타임" 효과를 위해 촬영된 프레임 사이를 보간한 순간까지 포함합니다. 이 논문은 10초 분량, 30fps, 18대 카메라로 촬영한 전체 녹화분을 단 28MB짜리 모델로 표현했다고 보고하며, 동일한 클립에 대해 프레임 단위로 순진하게 학습시키는 NeRF 베이스라인은 학습에 약 15,000 GPU시간이 필요한 반면, 자신들의 방법은 약 1,300 GPU시간만 필요하다고 밝히고 있습니다.

이 결과가 정확히 무엇을 의미하는지 짚어볼 필요가 있습니다. DyNeRF는 가상의 카메라를 통과시켜 날아다닐 수 있는, VR 헤드셋으로 재생해 볼 법한 재렌더링 가능한 4D 볼륨을 만들어냅니다. Blender나 Unity에서 열어볼 수 있는 단일한 정적 삼각형 메시를 내보내는 것은 아닙니다. 이는 진정으로 다른 캡처 구성, 즉 객체 주위를 도는 하나의 핸드헬드 카메라가 아니라 장면 주위에 배치된 여러 대의 동기화된 카메라에 대응하는, 진정으로 다른 출력 형식입니다. 만약 실제로 원하는 것이 하나의 객체에 대한 정적인 3D 모델이라면, 이 동적 장면 연구는 "비디오"에서 출발하는 기술이라 하더라도 적합한 도구가 아닙니다.

오늘날 "비디오를 3D로" 변환하는 도구들이 실제로 하는 일

이 모든 것을 감안할 때, 지금 대부분의 소비자용 플랫폼에서 "비디오 업로드" 버튼 뒤에 실제로 무엇이 돌아가고 있는지 물어볼 필요가 있습니다. 이 분야를 정리하는 유용한 방법은 입력 방식별로 나누어 보는 것인데, 이것이 보통 그 이면에 있는 재구성 기법을 알려주는 믿을 만한 신호이기 때문입니다.

입력 방식여러 각도가 필요한가?일반적인 기반 기술
단일 이미지아니요, 없는 각도는 추론되거나 생성됩니다디퓨전 기반 단일 시점 3D 생성
멀티 이미지 (사진 2~4장)예, 사용자가 직접 제공합니다멀티뷰 재구성, 고전적인 삼각측량에 더 가까움
텍스트-투-멀티뷰 이미지아니요, 텍스트 프롬프트로부터 시점이 생성됩니다디퓨전 기반 멀티뷰 이미지 생성
"비디오" (마케팅상)사실상 필요, 다만 도구 내부에서 추출됨위 파이프라인 중 하나에 입력되는 프레임 샘플링

마지막 행에 나타난 패턴은 흔히 볼 수 있습니다. 비디오 입력을 광고하는 플랫폼은 앞서 설명한 디퓨전 기반 접근처럼 비디오 자체를 다루는 방식이 아니라, 내부적으로 몇 장의 프레임을 추출한 뒤 이미 사진 업로드용으로 운영 중인 것과 동일한 멀티뷰 또는 단일 이미지 파이프라인으로 그것들을 보내는 경우가 매우 많습니다. 이것이 반드시 나쁜 제품 결정인 것은 아닙니다. 좋은 비디오에서 추출한 프레임은 훌륭한 멀티뷰 입력이 될 수 있습니다. 다만 이는 "우리 모델은 전체 비디오로 학습되었고 비디오 전체를 추론한다"는 주장과는 다릅니다. 실제로 어떤 방식을 사용하고 있는지 알고 싶다면, 가장 믿을 만한 출처는 블로그 게시물의 스크린샷이 아니라 플랫폼 자체의 API 문서입니다. 개발자가 이를 바탕으로 통합할 수 있도록, 이 문서는 지원되는 입력 스키마를 정확하게 나열해야 하기 때문입니다.

프로젝트에 맞는 플랫폼 선택하기

게임 개발자를 위한 안내

게임을 위해 소품, 캐릭터, 환경 요소를 캡처하는 경우, 보통 원하는 것은 재생 가능한 장면이 아니라 적절한 토폴로지와 UV를 갖춘 깔끔한 정적 메시입니다. 잘 선택한 몇 장의 각도별 촬영본을 멀티뷰 재구성 파이프라인에 넣는 것이, 전체 둘러보기 비디오를 통째로 넣고 도구가 알아서 좋은 프레임을 골라주기를 바라는 것보다 더 빠르고 더 예측 가능하게 원하는 결과에 도달하게 해줍니다. 이것이 바로 소품과 캐릭터 레퍼런스 시트를 Meshy의 멀티 이미지 워크플로에 통과시키는 방식이 제작용 에셋에 있어 원본 클립보다 더 안정적인 결과를 내는 경향이 있는 이유입니다.

이커머스 및 제품 시각화를 위한 안내

제품 시각화는 이 기술에 있어 이상적인 사례에 가깝습니다. 정적인 객체, 조절 가능한 조명, 그리고 턴테이블 방식의 촬영은 의도적으로 찍기가 쉽기 때문입니다. 제품 주위를 도는 짧은 360도 클립은 멀티뷰 재구성이 필요로 하는, 구조화되고 일정한 간격으로 배치된 시점을 정확히 제공해 주며, 이것이 바로 이 사용 사례가 데모에서 그토록 자주 등장하는 큰 이유입니다. 그 클립에서 일정한 간격으로 4개의 프레임을 추출하면, 나머지는 Meshy의 Image to 3D가 맡아 처리해 줄 수 있습니다.

인디 크리에이터와 취미 사용자를 위한 안내

휴대폰으로 작업하며 별도의 캡처 리그가 없다 해도, 위에서 살펴본 연구 결과는 여러분에게도 진정으로 좋은 소식입니다. 근본이 되는 포토그래메트리 파이프라인은 애초에 캘리브레이션되지 않은 핸드헬드 소비자용 카메라를 대상으로 설계되었고, 그 위에 구축된 AI 기법들 역시 이러한 낮은 장비 요구 수준을 그대로 물려받았습니다. 장비보다 더 중요한 것은 객체의 뒷면과 옆면을 실제로 담아내는 몇 장의 프레임을 고르는 것입니다. 휴대폰과 Meshy의 멀티 이미지 워크스페이스만으로도 아무것도 구입하지 않고 쓸 만한 결과를 얻기에 충분합니다.

오늘날의 실용적인 경로: 비디오 프레임에서 3D 모델까지

이 글에서 반드시 챙겨가야 할 핵심 맥락은 이렇습니다. 비디오는 근본적으로 2D 이미지들의 밀집된 시퀀스이며, 멀티뷰 재구성은 근본적으로 서로 다른 각도의 몇 장의 2D 이미지를 하나의 3D 형상으로 바꾸는 기법입니다. 이는 V3D가 궤도를 도는 비디오를 멀티뷰 이미지 세트로 취급할 때 사용하는 것과 동일한 논리적 전환입니다. 또한 하나의 객체에 대해 한 장이 아니라 여러 장의 참조 사진을 받아들이는 이미지-투-3D 도구들 이면에 있는 것과도 같은 논리입니다.

Meshy의 Image to 3D 기능은 바로 이러한 종류의 멀티 이미지 입력, 즉 서로 다른 각도에서 촬영한 동일 객체의 사진 최대 4장을 지원하며, 이는 Meshy 5부터 플랫폼이 갖춰온 기능입니다. AI는 객체 뒷면이 어떻게 생겼을지 추측하는 대신, 제공된 각 사진에서 실제 형상과 디테일을 읽어냅니다. 뒷면 추측은 단일 이미지 생성에서 흔히 나타나는 실패 방식입니다. 여러 장이 아니라 사진 한 장만 있는 경우라면, Meshy는 동일한 피사체의 추가 멀티뷰 이미지를 생성할 수 있는 Flux Kontext 기반의 텍스트 및 이미지 도구도 제공하며, 이렇게 생성한 이미지를 동일한 멀티 이미지 워크플로에 넣을 수 있습니다.

Meshy의 멀티 이미지 워크플로를 이용해 동일 객체의 네 각도 사진을 하나의 정확한 3D 모델로 결합한 모습

따라서 "지금 당장 내 비디오를 3D 모델로 바꾸려면 어떻게 해야 하는가"에 대한 실용적인 답은 단순합니다. 클립 전체를 업로드하지 마세요. 대신 비디오를 앞뒤로 넘겨가며 객체의 명확히 다른 각도, 예를 들어 정면, 측면, 후면, 어쩌면 4분의 3 각도를 보여주는 서너 개의 프레임을 골라낸 뒤, 그 정지 이미지들을 Workspace의 Meshy Multi-View Image to 3D 플로에 넣으세요. 이는 수동으로 진행해야 하는 단계이며, 생성당 이미지 수는 임의의 프레임 개수가 아니라 1장에서 4장으로 제한되어 있습니다. 이 과정을 처음부터 끝까지 자세히 보고 싶다면, 촬영 구도 선택과 설정을 더 자세히 다루는 이 멀티뷰 이미지 투 3D 안내를 참고하세요. 이 방법은 DyNeRF처럼 움직이는 장면 전체를 재구성하지는 못하며, V3D가 설명하는 비디오 자체를 다루는 디퓨전 파이프라인도 아닙니다. 하지만 이는 이 글 전체가 그 출처까지 거슬러 올라가며 추적해 온 것과 동일한 근본 논리 위에 세워진, 오늘날 실제로 사용 가능한 방법입니다.

자주 묻는 질문

단 하나의 '최고의' 도구란 존재하지 않습니다. 비디오 입력을 내세워 마케팅하는 대부분의 플랫폼이 실제로는 추출한 정지 프레임을 사진 업로드에 사용하는 것과 동일한 멀티뷰 또는 단일 이미지 재구성 파이프라인에 통과시키고 있기 때문입니다. 더 유용한 질문은 포토그래메트리 방식의 멀티뷰 재구성, 단일 이미지 디퓨전, 혹은 더 실험적인 방식 중 어떤 기반 기술이 여러분의 원본 영상과 필요한 결과물에 적합한지입니다. 객체 단위의 에셋이라면, 추측한 형상으로 클립 전체 분량을 생성하는 대신 실제로 최적화된 프레임으로부터 재구성하는, 진짜 멀티 이미지 입력을 기반으로 한 도구가 가장 예측 가능한 결과를 내는 경향이 있습니다. Meshy의 Image to 3D 기능은 이러한 범주의 구체적인 예시 중 하나로, 비디오 파일이 아니라 하나의 객체를 촬영한 최대 네 장의 각도별 사진을 입력받습니다. 이는 이 글이 자세히 다룬 우회 방법이기도 합니다.

비디오-투-3D와 이미지-투-3D는 2D 픽셀로부터 3D 형상을 추출한다는 동일한 근본 재구성 문제를 풀지만, 비디오는 사람이 보통 수고롭게 손으로 촬영할 법한 것보다 초당 훨씬 더 많은 후보 시점을 제공합니다. 이러한 풍부함은 양날의 검입니다. 비디오 속 대부분의 프레임은 이웃한 프레임과 거의 중복되며, 바로 이 때문에 고전적인 Video-to-3D 파이프라인은 모든 프레임을 사용하는 대신 명시적인 키프레임 선택 단계를 포함합니다. 의도적으로 촬영한 멀티 이미지 세트는 재구성에 실제로 중요한 각도만을 제공함으로써 이러한 중복 문제를 아예 건너뛸 수 있습니다. Meshy의 멀티 이미지 입력도 같은 원리를 따릅니다. 신중하게 고른 몇 개의 각도가 거의 동일한 프레임의 중복 스트림보다 낫습니다.

아니요. 이 분야 전체의 근간이 되는 포토그래메트리 연구는 애초에 초점 거리를 미리 알 필요도, 고정된 설정을 미리 맞춰둘 필요도 없는 캘리브레이션되지 않은 핸드헬드 소비자용 카메라를 대상으로 설계되었습니다. 스마트폰으로 촬영한 단일 객체만으로도 정적 객체 재구성에는 충분합니다. DyNeRF 같은 동적 장면 연구에서 볼 수 있는 다중 카메라 리그는 자유 시점 재생으로 움직이는 장면을 캡처하기 위한, 전혀 다른 훨씬 더 전문적인 사용 사례일 뿐, 일상적인 객체 스캐닝에 요구되는 조건이 아닙니다.

이는 전적으로 어떤 기법이 실행되고 있는지에 달려 있으며, 발표된 연구들이 보여주는 범위는 일반적인 멀티뷰 재구성에서부터 진짜 몇 주에 달하는 GPU 시간에까지 걸쳐 있습니다. 극단적인 예로, Li et al.은 10초 분량, 30fps, 18대 카메라로 촬영한 단일 동적 클립에 대해 프레임 단위로 순진하게 학습시키는 NeRF 베이스라인은 학습에 약 15,000 GPU시간이 필요했으며, 이들이 최적화한 DyNeRF 방법은 이를 약 1,300 GPU시간으로 줄였다고 보고합니다. 이는 단일 GPU 기준으로도 여전히 거의 두 달에 해당하는 시간입니다. 몇 장의 이미지로부터 이루어지는 정적 객체의 멀티뷰 재구성은 이 두 수치보다 훨씬 작은 규모의 연산 문제이며, 이것이 바로 일상적인 사용에 있어 실용적인 선택지가 되는 이유입니다. 실제로 몇 장의 스틸 이미지로 수행하는 Meshy Image to 3D 생성은 GPU 몇 개월이 아니라 몇 분 만에 완료됩니다.

포토그래메트리는 사진들 간에 매칭된 픽셀로부터 만들어진 명시적인 텍스처 메시를 출력하고, NeRF는 무언가를 렌더링하려면 반드시 광선을 따라 샘플링해야 하는 암시적 신경망 함수를 출력하며, 가우시안 스플래팅은 실시간으로 렌더링되는, 명시적이지만 메시는 아닌 색상이 입혀진 3D 가우시안들의 구름을 출력합니다. 실질적으로 이는 포토그래메트리 메시는 게임 엔진에 곧바로 가져다 쓸 수 있고, NeRF는 사실적인 재생에는 가장 뛰어나지만 편집하기는 까다로우며, 가우시안 스플랫은 그 중간에 위치해 렌더링은 빠르지만 여전히 표준적인 편집 가능한 메시는 아니라는 것을 의미합니다.

오늘날 임의의 처리되지 않은 비디오에 대해서는 불가능하지만, 직접 몇 장의 각도별 프레임을 추출한 뒤 멀티 이미지 재구성 워크플로에 통과시키면 비용 없이도 거의 그에 가까운 결과를 얻을 수 있습니다. Meshy를 포함한 여러 서비스가 제한된 횟수의 생성에 대해 무료 사용을 제공합니다. 이러한 수동 프레임 선택 단계는 아직 널리 사용할 수 없는 진정으로 비디오 자체를 다루는 파이프라인을 기다리는 대신, 실제로 작동하는 결과를 얻기 위한 약간의 추가 노력에 해당합니다.

3D로 시작하기

신용카드가 필요하지 않습니다. 1분 이내에 첫 3D 모델을 생성해 보세요.