Vol.268
October
ENG
SPECIAL 3

상상을 현실로 빚어내는 기술

미디어AX연구실 손정우 책임연구원

도시가 폭발하고 전쟁이 벌어지는 장면처럼, 현실에서는 불가능한 모습을 영화와 드라마에서 자주 접하곤 한다. 모두 VFX(Visual Effects, 시각효과) 덕분이다. 콘텐츠의 스케일을 키우고 몰입도를 높이는 VFX 제작에 AI가 더해지고 있다. ETRI는 AI가 촬영 영상을 이해하고 불·연기·물·폭발 등의 특수효과를 생성하는 기술을 개발했다. AI가 창작자를 대신하는 것이 아니라, 반복적인 작업의 부담을 덜고 아티스트가 표현에 더 집중할 수 있도록 돕는 기술이다. 손정우 책임연구원을 만나 AI가 바꿔 갈 VFX 기술의 미래를 들어봤다.

구독자들에게 소개 부탁드립니다.

안녕하세요. ETRI 공간미디어연구소 미디어시스템연구본부 미디어AX연구실의 손정우입니다. 저는 AI가 미디어의 내용을 이해하고, 이를 콘텐츠 제작을 비롯한 다양한 서비스에 활용하도록 하는 기술을 연구하고 있습니다.

예를 들어 드라마나 영화 속 인물의 감정과 관계, 이야기의 흐름을 파악하거나 뉴스에서 다루는 사건을 이해하는 기술입니다. 사람이 영상을 보면서 내용을 이해하듯, AI도 영상에 담긴 의미를 이해할 수 있도록 만드는 일이라고 생각하시면 됩니다.

개발에 참여하신 ‘온프레미스 기반 특수효과 생성 AI’는 무엇인가요?

촬영된 영상을 이해하고, 아티스트가 원하는 불·연기·물·폭발 등의 특수효과를 생성하는 AI 기술이에요. ‘온프레미스’는 외부 클라우드가 아니라 제작사가 보유한 서버나 장비에서 시스템을 직접 운영하는 방식을 뜻해요.

저희 기술의 가장 큰 특징은 비교적 작은 AI 모델을 활용해 스튜디오의 자체 장비에서 구동할 수 있도록 개발한다는 점이에요. 또한, 생성한 특수효과를 아티스트가 편집할 수 있도록 별도의 레이어 영상으로 제공하는 데 중점을 두고 있어요.

기존에는 아티스트가 직접 제작하던 특수효과 일부를 AI가 생성하도록 돕는다는 점에서 차이가 있는데요, AI가 만든 결과물을 아티스트가 의도에 맞게 다듬고 완성할 수 있도록 하는 것이 저희가 지향하는 방향이에요.

사용자가 입력한 프롬프트만으로 특수효과 영상을 생성한다고 들었습니다. 어떤 정보를 AI가 분석하고, 이를 어떻게 영상으로 구현하나요?

저희 시스템은 사용자의 요청과 특수효과를 적용할 촬영 영상을 함께 분석합니다. 먼저 사용자가 어떤 효과를 원하는지 구체화해요. 예를 들어 같은 불이라도 불길이 움직이는 방식이나 불티의 크기에 따라 모습이 달라지죠. 저희는 두 개의 대규모 언어모델, 즉 LLM을 활용해 사용자가 대화하면서 원하는 효과를 구체적인 프롬프트로 표현할 수 있도록 도와요.

다음으로 촬영 영상에서 효과가 들어갈 위치와 주변 사물의 관계를 파악해요. 영상은 시간이 흐르면서 사물이나 카메라가 움직이기 때문에, 한 장면에 효과를 잘 배치하는 것만으로는 충분하지 않아요. 움직임에 따라 효과의 위치와 주변 사물과의 관계가 어떻게 달라지는지도 분석해야 자연스럽게 어우러질 수 있죠.

이렇게 분석한 정보를 바탕으로 특수효과를 생성하고 합성합니다. 불길이나 연기의 방향뿐 아니라 주변의 빛과 반사광도 함께 고려해요. 저희는 이 과정을 작은 작업 단위로 나누어 모델을 구성함으로써, 계산에 필요한 자원을 줄이고 스튜디오의 자체 장비에서 동작하도록 개발했어요.

레이어 영상 생성 기능을 지원한다는 점이 인상적입니다. 하나의 특수효과 영상을 통째로 생성하는 것과 레이어별로 생성하는 것은 어떤 차이가 있나요?

프롬프트를 입력해 화면 전체를 한 번에 생성하는 방식은 결과물의 특정 부분만 세밀하게 수정하기가 어려워요. 제작 현장에서는 전체적인 모습이 마음에 들더라도 불이나 연기 같은 개별 효과를 따로 조정해야 하는 경우가 많아요.

레이어는 원본 영상 위에 겹쳐 놓는 투명한 판이라고 생각하시면 돼요. 불과 연기를 각각 다른 투명판에 담으면, 원본 영상은 유지하면서 필요한 효과를 따로 수정할 수 있는 거죠.

이처럼 특수효과를 레이어별로 생성하면 각 효과의 편집 자유도가 높아져요. 기존 VFX(Visual Effects, 특수시각효과) 제작 과정에서도 레이어를 활용하기 때문에, 현장의 작업 방식과 연결하기에도 유리하죠.

연구 중 가장 인상 깊었던 순간이 있었다면 말씀해 주세요.

함께 일하는 스튜디오 관계자분에게 “쓸 수 있겠다”라는 말을 들었을 때가 가장 기억에 남아요. 과제를 기획할 때부터 현장의 요구를 반영해 실제로 활용할 수 있는 기술을 만들자는 목표가 있었거든요. 이를 위해 여러 스튜디오와 학계의 의견을 듣고 개발 방향에 반영했죠.

스튜디오의 자체 장비에서 구동할 수 있도록 소형 모델의 성능을 최대한 끌어올렸고, 기존 작업 과정에 연결할 수 있도록 레이어 영상을 생성하는 방식으로 접근했어요. 최신 AI 모델도 빠르게 적용하면서 품질을 높였고요.

그렇게 개발한 결과물을 보고 현장에서는 활용 가능성을 인정해 주셨어요. 개발한 기술을 영화 제작에 적용해 이번 부산국제영화제에 작품을 출품한다거나, 우수학술대회에 과제 결과물이 실리는 등 결과물이 인정받을 때 저희가 잡은 방향이 의미가 있다는 생각이 들어 가장 기뻤어요.

실제 영화나 드라마 제작 현장에서 이 기술을 활용한다면, 기존 VFX 제작 과정의 어떤 부분이 가장 크게 달라질까요?

특수효과를 처음 만들고 수정하는 데 드는 시간과 작업 부담을 줄일 수 있을 것으로 기대해요. 예를 들어 불이 나고 연기가 피어오르는 장면을 만들려면, 불과 연기 등 여러 요소를 각각 제작하고 원본 영상에 맞춰 합성해야 해요. 하나의 장면에도 적게는 몇 개에서 많게는 수십 개의 레이어가 사용되죠.

저희 기술은 이렇게 개별 효과를 만드는 작업의 일부를 AI로 간소화하는 거예요. 아티스트는 AI가 생성한 레이어를 바탕으로 원하는 표현을 다듬을 수 있어, 장면을 완성하는 시간을 줄이고 세부적인 연출에 더 집중할 수 있을 것으로 기대해 봅니다.

기술의 상용화를 위해 남아 있는 숙제가 있다면 무엇인가요?

현재 과제에서는 불·물·연기·폭발·변형의 다섯 가지 효과를 대상으로 기술을 개발하고 있어요. 내부적으로는 그 밖의 효과도 함께 검토하고 있고요. 상용화를 위해서는 더 다양한 효과와 촬영 조건에서도 원하는 품질을 안정적으로 얻을 수 있는지 검증해야 해요. 실제 제작 현장에서 활용할 수 있는 범위를 넓히고, 그 안에서 기술의 신뢰성을 확인하는 것이 남은 과제입니다.

앞으로의 연구 계획과 박사님의 비전을 말씀해 주세요.

저는 그동안 미디어라는 복잡한 데이터를 분석하고, 그 안에서 필요한 정보를 찾아 의미를 이해하는 기술을 연구해 왔어요. 현재는 이렇게 추출한 정보를 사람뿐 아니라 다른 AI도 이해하고 활용할 수 있도록 전달하는 기술을 개발하고 있죠.

이런 기술이 계속 발전하면 언젠가는 제 옆에서 함께 TV를 보고 웃고 떠드는 AI도 만들어질 것이라고 기대해요. 같은 장면을 보고 왜 재미있는지, 왜 슬픈지를 함께 이야기할 수 있는 AI를 만드는 데 저도 힘을 보태고 싶어요.