불과 얼마 전까지만 해도 인공지능(AI)이 만든 이미지는 텍스트가 뭉개지거나 객체 표현이 불안정한 '어색함'이 뚜렷했다. 하지만 최근 구글과 오픈AI 등 빅테크 기업이 연이어 선보인 혁신적인 기술은 이러한 한계의 극복을 알리며, '정교함'이 생성형 AI 시장의 핵심 무기로 떠올랐음을 선언한다.
구글 딥마인드의 범용 시각 AI 모델 '비전 바나나(Vision Banana)'는 AI가 시각적 요소를 완벽히 이해하고 분석하는 경지에 이르렀음을 증명한다. 이미지 출력값을 빛의 삼원색(RGB)으로 세분화해, 웅크린 고양이와 앞다리와 뻗은 고양이의 미세한 자세 차이는 물론, 똑같이 생긴 여러 개의 농구공조차 개별 객체로 분리해 낸다. 단일 단어부터 긴 구절에 이르기까지 지정된 시각 요소를 분할하는 이 기술은 AI가 인간에 버금가는 시각 인지 능력을 갖췄음을 보여준다.
'챗GPT 이미지 2.0'은 언어 구현의 장벽을 완벽히 허물었다. 과거 AI들이 한글을 생성할 때의 맞춤법 오류를 바로잡고, 포장마차 메뉴판이나 소주병 상표를 거의 완벽하게 구사한다. 이 모델은 벵골어 등 비라틴어 계열 언어까지 정교하게 표현하며, 이는 정보를 검색하고 스스로 검증하는 고차원적인 '사고 능력'을 탑재한 덕분이다. 이러한 발전은 포스터, 광고 등 언어가 포함된 콘텐츠 산업에서 비용을 절감하고 생산성을 극대화할 것이다.
정교해진 이미지 생성 기술은 어디로 향할 것인가. 가장 유력하고 필연적인 방향은 정지된 이미지를 넘어 '시간과 움직임이 결합된 영상'으로 무대가 확장되는 것이다. 현재 AI가 보여주는 복잡한 연산 능력과 객체의 깊이를 추정하는 공간 지각력은 머지않아 일관된 물리 법칙이 적용되는 고해상도 동영상을 실시간으로 생성해 낼 것이다. 사용자가 입력한 텍스트 대본 몇 줄만으로 캐릭터의 외형이 수만 프레임 동안 변함없이 유지되는 영화가 만들어지고, 시청 중 등장인물의 행동이나 결말을 실시간 프롬프트로 수정하는 '초개인화된 상호작용형 동영상 AI'의 출현도 예측된다. 누구나 상상력만으로 자신만의 영화를 감독하는 '시각 콘텐츠 민주화' 시대가 다가오고 있다.
하지만 기술이 완벽해질수록 진위를 가려내기 어렵다는 모호함과 혼란 역시 커진다. 완벽하게 조작된 가짜 뉴스 영상이나 딥페이크의 위험성에 대비해, 국내에서는 1월부터 'AI 기본법'이 시행되며 선제 대응에 나섰다. 이 법 제31조의 '투명성 확보 의무'에 따라 고영향 AI 및 생성형 AI 사업자는 이용자에게 사실을 고지하고, 결과물에 워터마크 등을 삽입해 AI 생성물임을 명확히 식별하게 해야 한다.
구글 연구진의 예측처럼 이미지 생성 모델이 광범위한 분야의 '파운데이션 시각 모델'로 도약하는 지금 우리는 현실 복제를 넘어 새로운 가상의 시공간을 창조하는 임계점에 서 있다. 일상을 뒤덮을 완벽한 동영상 생성 AI 시대에는 기술의 혁신을 누림과 동시에, 가상과 현실을 안전하게 구분할 촘촘하고 이성적인 윤리적, 제도적 방파제가 단단히 구축돼야 한다.
후원하기




























