샌프란시스코 영상 검색 스타트업, 아마존과 벤처캐피탈로부터 1억 달러 투자 유치

샌프란시스코의 한 영상 검색 스타트업이 아마존과 벤처캐피탈로부터 1억 달러 규모의 투자를 받았습니다. 이번 투자는 영상 분석 기술의 상용화를 가속화하려는 움직임으로 풀이됩니다.

News_0

비디오 검색 AI 스타트업, 1억 달러 투자 유치

Nvidia가 지원하는 비디오 검색 스타트업 Twelve Labs Co.가 Amazon을 포함한 투자자들로부터 1억 달러를 조달했습니다. 이번 Series B 라운드는 NEA Management Co.와 Naver Ventures가 공동으로 주도했으며, Radical Ventures, Index Ventures, Korea Investment Partners Co. 등이 참여했습니다. Amazon의 클라우드 서비스 AWS는 Trainium 칩에서 회사의 워크로드를 호스팅하기 위한 다년간의 계약을 체결했으며, AI 애플리케이션을 개발하는 개발자들을 위해 새로운 모델들을 서비스에 출시할 예정입니다.

한국 태생의 엔지니어들이 설립하고 샌프란시스코에 본사를 둔 Twelve Labs는 비디오를 검색 가능하고 이해 가능하게 만드는 AI 모델을 개발하고 있습니다. 회사의 목표는 방대한 영상 아카이브에 접근하고 이를 더 쉽게 수익화하는 것입니다. CEO이자 공동 창립자인 Jae Lee는 “5년 전 우리는 비디오가 텍스트가 아니라 인간이 세상을 배우기 위해 받는 가장 유사한 신호 데이터라는 대담한 가정을 했습니다”라고 말했습니다.

비디오는 전 세계 데이터의 약 90%를 차지하지만, 대부분은 아카이브에 방치되어 있어 규모에 맞게 쿼리하거나 분석하기에는 너무 복잡하고 구조화되지 않은 상태입니다. 대규모 언어 모델은 프레임을 샘플링할 수 있지만 콘텐츠를 놓치는 경향이 있습니다. 이를 해결하기 위해 Twelve Labs는 여러 유형의 데이터를 동시에 처리할 수 있는 모델을 구축했습니다.

혁신적인 기술: Marengo와 Pegasus 모델

Twelve Labs의 주력 모델인 Marengo 3.0은 원본 영상을 변환하여 기계가 음향, 음성, 동작 전반에 걸쳐 검색할 수 있도록 합니다. 회사의 Pegasus 1.5 모델은 그 결과를 AI 도구나 애플리케이션을 위해 파싱 가능한 데이터로 구조화하며, 이는 문서를 브라우저에서 검색 가능하게 만드는 마크업 언어와 유사합니다. 이 두 모델이 함께 작동하여 회사가 수집한 모든 비디오의 스택을 형성하며, 시간이 지남에 따라 검색 정확도를 높이는 것을 목표로 합니다.

크리에이터와 엔터테인먼트 회사들은 자신의 비디오 아카이브를 검색 가능한 시스템에 넣을 수 있습니다. 이를 통해 1954년 영화 ‘온 더 워터프론트’에서 말론 브란도의 택시 장면이나 1986년 월드컵에서 디에고 마라도나의 논란이 많은 ‘신의 손’ 골을 찾는 것이 더 쉬워집니다. 이러한 기능은 방송국, 영화사, 광고 회사 등이 수십 년간 축적한 영상 자료를 효율적으로 활용할 수 있게 해줍니다.

Twelve Labs는 또한 텍스트 명령을 통해 검색, 설명, 계획 및 실행이 가능한 비디오 에이전트를 개발 중입니다. Lee는 “우리는 아직 비디오 에이전트의 이름을 정하지 않았습니다”라고 말했으며, 약 200명 규모의 팀은 서울과 샌프란시스코에 균등하게 분산되어 있습니다. 비디오는 방송, 영화, 회의, 공장, 병원, 경기장, 드론, 위성 등에서 나오는 엄청난 양의 정보를 담고 있지만, 대부분은 여전히 파일명, 폴더, 캡션, 스크립트, 인간의 기억을 통해 접근됩니다.

실제 활용 사례와 고객층 확대

Twelve Labs의 고객에는 수백만 시간의 아카이브 콘텐츠를 보유한 할리우드 스튜디오, 광고 회사, 소셜 미디어 인플루언서, 스포츠 프랜차이즈 소유자들이 포함됩니다. 고객 목록에는 Toronto Raptors 소유사인 Maple Leaf Sports & Entertainment Ltd., AMC Global Media Inc., UNICEF 등이 있습니다. 이러한 다양한 산업의 고객들은 각각 고유한 비디오 검색 및 분석 요구사항을 가지고 있으며, Twelve Labs의 기술이 이를 해결하는 데 도움이 되고 있습니다.

비디오에는 방송, 영화, 회의, 공장 운영, 병원 기록, 경기장 영상, 드론 및 위성 촬영 등 엄청난 양의 정보가 포함되어 있습니다. 그러나 현재 대부분의 비디오는 여전히 파일명, 폴더 구조, 캡션, 스크립트, 그리고 인간의 기억을 통해서만 접근됩니다. Lee는 “우리의 목표는 비디오의 모든 초를 에이전트가 주소 지정 가능하고 검색 가능하며 사용 가능하게 만드는 것입니다”라고 강조했습니다.

이 기술의 잠재력은 특히 대규모 미디어 라이브러리를 관리하는 조직에서 두드러집니다. 예를 들어, 스포츠 팀은 특정 플레이어의 모든 경기 장면을 즉시 찾을 수 있고, 뉴스 방송국은 특정 사건이나 인물에 관한 과거 영상을 빠르게 검색할 수 있습니다. 이러한 효율성 향상은 콘텐츠 제작 시간을 단축하고 운영 비용을 절감하는 데 직접적인 영향을 미칩니다.

비디오 AI 기술 활용 시 알아두면 좋은 팁

비디오 검색 AI를 효과적으로 활용하려면 먼저 자신의 비디오 아카이브를 체계적으로 정리하는 것이 중요합니다. 기존의 파일명, 폴더 구조, 메타데이터를 최대한 명확하게 유지하면 AI 모델이 더 정확하게 학습할 수 있습니다. 또한 검색하고자 하는 주요 콘텐츠 유형을 미리 파악하고 우선순위를 정하면, 시스템 도입 후 더 빠른 성과를 얻을 수 있습니다.

비디오 에이전트를 활용할 때는 명확하고 구체적인 텍스트 명령을 사용하는 것이 효과적입니다. 예를 들어 “특정 배우가 나오는 장면”이나 “특정 음악이 나오는 부분”처럼 구체적으로 지시하면 더 정확한 결과를 얻을 수 있습니다. 또한 정기적으로 검색 결과를 검토하고 피드백을 제공하면, 시간이 지남에 따라 시스템의 정확도가 점진적으로 향상됩니다.

조직 내에서 비디오 검색 시스템을 도입할 때는 팀 전체가 새로운 도구에 익숙해질 수 있도록 충분한 교육 시간을 확보하는 것이 좋습니다. 초기에는 가장 자주 사용되는 검색 쿼리부터 시작하여 점진적으로 확대하는 방식이 효과적입니다. 또한 다양한 부서의 피드백을 수집하여 시스템을 지속적으로 개선하면, 조직 전체의 생산성 향상으로 이어질 수 있습니다.

※ 본문은 일반 독자를 위한 요약 설명이며, 자문이 아닙니다.

댓글 남기기