LAION의 Big Video Dataset은 CommonCrawl에서 찾은 13억개 영상 URL 가운데 8000만개 영상을 내려받아 1000만시간 분량으로 구성했습니다. 여기서 자동 영상 및 음성 설명이 붙은 5500만개 클립과 정지 이미지 3억장을 추출했고, 이 데이터로 학습한 모델은 InternVid 기반 비교 모델보다 영상-텍스트 벤치마크가 최대 2.1%포인트 높았습니다. 데이터와 코드는 연구용으로 공개됐지만 대부분 YouTube와 영어 콘텐츠이고 저작권자 권리를 지켜야 한다는 조건이 붙습니다.
한줄 결론: 영상, 음성, 텍스트를 함께 학습하는 연구 기반이 크게 열렸지만 연구용 조건과 저작권 검토가 필수입니다.