본문으로 건너뛰기

06_프로젝트 소개 및 Qwen3.6 방송 도메인 적용기

· 약 6분
sbin
SceneMakerAI 팀

들어가며


방송사에서 "인물별 모아보기" 영상 1편을 만드는 데 전문 편집자 기준 며칠 이 걸린다. 16부작 드라마의 주요 인물 5명 것을 다 만들려면 수 주일 것이 다.

YouTube Shorts, Reels, TikTok — 플랫폼마다 최적 포맷이 달라 같은 소스로 3번 이상 반복 편집 한다.

광고는 아예 다른 문제다. 현행 VOD 광고 편성은 시간대·장르 같은 메타데이터 기반의 기계적 배정일 것이다.

K-콘텐츠 수요는 폭발하는데, 재가공은 여전히 사람 손에 묶여있다. 병목이 명확하다.

이 글에서는 무엇을 만들고 있고, 어떻게 만들 것이며, 향후 계획을 적어보았다.


1. 무엇을 만드는가

AI에게 영상을 이해시켜, 스토리를 파악하고, 저장한 뒤, 모아보기·리믹스·광고 최적화를 자동 수행하는 서비스

오픈웨이트 모델을 도입하여, RAG와 프롬프트 엔지니어링 으로 방송 도메인에 적응시키기로 했다.

서비스 한 눈에 보면 이와 같다.

image

구축 예정 서비스하는 일
모아보기정주행 가이드, 인물별 하이라이트, 감성 몽타주 자동 생성
리믹스 / 숏폼예고편·명장면 클립·명대사 카드, 플랫폼별 자동 변환
광고 최적화장면 맥락·감정 흐름 기반 최적 광고 삽입 지점 추천
Batch 자동화위 셋을 템플릿화해 대량 콘텐츠 일괄 처리

2. 어떻게 만드는가 — 4개의 STEP

전체 파이프라인은 네 단계이며, 아래와 같다.

image

STEP이름한 줄 요약
01멀티모달 비디오 인덱싱영상을 AI가 읽을 수 있는 형태 로 분해한다
02Chunking · 저장흩어진 정보를 의미 단위 장면 으로 묶어 저장한다
03영상 추출 · 검색자연어 질의로 원하는 장면을 찾아낸다
04영상 생성 · Serving찾은 장면을 실제 결과물로 조립한다

조금 복잡한것 같아, step 별로 설명을 기재해본다.


STEP 01 — 시각·청각 통합 멀티모달 비디오 인덱싱

image

VLM에게 영상을 주는 게 아니라, VLM이 볼 만한 것만 골라서 주기로 했다.

그 뒤, 아래의 도구를 이용하여, 성능을 최적화 시키기로 했다.

구간도구하는 일
영상/음성 분리FFmpeg프레임과 오디오 스트림 분리
대사/BGM 분리demucs음성과 배경음악을 독립 트랙으로 분리
장면 전환 탐지PySceneDetect컷 전환 지점 자동 검출 → 분석 단위 확정
STTfaster-whisper대사를 텍스트로. 단어별 타임스탬프 확보
BGM 분석librosa음향 특성(강도·템포)으로 장면 분위기 수치화
이미지 분석 · 요약Qwen3.6위 결과를 통합해 장면의 의미를 추론

여기서 배운 것 하나:

VLM은 눈이지, 파이프라인이 아니다. 전처리를 대충 하면 모델이 아무리 좋아도 안 된다. 도메인 적용의 절반은 모델 밖에서 일어난다.


STEP 02 — Chunking, 데이터 구축 및 저장

image

그래서 시각·음성·오디오를 같은 시간축에 정렬. 의미 단위로 다시 묶는다.

결과물은 이런 모양이다. (json 으로 할 예정)

Segment 47 | 00:18:20 ~ 00:18:30
─────────────────────────────────────────────
요약 병실에서 어머니의 고백 이후, 딸의 감정이 급격히 흔들리는 장면
시각 모녀 대화 → 딸 클로즈업 → 눈물 직전 표정
언어 "왜 이제 말한 거야?" / "걱정 끼치기 싫었어" / "무서워…"
오디오 슬픈 피아노 BGM, 후반부 음량 상승, 짧은 정적
감정 슬픔 0.82 불안 0.74 [관계 전환점]

이 객체를 임베딩해 Qdrant(벡터 DB) , 구조화 메타데이터는 MariaDB 에 저장한다.

의미 기반 검색과 조건 기반 필터링을 동시에 지원하는 하이브리드 구조다.


STEP 03 — 영상 추출 및 검색

image

기존 메타데이터 검색은 키워드가 일치해야만 결과가 나온다.

서비스를 위해 질의 재구성 가능한 langraph 도입하기로 한 상태다..

단순 선형 파이프라인이 아니라 그래프 기반 순환 구조라서, 결과가 미흡하면 스스로 이전 단계로 돌아가 재시도한다고 한다


STEP 04 — 영상 생성 및 Serving

image

검색된 구간을 실제 영상으로 조립한다. 영상을 다시 인코딩하지 않고 필요한 구간만 잘라 내, 원본 품질을 유지하면서 플랫폼별 규격(16:9 / 9:16)으로 출력해보려 한다.

이 전 과정을 LangGraph 가 오케스트레이션하기로 했다.


3. 사용 오픈웨이트

현재 기준 아래 두 모델을 도입하여 시도 중에 있다.

QWEN3.6-27Bhttps://huggingface.co/Qwen/Qwen3.6-27B
Qwen3.6-35B-A3Bhttps://huggingface.co/Qwen/Qwen3.6-35B-A3B

4. 시스템 구축 및 서비스 흐름

노트

💡 2026-07 / 프로젝트 시작 2개월 차, 구축된 시스템 및 서비스를 적어보았다.

시스템 구축

두 GPU 를 사용하기로 하였다.

인스턴스 이름탑재 GPU 종류GPU 개수총 GPU 메모리 (VRAM)메모리 특징
g7e.2xlargeNVIDIA RTX PRO 6000 Blackwell1개96 GBGDDR7, 대역폭 1,597 GB/s
g7e.12xlargeNVIDIA RTX PRO 6000 Blackwell2개192 GB (각 96 GB)GDDR7, GPU 간 직접 통신(P2P) 지원

웹, API, DB 를 포함한 다이어그램을 그려보았다.

오늘 기준 다이어그램이며, 최종 배포 시에는 다를 수 있다.

image

서비스 흐름

오늘까지 구축한 agent 아래의 4개이다.

에이전트역할주요 스택
agent-stt음성 인식, 화자별 대사 추출, 자막 생성faster-whisper, demucs
agent-vision장면 탐지, 프레임 분석, 시각 맥락 추론PySceneDetect, Qwen3.6 VLM
agent-scenario서사 구조 파악, 감정 흐름 분석, 장면 병합Qwen3.6, RAG
agent-search자연어 질의 → 장면 검색, 구간 추출Qdrant, Embedding

4개의 독립 에이전트 로 분리했다. (또한 STT 의 경우, 2차 보정 까지 시키는 상태다)

오늘 기준의 서비스 flow 를 그림으로 정리했다.

image


5. 다음 글 예고

이번 글에서는 무엇을 만들 예정인지, 어떻게 구축 예정인지 방식을 다뤘다.

다음 글부터는 실제로 하나하나 과정을 선보일 예정이다.

  • 음성분석 처리 과정 및 결과
  • faster-whisper 한국어 음성인식 최적화 경험 공유

참고

본 글은 과학기술정보통신부·정보통신산업진흥원 「2026년 오픈소스 AI·SW 개발·활용 지원사업」의 지원으로 수행된 연구 결과입니다.