[태그:] 카드뉴스 영상

  • 텍스트 한 줄로 카드뉴스 영상 만드는 법

    텍스트 한 줄로 카드뉴스 영상 만드는 법

    이젠 Canva에서 이미지 10장 직접 넣는 게 의미 없다

    1인 사업자가 카드뉴스에 집착해야 하는 진짜 이유

    매일 블로그 글을 쓰고 나서 릴스로 옮기려니 영상 편집이 발목을 잡는다. 카드뉴스 영상 만드는 법을 검색해봐야 Canva에서 이미지 10장 넣고 텍스트 박고 음악 입히는 반복 작업이 전부다. 1인 사업자에게 편집 프로그램 켜는 시간은 곧 비용이다. 포토샵이나 프리미어프로를 배우는 것보다 텍스트 한 줄을 API에 던져서 완성본을 받아내는 방식으로 시스템을 바꿨다.

    인스타 한 계정의 최근 30편을 재보니 릴스 18편은 조회수 중앙값이 50이었고, 피드 12편은 0이었다. 숫자가 보여주듯 사진 카드뉴스는 피드에서 묻힌다. 세로형 영상 포맷이 아니면 노출 자체가 안 된다. 내가 카드뉴스에 매달리는 건 단순한 유행이 아니라 트래픽을 남기기 위한 가장 현실적인 출구라서다.

    편집 프로그램 없이 텍스트만으로 영상이 만들어지는 원리

    카드뉴스 자동화란 블로그 HTML이나 마크다운 텍스트를 파싱하여 이미지 생성 API와 비디오 렌더링 API로 전달해 완성본을 반환하는 무인 파이프라인을 뜻한다. 사람이 끼어들 지 않는다. 이 블로그는 한 달 반 동안 43편을 발행했다(2026-07-07~08-23, 47일). 이 작업이 가능한 이유는 편집을 기계에 떠넘겼기 때문이다. 주 1~5편으로 불규칙하게 초안을 만들고 문체와 사실성 검사를 통과한 글만 공개되는 구조다.

    블로그 텍스트 한 줄, 카드뉴스 영상으로 변환하는 워크플로우

    텍스트 입력부터 9:16 비율 변환까지 자동화 파이프라인

    아일리고(AILEEGO)가 실제 운영 중인 크론 기반 텍스트-영상 자동화 워크플로우는 4단계로 짜여 있다. 블로그 글이 발행되면 텍스트가 파싱되어 이미지로 변환되고, 9:16 캔버스에 합성된 뒤 렌더링 검증을 거쳐 영상으로 나온다.

    1. 블로그 텍스트를 문단 단위로 분할한다
    2. 각 문단의 핵심 키워드를 추출해 이미지를 매칭하거나 API로 생성한다
    3. 9:16 캔버스에 텍스트와 이미지를 합성해 렌더링한다
    4. 폰트 렌더링 깨짐 여부를 시각적 안전 마진 안에서 검증한다

    헤드리스로 LLM을 부를 때 기본 설정은 1회 $0.78 이었다. 모델과 작업 디렉터리를 지정하고 불필요한 도구를 떼자 $0.028 로 27배 줄었다. 텍스트와 이미지 매칭을 한 번에 처리하면 비용이 터지기 때문에 파싱 단계부터 극단적으로 쪼개서 던지는 게 낫다.

    node render_video.js --input post.md --aspect 9:16 --safeZone true

    API를 활용한 이미지-텍스트 매칭 및 자동 자막 생성

    이미지 매칭은 키워드 추출 API와 이미지 생성 API를 순차적으로 묶어서 처리한다. 텍스트가 입력되면 핵심 명사를 뽑아내고, 그 단어에 맞는 프롬프트를 조립해 비주얼을 만들어낸다.

    주어진 텍스트에서 한 문장씩 추출해 9:16 비율에 맞는 카드뉴스 장면을 JSON 형태로 설명하라. 각 장면은 배경 이미지 생성 프롬프트와 화면에 띄울 텍스트로 구성한다.

    9:16 세로형 카드뉴스 영상의 가장 이상적인 길이는?

    시청 지속률을 높이는 최적의 초 단위

    9:16 세로형 영상 최적화란 시청자의 첫 1초 이탈을 막기 위해 텍스트 노출 시간과 장면 전환 속도를 플랫폼 데이터 기반으로 조절하는 과정을 의미한다. 무작정 짧게 만들면 조회수가 나오는 게 아니다. 텍스트가 너무 길어 읽기 부담스러운 구간에서 시청자가 이탈하기 시작한다.

    영상 길이를 최소 단위로 쪼개고 첫 장면에서 시선을 끄집어오는 구조로 수정했다. 인스타 데이터를 보면 릴스 18편의 조회수 중앙값이 50이었고 피드 12편은 0이었다. 텍스트를 읽어주는 시간을 장면 전환 속도에 맞추다 보니 자연스럽게 짧아졌다.

    플랫폼(인스타/쇼츠)별 체류 시간 분석 데이터

    쇼츠와 릴스는 체류 시간 잣대가 다르다. 인스타는 첫 3초가 관건이고 쇼츠는 끝까지 보는 비율이 더 중요하다. 텍스트를 9:16 화면에 꽉 채우기보단 상단 3분의 1에만 배치하고 나머지는 여백으로 두니 이탈률이 낮아졌다.

    텍스트를 영상으로 자동 변환

    영상 제작 시 텍스트가 화면 밖으로 나가거나 깨지는 것 방지법

    모바일 노치(UI)를 고려한 9:16 안전 영역(Safe Zone) 설정

    안전 영역(Safe Zone)이란 스마트폰의 노치나 하단 UI 가림 현상을 피하기 위해 9:16 캔버스 중앙에 확보해야 하는 텍스트 렌더링 경계선이다. 자동화 과정에서 텍스트 오버플로우로 영상을 폐기한 적이 있다. AI가 만든 텍스트가 9:16 화면 밖으로 나가거나 폰트 렌더링이 깨지는 현상이 잦았다.

    직접 만든 중복 검사 가드를 검증해 보니 이미 발행된 글 35편끼리 비교했을 때 595쌍 중 73쌍(12.3%)을 중복이라고 잘못 판정했다. 텍스트 매칭 검증 로직도 비슷한 함정이 있다. 지나치게 엄격하게 걸러내면 정상 텍스트까지 잘려 나간다. 그래서 수동 검토 단계를 아예 없애지는 못했다.

    AI 자동 줄바꿈 및 폰트 렌더링 깨짐 방지 로직

    CSS 수준의 박스 모델을 캔버스에 그대로 적용했다. 자간과 행간을 고정하고, 텍스트가 상자를 벗어나면 글자 크기를 줄이거나 줄바꿈하는 스크립트를 넣었다.

    {
      "canvas": {
        "width": 1080,
        "height": 1920,
        "safe_zone": { "top": 200, "bottom": 200, "padding": 80 }
      },
      "text_box": "wrap_text_hard",
      "font": "Pretendard-Bold"
    }

    설정을 바꿔 렌더링을 다시 돌리니 폐기율이 줄었다. 텍스트가 가장자리로 나가는 문제는 safe_zone 여백을 넓히는 것으로 해결됐다. 폰트가 깨지는 건 시스템 기본 폰트를 쓰지 않고 웹폰트를 캔버스에 임베딩하면서 잡혔다.

    텍스트 1줄이면 콘텐츠 매트릭스가 완성된다

    1인 빌더를 위한 콘텐츠 자동화 다음 단계

    혼자서 여러 SaaS를 굴리려면 콘텐츠 발행이 기계화되어야 한다. 현재 작업 폴더가 183개, git 저장소가 90개 쌓여 있다. cron 63개를 무인으로 돌리고 있다. 1인 빌더의 생산성은 여기서 나온다.

    자동 생성한 글의 AI 문체 지문을 재보니 1,000자당 10.1건이었고, 손으로 고친 뒤 1.4건으로 떨어졌다. 영상 변환 전 텍스트 품질부터 잡아야 한다. 문체가 기계 티를 내면 시청자가 스와이프를 멈추지 않는다.

    지금 바로 실험해 볼 텍스트-영상 프롬프트

    텍스트만으로 영상을 찍어내는 시스템 구축이 끝났다면 다음은 자동화 시스템 고도화와 훅 설계로 넘어가면 된다. 아래 프롬프트를 복사해 바로 실험해 볼 수 있다.

    블로그 본문 500자를 입력할 테니, 9:16 카드뉴스 3장 분량의 콘티를 짜라. 각 장면은 상단에 들어갈 10자 이내의 헤드라인, 중앙의 본문 텍스트, 하단의 이미지 생성 키워드를 포함한다.

    이 흐름이 익숙해지면 텍스트 1줄로 영상 1편을 찍어내는 1인 공장 라인이 완성된다.

    근거로 삼은 문서


    글쓴이 정보

    여기 올라오는 글의 초안은 운영자가 만든 AI 파이프라인이 자동으로 만듭니다. 다만 문체·사실성 검사를 통과하지 못한 초안은 공개되지 않고 사람이 손봅니다. 그 과정은 포트폴리오에서 볼 수 있습니다.

    자주 나오는 질문

    카드뉴스 영상을 만들 때 텍스트가 화면 밖으로 나가는 건 어떻게 방지하나요?

    9:16 캔버스 중앙에 스마트폰 노치나 하단 UI를 피하는 안전 영역(Safe Zone)을 설정해야 합니다. CSS 박스 모델처럼 자간과 행간을 고정하고, 텍스트가 상자를 벗어나면 글자 크기를 줄이거나 줄바꿈하는 스크립트를 적용하면 렌더링 깨짐을 막을 수 있습니다.

    9:16 세로형 카드뉴스 영상의 가장 이상적인 길이는 얼마인가요?

    시청자의 첫 1초 이탈을 막기 위해 텍스트 노출 시간과 장면 전환 속도를 조절하는 것이 핵심입니다. 무작정 짧게 만들기보다 텍스트를 읽어주는 시간에 맞춰 전환 속도를 세팅하고, 텍스트는 화면 상단 3분의 1에만 배치해 이탈률을 낮추는 게 좋습니다.

    텍스트 한 줄로 카드뉴스 영상을 자동화하는 원리는 무엇인가요?

    블로그 HTML이나 마크다운 텍스트를 파싱해 이미지 생성 API와 비디오 렌더링 API로 전달하는 무인 파이프라인을 구축하는 방식입니다. 텍스트에서 핵심 명사를 추출해 이미지를 매칭하고 9:16 캔버스에 합성한 뒤 렌더링 검증을 거쳐 완성본을 받아냅니다.

    카드뉴스 자동화 작업 시 API 비용을 줄이려면 어떻게 해야 하나요?

    LLM을 호출할 때 모델과 작업 디렉터리를 지정하고 불필요한 도구를 제외하면 비용을 크게 낮출 수 있습니다. 텍스트와 이미지 매칭을 한 번에 처리하면 비용이 터지므로, 파싱 단계부터 극단적으로 잘게 쪼개서 API에 던지는 것이 유리합니다.

    쇼츠와 릴스는 카드뉴스 시청 지속률 기준이 어떻게 다른가요?

    인스타 릴스는 첫 3초가 관건이고, 쇼츠는 끝까지 보는 비율이 더 중요하게 작용합니다. 그래서 텍스트를 9:16 화면에 꽉 채우기보단 상단 3분의 1에만 배치하고 나머지는 여백으로 두는 방식으로 플랫폼별 이탈률을 낮출 수 있습니다.

    자동화된 카드뉴스에서 텍스트 중복이나 잘못된 매칭은 어떻게 검사하나요?

    자동화 과정에서 텍스트 오버플로우나 중복 판정이 발생할 수 있어 수동 검토 단계를 완전히 없애기는 어렵습니다. 지나치게 엄격하게 필터링하면 정상 텍스트까지 잘려 나가기 때문에, 검증 로직과 함께 최종적으로 수동 검토를 거치는 하이브리드 방식이 안전합니다.