ClipToTranscript광고 문의

영상 텍스트 변환 방법: 틱톡, 유튜브, X 링크부터 내 영상 파일까지

최종 업데이트: 2026년 9월

틱톡, 유튜브, X 영상을 텍스트로 변환하려면 ClipToTranscript에 링크를 붙여넣기만 하면 됩니다. 플랫폼에 이미 있는 자막을 읽어 오고, 자막이 없을 때만 음성 인식을 실행해 타임스탬프가 포함된 텍스트를 돌려줍니다(무료, 가입 불필요). 내 PC나 스마트폰에 있는 영상 파일은 도구가 링크만 받기 때문에 다른 방법이 필요한데, 그 무료 방법은 아래쪽에 정리해 두었습니다.

틱톡, 유튜브, X 영상을 텍스트로 변환하기

  1. 영상 링크 복사하기틱톡에서는 영상을 열고 '공유' > '링크 복사'를 탭합니다(앱에서 나오는 vm.tiktok.com 단축 링크도 됩니다). 유튜브에서는 주소창의 주소를 복사하거나 '공유' > '복사'를 사용합니다. youtu.be, 쇼츠, 라이브, 임베드 링크 모두 됩니다. X에서는 영상이 있는 게시물을 열고 '공유' > '링크 복사'를 탭합니다.
  2. 붙여넣고 '자막 추출하기' 누르기아래 입력창에 링크를 붙여넣고 '자막 추출하기'를 누릅니다. ClipToTranscript는 먼저 플랫폼에 이미 있는 자막(틱톡의 자막, 또는 유튜브의 수동 자막과 자동 생성 자막)을 찾아 몇 초 만에 보여 줍니다. 자막이 없으면(자막을 제공하지 않는 X 영상은 항상 그렇습니다) 자체 서버의 오픈소스 음성 인식 모델로 오디오를 텍스트로 변환합니다. 보통 10~60초가 걸리며 10분 이하 영상만 지원합니다.
  3. 텍스트 복사 또는 다운로드하기모든 줄에 시작 시간이 붙은 스크립트가 나타납니다. '타임스탬프'를 켜거나 끈 뒤 '복사'를 눌러 클립보드에 넣거나, TXT(일반 텍스트) 또는 SRT, VTT(타이밍이 포함된 자막 파일)로 다운로드하세요.

틱톡, 유튜브, X 영상 변환하기

아래에 링크를 붙여넣으세요. 틱톡, 유튜브(쇼츠 포함), X 영상에 사용할 수 있으며, 자막이 있으면 자막을, 없으면 음성 인식을 사용합니다.

틱톡 영상의 ClipToTranscript 결과 페이지: 플랫폼 배지, 재생 시간, '자동 생성' 라벨, 제목과 게시자, 스폰서 카드, '타임스탬프' 체크박스와 '복사', TXT, SRT, VTT 버튼이 있는 줄, 타임스탬프가 붙은 스크립트 줄(영어 UI)
결과 화면: 타임스탬프가 붙은 줄, '타임스탬프' 토글, '복사', 그리고 TXT, SRT, VTT 다운로드(스크린샷은 영어 UI).

내 PC나 스마트폰에 있는 영상 파일

ClipToTranscript는 링크로만 작동하고 업로드 기능이 없기 때문에, 스마트폰으로 찍은 영상이나 화면 녹화, 다운로드한 파일에는 다른 방법이 필요합니다. 무료로 쓸 수 있는 방법이 세 가지 있습니다. 가장 간단한 방법은 파일을 유튜브에 올리는 것입니다(YouTube 스튜디오에서 '만들기' > '동영상 업로드', '공개 상태'는 '일부 공개'로, 개인적인 녹화라면 '비공개'로). 유튜브가 보통 몇 분, 길면 몇 시간 안에 자동 생성 자막을 달아 주므로, 그다음 재생 페이지에서 스크립트 패널을 열거나(유튜브 스크립트 추출 가이드에 버튼 위치가 나옵니다) YouTube 스튜디오의 '자막' 메뉴에서 해당 언어 행의 옵션(⋮)을 열고 '다운로드'를 선택해 자막 파일을 받으면 됩니다(고객센터가 안내하는 경로는 '수정' > '옵션' > '자막 다운로드'). 가장 강력한 방법은 오픈소스 Whisper 앱입니다. OpenAI의 음성 인식 모델을 내 컴퓨터에서 오프라인으로 실행하며, 길이 제한 없이 파일에서 TXT, SRT, VTT를 만들어 냅니다. Buzz(Windows, macOS, Linux)와 Vibe는 무료 오픈소스이고, macOS에는 MacWhisper 무료 버전도 있습니다. 처음 한 번 수백 MB의 모델을 다운로드해야 하고, 오래된 컴퓨터에서는 변환이 실시간보다 느릴 수 있다는 점은 감안하세요. 저장하지 않고 읽기만 하려면 Windows 11의 '라이브 캡션'('설정' > '접근성' > '캡션', 또는 Windows 키+Ctrl+L), Android의 '실시간 자막'('설정' > '접근성' > '실시간 자막', 또는 볼륨 버튼을 눌렀을 때 볼륨 조절 막대 아래에 나타나는 버튼), macOS의 '실시간 자막'('시스템 설정' > '손쉬운 사용' > '실시간 자막', Apple Silicon Mac)이 영상을 재생하는 동안 화면에 말을 글로 띄워 줍니다. 지원 언어가 제한적이고 아무것도 저장되지 않습니다.

자막과 음성 인식: 기대할 수 있는 정확도

텍스트의 출처에 따라 얼마나 확인해야 하는지가 달라집니다. 크리에이터가 직접 입력하거나 업로드한 자막이 가장 좋습니다. 문장 부호가 있고, 이름이 정확하며, 화자 표시가 붙기도 합니다. 유튜브 등 플랫폼의 자동 생성 자막은 플랫폼이 실행하는 음성 인식입니다. 한 사람이 또렷하게 말하는 영상은 대체로 정확하지만 이름, 브랜드, 전문 용어, 숫자, 강한 사투리, 여러 사람이 동시에 말하는 장면, 큰 음악에 묻힌 말에는 약하고, 문장 부호도 거의 없습니다. ClipToTranscript 서버에서 실행되는 음성 인식(X 영상과 자막 없는 모든 영상에 쓰입니다)도 같은 종류의 기술이라 장단점이 같습니다. 어느 것도 법정 속기록 수준은 아닙니다. 좋은 원칙은 이렇습니다. 검색, 메모, 요약에는 그대로 쓰고, 인용하거나 공개하거나 그 안의 숫자를 믿기 전에는 오디오와 대조하세요.

정확도를 높이는 팁: 오디오가 깨끗할수록 텍스트도 정확해집니다. 한 번에 한 사람만 말하고, 마이크를 입 가까이 두고, 배경 음악을 깔지 않는 것이 무엇보다 효과적입니다. 이름, 브랜드명, 흔치 않은 단어는 어떤 음성 모델이든 가장 자주 잘못 듣는 부분이니 스크립트에서 검색해 영상과 대조하며 고치세요. 타임스탬프가 그 장면으로 바로 데려다줍니다. 숫자도 똑같이 확인해야 합니다. '일(1)'과 '이(2)'는 소리가 비슷합니다.

텍스트로 할 수 있는 일

스크립트가 있으면 영상을 검색하고 인용하고 재활용할 수 있는 자료로 바꿀 수 있습니다. 한 시간짜리 강연도 Ctrl+F로 기억나는 대목을 찾을 수 있습니다. 메모, 기사, 과제에 쓸 인용문을 타임스탬프를 근거로 삼아 뽑아낼 수 있습니다. 일반 텍스트를 AI 어시스턴트에 붙여넣으면 요약, 핵심 정리, 번역을 얻을 수 있고, 영상을 처리하는 것보다 훨씬 가볍습니다. SRT나 VTT를 다운로드하면 편집 중이거나 다시 올릴 영상에 자막을 넣을 수 있습니다. 그리고 무엇이든 공개할 때는 크리에이터를 밝히고, 베끼기보다 인용하고, 내 말이 아닌 것은 허락을 받으세요. 스크립트로 만들었다고 해서 말의 주인이 바뀌지는 않습니다. 이용약관을 참고하세요.

자주 묻는 질문

얼마나 걸리나요?
플랫폼에 이미 자막이 있으면 영상 길이와 상관없이 몇 초면 됩니다. 오디오를 변환해야 하는 경우(모든 X 영상과 자막 없는 모든 영상)에는 10~60초 정도 걸리며, 영상은 10분 이하여야 합니다.
어떤 언어를 지원하나요?
자막은 플랫폼이 그 영상에 제공하는 모든 언어로 받을 수 있고, 트랙이 여러 개라면 텍스트 위의 언어 탭으로 바꿔 가며 볼 수 있습니다. 오디오를 변환하는 경우에는 영상에서 말하는 언어 그대로 텍스트가 나옵니다.
무료인가요?
네. 가입도, 워터마크도, 설치할 것도 없습니다. 항상 '스폰서'라고 표시되는 스폰서 카드 수익으로 사이트를 운영합니다.
비공개나 일부 공개 영상도 되나요?
비공개 영상, 친구에게만 공개된 틱톡 영상, 보호된 X 계정의 게시물은 안 됩니다. 이 도구는 링크만 있으면 누구나 볼 수 있는 것만 읽을 수 있고, 로그인을 요구하지도 않습니다. 유튜브의 일부 공개 영상은 같은 이유로 대개 됩니다.
인스타그램 릴스도 변환할 수 있나요?
아니요, 인스타그램은 지원하지 않고 틱톡, 유튜브(쇼츠 포함), X 세 플랫폼만 지원합니다. 내 인스타그램 영상이라면 위에서 설명한 영상 파일용 방법을 쓰면 됩니다.

틱톡 자막 추출하기

관련 가이드

전체 가이드