1. 목소리 프로필 등록 (선택이지만 권장)

이름을 입력하고 다음 중 하나를 선택하세요:

  • 실시간 녹음 — 조용한 방에서 화면에 나오는 문구를 10~20초 동안 소리 내어 읽습니다, 또는
  • 샘플 업로드 — 해당 인물의 목소리가 담긴 기존 오디오나 영상 파일을 사용합니다.

원하는 만큼 여러 사람(팀원, 정기 회의 참석자)을 등록할 수 있습니다. 등록된 모든 프로필은 매번 새로운 변환마다 함께 확인됩니다.

설정 영역에서 프로필을 관리할 수 있습니다: 등록된 프로필 목록 보기, 개별 목소리 샘플 확인 또는 삭제, 프로필 전체 삭제.

2. 파일 변환

창에 mp4나 오디오 파일을 드래그하거나, Finder에서 선택 버튼으로 파일을 복사하지 않고 그 자리에서 바로 지정할 수 있습니다. 이번 변환에서 매칭할 목소리 프로필을 체크하고 시작하세요.

녹화본에 몇 명이 등장하는지 대략 알고 있다면, 선택 항목인 예상 화자 수(최소/최대, 또는 숫자 하나)를 입력하세요. 화자 분리가 가끔 한 사람을 두 명으로 나눠버리는 경우가 있는데, 인원 수 범위를 알려주면 이를 방지하는 데 도움이 됩니다.

진행 상황은 각 파이프라인 단계마다 실시간으로 표시됩니다: 오디오 추출 → 화자 분리 → 전사 → 화자 매칭 → 완료.

3. 작업 이력

모든 변환은 나중에 다시 확인할 수 있는 작업으로 보관됩니다:

  • 지난 작업 목록을 보고 원하는 항목을 다시 엽니다
  • 아직 실행 중인 작업을 취소합니다
  • 더 이상 필요 없는 작업을 삭제합니다

4. 재매칭 & 재라벨링

비용이 큰 파이프라인 단계(화자 분리 + 전사)를 다시 돌리지 않고 전사본을 고치는 두 가지 방법:

  • 재매칭 — 목소리 프로필 매칭 단계만 다시 실행합니다. 예를 들어 아직 등록하지 않았던 프로필을 추가한 뒤나, 어떤 프로필을 포함할지 조정한 뒤에 사용합니다. 화자 분리와 전사 결과는 그대로 재사용됩니다.
  • 재라벨링 — 특정 작업의 화자 라벨을 수동으로 직접 바꿉니다(예: 잘못 매칭된 것을 손으로 고치거나, 등록되지 않은 화자에게 이름을 붙일 때).

두 기능 모두 이미 계산되어 있는 작업의 화자 분리 및 전사 결과를 그대로 활용하므로, 몇 분이 아니라 몇 초 만에 끝납니다.

5. 내보내기

완료된 모든 작업은 세 가지 형식으로 다운로드할 수 있습니다:

형식용도
TXT읽기 편한 전사본: [00:12:34] Alex: Hi everyone...
SRT화자 분리된 구간에 맞춰 타이밍이 맞춰진 영상 자막
JSON원본 데이터 — 타임스탬프가 포함된 화자별 블록. 스크립팅이나 추가 처리용

결과물은 기본적으로 ~/Downloads/video2text에 저장됩니다(설정에서 변경 가능).

설정

설정 패널에서 HuggingFace 토큰을 설정하고(저장되어 유지됩니다), 수동으로 확인하고 싶을 때 작업 파일이 있는 폴더를 (macOS Finder를 통해) 열 수 있습니다.