내 Mac 안에 남는 것
오디오 추출, 화자 분리, 전사, 목소리 매칭까지 모든 처리 단계는 Apple Silicon(Metal) 가속을 사용해 여러분의 기기에서 로컬로 실행됩니다. 여러분의 녹화본, 그 결과로 만들어진 전사본, 등록한 목소리 프로필은 video2text에 의해 어디로도 업로드되지 않습니다.
video2text가 네트워크를 사용하는 유일한 경우
- 최초 1회 모델 다운로드: 화자 분리, 전사, 화자 임베딩을 처음 실행할 때, 해당 모델 가중치(각각 수백 MB에서 약 1GB)를 HuggingFace / Apple(mlx-community)에서 내려받아 로컬에 캐시합니다. 이후에는 video2text가 완전히 오프라인으로 동작합니다.
- 버전 확인 (문서 사이트에서만 발생, 앱 자체는 아님): 이 문서 사이트는 최신 릴리즈 태그를 표시하기 위해 GitHub API를 호출합니다. 앱 자체는 이런 호출을 하지 않습니다.
일반적인 사용 과정에서 어떤 녹화본, 전사본, 목소리 샘플도 neurosam.AI, HuggingFace, 또는 그 밖의 어떤 서버로도 전송되지 않습니다.
HuggingFace 토큰에 대하여
pyannote/speaker-diarization-3.1은 게이트된 모델이므로, video2text는 이를 내려받기 위해 Read 범위의 HuggingFace 접근 토큰이 필요합니다. 이 토큰은:
~/Library/Application Support/video2text/.env에 로컬로 저장됩니다 (개발 중에는 프로젝트 루트의.env도 사용됩니다)- HuggingFace에서 모델을 최초 1회 다운로드할 때 인증하는 용도로만 사용됩니다
- 사용자별로 발급됩니다 — HuggingFace의 게이팅은 계정 단위이므로, video2text를 배포하는 사람마다 자신의 토큰이 필요하며, 하나의 토큰을 앱에 미리 넣어둘 수 없습니다
이 토큰은 다른 자격 증명과 마찬가지로 다뤄야 합니다: 공개 저장소에 커밋하지 말고, 공개 앱 설정값처럼 공유하지 마세요.
샘플 녹화본
프로젝트 저장소 자체에는 실제 회의 녹화본이 전혀 포함되어 있지 않습니다 — sample/(로컬 개발 및 테스트에만 사용)은 .gitignore로 명시적으로 제외되어 있으며 절대 푸시되지 않습니다. video2text를 포크하거나 확장한다면 같은 원칙을 지켜주세요: 녹화본, 목소리 샘플, 다른 사람의 발화가 담긴 그 무엇이든 버전 관리에 포함시키지 마세요.
다른 Mac에 앱 배포하기
video2text.app은 완전히 독립적인 번들(자체 Python 런타임, ffmpeg, ML 의존성 포함)이므로, 시스템 전역에 아무것도 설치하지 않고도 다른 Apple Silicon Mac에 복사할 수 있습니다(AirDrop, USB 등). 각 Mac은 여전히 자체 HuggingFace 토큰이 필요하며 최초 실행 시 모델 가중치를 내려받습니다 — 이 두 가지는 본질적으로 기기/사용자별로 다르므로 공유 번들에 미리 넣어둘 수 없습니다.