Sangdon Park

설치와 출력 상태

2026년 9월 6일, 이 PC에서 사용자 참조 음성을 등록하고 두 영상의 실제 합성을 완료했습니다.

Qwen3-TTS Base 1.7B, Whisper small, CAM++ 모델이 설치되어 있습니다. Python 3.11, PyTorch 2.8.0+cu128, RTX 5090 CUDA 연산을 확인했습니다.

현재 목소리는 voice/reference.wav와 reference.txt에 등록되어 있습니다. 합성은 참조 방식이며 별도 개인 미세학습은 수행하지 않았습니다.

영상 화면 수 길이 음성 문단 ASR 문자 오류율 화자 코사인 평균 강조 장면
강의 36 21분 28초 115 1.42% 0.832 131
포트폴리오 8 6분 02초 35 1.41% 0.832 39

전체 모델 가중치와 실행 환경은 사용자 캐시 C:\Users\HP-SERVER\.cache\career-tts에, 재제작 도구는 C:\Github\TTS\career-presentation에 있습니다.