2026년 9월 6일, 이 PC에서 사용자 참조 음성을 등록하고 두 영상의 실제 합성을 완료했습니다.
Qwen3-TTS Base 1.7B, Whisper small, CAM++ 모델이 설치되어 있습니다. Python 3.11, PyTorch 2.8.0+cu128, RTX 5090 CUDA 연산을 확인했습니다.
현재 목소리는 voice/reference.wav와 reference.txt에 등록되어 있습니다. 합성은 참조 방식이며 별도 개인 미세학습은 수행하지 않았습니다.
| 영상 | 화면 수 | 길이 | 음성 문단 | ASR 문자 오류율 | 화자 코사인 평균 | 강조 장면 |
|---|---|---|---|---|---|---|
| 강의 | 36 | 21분 28초 | 115 | 1.42% | 0.832 | 131 |
| 포트폴리오 | 8 | 6분 02초 | 35 | 1.41% | 0.832 | 39 |
전체 모델 가중치와 실행 환경은 사용자 캐시 C:\Users\HP-SERVER\.cache\career-tts에, 재제작 도구는 C:\Github\TTS\career-presentation에 있습니다.