uncloseai-speech/scripts
russell@unturf.com f25731ca08
Add make whisper-refs — re-transcribe cloned-voices/*.wav with whisper-large-v3
F5-TTS cloning quality depends on ref_text matching the prosody of ref_audio
(commas, periods, casing). Previous ref_texts were LibriSpeech ground-truth
labels: ALL CAPS, no punctuation — wrong signal for a flow-matching TTS
conditioned on text. Whisper hears what F5 will hear.

- scripts/whisper_refs.py — transcribe all wavs, rewrite
  voice_to_speaker.default.yaml + cloned-voices/voices_metadata.json
  in place. Also writes cloned-voices/whisper_refs.json sidecar.
- Makefile: whisper-refs target. Idempotent, rerun whenever
  cloned-voices/ changes.

Run on a GPU host (4090/3090). ~30s for 40 short clips on a 4090.
2026-05-24 11:56:15 -04:00
..
add_voice.py Organize repository: create scripts/ and docs/ directories 2025-11-09 09:25:21 -05:00
download_diverse_voices.py Add idempotent voice registry system for permanent speaker-to-name assignments 2026-01-27 13:59:39 -05:00
download_diverse_voices.sh Add 20 diverse voice samples for Qwen3-TTS 2026-01-26 16:50:54 -05:00
download_samples.sh Organize repository: create scripts/ and docs/ directories 2025-11-09 09:25:21 -05:00
download_voice_samples.sh Use LJ Speech sample for voice cloning (Alibaba Cloud URL blocked) 2026-01-26 16:28:39 -05:00
fetch_voices.py Add 20 diverse voice samples for Qwen3-TTS 2026-01-26 16:50:54 -05:00
say.py Organize repository: create scripts/ and docs/ directories 2025-11-09 09:25:21 -05:00
test_voices.sh Organize repository: create scripts/ and docs/ directories 2025-11-09 09:25:21 -05:00
whisper_refs.py Add make whisper-refs — re-transcribe cloned-voices/*.wav with whisper-large-v3 2026-05-24 11:56:15 -04:00