uncloseai-speech/voice_to_speaker.default.yaml
russell@unturf.com b315659be6 Make Qwen3-TTS the default engine, add CPU-only docker support
- Switch default TTS engine from Piper to Qwen3-TTS (1.7B params)
- Upgrade to Python 3.12
- Add docker-compose.cpu.yml for CPU-only deployments
- Improve GPU configuration with NVIDIA environment variables
- Comment out optional engines (Piper, XTTS, Silero, Kokoro) in requirements
- Update Makefile with local/local-cpu targets and venv support
- Simplify voice_to_speaker.default.yaml for Qwen3-TTS voices
- Update docs/MODELS.md with Qwen3-TTS documentation
- Add git commit guidelines to CLAUDE.md
2026-01-26 10:41:23 -05:00

77 lines
2.6 KiB
YAML

# uncloseai-speech Voice Configuration
# Only tts-1-qwen is enabled by default
tts-1-qwen:
# OpenAI-compatible voice aliases
# Each voice requires ref_audio (reference audio) and ref_text (transcript of the audio)
# Language: Chinese, English, Japanese, Korean, German, French, Russian, Portuguese, Spanish, Italian
# Default voice - using Qwen's example clone audio
alloy:
ref_audio: https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen3-TTS-Repo/clone.wav
ref_text: "Okay. Yeah. I resent you. I love you. I respect you. But you know what? You blew it!"
language: English
# Echo - same sample, different name for compatibility
echo:
ref_audio: https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen3-TTS-Repo/clone.wav
ref_text: "Okay. Yeah. I resent you. I love you. I respect you. But you know what? You blew it!"
language: English
# Fable - same sample
fable:
ref_audio: https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen3-TTS-Repo/clone.wav
ref_text: "Okay. Yeah. I resent you. I love you. I respect you. But you know what? You blew it!"
language: English
# Onyx - same sample
onyx:
ref_audio: https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen3-TTS-Repo/clone.wav
ref_text: "Okay. Yeah. I resent you. I love you. I respect you. But you know what? You blew it!"
language: English
# Nova - same sample
nova:
ref_audio: https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen3-TTS-Repo/clone.wav
ref_text: "Okay. Yeah. I resent you. I love you. I respect you. But you know what? You blew it!"
language: English
# Shimmer - same sample
shimmer:
ref_audio: https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen3-TTS-Repo/clone.wav
ref_text: "Okay. Yeah. I resent you. I love you. I respect you. But you know what? You blew it!"
language: English
# Custom voice example - add your own reference audio
# my_voice:
# ref_audio: voices/my_voice_sample.wav
# ref_text: "The exact text spoken in the reference audio file"
# language: English
# Other models are disabled by default. Uncomment to enable.
# See the git history for full voice configurations.
# tts-1:
# # Piper TTS voices (fast CPU inference)
# alloy:
# model: /app/voices/en/en_US/libritts_r/medium/en_US-libritts_r-medium.onnx
# speaker: 79
# tts-1-hd:
# # XTTS voice cloning
# alloy:
# model: xtts
# speaker: voices/alloy.wav
# tts-1-silero:
# # Silero TTS (CPU-friendly)
# en_0:
# language: en
# speaker: en_0
# silero_speaker: v3_en
# tts-1-kokoro:
# # Kokoro TTS (lightweight 82M params)
# alloy:
# lang_code: a
# kokoro_voice: af_alloy