- Switch default TTS engine from Piper to Qwen3-TTS (1.7B params) - Upgrade to Python 3.12 - Add docker-compose.cpu.yml for CPU-only deployments - Improve GPU configuration with NVIDIA environment variables - Comment out optional engines (Piper, XTTS, Silero, Kokoro) in requirements - Update Makefile with local/local-cpu targets and venv support - Simplify voice_to_speaker.default.yaml for Qwen3-TTS voices - Update docs/MODELS.md with Qwen3-TTS documentation - Add git commit guidelines to CLAUDE.md
77 lines
2.6 KiB
YAML
77 lines
2.6 KiB
YAML
# uncloseai-speech Voice Configuration
|
|
# Only tts-1-qwen is enabled by default
|
|
|
|
tts-1-qwen:
|
|
# OpenAI-compatible voice aliases
|
|
# Each voice requires ref_audio (reference audio) and ref_text (transcript of the audio)
|
|
# Language: Chinese, English, Japanese, Korean, German, French, Russian, Portuguese, Spanish, Italian
|
|
|
|
# Default voice - using Qwen's example clone audio
|
|
alloy:
|
|
ref_audio: https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen3-TTS-Repo/clone.wav
|
|
ref_text: "Okay. Yeah. I resent you. I love you. I respect you. But you know what? You blew it!"
|
|
language: English
|
|
|
|
# Echo - same sample, different name for compatibility
|
|
echo:
|
|
ref_audio: https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen3-TTS-Repo/clone.wav
|
|
ref_text: "Okay. Yeah. I resent you. I love you. I respect you. But you know what? You blew it!"
|
|
language: English
|
|
|
|
# Fable - same sample
|
|
fable:
|
|
ref_audio: https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen3-TTS-Repo/clone.wav
|
|
ref_text: "Okay. Yeah. I resent you. I love you. I respect you. But you know what? You blew it!"
|
|
language: English
|
|
|
|
# Onyx - same sample
|
|
onyx:
|
|
ref_audio: https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen3-TTS-Repo/clone.wav
|
|
ref_text: "Okay. Yeah. I resent you. I love you. I respect you. But you know what? You blew it!"
|
|
language: English
|
|
|
|
# Nova - same sample
|
|
nova:
|
|
ref_audio: https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen3-TTS-Repo/clone.wav
|
|
ref_text: "Okay. Yeah. I resent you. I love you. I respect you. But you know what? You blew it!"
|
|
language: English
|
|
|
|
# Shimmer - same sample
|
|
shimmer:
|
|
ref_audio: https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen3-TTS-Repo/clone.wav
|
|
ref_text: "Okay. Yeah. I resent you. I love you. I respect you. But you know what? You blew it!"
|
|
language: English
|
|
|
|
# Custom voice example - add your own reference audio
|
|
# my_voice:
|
|
# ref_audio: voices/my_voice_sample.wav
|
|
# ref_text: "The exact text spoken in the reference audio file"
|
|
# language: English
|
|
|
|
# Other models are disabled by default. Uncomment to enable.
|
|
# See the git history for full voice configurations.
|
|
|
|
# tts-1:
|
|
# # Piper TTS voices (fast CPU inference)
|
|
# alloy:
|
|
# model: /app/voices/en/en_US/libritts_r/medium/en_US-libritts_r-medium.onnx
|
|
# speaker: 79
|
|
|
|
# tts-1-hd:
|
|
# # XTTS voice cloning
|
|
# alloy:
|
|
# model: xtts
|
|
# speaker: voices/alloy.wav
|
|
|
|
# tts-1-silero:
|
|
# # Silero TTS (CPU-friendly)
|
|
# en_0:
|
|
# language: en
|
|
# speaker: en_0
|
|
# silero_speaker: v3_en
|
|
|
|
# tts-1-kokoro:
|
|
# # Kokoro TTS (lightweight 82M params)
|
|
# alloy:
|
|
# lang_code: a
|
|
# kokoro_voice: af_alloy
|