Coqui-TTS 本地部署及 xtts-v2 模型试用

本地部署方式:Docker

1、创建docker-compose.yml

version: '3.9'

services:
  coqui-tts-cpu:
    image: ghcr.io/coqui-ai/tts-cpu
    container_name: coqui-tts-cpu
    restart: unless-stopped
    ports:
      - "5002:5002"
    deploy:
      resources:
        reservations:
          devices:
            - capabilities: [cpu]
    entrypoint: ["python3", "TTS/server/server.py"]
    command: >
      --model_name tts_models/en/ljspeech/glow-tts
      --use_cuda true
      --port 5002

  coqui-tts-gpu:
    image: ghcr.io/coqui-ai/tts:latest
    container_name: coqui-tts-gpu
    restart: unless-stopped
    ports:
      - "5002:5002"
    deploy:
      resources:
        reservations:
          devices:
            - capabilities: [gpu]
    entrypoint: ["python3", "TTS/server/server.py"]
    command: >
      --model_path /root/.local/share/tts/tts_models--multilingual--multi-dataset--xtts_v2
      --config_path /root/.local/share/tts/tts_models--multilingual--multi-dataset--xtts_v2/config.json
      --use_cuda true
      --port 5002
    volumes:
      - D:\docker\Myself\couqi-tts\modules:/root/.local/share/tts:rw
      - D:\docker\Myself\couqi-tts\voice:/root/TTS/server/static:rw
      - D:\docker\Myself\couqi-tts\logs:/root/TTS/server/logs:rw
    environment:
      - COQUI_TOS_AGREED=1

【coqui-tts-cpu】的镜像本地没有测试,
【coqui-tts-gpu】可直接构建使用(版本、端口、目录挂载可自行定义)

2、准备xtts-v2模型
下载地址: https://huggingface.co/coqui/XTTS-v2/tree/main

在这里插入图片描述
3、下载成功后将所有文件复制到挂载的镜像目录下,我的地址是

D:\docker\Myself\couqi-tts\modules\tts_models–multilingual–multi-dataset–xtts_v2

在这里插入图片描述
4、docker命令运行容器

docker-compose up -d coqui-tts-gpu

5、启动成功后浏览器访问
http://localhost:5002/
注意:最新版本的coqui-tts没有下拉框选择模型,如果启动时指定了xtts-v2模型启动,在UI页面上无法验证,输入文本转换将会报错:
在这里插入图片描述
6、浏览器直接访问
http://localhost:5002/api/tts?text=你好&speaker_id=Baldur%20Sanjin&language_id=zh-cn

参数text: 要转换的文本
参数speaker_id: 语音角色id
language_id: 语言代码
在这里插入图片描述

7、speaker_id查看方式
进入容器:

docker exec -it coqui-tts-gpu bash

执行命令

tts --model_name tts_models/multilingual/multi-dataset/xtts_v2 --list_speaker_idxs

输入如下信息:
在这里插入图片描述
8、language_id查看:
打开xtts-v2模型下的config.json文件

在这里插入图片描述

更多推荐