Shopping cart

Subtotal $0.00

View cartCheckout

Building better devs

TnewsTnews
  • Home
  • IA
  • Gemini 3.8 TTS Clona Sua Voz em 30 Segundos (e Custa 10x Menos)
IA

Gemini 3.8 TTS Clona Sua Voz em 30 Segundos (e Custa 10x Menos)

Email : 4

O Google acabou de soltar duas bombas no mercado de voz sintética

Você já tentou gerar áudio com IA e ficou com aquela sensação de robô lendo cardápio de restaurante? Pois é. O Google decidiu resolver isso de vez com o lançamento do Gemini 3.8 Flash TTS e do Gemini 3.8 Flash-Lite TTS, dois modelos de text-to-speech que prometem ser os mais expressivos que a empresa já produziu.

E quando eu digo “expressivos”, não é marketing genérico. O Flash TTS literalmente clona sua voz a partir de 30 segundos de áudio. Trinta. Segundos. Isso é menos tempo do que você gasta escolhendo um filtro pro Instagram.

Mas calma que tem mais: além de clonar, o modelo cria vozes completamente novas a partir de uma descrição em texto. Tipo “voz masculina jovem, sotaque mineiro, tom relaxado”. E sai uma voz que nunca existiu antes, pronta pra usar em produção.

Os dois modelos já estão disponíveis na Gemini API e no Google AI Studio desde 23 de setembro de 2026. Então sim, você pode testar agora.

Como funciona o voice design (criar vozes do zero)

Essa é a feature mais impressionante. Em vez de escolher de uma lista fixa de vozes, você descreve em linguagem natural o tipo de voz que quer. O modelo interpreta a descrição e gera uma persona vocal completa.

Por exemplo, você pode enviar algo assim na API:


from google import genai

client = genai.Client()

# Criar uma voz customizada a partir de descrição
voice = client.voices.create(
    display_name="Narrador Tech",
    description="Male voice, mid-30s, Brazilian Portuguese, "
                "warm and confident tone, moderate pace, "
                "slight São Paulo accent"
)

print(f"Voice ID: {voice.name}")
# voice_abc123... (persiste por 1 ano)

A voz gerada recebe um ID persistente (voice_...) que você reutiliza em qualquer chamada futura. O Google guarda até 200 vozes customizadas por projeto, com retenção de 1 ano.

E não é só pra inglês. O voice design funciona em mais de 130 idiomas, incluindo português brasileiro, espanhol mexicano, francês canadense e até escocês. Sim, o modelo diferencia sotaques regionais.

Clonagem de voz: 30 segundos e uma autorização

Eu sei o que você está pensando: “clonagem de voz + IA = deepfake”. O Google também pensou nisso.

O processo de voice replication exige duas coisas: um sample de áudio de aproximadamente 30 segundos da pessoa cuja voz será clonada, e uma gravação de consentimento explícito dessa mesma pessoa. Sem o consentimento, a API rejeita a requisição.

Além disso, todo áudio gerado pelo Gemini 3.8 TTS carrega uma marca d’água inaudível via SynthID e metadados C2PA. Ou seja, qualquer arquivo gerado pode ser verificado como sintético. Não é perfeito (nenhum sistema de watermark é), mas é mais do que a maioria dos concorrentes oferece.

A clonagem tem dois modos:

Modo Armazenamento Retenção Uso
—–
Stateful (store=True) Persistente 1 ano Produção, uso recorrente
Stateless (store=False) Temporário 7 dias Testes, prototipação

Cada projeto comporta até 200 vozes stateful. Se você precisa de mais, é hora de falar com o time comercial do Google.

2.000+ vozes prontas (pra quem não quer criar do zero)

Nem todo mundo precisa criar vozes customizadas. Pra quem só quer algo que funcione rápido, o Gemini 3.8 TTS traz uma biblioteca com mais de 2.000 vozes pré-construídas.

Essas vozes cobrem uma variedade absurda: gêneros, faixas etárias, sotaques regionais (espanhol mexicano, inglês australiano, francês de Quebec, entre outros), alturas de voz e contextos de uso (audiobook, conversacional, narração).

Você filtra assim:


response = client.voices.list(
    language_code=["pt-BR", "pt-PT"],
    gender=["male"],
    pitch=["medium", "low"],
    contexts=["Conversational", "Audiobook"],
    page_size=20,
)

for voice in response.voices:
    print(f"{voice.display_name} - {voice.accent} ({voice.name})")

E ainda tem as 30 vozes “studio” originais (Kore, Puck, Charon, Fenrir, etc.) que já existiam nas versões anteriores. Elas continuam disponíveis e funcionam como ponto de partida pra quem já tem integrações rodando.

Direção linha por linha: podcast e audiobook nunca foram tão fáceis

Uma coisa que separa o Gemini 3.8 TTS de quase todos os concorrentes é o controle granular sobre a entrega de cada linha. Você não define só a voz, define o estilo de cada trecho.

Funciona em dois níveis:

1. Estilo sustentado (turn-level): define emoção, ritmo e prosódia pra um bloco inteiro de texto.


interaction = client.interactions.create(
    model="gemini-3.8-flash-tts",
    input=[{
        "type": "user_input",
        "content": [{
            "type": "text",
            "text": "A nave inteira tremeu. As luzes piscaram duas vezes "
                    "antes de apagar de vez.",
            "annotations": [{
                "type": "speech_metadata",
                "style": "tense, slow pace, dramatic whisper",
            }],
        }],
    }],
    response_format={"type": "audio"},
    generation_config={
        "speech_config": [{"voice": "Charon"}]
    },
)

2. Tags inline (point-in-time): insere eventos pontuais no meio do texto.


"Espera... <short pause> você ouviu isso? <sigh> Eu sabia que não devíamos ter entrado aqui."

Tags disponíveis incluem , , , , e outras. Pra dar ênfase, basta capitalizar: “Isso é MUITO importante”.

Pra quem produz audiobooks ou podcasts com IA, essa combinação de estilo por turno + tags inline é um salto enorme em relação ao que existia.

Multi-speaker: dois personagens, um modelo

O Gemini 3.8 TTS suporta diálogos entre dois speakers usando vozes pré-construídas. Você configura os participantes e alterna entre eles com metadados de speech:


interaction = client.interactions.create(
    model="gemini-3.8-flash-tts",
    input=[
        {
            "type": "user_input",
            "content": [{
                "type": "text",
                "text": "E aí, pronto pro deploy?",
                "annotations": [{
                    "type": "speech_metadata",
                    "speaker": "Dev1",
                    "style": "casual, upbeat"
                }],
            }],
        },
        {
            "type": "user_input",
            "content": [{
                "type": "text",
                "text": "Pronto? Cara, eu nem terminei os testes.",
                "annotations": [{
                    "type": "speech_metadata",
                    "speaker": "Dev2",
                    "style": "nervous, hesitant"
                }],
            }],
        },
    ],
    response_format={"type": "audio"},
    generation_config={
        "speech_config": {
            "mode": "conversational",
            "speakers": [
                {"speaker": "Dev1", "voice": "Puck"},
                {"speaker": "Dev2", "voice": "Kore"},
            ],
        }
    },
)

Tem até suporte a “backchannels”, aquelas reações do ouvinte durante uma conversa. Usa o caractere pipe: "Então o deploy é quinta |oh hmm| Estamos prontos?". O modelo gera a reação vocal do segundo speaker em cima da fala do primeiro. Bem natural.

A limitação atual: máximo de 2 speakers por interação, e só com vozes pré-construídas. Vozes customizadas ainda não suportam multi-speaker.

Flash vs Flash-Lite: qual usar?

O Google lançou dois modelos porque os casos de uso são bem diferentes:

Característica Flash TTS Flash-Lite TTS
Modelo gemini-3.8-flash-tts gemini-3.8-flash-lite-tts
Idiomas 130 101
Foco Qualidade máxima Custo mínimo
Caso de uso Audiobooks, podcasts, games Voice agents, dubbing em massa
Preço (2026) $9.00/M tokens de áudio $6.00/M tokens de áudio
Custo por hora ~$0.81 ~$0.54
Voice design Sim Sim
Voice replication Sim Sim
Multi-speaker Sim Sim
Speaker drift Mínimo em horas de áudio Mínimo

Pra contextualizar o preço: 1 segundo de áudio = 25 tokens. Uma hora inteira de áudio custa $0.81 no Flash e $0.54 no Flash-Lite. O modelo anterior (Gemini 3.1 Flash TTS Preview) custava $20/M tokens, então estamos falando de uma redução de mais de 50% no preço.

Comparando com o ElevenLabs, que cobra por caractere e fica em torno de $0.18 a $0.30 por minuto dependendo do plano, o Gemini 3.8 Flash-Lite sai por $0.009/minuto. Sim, centésimos de centavo. A diferença é brutal.

Benchmarks: primeiro lugar em pronúncia e design de voz

Números falam mais que marketing:

Benchmark Score Posição
Artificial Analysis Pronunciation Robustness 89.5% 1o lugar
Hume AI Voice Design 71.4 1o lugar

O benchmark de pronúncia é particularmente relevante porque mede como o modelo lida com palavras difíceis, nomes próprios, termos técnicos e siglas. Um TTS que tropeça em “Kubernetes” ou “OAuth” perde credibilidade instantaneamente. 89.5% é o melhor score registrado até agora.

O benchmark de voice design avalia a capacidade do modelo de gerar vozes consistentes e naturais a partir de descrições textuais. Primeiro lugar com 71.4 indica que as vozes geradas realmente soam como a descrição pede.

Streaming: áudio em tempo real

Pra aplicações que precisam de resposta imediata (voice agents, assistentes, jogos), o Gemini 3.8 TTS suporta streaming nativo:


import base64

stream = client.interactions.create(
    model="gemini-3.8-flash-tts",
    input=[{
        "type": "user_input",
        "content": [{
            "type": "text",
            "text": "Bem-vindo ao suporte técnico. Como posso ajudar?",
            "annotations": [{
                "type": "speech_metadata",
                "style": "professional, warm"
            }],
        }],
    }],
    response_format={
        "type": "audio",
        "mime_type": "audio/l16",
        "sample_rate": 24000
    },
    generation_config={
        "speech_config": [{"voice": "Kore"}]
    },
    stream=True,
)

for event in stream:
    if event.event_type == "step.delta" and event.delta.type == "audio":
        audio_chunk = base64.b64decode(event.delta.data)
        # enviar pro player / websocket / telefonia

O streaming retorna PCM 16-bit, 24 kHz, mono, sem header. Se você precisa de formatos de telefonia, o modelo também suporta mu-law e A-law (G.711).

Formatos de saída disponíveis:

Formato MIME Type Uso típico
WAV audio/wav Arquivo completo, com header
Raw PCM audio/l16 Streaming, players customizados
Mu-law audio/mulaw Telefonia América/Japão
A-law audio/alaw Telefonia Europa

Via curl: pra quem quer testar sem instalar nada

Se você não quer configurar o SDK Python, dá pra testar direto com curl:


curl -X POST \
  "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.8-flash-tts",
    "input": [{
      "type": "user_input",
      "content": [{
        "type": "text",
        "text": "Fala dev! Hoje a gente vai falar sobre containers.",
        "annotations": [{
          "type": "speech_metadata",
          "style": "energetic, podcast host"
        }]
      }]
    }],
    "response_format": {"type": "audio"},
    "generation_config": {
      "speech_config": [{"voice": "Puck"}]
    }
  }'

A resposta vem com o áudio em base64. Decodifica e pronto.

Integrações prontas

O Google não lançou o modelo isolado. Já tem integrações day-one com plataformas que fazem sentido:

  • Agora: comunicação em tempo real (videochamadas, live streaming)
  • LiveKit: infraestrutura de áudio/vídeo open source
  • Pipecat: framework pra pipelines de voz com IA
  • Vercel: deploy de aplicações web (via AI Gateway)
  • Google Vids: ferramenta de criação de vídeo do Google (usa Flash-Lite)

A API Enterprise do Google Cloud também vai receber suporte em breve. Pra empresas que já rodam workloads no GCP, isso significa que o TTS entra no mesmo billing e governance que todo o resto.

O que isso significa pro mercado de voz

Eu acompanho o mercado de TTS desde quando o melhor que existia era o Google Translate falando “boa noite” com sotaque de GPS. A evolução nos últimos dois anos foi absurda, mas o Gemini 3.8 TTS representa um ponto de inflexão por três motivos.

Primeiro: preço. A $0.009 por minuto no Flash-Lite, gerar horas de áudio custa menos que um café. Isso democratiza o acesso pra indie devs, criadores de conteúdo solo e startups sem budget.

Segundo: voice design por prompt. Não precisar mais de estúdio, ator de voz ou sample pack pra ter uma voz única é transformador. Podcasters, game devs e produtores de conteúdo ganham uma ferramenta que antes custava milhares de reais em produção.

Terceiro: qualidade com segurança. O SynthID e a verificação de consentimento não são perfeitos, mas mostram que dá pra avançar em qualidade sem ignorar completamente as implicações éticas. A barra subiu pra todo mundo.

O ElevenLabs, que até ontem era o padrão de ouro em TTS, agora precisa responder. Não só em qualidade (onde a competição era apertada), mas em preço (onde a diferença é de 10x ou mais). A Amazon Polly e o Azure Speech já estavam ficando pra trás, agora a distância aumentou.

Pra quem está construindo produtos com voz, o recado é claro: o custo de adicionar áudio natural à sua aplicação caiu de “feature premium” pra “feature padrão”. Se o seu app ainda fala como robô, a desculpa acabou.

Fonte de inspiração: Gemini 3.8 text-to-speech says hello (Google Blog)

Leave a Reply

Your email address will not be published. Required fields are marked *

Related Posts