O Google acabou de soltar duas bombas no mercado de voz sintética
Você já tentou gerar áudio com IA e ficou com aquela sensação de robô lendo cardápio de restaurante? Pois é. O Google decidiu resolver isso de vez com o lançamento do Gemini 3.8 Flash TTS e do Gemini 3.8 Flash-Lite TTS, dois modelos de text-to-speech que prometem ser os mais expressivos que a empresa já produziu.
E quando eu digo “expressivos”, não é marketing genérico. O Flash TTS literalmente clona sua voz a partir de 30 segundos de áudio. Trinta. Segundos. Isso é menos tempo do que você gasta escolhendo um filtro pro Instagram.
Mas calma que tem mais: além de clonar, o modelo cria vozes completamente novas a partir de uma descrição em texto. Tipo “voz masculina jovem, sotaque mineiro, tom relaxado”. E sai uma voz que nunca existiu antes, pronta pra usar em produção.
Os dois modelos já estão disponíveis na Gemini API e no Google AI Studio desde 23 de setembro de 2026. Então sim, você pode testar agora.
Como funciona o voice design (criar vozes do zero)
Essa é a feature mais impressionante. Em vez de escolher de uma lista fixa de vozes, você descreve em linguagem natural o tipo de voz que quer. O modelo interpreta a descrição e gera uma persona vocal completa.
Por exemplo, você pode enviar algo assim na API:
from google import genai
client = genai.Client()
# Criar uma voz customizada a partir de descrição
voice = client.voices.create(
display_name="Narrador Tech",
description="Male voice, mid-30s, Brazilian Portuguese, "
"warm and confident tone, moderate pace, "
"slight São Paulo accent"
)
print(f"Voice ID: {voice.name}")
# voice_abc123... (persiste por 1 ano)
A voz gerada recebe um ID persistente (voice_...) que você reutiliza em qualquer chamada futura. O Google guarda até 200 vozes customizadas por projeto, com retenção de 1 ano.
E não é só pra inglês. O voice design funciona em mais de 130 idiomas, incluindo português brasileiro, espanhol mexicano, francês canadense e até escocês. Sim, o modelo diferencia sotaques regionais.
Clonagem de voz: 30 segundos e uma autorização
Eu sei o que você está pensando: “clonagem de voz + IA = deepfake”. O Google também pensou nisso.
O processo de voice replication exige duas coisas: um sample de áudio de aproximadamente 30 segundos da pessoa cuja voz será clonada, e uma gravação de consentimento explícito dessa mesma pessoa. Sem o consentimento, a API rejeita a requisição.
Além disso, todo áudio gerado pelo Gemini 3.8 TTS carrega uma marca d’água inaudível via SynthID e metadados C2PA. Ou seja, qualquer arquivo gerado pode ser verificado como sintético. Não é perfeito (nenhum sistema de watermark é), mas é mais do que a maioria dos concorrentes oferece.
A clonagem tem dois modos:
| Modo | Armazenamento | Retenção | Uso |
|---|---|---|---|
| —– | |||
Stateful (store=True) |
Persistente | 1 ano | Produção, uso recorrente |
Stateless (store=False) |
Temporário | 7 dias | Testes, prototipação |
Cada projeto comporta até 200 vozes stateful. Se você precisa de mais, é hora de falar com o time comercial do Google.
2.000+ vozes prontas (pra quem não quer criar do zero)
Nem todo mundo precisa criar vozes customizadas. Pra quem só quer algo que funcione rápido, o Gemini 3.8 TTS traz uma biblioteca com mais de 2.000 vozes pré-construídas.
Essas vozes cobrem uma variedade absurda: gêneros, faixas etárias, sotaques regionais (espanhol mexicano, inglês australiano, francês de Quebec, entre outros), alturas de voz e contextos de uso (audiobook, conversacional, narração).
Você filtra assim:
response = client.voices.list(
language_code=["pt-BR", "pt-PT"],
gender=["male"],
pitch=["medium", "low"],
contexts=["Conversational", "Audiobook"],
page_size=20,
)
for voice in response.voices:
print(f"{voice.display_name} - {voice.accent} ({voice.name})")
E ainda tem as 30 vozes “studio” originais (Kore, Puck, Charon, Fenrir, etc.) que já existiam nas versões anteriores. Elas continuam disponíveis e funcionam como ponto de partida pra quem já tem integrações rodando.
Direção linha por linha: podcast e audiobook nunca foram tão fáceis
Uma coisa que separa o Gemini 3.8 TTS de quase todos os concorrentes é o controle granular sobre a entrega de cada linha. Você não define só a voz, define o estilo de cada trecho.
Funciona em dois níveis:
1. Estilo sustentado (turn-level): define emoção, ritmo e prosódia pra um bloco inteiro de texto.
interaction = client.interactions.create(
model="gemini-3.8-flash-tts",
input=[{
"type": "user_input",
"content": [{
"type": "text",
"text": "A nave inteira tremeu. As luzes piscaram duas vezes "
"antes de apagar de vez.",
"annotations": [{
"type": "speech_metadata",
"style": "tense, slow pace, dramatic whisper",
}],
}],
}],
response_format={"type": "audio"},
generation_config={
"speech_config": [{"voice": "Charon"}]
},
)
2. Tags inline (point-in-time): insere eventos pontuais no meio do texto.
"Espera... <short pause> você ouviu isso? <sigh> Eu sabia que não devíamos ter entrado aqui."
Tags disponíveis incluem , , , , e outras. Pra dar ênfase, basta capitalizar: “Isso é MUITO importante”.
Pra quem produz audiobooks ou podcasts com IA, essa combinação de estilo por turno + tags inline é um salto enorme em relação ao que existia.
Multi-speaker: dois personagens, um modelo
O Gemini 3.8 TTS suporta diálogos entre dois speakers usando vozes pré-construídas. Você configura os participantes e alterna entre eles com metadados de speech:
interaction = client.interactions.create(
model="gemini-3.8-flash-tts",
input=[
{
"type": "user_input",
"content": [{
"type": "text",
"text": "E aí, pronto pro deploy?",
"annotations": [{
"type": "speech_metadata",
"speaker": "Dev1",
"style": "casual, upbeat"
}],
}],
},
{
"type": "user_input",
"content": [{
"type": "text",
"text": "Pronto? Cara, eu nem terminei os testes.",
"annotations": [{
"type": "speech_metadata",
"speaker": "Dev2",
"style": "nervous, hesitant"
}],
}],
},
],
response_format={"type": "audio"},
generation_config={
"speech_config": {
"mode": "conversational",
"speakers": [
{"speaker": "Dev1", "voice": "Puck"},
{"speaker": "Dev2", "voice": "Kore"},
],
}
},
)
Tem até suporte a “backchannels”, aquelas reações do ouvinte durante uma conversa. Usa o caractere pipe: "Então o deploy é quinta |oh hmm| Estamos prontos?". O modelo gera a reação vocal do segundo speaker em cima da fala do primeiro. Bem natural.
A limitação atual: máximo de 2 speakers por interação, e só com vozes pré-construídas. Vozes customizadas ainda não suportam multi-speaker.
Flash vs Flash-Lite: qual usar?
O Google lançou dois modelos porque os casos de uso são bem diferentes:
| Característica | Flash TTS | Flash-Lite TTS |
|---|---|---|
| Modelo | gemini-3.8-flash-tts |
gemini-3.8-flash-lite-tts |
| Idiomas | 130 | 101 |
| Foco | Qualidade máxima | Custo mínimo |
| Caso de uso | Audiobooks, podcasts, games | Voice agents, dubbing em massa |
| Preço (2026) | $9.00/M tokens de áudio | $6.00/M tokens de áudio |
| Custo por hora | ~$0.81 | ~$0.54 |
| Voice design | Sim | Sim |
| Voice replication | Sim | Sim |
| Multi-speaker | Sim | Sim |
| Speaker drift | Mínimo em horas de áudio | Mínimo |
Pra contextualizar o preço: 1 segundo de áudio = 25 tokens. Uma hora inteira de áudio custa $0.81 no Flash e $0.54 no Flash-Lite. O modelo anterior (Gemini 3.1 Flash TTS Preview) custava $20/M tokens, então estamos falando de uma redução de mais de 50% no preço.
Comparando com o ElevenLabs, que cobra por caractere e fica em torno de $0.18 a $0.30 por minuto dependendo do plano, o Gemini 3.8 Flash-Lite sai por $0.009/minuto. Sim, centésimos de centavo. A diferença é brutal.
Benchmarks: primeiro lugar em pronúncia e design de voz
Números falam mais que marketing:
| Benchmark | Score | Posição |
|---|---|---|
| Artificial Analysis Pronunciation Robustness | 89.5% | 1o lugar |
| Hume AI Voice Design | 71.4 | 1o lugar |
O benchmark de pronúncia é particularmente relevante porque mede como o modelo lida com palavras difíceis, nomes próprios, termos técnicos e siglas. Um TTS que tropeça em “Kubernetes” ou “OAuth” perde credibilidade instantaneamente. 89.5% é o melhor score registrado até agora.
O benchmark de voice design avalia a capacidade do modelo de gerar vozes consistentes e naturais a partir de descrições textuais. Primeiro lugar com 71.4 indica que as vozes geradas realmente soam como a descrição pede.
Streaming: áudio em tempo real
Pra aplicações que precisam de resposta imediata (voice agents, assistentes, jogos), o Gemini 3.8 TTS suporta streaming nativo:
import base64
stream = client.interactions.create(
model="gemini-3.8-flash-tts",
input=[{
"type": "user_input",
"content": [{
"type": "text",
"text": "Bem-vindo ao suporte técnico. Como posso ajudar?",
"annotations": [{
"type": "speech_metadata",
"style": "professional, warm"
}],
}],
}],
response_format={
"type": "audio",
"mime_type": "audio/l16",
"sample_rate": 24000
},
generation_config={
"speech_config": [{"voice": "Kore"}]
},
stream=True,
)
for event in stream:
if event.event_type == "step.delta" and event.delta.type == "audio":
audio_chunk = base64.b64decode(event.delta.data)
# enviar pro player / websocket / telefonia
O streaming retorna PCM 16-bit, 24 kHz, mono, sem header. Se você precisa de formatos de telefonia, o modelo também suporta mu-law e A-law (G.711).
Formatos de saída disponíveis:
| Formato | MIME Type | Uso típico |
|---|---|---|
| WAV | audio/wav |
Arquivo completo, com header |
| Raw PCM | audio/l16 |
Streaming, players customizados |
| Mu-law | audio/mulaw |
Telefonia América/Japão |
| A-law | audio/alaw |
Telefonia Europa |
Via curl: pra quem quer testar sem instalar nada
Se você não quer configurar o SDK Python, dá pra testar direto com curl:
curl -X POST \
"https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.8-flash-tts",
"input": [{
"type": "user_input",
"content": [{
"type": "text",
"text": "Fala dev! Hoje a gente vai falar sobre containers.",
"annotations": [{
"type": "speech_metadata",
"style": "energetic, podcast host"
}]
}]
}],
"response_format": {"type": "audio"},
"generation_config": {
"speech_config": [{"voice": "Puck"}]
}
}'
A resposta vem com o áudio em base64. Decodifica e pronto.
Integrações prontas
O Google não lançou o modelo isolado. Já tem integrações day-one com plataformas que fazem sentido:
- Agora: comunicação em tempo real (videochamadas, live streaming)
- LiveKit: infraestrutura de áudio/vídeo open source
- Pipecat: framework pra pipelines de voz com IA
- Vercel: deploy de aplicações web (via AI Gateway)
- Google Vids: ferramenta de criação de vídeo do Google (usa Flash-Lite)
A API Enterprise do Google Cloud também vai receber suporte em breve. Pra empresas que já rodam workloads no GCP, isso significa que o TTS entra no mesmo billing e governance que todo o resto.
O que isso significa pro mercado de voz
Eu acompanho o mercado de TTS desde quando o melhor que existia era o Google Translate falando “boa noite” com sotaque de GPS. A evolução nos últimos dois anos foi absurda, mas o Gemini 3.8 TTS representa um ponto de inflexão por três motivos.
Primeiro: preço. A $0.009 por minuto no Flash-Lite, gerar horas de áudio custa menos que um café. Isso democratiza o acesso pra indie devs, criadores de conteúdo solo e startups sem budget.
Segundo: voice design por prompt. Não precisar mais de estúdio, ator de voz ou sample pack pra ter uma voz única é transformador. Podcasters, game devs e produtores de conteúdo ganham uma ferramenta que antes custava milhares de reais em produção.
Terceiro: qualidade com segurança. O SynthID e a verificação de consentimento não são perfeitos, mas mostram que dá pra avançar em qualidade sem ignorar completamente as implicações éticas. A barra subiu pra todo mundo.
O ElevenLabs, que até ontem era o padrão de ouro em TTS, agora precisa responder. Não só em qualidade (onde a competição era apertada), mas em preço (onde a diferença é de 10x ou mais). A Amazon Polly e o Azure Speech já estavam ficando pra trás, agora a distância aumentou.
Pra quem está construindo produtos com voz, o recado é claro: o custo de adicionar áudio natural à sua aplicação caiu de “feature premium” pra “feature padrão”. Se o seu app ainda fala como robô, a desculpa acabou.
Fonte de inspiração: Gemini 3.8 text-to-speech says hello (Google Blog)













