OpenVoice
Voz sintética e transcrição que entendem o Brasil
Projeto independente de tecnologia de voz em português brasileiro. Síntese de fala, transcrição de áudio, agentes que atendem telefone. É para quem cansou de modelo treinado em inglês errando CPF ditado, sotaque regional e número lido em voz alta.
Em construção, aberto a conversa
Falar sobre voz em PT-BR→Resumo
OpenVoice é um projeto brasileiro independente de tecnologia de voz em português: como transcrever, sintetizar e colocar um agente a atender telefone sem soar robótico.
Perguntas Frequentes
O que é o OpenVoice?
OpenVoice é um projeto independente sobre tecnologia de voz em português brasileiro. Cobre síntese de fala, reconhecimento de áudio e agentes que atendem ligação telefônica. Não tem vínculo com o projeto homônimo de clonagem de voz mantido pela MyShell; aqui o nome vem do domínio. Interessa o que quebra quando o modelo foi treinado só em inglês.
Para quem o OpenVoice é feito?
É para dev e time de produto no Brasil que precisa colocar voz num fluxo real: URA que não irrita, transcrição de ligação de suporte, ditado de CPF, bot que atende às duas da manhã. Se o seu usuário fala português com sotaque, o problema de reconhecimento é seu.
Qual a diferença entre TTS e STT?
STT, de speech to text, transcreve áudio em texto. TTS, de text to speech, faz o caminho inverso e gera fala a partir de texto escrito. Um agente de voz usa os dois em cadeia, com um modelo de linguagem no meio. Whisper é exemplo de STT; Coqui e ElevenLabs, de TTS.
O que é WER e por que ele sobe em português com ruído?
WER, word error rate, é a soma de inserções, deleções e substituições dividida pelo número de palavras da referência. Sobe em português brasileiro porque ruído de fundo, telefonia em banda estreita, sotaque regional e gíria pouco representada no treino empurram o decodificador para o palpite mais frequente, não para o que foi dito.
Quanta latência um agente de voz pode ter em cada etapa?
Conversa por telefone trava quando o silêncio passa de meio segundo. A recomendação ITU-T G.114 fala em até 150 ms de atraso só no transporte da voz. Sobra pouco, então divida o orçamento entre STT parcial, resposta do modelo de linguagem e primeiro byte de áudio do TTS, medindo cada etapa separada.
Streaming ou batch: qual usar na síntese de voz?
Batch gera o arquivo inteiro antes de tocar. Serve para audiobook, podcast e material gravado, onde prosódia bem cuidada vale mais que espera. Streaming devolve o áudio em pedaços e derruba o tempo até o primeiro som, que é o número decidindo se a ligação soa viva ou travada.
O que são VAD e barge-in num agente de voz?
VAD é detecção de atividade de voz: o componente que decide se o que chegou no microfone é fala ou barulho de fundo. Barge-in é permitir que a pessoa interrompa o bot no meio da frase. Sem os dois, o agente atropela quem está falando e ainda escuta o próprio áudio de volta.
Por que número, data e CPF quebram a transcrição?
O modelo trabalha com sequência de fonemas, e número ditado é ambíguo: meia, seis e 6 viram grafias diferentes; data aceita barra, ponto ou nome do mês. Normalização de texto resolve nas duas pontas, convertendo o que o STT ouviu em dígito canônico e ensinando o TTS a ler CPF em grupos de três.
Clonar a voz de outra pessoa é permitido?
Clonagem exige consentimento específico e registrado de quem falou, com finalidade declarada e prazo. Usar voz de terceiro sem isso é apropriação de traço biométrico e alimenta o golpe do áudio do parente pedindo dinheiro por aplicativo. Aqui não circula receita para furar autenticação por voz: banco que usa voz como senha precisa de prova de vivacidade.
Voz sintética em URA melhora ou piora o atendimento?
Melhora quando o texto muda com frequência e regravar locutor sairia caro ou lento. Piora quando o bot esconde que é bot, empurra menu longo ou não aceita interrupção. Boa prática: avisar na primeira frase que o atendimento é automatizado e deixar a saída para humano sempre disponível.
Voz é dado pessoal sensível na LGPD?
A LGPD, Lei 13.709/2018, lista dado biométrico entre os dados pessoais sensíveis, e gravação de voz usada para identificar alguém cai nessa categoria. Isso muda a base legal aceitável, exige finalidade específica, prazo de retenção definido e cuidado com compartilhamento. A ANPD é o órgão que fiscaliza esse tratamento no Brasil.
O projeto já está disponível e quanto custa?
Está em desenvolvimento. Não existe API pública, plano fechado nem preço divulgado, e cravar data agora seria chute. O que já existe é a direção editorial e o conteúdo técnico em português sobre voz. Quem quiser acompanhar ou discutir um caso concreto pode falar pelo ft.ia.br.
O domínio deste site está à venda?
Sim, openvoice.com.br está disponível para aquisição. Serve para quem monta produto de voz, TTS, transcrição ou agente telefônico no Brasil e quer um nome curto e direto no assunto. Proposta e conversa sobre a transferência pelo ft.ia.br, com o autor do projeto respondendo direto.
"Sr. Watson, venha até aqui, quero vê-lo."