2026/07/29

Fish Audio S2.1 Pro cria vozes naturais em tempo real

A Fish Audio apresentou o seu impressionante S2.1 Pro, que pode replicar vozes com base em poucos segundos de amostra.

A Fish Audio apresentou o S2.1 Pro, o seu mais recente modelo de text-to-speech (TTS) para utilização em produção, destacando-se pelo suporte de 83 idiomas, latência de apenas 90 milissegundos e novas capacidades de clonagem de voz. O modelo já está disponível através da API da empresa e inclui um plano gratuito destinado a programadores e testes, sujeito a limites de utilização razoáveis.

O S2.1 Pro foi desenvolvido para conversas em tempo real, permitindo respostas de voz mais naturais em assistentes virtuais e aplicações AI. Além da latência reduzida, o modelo consegue manter a mesma identidade vocal em todos os idiomas suportados e permite controlar o tom da fala através de instruções inseridas directamente no texto, incluindo efeitos como sussurros, risos, ou diferentes emoções. Também suporta diálogos com vários interlocutores e clonagem de voz a partir de amostras de apenas 10 a 30 segundos.
A demonstração é impressionante, não só a nível de clonagem de voz, como também de lidar com cenários reais como a compreensão de múltiplas pessoas em simultâneo, e de reagir de forma natural.

Segundo a Fish Audio, o novo modelo melhora significativamente o anterior S2-Pro, e integra-se facilmente com plataformas de agentes de IA e sistemas de atendimento por voz, tornando-o adequado para assistentes inteligentes, call centers, e outros serviços de conversação.

No comments:

Post a Comment