Sabendo-se que a interacção por voz será cada vez mais importante numa era que se vai dependendo cada vez mais dos assistentes AI, a Google anunciou o Gemini 3.5 Transcribe, o seu mais avançado modelo de conversão de voz para texto até à data. A nova tecnologia já está a ser utilizada em vários produtos da empresa, incluindo o Gboard Rambler e a aplicação Gemini para macOS, prometendo transcrições mais rápidas, precisas e naturais.
Ao contrário dos sistemas tradicionais de reconhecimento de voz, o Gemini 3.5 Transcribe consegue compreender melhor conversas reais, corrigindo automaticamente frases interrompidas, eliminando palavras de preenchimento como "hum" ou "ah" e formatar o texto final de forma inteligente. O modelo também reconhece vocabulário personalizado, termos técnicos, e diferentes sotaques, suportando mais de 85 idiomas.
Este novo modelo marca um avanço significativo face ao modelo Chirp 3 anterior, reduzindo substancialmente o tempo necessário para gerar uma transcrição, e apresenta taxas de erro bastante mais baixas, mesmo em ambientes ruidosos ou com múltiplos intervenientes na conversa.Today we’re introducing Gemini 3.5 Transcribe, our latest transcription model built for incredibly precise, smart dictation across your favorite apps and devices.
— Google AI (@GoogleAI) August 26, 2026
Remember when traditional speech-to-text meant shouting over background noise, constantly hitting backspace to fix… pic.twitter.com/WbFoDw0JwM
Além da transcrição, o Gemini 3.5 Transcribe foi desenvolvido para permitir a execução de tarefas através da voz, podendo encaminhar pedidos para outros modelos Gemini quando necessário. Este modelo chegará em breve ao Chrome, permitindo ditar texto directamente em qualquer campo de texto na web, tornando a interacção por voz mais natural e integrada no browser - embora, muito provavelmente, também sujeita a limites de utilização para incentivar os utilizadores a optarem por planos Google AI pagos.



















No comments:
Post a Comment (problemas a comentar?)