IA do Google remove 'ums' e 'ahs' de transcrições
O Google adicionou ao Gemini a capacidade de limpar transcrições de áudio, removendo hesitações. Para quem está aprendendo IA, mostra como modelos entendem e editam linguagem natural, facilitando a criação de conteúdo e reuniões.

Illustration: FayAI Studio
O Google anunciou uma atualização no seu modelo de IA Gemini que permite transcrever áudios e automaticamente remover palavras de hesitação como 'ums' e 'ahs'. Isso significa que, ao gravar uma reunião ou uma palestra, a transcrição final fica mais limpa e profissional, sem os vícios de linguagem comuns na fala. A novidade foi revelada em uma demonstração no blog oficial da empresa, mostrando o potencial da IA em processar e refinar linguagem natural.

Essa funcionalidade chega em um momento em que a demanda por ferramentas de produtividade baseadas em IA cresce. Com o aumento do trabalho remoto e de reuniões online, muitos brasileiros dependem de gravações e transcrições para não perder detalhes. A capacidade de editar automaticamente a fala é um passo além da simples transcrição, mostrando que a IA não só entende o que é dito, mas também pode melhorar a comunicação.
Para quem está aprendendo IA no Brasil, essa notícia é relevante porque ilustra um uso prático de modelos de linguagem. Entender como a IA identifica e remove hesitações envolve conceitos como processamento de áudio, reconhecimento de fala e pós-processamento de texto. É um exemplo concreto de como a tecnologia pode ser aplicada no dia a dia, incentivando estudantes a explorar APIs e ferramentas de transcrição.

Imagine que você gravou uma entrevista para um podcast ou uma aula. Com essa ferramenta, o áudio é transcrito e, em segundos, você recebe um texto limpo, sem os 'é...' e 'tipo...' que atrapalham a leitura. Isso economiza horas de edição manual. Para jornalistas, estudantes e profissionais de marketing, é uma mão na roda. A ferramenta está integrada ao Gemini, que já é acessível no Brasil via Google AI Studio.
Se você quer testar, acesse o Google AI Studio e experimente a transcrição de áudio com o modelo Gemini 3.5. Observe como ele lida com diferentes sotaques e ruídos. Fique atento também a futuras atualizações, pois a tendência é que essas funcionalidades sejam incorporadas a aplicativos como Google Meet e Docs. Aprender a usar essas ferramentas agora é um diferencial competitivo no mercado.
real smartphone screen showing a transcription app with text being cleaned, removing filler words like 'um' and 'ah', with a play button and audio waveform below
Original story · image from the sourceRead it on The Verge ↗
